Diseñar un data center es administrar consecuencias. El producto final no es el edificio, sino la entrega continua y segura de capacidad computacional, conectividad y almacenamiento. Esta guía recorre la cadena completa de decisiones — del business case y el análisis de riesgo a la ingeniería térmica y eléctrica, telecomunicaciones, protección, construcción, commissioning y operación.
El encadenamiento es siempre el mismo: el business case define la criticidad; la criticidad define los requisitos; los requisitos definen el proyecto; el proyecto se comprueba mediante pruebas; y la operación preserva el desempeño obtenido. Saltar una etapa transfiere incertidumbre a la obra, donde los cambios cuestan más y comprometen el plazo.
Sobre este material: las arquitecturas presentadas son referenciales y no sustituyen el proyecto ejecutivo, el laudo técnico, la responsabilidad técnica ni la consulta a las ediciones vigentes de las normas aplicables. La redundancia no es sinónimo automático de disponibilidad: el resultado depende de independencia física, selectividad, automatización, procedimientos, pruebas integradas y competencia operativa.
Resumen ejecutivo
Cada parte de la guía responde a una decisión específica. Use la tabla como mapa de lectura: los gestores comienzan por las cuatro primeras filas; la ingeniería avanza por las disciplinas técnicas; la operación se concentra en commissioning, documentación e indicadores; compras usa las matrices y checklists para estructurar el RFP, la equalización técnica y la aceptación.
| Parte | Contenido | Decisión principal |
|---|---|---|
| Fundamentos | Objetivo, tipologías y ciclo de vida | ¿Construir, contratar colocation, edge o híbrido? |
| Requisitos y riesgos | BIA, criticidad, amenaza y tolerancia | ¿Qué interrupción es aceptable y a qué costo? |
| Disponibilidad | Clases, topologías, mantenimiento y fallas | ¿Qué arquitectura satisface el servicio? |
| Planificación | Capacidad, área, densidad y expansión | ¿Cuánto, cuándo y dónde construir? |
| Térmica | Flujo de aire, DX, agua helada y liquid cooling | ¿Cómo remover calor con estabilidad y eficiencia? |
| Eléctrica | Red, GMG, UPS, baterías, ATS, PDU y protección | ¿Cómo entregar energía segura hasta la carga de TI? |
| Telecom | Rutas, MMR, cableado y topologías | ¿Cómo eliminar dependencias ocultas? |
| Protección y control | Incendio, acceso, CCTV, BMS y DCIM | ¿Cómo detectar, contener y responder? |
| Construcción y entrega | Materiales, etapas, QA/QC y commissioning | ¿Cómo demostrar que el proyecto funciona? |
| Operación y futuro | SLA, mantenimiento, PUE, IA y alta densidad | ¿Cómo sostener la confiabilidad en el tiempo? |
Qué es un data center
Un data center es el conjunto coordinado de espacios, servicios (utilities), controles y procesos que sustenta equipos de tecnología y telecomunicaciones. Energía, refrigeración y redes son cadenas de servicio; cada eslabón necesita capacidad, protección, monitoreo y camino de mantenimiento.
| Capa | Ejemplos | Falla típica |
|---|---|---|
| Negocio | Servicios, clientes, legislación, ingresos | Criticidad mal definida |
| TI y telecom | Compute, storage, red, plataformas | Demanda superior a la capacidad |
| Facilities | Energía, climatización, incendio, seguridad | Punto único de falla |
| Operación | Personas, procesos, piezas y proveedores | Error humano o respuesta tardía |
Principio: la infraestructura crítica debe diseñarse en función del servicio que necesita sobrevivir, y no solo del equipo que se instalará.
El ciclo de vida completo va de estrategia y requisitos al estudio preliminar, proyecto conceptual, básico y ejecutivo, contratación, construcción, pruebas, operación, optimización y, finalmente, expansión o desactivación.
Tipos y modelos de implementación
| Modelo | Ventaja | Atención |
|---|---|---|
| Enterprise | Control e integración con el negocio | CAPEX, escala y equipo especializado |
| Colocation | Velocidad, conectividad e infraestructura compartida | Contrato, demarcación de responsabilidades y cross-connects |
| Hyperscale | Escala, estandarización y automatización | Gran demanda de energía, agua y territorio |
| Edge | Baja latencia y proximidad del usuario | Sitios distribuidos, mantenimiento y seguridad física |
| Modular/prefabricado | Plazo y repetibilidad | Interfaces civiles, logística y expansión |
| Híbrido | Flexibilidad entre sitios y nubes | Arquitectura operativa y observabilidad de punta a punta |
La comparación entre construir y contratar debe incorporar costo total, plazo, riesgo regulatorio, energía disponible, conectividad, capacidad de expansión, vida útil, costo de capital, equipo, obsolescencia y flexibilidad contractual. Una sala propia aparentemente barata puede exigir una reforma eléctrica y térmica desproporcionada; el colocation puede reducir el plazo, pero exige SLA, auditoría y plan de salida.
- Mapee las cargas que no pueden salir del sitio y las que pueden distribuirse.
- Modele al menos tres escenarios de crecimiento y un escenario de estrés.
- Incluya el costo de la indisponibilidad, no solo CAPEX y mensualidad.
- Defina quién responde por cada tramo: concesionaria, data center, rack, equipo y aplicación.
Requisitos en equilibrio
Un proyecto viable equilibra tres grupos: el negocio define qué necesita continuar; la técnica transforma eso en capacidad, topología y desempeño; las finanzas imponen el envelope de inversión y operación. El equilibrio debe documentarse en un Basis of Design (BoD), con premisas, exclusiones y criterios de aceptación.
| Grupo | Preguntas esenciales |
|---|---|
| Negocio | ¿Qué servicios? ¿Quién se ve afectado? ¿Qué ventana? ¿Qué obligación contractual o legal? |
| Técnico | ¿Carga inicial y futura? ¿Densidad? ¿Autonomía? ¿Rutas? ¿Mantenibilidad? |
| Financiero | ¿CAPEX, OPEX, contingencia, costo de capital, energía, mantenimiento y renovación? |
| Operacional | ¿Equipo, cobertura 24x7, repuestos, proveedores, procedimientos y capacitación? |
El Documento de Requisitos del Propietario (OPR) consolida esa decisión y debe contener:
- Objetivos y alcance del emprendimiento.
- Perfil de carga y horizonte de crecimiento.
- Criterios de disponibilidad, seguridad y eficiencia.
- Condiciones ambientales y límites de operación.
- Medición, alarmas, integración y retención de datos.
- Pruebas, documentación, capacitación y garantía.
BIA y riesgo del negocio
El Business Impact Analysis identifica procesos críticos, dependencias, tiempo máximo tolerable de interrupción e impactos progresivos. El RTO orienta el tiempo de recuperación; el RPO orienta la pérdida máxima de datos. No sustituyen el análisis de facilities, pero impiden que la infraestructura se dimensione por percepción.
| Impacto | Ejemplo de evidencia | Tratamiento |
|---|---|---|
| Financiero | Ingresos perdidos, multa, retrabajo | Cuantificar por hora y por evento |
| Operacional | Cola acumulada, pérdida de productividad | Modelar degradación y recuperación |
| Legal/regulatorio | Plazo, custodia de datos, seguridad | Validar con jurídico y compliance |
| Reputación | Churn, prensa, confianza | Usar escenarios e indicadores |
| Vida/seguridad | Servicios médicos, emergencia, control | Tolerancia mínima y respuesta formal |
Probabilidad y consecuencia deben sustentarse con histórico, condición del activo, exposición y controles existentes. El riesgo residual es el que permanece después de la mitigación — aceptarlo es una decisión del dueño del riesgo, no una omisión del proyecto.
Ejemplo: si una falla de alimentación puede interrumpir R$ 300 mil por hora y la recuperación probable es de 4 horas, el impacto directo de referencia es R$ 1,2 millones — antes de multas, imagen y recuperación operacional.
Riesgos internos y externos
| Dominio | Amenazas | Verificación |
|---|---|---|
| Ubicación | Inundación, deslizamiento, incendio externo, caída de aeronave | Mapas, histórico, radio de exposición e inspección |
| Servicios (utilities) | Red eléctrica débil, combustible, agua, telecom | Cartas de viabilidad y rutas físicas |
| Edificación | Carga estructural, agua sobre sala crítica, vibración | Levantamiento y ensayos |
| Incendio | Carga combustible, compartimentación, detección | Proyecto legal y análisis de causa/propagación |
| Personas | Acceso indebido, error, falta de capacitación | Segregación, procedimiento y capacitación |
| Supply chain | Lead time, pieza exclusiva, proveedor único | Lista crítica y stock estratégico |
| Cibernético-físico | BMS/DCIM expuesto, credenciales débiles | Segmentación, hardening, backup y logging |
- Registro de riesgos con responsable, plazo y evidencia.
- FMEA para modos de falla, efectos y controles.
- HAZOP o What-if para desviaciones de proceso.
- Fault Tree para combinaciones que llevan al evento tope.
- Bow-tie para visualizar prevención, evento y mitigación.
Disponibilidad sin simplificaciones
Disponibilidad es la proporción de tiempo en que el servicio está apto para cumplir su función. Para un componente reparable, una aproximación común es A = MTBF / (MTBF + MTTR). Sin embargo, en el data center, las dependencias comunes, las fallas humanas, el mantenimiento, los controles y la respuesta operativa hacen que el comportamiento sistémico sea mucho más complejo de lo que sugiere la fórmula.
| Concepto | Significado práctico |
|---|---|
| N | Capacidad necesaria para soportar la carga de proyecto |
| N+1 | Un módulo adicional además del necesario |
| 2N | Dos sistemas completos e independientes |
| 2(N+1) | Dos sistemas completos, cada uno con reserva adicional |
| Mantenimiento simultáneo | Retirar componente o camino de forma planificada sin detener la carga |
| Tolerancia a fallas | Una falla no causa interrupción inmediata de la carga crítica |
- Dos equipos alimentados por el mismo tablero no forman caminos independientes.
- La redundancia lógica sin separación física puede fallar ante un único evento.
- La carga single-cord exige STS o arquitectura específica; la dual-cord debe tener distribución A/B coherente.
- La autonomía nominal de batería varía con la carga, la temperatura, la antigüedad y el régimen de descarga.
Clases y referenciales
La serie ISO/IEC 22237 clasifica la infraestructura por disponibilidad, seguridad y eficiencia a lo largo del ciclo de vida. El Uptime Institute usa criterios Tier orientados a la topología y al desempeño operativo. Niveles y clases de referenciales diferentes no deben tratarse como equivalentes automáticos: el requisito contractual debe indicar norma, edición, alcance y forma de comprobación.
| Intención | Arquitectura típica | Pregunta de validación |
|---|---|---|
| Capacidad básica | Camino único y componentes dimensionados | ¿Un mantenimiento planificado exige apagado? |
| Componentes redundantes | N+1 en partes de la cadena | ¿Todavía existe camino único? |
| Mantenibilidad | Múltiples caminos y aislamiento | ¿Cada componente puede mantenerse con carga activa? |
| Tolerancia a fallas | Segregación y respuesta automática | ¿Una falla aislada interrumpe la carga? |
Cuidado: no anuncie certificación, clase o Tier basándose solo en un diagrama. La certificación depende del programa, del alcance, de la documentación, de la construcción y/o de la operación evaluados por la entidad competente.
Arquitectura eléctrica dual path
El principio A/B crea dos caminos de energía hasta la carga crítica. Para ser efectivo, debe considerar origen, generación, transformación, maniobra, UPS, distribución, cables, PDU y conexión del equipo. Los componentes compartidos deben identificarse y justificarse — no descubrirse durante una falla.
- Capacidad N durante mantenimiento y en la condición de falla definida.
- Selectividad y coordinación de las protecciones en todos los modos de operación.
- Interbloqueos y lógica de transferencia comprobables mediante pruebas.
- Separación física contra incendio, agua e intervención.
- Puntos de medición desde el utility hasta el rack.
- Plan seguro de bypass y retorno a la condición normal.
Del inventario de TI a la potencia de proyecto
El dimensionamiento comienza con el inventario de equipos, potencia medida o declarada, simultaneidad, perfil de utilización, crecimiento y reservas. La potencia de placa no es el consumo promedio — pero el proyecto tampoco puede ignorar picos, transitorios, arranque simultáneo, recarga de baterías y degradación.
| Etapa | Cálculo de referencia |
|---|---|
| Carga TI inicial | Suma por equipo × factor de utilización y simultaneidad |
| Crecimiento | Escenarios anualizados o por olas de instalación |
| Capacidad de rack | Límite eléctrico, térmico, físico y de piso — vale el menor |
| Carga térmica TI | Aproximadamente igual a la potencia eléctrica disipada en régimen |
| Infraestructura | TI + refrigeración + pérdidas + iluminación + auxiliares |
| Reserva | Margen explícito, sin duplicar factores conservadores |
Ejemplo: 100 racks × 8 kW = 800 kW de carga TI. Con PUE de proyecto 1,45, la potencia total promedio de referencia sería 1,16 MW. El sistema eléctrico todavía debe considerar modos de falla, mantenimiento, arranques y capacidad nominal.
Densidad y estrategia de racks
La densidad puede expresarse en kW/rack, kW/m² de sala o por unidad computacional. El promedio esconde hotspots: una sala de 8 kW/rack puede contener islas de 30 kW. El proyecto debe separar zonas, definir límites por rack y reservar caminos de evolución para refrigeración líquida.
| Rango indicativo | Aplicación típica | Estrategia térmica |
|---|---|---|
| Hasta 5 kW/rack | TI convencional o baja ocupación | Pasillos organizados y control de bypass |
| 5 a 15 kW/rack | Virtualización y storage | Contención y unidades con modulación |
| 15 a 30 kW/rack | Compute denso y aceleradores moderados | In-row/rear-door o aire altamente controlado |
| Más de 30 kW/rack | HPC e IA de alta densidad | Evaluar direct-to-chip, CDU y agua tecnológica |
Los rangos son orientativos. La decisión depende del caudal exigido, del ΔT del equipo, de la presión disponible, del layout, de la tolerancia térmica y de la especificación del fabricante.
- Ancho y profundidad compatibles con equipos y cables.
- Pasillos de circulación, mantenimiento y retiro de componentes.
- Gestión de cables sin obstruir la extracción de aire.
- Blanking panels y sellado de pasajes.
- Puesta a tierra, equipotencialización e identificación.
Selección del sitio
| Criterio | Cuestiones de due diligence |
|---|---|
| Energía | ¿Capacidad firme? ¿Tensión? ¿Redundancia externa? ¿Plazo de conexión? ¿Calidad? |
| Telecom | ¿Cuántos operadores? ¿Rutas realmente diversas? ¿Entradas opuestas? |
| Ambiental | Clima, agua, ruido, emisiones, licencias, inundación y vecindad |
| Civil | Suelo, carga, vibración, altura, accesos y logística de equipos |
| Operación | Mano de obra, combustible, piezas, seguridad y tiempo de atención |
| Expansión | Área, servicios, fases, interferencias y continuidad durante obras |
En edificio existente (brownfield), realice levantamiento as-built, escaneo cuando sea aplicable, pruebas de carga, inspección de tableros y cables, análisis estructural y verificación de agua arriba o al lado de áreas críticas. La restricción invisible suele definir el proyecto: shaft, ruta de extracción, altura libre, carga de piso, protección contra incendio o acceso de rigging.
Fundamentos térmicos
Casi toda la energía eléctrica consumida por la TI se convierte en calor. La tarea del sistema térmico es capturar ese calor en el origen, transportarlo y rechazarlo al ambiente, manteniendo la entrada del equipo dentro del rango definido. La temperatura promedio de la sala no revela recirculación, bypass ni hotspot.
| Fenómeno | Efecto | Control |
|---|---|---|
| Recirculación | El aire caliente retorna a la entrada del rack | Contención, sellado y presión adecuada |
| Bypass | El aire frío no atraviesa la TI | Ajuste de caudal, placas ciegas y layout |
| Mezcla | Reduce el ΔT y la eficiencia | Segregación física de los flujos |
| Bajo caudal | La temperatura de entrada sube | Capacidad, ventiladores y caminos libres |
| Caudal excesivo | Energía desperdiciada y presión indebida | Modulación por demanda |
Parámetros ambientales
Las clases ambientales deben definirse conforme a los equipos instalados. Como referencia ampliamente usada, la ASHRAE TC 9.9 indica un rango recomendado de 18 °C a 27 °C para las clases A1 a A4; los límites permisibles varían por clase y no deben confundirse con un objetivo permanente de operación. La humedad debe gestionarse por punto de rocío, riesgo de condensación, electrostática y corrosión.
| Parámetro | Por qué medir | Buena práctica |
|---|---|---|
| Temperatura de entrada | Es el aire efectivamente recibido por la TI | Sensores por rack y altura, no solo en la pared |
| Humedad y punto de rocío | Condensación, ESD y corrosión | Tendencia y alarmas coherentes |
| Presión diferencial | Comprueba la dirección del flujo | Medir entre zonas relevantes |
| Particulado y corrosión | Confiabilidad electrónica | Filtrado, sellado y cupones cuando sea necesario |
| Fuga de agua | Detección temprana | Sensores por zona y prueba periódica |
Los equipos de cinta, baterías y componentes de potencia pueden tener límites distintos. La especificación del fabricante y la condición de garantía prevalecen.
Tecnologías de climatización
| Solución | Cuándo tiene sentido | Puntos de atención |
|---|---|---|
| Expansión directa (DX) | Sitios pequeños, modulares o distribuidos | Refrigerante, distancia, redundancia y eficiencia parcial |
| Agua helada | Mediana y gran escala, centralización | Bombas, chiller, torre/dry cooler, agua y controles |
| In-row | Hotspots y proximidad de la carga | Distribución hidráulica o de refrigerante en la sala |
| Rear-door | Retrofit y densidad elevada | Peso, mangueras, condensación y mantenimiento |
| Direct-to-chip | CPU y GPU de alta densidad | CDU, calidad del agua, presión, detección e interfaces |
| Inmersión | Cargas específicas y altísima densidad | Fluido, mantenimiento, compatibilidad y operación |
Compare costo total, clima local, disponibilidad hídrica, densidad, modularidad, eficiencia en carga parcial, mantenimiento simultáneo, área, ruido, refrigerantes, riesgo de fuga y capacidad del equipo. El mejor COP de un equipo aislado no garantiza el mejor desempeño del sistema.
Dimensionamiento y controles térmicos
La capacidad debe verificarse para condiciones externas de proyecto, carga sensible, pérdidas, redundancia y modos degradados. Sumar capacidades nominales sin confirmar curvas, temperatura de agua y aire, altitud y caudales genera falsa seguridad.
| Verificación | Pregunta de aceptación |
|---|---|
| Balance térmico | ¿Se incluyeron todas las fuentes de calor y escenarios? |
| Psicrometría | ¿Existe control contra condensación y humidificación excesiva? |
| Hidráulica | ¿La pérdida de carga, la autoridad de válvula y el balanceo están comprobados? |
| Controles | ¿Se revisaron la secuencia de operación y los setpoints? |
| Falla y mantenimiento | ¿La temperatura se mantiene aceptable en el evento definido? |
| Prueba dinámica | ¿Se simularon escalones de carga y transferencia? |
Métrica: la capacidad instalada no basta. Monitoree la capacidad disponible, utilizada y comprometida por zona, considerando siempre el componente limitante.
Cadena eléctrica crítica
La cadena típica incluye concesionaria, media tensión, transformación, tableros, generación, transferencia, UPS, distribución y rack. Cada etapa debe analizarse en condición normal, mantenimiento, falla, emergencia y retorno a la normalidad.
| Componente | Función | Riesgo crítico |
|---|---|---|
| Entrada y MT | Recibir, seccionar y proteger | Arco eléctrico, coordinación e indisponibilidad externa |
| Transformador | Adecuar tensión y aislar | Capacidad, temperatura, armónicos e incendio |
| GMG | Suministrar durante interrupción prolongada | Arranque, combustible, emisiones y rechazo de calor |
| ATS/STS | Transferir fuentes y caminos | Lógica, sincronismo y falla de conmutación |
| UPS | Acondicionar y sostener la transición | Bypass, batería, sobrecarga y falla común |
| PDU/RPP/busway | Distribuir y medir | Selectividad, expansión y error de conexión |
Grupos generadores y combustible
El generador debe atender la carga en régimen y los escalones transitorios, incluyendo motores, UPS, recarga, climatización y auxiliares. El análisis debe considerar secuencia de arranque, caída de tensión y frecuencia, capacidad de cortocircuito, altitud, temperatura, combustible y emisiones.
| Tema | Criterio |
|---|---|
| Autonomía | Definida por el riesgo, el contrato de reabastecimiento y el escenario de crisis |
| Tanques | Capacidad útil, contención, detección, transferencia y calidad del combustible |
| Arranque | Baterías y cargadores redundantes, precalentamiento y pruebas |
| Paralelismo | Control, sincronismo, división de carga y protección |
| Mantenimiento | Acceso, piezas, load bank e indisponibilidad planificada |
| Extracción y ruido | Contrapresión, temperatura, dispersión, acústica y licencias |
Prueba significativa: el arranque semanal sin carga no comprueba la cadena. El programa debe incluir pruebas bajo carga, falla de fuente, transferencia, estabilidad, autonomía operativa y retorno, con instrumentos calibrados y criterios claros.
UPS, baterías y almacenamiento de energía
| Tecnología | Ventaja | Atención |
|---|---|---|
| Doble conversión | Aislamiento de la carga y amplia aplicación | Pérdidas, bypass y eficiencia parcial |
| Modular | Escalabilidad y mantenimiento por módulo | Fallas comunes de control y bus |
| VRLA | Madurez y costo inicial | Temperatura, vida, peso y monitoreo |
| Ion-litio | Vida útil, ciclos y menor área/peso | BMS, propagación térmica y estrategia de incendio |
| Flywheel | Alta potencia y muchos ciclos | Autonomía corta e integración con generación |
Para dimensionar la autonomía, considere la curva real de descarga, la potencia constante, la tensión mínima, la temperatura, el envejecimiento, la tolerancia de fabricación y el margen de crecimiento. La autonomía necesaria no debe elegirse por costumbre: debe cubrir el intervalo entre la pérdida de fuente y la estabilización de la generación, o una estrategia de shutdown controlado.
Seguridad: las salas y sistemas de batería exigen una evaluación específica de ventilación, detección, contención, acceso, EPP y respuesta a emergencias conforme a la tecnología y la regulación aplicable.
Protección, selectividad y calidad de energía
El estudio eléctrico debe incluir flujo de carga, cortocircuito, coordinación y selectividad, caída de tensión, puesta a tierra, protección contra sobretensiones, armónicos y, cuando sea aplicable, energía incidente de arco eléctrico. Los estudios deben reflejar todos los modos de operación, incluso con generador.
| Problema | Síntoma | Tratamiento de proyecto |
|---|---|---|
| Armónicos | Calentamiento y distorsión | Medición, filtros, transformadores y conductores adecuados |
| Bajo factor de potencia | Capacidad ocupada y penalizaciones | Corrección coordinada y análisis de resonancia |
| Transitorios | Reinicio o daño | DPS en cascada y equipotencialización |
| Falta de selectividad | Desconecta un área mayor que la falla | Curvas, ajustes y ensayo de protección |
| Desequilibrio | Calentamiento y pérdida de capacidad | Distribución de fases y monitoreo |
Planifique medidores en utility, generación, UPS, refrigeración, distribución y rack. Sin granularidad, no se calcula el PUE con confianza ni se localiza pérdida, desbalanceo o capacidad ociosa.
Conectividad de punta a punta
Tener dos contratos de operadora no garantiza diversidad. Las fibras pueden compartir poste, ducto, caja, entrada de edificio o sala. El análisis debe mapear rutas físicas, puntos de presencia, meet-me rooms, cross-connects, equipos activos y alimentación.
- Entradas físicas separadas y documentadas.
- Meet-me rooms segregadas cuando la criticidad lo exija.
- Rutas internas A/B hasta las salas y racks.
- Bandejas y ductos dimensionados, aterrizados y protegidos.
- Identificación permanente y documentación as-built.
- Pruebas ópticas y metálicas con informes de aceptación.
Cableado y arquitectura de red
| Capa | Opciones | Criterios |
|---|---|---|
| Campus y operadora | Fibra monomodo | Distancia, ruta, empalme, disponibilidad y SLA |
| Backbone interno | OS2, OM4 o OM5 según la aplicación | Velocidad, distancia y evolución |
| Horizontal | Cobre o fibra | Longitud, densidad, PoE, EMI y gestión |
| Core/spine | Alta capacidad y redundancia | Falla de dominio, convergencia y automatización |
| Leaf/ToR/EoR | Conexión de servidores | Cableado, puertos, oversubscription y mantenimiento |
| OOB | Red fuera de banda | Independencia, seguridad y acceso durante fallas |
Dimensione fibras, puertos, bandejas y patch panels con crecimiento explícito. La tasa de datos depende del estándar, del transceptor, de la distancia, de la pérdida óptica y de los conectores. El proyecto también debe separar las redes de producción, gestión, storage, seguridad y automatización predial.
Protección contra incendio
La estrategia combina prevención, detección temprana, compartimentación, control de materiales, supresión y respuesta. Ninguna tecnología aislada elimina el riesgo. El proyecto debe ser aprobado por las autoridades competentes y coordinado con arquitectura, eléctrica, climatización y operación.
| Capa | Ejemplos | Objetivo |
|---|---|---|
| Prevención | Housekeeping, termografía, mantenimiento, materiales | Reducir la probabilidad |
| Detección | Puntual, aspiración, térmica y alarmas | Identificar temprano y localizar |
| Pasiva | Compartimentación, sellado y puertas | Limitar la propagación |
| Supresión | Sprinkler/pre-action, agua nebulizada, agente limpio | Controlar o extinguir |
| Respuesta | EPO definido, brigada, bomberos, continuidad | Proteger personas y servicio |
Estanqueidad: cuando la eficacia del agente dependa de la retención en el recinto, el proyecto debe prever integridad, sellado, alivio de presión y ensayo de estanqueidad conforme a los criterios aplicables.
Seguridad física y protección patrimonial
| Zona | Control típico |
|---|---|
| Perímetro | Barreras, iluminación, detección y vigilancia |
| Recepción | Identificación, autorización, registro y escolta |
| Áreas técnicas | Perfiles de acceso, doble autenticación e interbloqueo |
| Sala de TI | Privilegio mínimo, logs y segregación de clientes |
| Racks y jaulas | Cerradura, sello, sensor e inventario |
| Medios y carga | Cadena de custodia, inspección y descarte seguro |
Para CCTV y control de acceso, defina cobertura, resolución, retención, sincronismo de hora, redundancia, privacidad e investigación. Los eventos de acceso deben correlacionar persona, credencial, puerta, cámara y orden de servicio. Anti-passback y mantrap necesitan procedimientos de contingencia y seguridad de vida.
Controladores, cámaras, BMS y DCIM son activos digitales: exigen redes segmentadas, cuentas individuales, MFA cuando sea compatible, hardening, gestión de parches, backups probados y logs enviados a un repositorio protegido.
BMS, EPMS y DCIM
| Sistema | Enfoque | Ejemplos |
|---|---|---|
| BMS | Automatización predial y ambiental | Climatización, fuga, presión, puertas |
| EPMS | Energía y calidad eléctrica | Medidores, interruptores, UPS, GMG, tendencias |
| DCIM | Capacidad y activos de data center | Rack, puerto, potencia, espacio, workflow |
| ITSM/NOC | Incidentes, cambios y servicio | Tickets, escalamiento, SLA y conocimiento |
- Cada alarma necesita prioridad, retardo, histéresis y procedimiento.
- Las alarmas consecuentes deben agruparse para evitar tempestades de alarmas.
- El sincronismo de hora es obligatorio para el análisis causal.
- El operador debe saber qué hacer, no solo qué ocurrió.
- Las pruebas periódicas deben comprobar sensor, comunicación, lógica y notificación.
Dato útil: la tendencia histórica transforma el monitoreo en gestión — anticipa pérdida de eficiencia, degradación de batería, saturación térmica y desbalanceo de carga.
Modelos de construcción
| Modelo | Característica | Riesgo a gestionar |
|---|---|---|
| Design-bid-build | Proyecto antes de la contratación de la obra | Interfaces y cambios tardíos |
| Design-build | Responsabilidad integrada | Gobernanza de requisitos e independencia de la verificación |
| EPC/turnkey | Entrega concentrada en un contratista | Alcance, desempeño y transparencia de costos |
| Construction management | Paquetes coordinados por el gerenciador | Integración y responsabilidad entre contratos |
| Modular/prefabricado | Fabricación fuera del sitio | FAT, transporte, interfaces y montaje |
El proyecto debe prever secuencia de obra, izaje, entrada de equipos, almacenamiento, áreas temporales, energización, limpieza, protección de activos y futuras sustituciones. En un entorno activo, el método de procedimiento, la ventana, el rollback y el aislamiento se convierten en parte del proyecto.
Materiales, ejecución y QA/QC
Los materiales deben cumplir con el desempeño mecánico, eléctrico, térmico, de fuego, corrosión y mantenimiento. Las sustituciones “equivalentes” solo pueden aceptarse tras una comparación formal de especificación, interfaces, certificaciones, pérdida de carga, eficiencia, curvas y garantía.
| Disciplina | Puntos de inspección |
|---|---|
| Civil y arquitectura | Cotas, carga, impermeabilización, sellado, acabado y limpieza |
| Eléctrica | Torque, identificación, medición de aislamiento, puesta a tierra, protección y parametrización |
| Mecánica | Limpieza, flushing, estanqueidad, aislamiento, balanceo y drenaje |
| Telecom | Radio de curvatura, segregación, certificación, etiquetado y as-built |
| Automatización | Puntos, escalas, alarmas, fail-safe, integración e histórico |
| Incendio | Zonas, detectores, interfaces, descarga/flujo y documentación legal |
Use Inspection and Test Plans con hold points, witness points, criterios, evidencias y responsables. No deje pendencias sin clasificación: la punch list debe registrar criticidad, responsable, plazo, bloqueo de aceptación y comprobación de cierre.
Commissioning por niveles
El commissioning es un proceso de garantía de desempeño iniciado en los requisitos, no una prueba hecha el último día. Verifica documentación, instalación, arranque, controles, capacidad e interacción entre sistemas.
| Nivel | Ejemplo de actividad |
|---|---|
| L0 — requisitos y proyecto | Revisión de OPR, BoD, secuencias y testabilidad |
| L1 — fábrica | FAT, certificados, inspección y configuración |
| L2 — instalación | Inspección física, torque, cables, tubería e identificación |
| L3 — arranque | Startup individual y pruebas funcionales |
| L4 — sistema | Capacidad, alarmas, redundancia y modos de operación |
| L5 — integrado | Fallas encadenadas, utility loss, black building y recovery |
Una prueba integrada (IST) debe usar guion aprobado, precondiciones, instrumentos calibrados, análisis de riesgos, abort criteria, roles definidos, comunicación y recolección sincronizada de datos. El objetivo es demostrar comportamiento y recuperación, no provocar una falla sin control.
Documentación y handover
| Entregable | Contenido mínimo |
|---|---|
| As-built | Planos, diagramas, rutas, listas y revisiones finales |
| O&M | Manuales, rutinas, límites, piezas y contactos |
| Estudios | Cortocircuito, selectividad, térmico, hidráulico y riesgo |
| Configuraciones | Setpoints, firmware, backups y matriz de comunicación |
| Pruebas | FAT, SAT, pruebas funcionales, IST y pendencias |
| Capacitación | Contenido, asistencia, evaluación y simulaciones |
| Activos | Tag, modelo, serial, garantía, criticidad y repuestos |
Regla de oro: no acepte un sistema que solo “enciende”. Acepte un sistema cuya capacidad, protección, control, alarmas, fallas y recuperación estén documentados y demostrados.
Los modelos BIM, la base de activos y los datos del DCIM solo agregan valor si existe gobernanza de actualización. Defina fuente oficial, responsable, frecuencia, integración y auditoría.
Operación crítica
La confiabilidad del proyecto se deteriora cuando los cambios, el mantenimiento y el conocimiento no se controlan. Una operación madura combina gobernanza, procedimientos, capacitación, comunicación y mejora continua.
| Proceso | Control esencial |
|---|---|
| Cambio | Evaluación de riesgo, aprobación, MOP, rollback y post-validación |
| Mantenimiento | Plan por criticidad, ventana, repuestos y evidencia |
| Incidente | Comando, comunicación, escalamiento, registro y RCA |
| Capacidad | Actual, comprometida, reservada y previsión por dominio |
| Proveedor | SLA, acceso, competencia, piezas y desempeño |
| Capacitación | Calificación, simulación y recertificación interna |
El SOP describe la operación normal; el MOP, una intervención planificada; el EOP, la respuesta a un evento anormal. Todos deben tener prerrequisitos, roles, pasos numerados, puntos de parada, validación y versión controlada.
Indicadores y eficiencia
El PUE es la razón entre la energía total del data center y la energía de la TI. Es útil cuando las fronteras, el período, la medición y las condiciones son consistentes. No mide disponibilidad, carbono, agua, productividad de la TI ni eficiencia aislada de un servidor.
| Indicador | Uso | Cuidado |
|---|---|---|
| PUE | Eficiencia energética de la infraestructura | Comparar con fronteras y períodos equivalentes |
| WUE | Uso de agua asociado a la operación | Definir metodología y contexto hídrico |
| CUE | Emisiones asociadas a la energía | Depende del factor de emisión |
| Disponibilidad | Tiempo apto para el servicio | Definir exclusiones y alcance |
| MTTR | Velocidad de recuperación | No ocultar recurrencia |
| Capacidad stranded | Recurso ocioso por otro límite | Analizar energía, térmica, espacio y red |
- Establezca baseline y calidad de la medición.
- Ataque el bypass, la recirculación y las cargas auxiliares antes de elevar los setpoints.
- Use secuenciamiento y velocidad variable.
- Pruebe los cambios en olas, con límites y rollback.
- Convierta el ahorro en costo evitado y capacidad liberada.
IA, HPC y refrigeración líquida
Las cargas de IA concentran potencia, red y calor en pocos racks. El desafío deja de ser solo capacidad total y pasa a incluir transitorios, calidad de energía, distribución física, caudal, temperatura de retorno, redundancia de CDU y mantenimiento de circuitos líquidos próximos a la electrónica.
| Tema | Preguntas de proyecto |
|---|---|
| Potencia | ¿Qué pico, rampa y diversidad por clúster? |
| Red | ¿Qué topología, latencia, cableado y espacio para óptica? |
| Líquido | ¿Qué clase de agua, temperatura, presión, calidad y responsabilidad? |
| CDU | ¿Redundancia, intercambio térmico, bombas, control y bypass? |
| Riesgo | ¿Detección, contención, dripless connectors y respuesta? |
| Operación | ¿Cómo drenar, purgar, mantener y expandir sin detener? |
Incluso si la primera fase es air cooled, reserve rutas, área técnica, carga estructural, puntos hidráulicos, capacidad eléctrica e instrumentación para pods de alta densidad. Los retrofits improvisados tienden a crear dependencias e indisponibilidad.
Roadmap de implementación
| Fase | Salidas verificables |
|---|---|
| 0. Estrategia | BIA, opciones build/buy, shortlist de sitios y business case |
| 1. Estudio preliminar | Carga, área, riesgos, concepto, plazo y presupuesto |
| 2. Proyecto conceptual | Arquitecturas, diagramas, criterios y estimación |
| 3. Básico y ejecutivo | Cálculos, detalles, especificaciones, BoQ y planes de prueba |
| 4. Contratación | RFP, equalización, responsabilidades e hitos |
| 5. Construcción | QA/QC, seguridad, cambios y evidencias |
| 6. Commissioning | Pruebas por nivel, IST, capacitación y punch list |
| 7. Operación | Handover, baseline, SLA, mantenimiento y mejora |
Cada fase debe terminar con criterios de aprobación. El gate no existe para burocratizar, sino para evitar que incertidumbres críticas avancen y se conviertan en cambios costosos. Los requisitos no atendidos deben corregirse, aceptarse formalmente como riesgo o retirarse del alcance con el impacto registrado.
Checklist para RFP y contratación
| Bloque | Ítems |
|---|---|
| Alcance | Límites, interfaces, inclusiones, exclusiones y responsabilidades |
| Desempeño | Capacidad, autonomía, eficiencia, disponibilidad y ambiente |
| Proyecto | Normas, entregables, revisión, BIM/CAD y control de cambios |
| Suministro | Marcas aceptadas, equivalencia, FAT, logística, garantía y piezas |
| Construcción | Plan, seguridad, QA/QC, ITP, cronograma y entorno activo |
| Pruebas | SAT, pruebas funcionales, load bank, IST y criterios de aceptación |
| Operación | Capacitación, O&M, as-built, asistencia y SLA |
- Compare excepciones técnicas, no solo el precio total.
- Normalice eficiencia, capacidad útil, redundancia y autonomía.
- Evalúe lead time, obsolescencia y soporte local.
- Exija matriz de conformidad ítem por ítem.
- Vincule el pago a hitos y evidencias de desempeño.
Checklist de preparación operacional
| Pregunta | Evidencia esperada |
|---|---|
| ¿El equipo conoce la secuencia de operación? | Capacitación y simulación registradas |
| ¿Los procedimientos reflejan el as-built? | SOP, MOP y EOP revisados y controlados |
| ¿Las alarmas tienen respuesta definida? | Matriz de alarmas y playbooks |
| ¿Las piezas críticas están disponibles? | Inventario, conservación y reposición |
| ¿Se probaron los backups de configuración? | Restauración comprobada |
| ¿Los contratos cubren el escenario 24x7? | SLA, contactos y escalamiento |
| ¿Hay baseline antes de la ocupación? | Energía, térmica, red y ambiente registrados |
Resultado: el data center está listo cuando las personas, procesos, documentación, herramientas y proveedores logran operar y recuperar la infraestructura — no solo cuando termina la obra.
Fórmulas y conversiones rápidas
| Tema | Relación de referencia |
|---|---|
| Potencia trifásica | P ≈ √3 × V × I × FP × eficiencia |
| Energía | kWh = kW × horas |
| Carga térmica | 1 kW ≈ 3.412 BTU/h |
| Tonelada de refrigeración | 1 TR ≈ 3,517 kW térmicos |
| PUE | energía total del data center ÷ energía de la TI |
| Disponibilidad simple | MTBF ÷ (MTBF + MTTR) |
| Crecimiento compuesto | capacidad futura = actual × (1 + tasa)^años |
Las relaciones anteriores son simplificaciones para estimación. El proyecto ejecutivo exige curvas, factores de corrección, condiciones ambientales, pérdidas, armónicos, simultaneidad y criterios normativos.
Ejemplo de sizing conceptual: carga TI de 600 kW, crecimiento hasta 900 kW en cinco años y expansión modular de 150 kW. La estrategia puede implementar 4 módulos activos + 1 redundante en la fase inicial, reservando espacio e infraestructura primaria para módulos futuros. El análisis debe verificar si el sistema mantiene N durante mantenimiento y falla, y si las cargas auxiliares acompañan cada etapa.
Referencias técnicas recomendadas
Consulte siempre la edición vigente, el alcance contratado y los requisitos legales locales. Las referencias siguientes orientan el estudio, pero no sustituyen la adquisición, la lectura íntegra ni la aplicación por profesionales habilitados.
| Referencia | Aplicación |
|---|---|
| ISO/IEC 22237 | Data centre facilities and infrastructures — conceptos, edificio, energía, ambiente, telecom, seguridad y operación |
| ISO/IEC 30134 | Indicadores clave de desempeño para data centers, incluyendo PUE |
| ASHRAE TC 9.9 | Thermal Guidelines for Data Processing Environments |
| Uptime Institute Tier Standard | Criterios de topología y programas de certificación |
| ANSI/TIA-942 | Infraestructura de telecomunicaciones para data centers |
| NFPA 70 / 75 / 76 / 855 | Eléctrica, protección de TI y telecom y sistemas de almacenamiento de energía, según aplicable |
| ABNT NBR 5410 / 14039 / 5419 | Instalaciones eléctricas BT y MT y protección contra descargas atmosféricas |
| ABNT NBR 14565 | Cableado estructurado para edificios comerciales y data centers |
| ABNT NBR 17240 y normas de incendio aplicables | Detección y alarma, además de las exigencias locales del Cuerpo de Bomberos |
La legislación brasileña, las normas ABNT, las instrucciones del Cuerpo de Bomberos y las exigencias ambientales deben confirmarse para el lugar y la fecha del proyecto.
Conclusión
Diseñar un data center es administrar consecuencias. La mejor solución no es la que acumula más equipos redundantes, sino la que conecta criticidad, riesgo, arquitectura, ejecución, pruebas y operación de forma coherente y demostrable.
- Realizar un workshop de requisitos y BIA.
- Consolidar inventario, capacidad y horizonte de expansión.
- Ejecutar due diligence del sitio y de los servicios.
- Producir un proyecto conceptual con alternativas y TCO.
- Definir criterios de commissioning antes de la contratación.
- Planificar el handover y la operación desde el inicio.
EnQ Digital: infraestructura inteligente para empresas que no pueden detenerse — estrategia, ingeniería, implementación, operación y evolución orientadas a riesgo y desempeño.