B200
NVIDIABlackwell · 2024
Ideal paraEntrenamiento a gran escala y FP4
Unas 4× la inferencia y 2× el entrenamiento de una H100; oferta restringida hasta 2027.
Infraestructura de email
Servidores KumoMTAMTA de código abierto, Rust + Lua, sin tarifa por mensajeServidores PowerMTACon licencia, pools VirtualMTA, soporte del proveedorEntregabilidadWarm-up, alineación DMARC, feedback loopsServidores
Bare metal — AMD EPYCInquilino único Turin / Genoa, hasta 192 núcleosServidores GPU e IANVIDIA Blackwell B200 / H200, PCIe Gen5VPSInstancias por núcleo sobre los mismos hosts EPYCCloud y red
CloudInstancias por horas, snapshots, NVMe Gen5Protección DDoSAbsorción en el borde incluida en cada servidorRed y regionesÁmsterdam · Fráncfort · Londres · AshburnGPU e IA
Un servidor GPU hace su trabajo con aceleradores en vez de con la CPU. Montamos servidores GPU de inquilino único para entrenamiento e inferencia de IA: NVIDIA B200 y H200 sobre hosts AMD EPYC de alta frecuencia, con NVLink, tejido rápido y refrigeración líquida. Y damos consejo honesto de alquilar-vs-comprar, de cuándo una H200 gana a esperar Blackwell, y de dónde encaja AMD Instinct —en España y en Latinoamérica.
En breve
Es un servidor cuyo trabajo lo hacen sobre todo los procesadores gráficos en vez de la CPU. Para IA significa uno o varios aceleradores de centro de datos —NVIDIA B200 o H200, o AMD Instinct— cada uno con decenas o cientos de gigabytes de memoria de alto ancho de banda, unidos entre sí por NVLink o Infinity Fabric y a otros nodos por una red rápida. El papel de la CPU pasa a ser alimentar las GPUs y mover datos, no hacer las cuentas.
La consecuencia práctica es que un servidor GPU se diseña al revés que uno normal: lo que importa no es el recuento de núcleos de la CPU sino la memoria de la GPU, el ancho de banda entre tarjetas y la red entre nodos. Una GPU es tan útil como la máquina que la alimenta, así que el resto de la página trata de eso: qué tarjeta, qué host, qué tejido, y cuándo conviene alquilar en vez de comprar.
Las tarjetas
No hay una sola «mejor GPU». La elección sale del tamaño del modelo y de si entrenas o infieres; aquí va para qué es de verdad cada una, revisado en 2026-06.
Blackwell · 2024
Ideal paraEntrenamiento a gran escala y FP4
Unas 4× la inferencia y 2× el entrenamiento de una H100; oferta restringida hasta 2027.
Hopper · 2024
Ideal paraLa mayoría de cargas, disponible ya
Memoria amplia, software maduro y menor consumo. Suele ser la elección sensata.
Hopper · 2022
Ideal paraEntrenamiento e inferencia probados
El caballo de batalla; barato al contado en neoclouds para trabajo sensible al coste.
CDNA 3 · 2023
Ideal paraInferencia de un nodo, modelos limitados por memoria
Competitiva en ROCm; el límite real es la profundidad de la oferta de alquiler.
El contexto de 2026 lo manda la escasez. La demanda de IA ha copado la producción de HBM y memoria, los precios de alquiler han subido con fuerza —la H100 en torno a un 20 %, la B200 un 24 % y la H200 hasta un 48 % en cuestión de meses— y los plazos de los chips nuevos van de 36 a 52 semanas. A principios de 2026 cuesta encontrar bloques de 64 GPUs o más disponibles de inmediato entre los proveedores grandes.
Estresan partes distintas de la máquina, y confundirlos es como se tira el dinero. El entrenamiento estresa la interconexión: cuántas GPUs puedes hacer que se comporten como una. La inferencia estresa la memoria y el ancho de banda por euro, porque el trabajo es sostener un modelo y servir tokens barato. La precisión vive debajo de ambos: FP4 reduce a la mitad los bytes por parámetro frente a FP8, duplica el ancho de banda efectivo y deja que una sola tarjeta sirva un modelo que antes necesitaba dos.
En la práctica, un clúster de entrenamiento se compra alrededor de su tejido —cuántas GPUs puedes hacer que se comporten como una— mientras que una flota de inferencia se compra alrededor de la memoria y el ancho de banda por euro, porque el trabajo es sostener un modelo y servir tokens barato. Diseñamos el nodo para el lado de esa línea en el que de verdad vives, en vez de comprar un equipo de entrenamiento para inferir o dejar a un entrenamiento sin interconexión.
El dimensionado sale de ese reparto de forma concreta. Para entrenar inclinamos el nodo hacia la interconexión y el número de GPUs que escala limpio en tu framework; para inferir lo inclinamos hacia memoria por euro y ancho de banda, y nos apoyamos en FP4 donde el modelo lo tolera. El tamaño de lote, la longitud de secuencia y cuántos usuarios sirves a la vez fijan luego cuánto margen dejar. Nada de esto es exótico, pero acertarlo más o menos es la diferencia entre pagar por aceleradores que trabajan y pagar por unos que esperan.
El nodo
Una GPU es tan útil como la máquina que la alimenta. La CPU del host, los enlaces entre GPUs y la red a otros nodos deciden si los aceleradores trabajan o esperan.
El host importa más de lo que se cree. Una CPU AMD EPYC de alta frecuencia —las piezas 'F' pensadas para velocidad de reloj— mantiene alimentadas a ocho GPUs hambrientas en vez de dejarlas ociosas entre lotes, que es por lo que los nodos GPU emparejan aceleradores con núcleos rápidos y no con el recuento de núcleos más alto. PCIe Gen5 mueve datos a las tarjetas, NVLink une las GPUs entre sí para que compartan memoria a terabytes por segundo, y un NIC rápido sobre InfiniBand o RoCE junta nodos en un clúster. Falla cualquiera de esos y el silicio caro espera.
$ nvidia-smi --query-gpu=name,memory.total,power.limit --format=csv
name, memory.total [MiB], power.limit [W]
NVIDIA B200, 183360 MiB, 1000.00 W
NVIDIA B200, 183360 MiB, 1000.00 W
... (8 GPUs en total en la placa base HGX)
$ nvidia-smi topo -m # matriz de interconexión (extracto)
GPU0 GPU1 GPU2 ... CPU Affinity NUMA
GPU0 X NV18 NV18 0-63 0
GPU1 NV18 X NV18 0-63 0
# NV18 = 18 conexiones NVLink — todo-con-todo por el switch NVLink Casi todo lo descrito se ensambla en unas pocas formas estándar, y cuál necesitas se sigue de la escala. Un solo acelerador vale para desarrollo e inferencia modesta; un nodo de ocho GPUs es el caballo de batalla para entrenamiento serio y servicio de alto rendimiento; y un rack completo une decenas de GPUs en un mismo tejido para los trabajos más grandes. Las unidades de abajo son con las que trabajamos.
El salto entre ellas es un escalón de coste, potencia y complejidad operativa cada vez, así que dimensionamos a la forma más pequeña que hace el trabajo. Un equipo que necesita cuarenta GPUs de entrenamiento durante unas semanas suele estar mejor servido por un nodo de ocho GPUs a tope, o por capacidad alquilada, que comprometiéndose a un rack que no mantendrá lleno.
Elegir
Una vez clara la carga, la elección se reduce a estas, más o menos en el orden en que aprietan.
Es la pregunta que más nos hacen, y la respuesta honesta es que depende de con qué constancia las vas a usar. Alquilar gana cuando el trabajo es a ráfagas o exploratorio. El trabajo es a ráfagas o exploratorio, el proyecto es corto, o necesitas cómputo este mes mientras persisten los plazos del silicio nuevo. Comprar gana cuando el trabajo es estable. La utilización es sostenida y casi continua, la residencia o el aislamiento de datos importan, o el horizonte es de varios años donde el alquiler por hora se acumula.
Como regla práctica que manejan muchos responsables financieros: por debajo de unas 500 horas de entrenamiento al mes, alquilar casi siempre gana; por encima de forma consistente, conviene calcular el ROI de tener infraestructura propia o un contrato de reserva. Comprar un servidor solo ahorra con una utilización sostenida por encima del 60 % durante 18 a 24 meses, y los costes ocultos —energía, refrigeración, personal, instalación, depreciación— añaden un 40–60 % sobre el precio del hardware al año. En Europa, donde la electricidad es cara, ese coste energético pesa más en la balanza.
Dos cautelas mantienen la decisión honesta. La primera es la oferta: El mercado de alquiler de NVIDIA es mucho más profundo que el de compra, y para contratos cortos suele ganar también en precio; los neoclouds especializados cuestan menos de la mitad que los hiperescaladores. La segunda es la tentación de esperar a lo siguiente. Esperar a la próxima generación rara vez sale a cuenta: para cuando llega y escala, ya vas un ciclo por detrás. Mejor probar en hardware disponible y comprometerte cuando la utilización lo justifique. Juntas, el camino sobrio para la mayoría es empezar en hardware disponible y probado —a menudo Hopper—, validar la carga, y comprometerte a comprar capacidad solo cuando la utilización lo justifique. El modelo híbrido suele ganar: el hardware propio cubre el suelo, el alquilado cubre el techo.
Alquila cuando
El trabajo es a ráfagas o exploratorio, el proyecto es corto, o necesitas cómputo este mes mientras persisten los plazos del silicio nuevo.
Compra cuando
La utilización es sostenida y casi continua, la residencia o el aislamiento de datos importan, o el horizonte es de varios años donde el alquiler por hora se acumula.
NVIDIA tiene en torno al 80 % del mercado y sigue liderando el entrenamiento multinodo a gran escala, más por el ecosistema de software CUDA y NCCL que por el silicio en bruto. Es el camino seguro cuando vas a repartir un entrenamiento entre muchas tarjetas y nodos, y donde el mercado de alquiler es más profundo si necesitas capacidad ya.
AMD Instinct, con hasta 288 GB de memoria, se ha vuelto competitiva de verdad en inferencia de un nodo y modelos limitados por memoria sobre ROCm, y a veces ofrece más memoria por euro. La pega honesta no es el silicio sino la oferta: el mercado de alquiler de NVIDIA es mucho más profundo, así que para contratos cortos NVIDIA suele ganar también en precio. Te decimos cuál encaja con tu modelo y tu plazo, no cuál está de moda.
Los aceleradores más nuevos consumen 1000 vatios o más cada uno, y ocho de ellos en un chasis producen más calor del que el aire puede sacar de forma razonable. La refrigeración líquida absorbe esa carga térmica y deja que las GPUs mantengan sus frecuencias bajo trabajo sostenido; las tarjetas de generación Hopper, a 700 vatios, aún pueden ir por aire, que es una razón más para que a veces la H200 sea la elección más simple. En Europa, además, el coste de la electricidad convierte la eficiencia energética en parte de la ecuación de propiedad, no en un detalle.
El inquilino único es la otra mitad. El nodo entero es tuyo, sobre un host AMD EPYC de alta frecuencia, con las GPUs, el tejido NVLink y el NVMe local dedicados a tu carga y sin otro inquilino compartiendo la máquina. Recibes root, tu elección de pila CUDA o ROCm, y el aislamiento físico que suelen pedir la residencia de datos y el cumplimiento —en la región que elijas, sea España o Latinoamérica, sobre una red que enrutamos de extremo a extremo.
Montamos y operamos nodos GPU de inquilino único para entrenamiento e inferencia, y te decimos con la misma franqueza cuándo alquilar capacidad a un tercero te sale mejor que comprometerte con hardware mientras el mercado está tensado. Donde aportamos valor es en el nodo propio bien dimensionado y bien alimentado, sobre EPYC, en la región que necesites, para la carga sostenida que justifica tenerlo.
Y si los números aún no lo justifican, lo decimos: empieza alquilando capacidad probada, valida la carga y mide la utilización real durante unas semanas. Cuando el uso sostenido cruce el umbral, montamos el nodo propio que pase a salir más barato. Preferimos ese camino —probar barato, comprometerse tarde— a venderte hierro que se quede ocioso entre proyectos mientras el mercado de GPU sigue tensado.
Preguntas
Lo que se pregunta antes de elegir GPU para IA.
Un servidor cuyo trabajo lo hacen sobre todo los procesadores gráficos, no la CPU. Para IA significa uno o varios aceleradores de centro de datos —NVIDIA B200 o H200, o AMD Instinct— cada uno con decenas o cientos de gigabytes de memoria de alto ancho de banda, unidos entre sí por NVLink o Infinity Fabric y a otros nodos por una red rápida. El papel de la CPU pasa a ser alimentar las GPUs y mover datos, no hacer las cuentas.
Depende del tamaño del modelo y de si entrenas o infieres. La VRAM decide qué cabe sin partir un modelo entre tarjetas: un modelo de 70B en FP16 necesita unos 140 GB, así que una H200 de 141 GB o una B200 de 192 GB lo sostienen en una sola GPU. El ancho de banda decide la velocidad de generación de tokens, y FP4 casi duplica el rendimiento de inferencia donde la exactitud lo permite. Dimensionamos a la carga, no a la parte alta de la lista de precios.
No. La B200 da unas cuatro veces la inferencia y cerca del doble del entrenamiento de una H100, pero consume 1000 vatios, suele necesitar refrigeración líquida y arrastra largos plazos de entrega. Una H200 tiene memoria de sobra, software maduro, menor consumo y está disponible ya, y cubre la gran mayoría de las cargas. Vamos a Blackwell cuando la memoria o el rendimiento FP4 son la verdadera restricción, no por defecto.
Alquila para trabajo a ráfagas o experimental, proyectos cortos, o cualquier cosa que necesites este mes mientras persisten los plazos del silicio nuevo. Compra —en un nodo dedicado o en colocation— cuando la utilización es sostenida y casi continua, cuando la residencia o el aislamiento de datos importan, o en un horizonte de varios años donde el alquiler por hora se acumula. Hacemos cualquiera de las dos y te decimos cuál favorecen los números.
NVIDIA tiene en torno al 80 % del mercado y sigue liderando el entrenamiento multinodo a gran escala, más por el ecosistema de software CUDA y NCCL que por el silicio en bruto. AMD Instinct, con hasta 288 GB de memoria, se ha vuelto competitiva de verdad en inferencia de un nodo y modelos limitados por memoria sobre ROCm. La pega honesta es la oferta: el mercado de alquiler de NVIDIA es mucho más profundo, así que para contratos cortos suele ganar también en precio.
Como guía rápida, parámetros por dos bytes para FP16, o por uno para FP8. Un modelo de 70B ronda los 140 GB en FP16 o 70 GB en FP8, así que cabe en una H200 o B200 a precisión completa, o en tarjetas menores si lo cuantizas. Por encima, o saltas a una pieza de 288 GB o lo repartes entre GPUs por NVLink, que es donde empieza a importar el ancho de banda de interconexión.
Sí, es lo que montamos. El nodo entero es tuyo, sobre un host AMD EPYC de alta frecuencia, con las GPUs, el tejido NVLink y el NVMe local dedicados a tu carga y sin otro inquilino compartiendo la máquina. Recibes root, tu elección de pila CUDA o ROCm, y el aislamiento que suelen pedir la residencia de datos y el cumplimiento.
Tamaño del modelo, si entrenas o infieres y tu horizonte, y te decimos qué GPU y qué nodo encajan —y si alquilar sale mejor que comprar. Sin presión.