GPU e IA

NVIDIA Blackwell y Hopper de inquilino único, a la medida del modelo.

Un servidor GPU hace su trabajo con aceleradores en vez de con la CPU. Montamos servidores GPU de inquilino único para entrenamiento e inferencia de IA: NVIDIA B200 y H200 sobre hosts AMD EPYC de alta frecuencia, con NVLink, tejido rápido y refrigeración líquida. Y damos consejo honesto de alquilar-vs-comprar, de cuándo una H200 gana a esperar Blackwell, y de dónde encaja AMD Instinct —en España y en Latinoamérica.

En breve

  • El modelo elige la GPU. La VRAM decide qué cabe; el ancho de banda, la velocidad de tokens. Dimensionamos a la carga.
  • Lo más nuevo no es siempre mejor. La H200 cubre la mayoría de cargas con menos consumo; vamos a B200 cuando la memoria o FP4 lo exigen.
  • Alquilar o comprar es cuestión de utilización. A ráfagas, alquila; sostenido y continuo, compra.
  • El mercado está tensado. Escasez de HBM, alquileres al alza y plazos de 36–52 semanas; a veces la mejor GPU es la disponible.
  • Inquilino único. El nodo entero es tuyo, con root y la pila CUDA o ROCm que elijas.

¿Qué es un servidor GPU?

Es un servidor cuyo trabajo lo hacen sobre todo los procesadores gráficos en vez de la CPU. Para IA significa uno o varios aceleradores de centro de datos —NVIDIA B200 o H200, o AMD Instinct— cada uno con decenas o cientos de gigabytes de memoria de alto ancho de banda, unidos entre sí por NVLink o Infinity Fabric y a otros nodos por una red rápida. El papel de la CPU pasa a ser alimentar las GPUs y mover datos, no hacer las cuentas.

La consecuencia práctica es que un servidor GPU se diseña al revés que uno normal: lo que importa no es el recuento de núcleos de la CPU sino la memoria de la GPU, el ancho de banda entre tarjetas y la red entre nodos. Una GPU es tan útil como la máquina que la alimenta, así que el resto de la página trata de eso: qué tarjeta, qué host, qué tejido, y cuándo conviene alquilar en vez de comprar.

Las tarjetas

¿Qué GPU necesitas de verdad?

No hay una sola «mejor GPU». La elección sale del tamaño del modelo y de si entrenas o infieres; aquí va para qué es de verdad cada una, revisado en 2026-06.

B200

NVIDIA

Blackwell · 2024

VRAM192 GB HBM3e Ancho de banda8 TB/s TDP1000 W (líquida) InterconexiónNVLink 1,8 TB/s

Ideal paraEntrenamiento a gran escala y FP4

Unas 4× la inferencia y 2× el entrenamiento de una H100; oferta restringida hasta 2027.

H200

NVIDIA

Hopper · 2024

VRAM141 GB HBM3e Ancho de banda4,8 TB/s TDP700 W (aire) InterconexiónNVLink

Ideal paraLa mayoría de cargas, disponible ya

Memoria amplia, software maduro y menor consumo. Suele ser la elección sensata.

H100

NVIDIA

Hopper · 2022

VRAM80 GB HBM3 Ancho de banda3,35 TB/s TDP700 W InterconexiónNVLink

Ideal paraEntrenamiento e inferencia probados

El caballo de batalla; barato al contado en neoclouds para trabajo sensible al coste.

MI300X

AMD

CDNA 3 · 2023

VRAM192 GB HBM3 Ancho de banda5,3 TB/s TDP750 W InterconexiónInfinity Fabric

Ideal paraInferencia de un nodo, modelos limitados por memoria

Competitiva en ROCm; el límite real es la profundidad de la oferta de alquiler.

El contexto de 2026 lo manda la escasez. La demanda de IA ha copado la producción de HBM y memoria, los precios de alquiler han subido con fuerza —la H100 en torno a un 20 %, la B200 un 24 % y la H200 hasta un 48 % en cuestión de meses— y los plazos de los chips nuevos van de 36 a 52 semanas. A principios de 2026 cuesta encontrar bloques de 64 GPUs o más disponibles de inmediato entre los proveedores grandes.

¿Entrenamiento o inferencia? Qué cambia

Estresan partes distintas de la máquina, y confundirlos es como se tira el dinero. El entrenamiento estresa la interconexión: cuántas GPUs puedes hacer que se comporten como una. La inferencia estresa la memoria y el ancho de banda por euro, porque el trabajo es sostener un modelo y servir tokens barato. La precisión vive debajo de ambos: FP4 reduce a la mitad los bytes por parámetro frente a FP8, duplica el ancho de banda efectivo y deja que una sola tarjeta sirva un modelo que antes necesitaba dos.

En la práctica, un clúster de entrenamiento se compra alrededor de su tejido —cuántas GPUs puedes hacer que se comporten como una— mientras que una flota de inferencia se compra alrededor de la memoria y el ancho de banda por euro, porque el trabajo es sostener un modelo y servir tokens barato. Diseñamos el nodo para el lado de esa línea en el que de verdad vives, en vez de comprar un equipo de entrenamiento para inferir o dejar a un entrenamiento sin interconexión.

El dimensionado sale de ese reparto de forma concreta. Para entrenar inclinamos el nodo hacia la interconexión y el número de GPUs que escala limpio en tu framework; para inferir lo inclinamos hacia memoria por euro y ancho de banda, y nos apoyamos en FP4 donde el modelo lo tolera. El tamaño de lote, la longitud de secuencia y cuántos usuarios sirves a la vez fijan luego cuánto margen dejar. Nada de esto es exótico, pero acertarlo más o menos es la diferencia entre pagar por aceleradores que trabajan y pagar por unos que esperan.

El nodo

En qué se apoya la GPU: el host y el tejido

Una GPU es tan útil como la máquina que la alimenta. La CPU del host, los enlaces entre GPUs y la red a otros nodos deciden si los aceleradores trabajan o esperan.

Un nodo de 8 GPUs, de extremo a extremo
Host EPYC CPU 'F' alta frec. PCIe Gen5 8 × GPU (B200 / H200) todo-con-todo por switch NVLink NVLink 1,8 TB/s alimenta y orquesta NIC InfiniBand / RoCE a otros nodos — tejido multinodo refrigeración líquida · inquilino único

El host importa más de lo que se cree. Una CPU AMD EPYC de alta frecuencia —las piezas 'F' pensadas para velocidad de reloj— mantiene alimentadas a ocho GPUs hambrientas en vez de dejarlas ociosas entre lotes, que es por lo que los nodos GPU emparejan aceleradores con núcleos rápidos y no con el recuento de núcleos más alto. PCIe Gen5 mueve datos a las tarjetas, NVLink une las GPUs entre sí para que compartan memoria a terabytes por segundo, y un NIC rápido sobre InfiniBand o RoCE junta nodos en un clúster. Falla cualquiera de esos y el silicio caro espera.

un nodo de 8× B200 — nvidia-smi
$ nvidia-smi --query-gpu=name,memory.total,power.limit --format=csv
name, memory.total [MiB], power.limit [W]
NVIDIA B200, 183360 MiB, 1000.00 W
NVIDIA B200, 183360 MiB, 1000.00 W
... (8 GPUs en total en la placa base HGX)

$ nvidia-smi topo -m   # matriz de interconexión (extracto)
       GPU0   GPU1   GPU2   ...   CPU Affinity   NUMA
GPU0    X     NV18   NV18          0-63          0
GPU1   NV18    X     NV18          0-63          0
# NV18 = 18 conexiones NVLink — todo-con-todo por el switch NVLink
Ocho GPUs en una placa base, totalmente conectadas por NVLink; el host y el tejido se dimensionan para que sigan ocupadas.

De una tarjeta a un rack

Casi todo lo descrito se ensambla en unas pocas formas estándar, y cuál necesitas se sigue de la escala. Un solo acelerador vale para desarrollo e inferencia modesta; un nodo de ocho GPUs es el caballo de batalla para entrenamiento serio y servicio de alto rendimiento; y un rack completo une decenas de GPUs en un mismo tejido para los trabajos más grandes. Las unidades de abajo son con las que trabajamos.

  • Una sola GPU — desarrollo e inferencia modesta. Una tarjeta sobre un host EPYC, lista en minutos.
  • Nodo de 8 GPUs — el caballo de batalla: entrenamiento serio y servicio de alto rendimiento, todo-con-todo por NVLink.
  • Rack completo — decenas de GPUs en un mismo tejido (InfiniBand / RoCE) para los trabajos más grandes.

El salto entre ellas es un escalón de coste, potencia y complejidad operativa cada vez, así que dimensionamos a la forma más pequeña que hace el trabajo. Un equipo que necesita cuarenta GPUs de entrenamiento durante unas semanas suele estar mejor servido por un nodo de ocho GPUs a tope, o por capacidad alquilada, que comprometiéndose a un rack que no mantendrá lleno.

Elegir

Las seis cosas que deciden la configuración

Una vez clara la carga, la elección se reduce a estas, más o menos en el orden en que aprietan.

VRAM Decide qué modelo cabe sin partirlo: 70B en FP16 ronda los 140 GB.
Ancho de banda Decide la velocidad a la que se generan los tokens.
Interconexión NVLink dentro del nodo; InfiniBand o RoCE entre nodos.
Precisión FP8 y FP4 duplican el rendimiento de inferencia donde la exactitud lo permite.
Refrigeración 1000 W por tarjeta suele exigir líquida; 700 W aún va por aire.
Oferta y plazo El chip más nuevo puede tardar meses; a veces la mejor GPU es la que hay.

¿Alquilar o comprar GPUs?

Es la pregunta que más nos hacen, y la respuesta honesta es que depende de con qué constancia las vas a usar. Alquilar gana cuando el trabajo es a ráfagas o exploratorio. El trabajo es a ráfagas o exploratorio, el proyecto es corto, o necesitas cómputo este mes mientras persisten los plazos del silicio nuevo. Comprar gana cuando el trabajo es estable. La utilización es sostenida y casi continua, la residencia o el aislamiento de datos importan, o el horizonte es de varios años donde el alquiler por hora se acumula.

Como regla práctica que manejan muchos responsables financieros: por debajo de unas 500 horas de entrenamiento al mes, alquilar casi siempre gana; por encima de forma consistente, conviene calcular el ROI de tener infraestructura propia o un contrato de reserva. Comprar un servidor solo ahorra con una utilización sostenida por encima del 60 % durante 18 a 24 meses, y los costes ocultos —energía, refrigeración, personal, instalación, depreciación— añaden un 40–60 % sobre el precio del hardware al año. En Europa, donde la electricidad es cara, ese coste energético pesa más en la balanza.

Dos cautelas mantienen la decisión honesta. La primera es la oferta: El mercado de alquiler de NVIDIA es mucho más profundo que el de compra, y para contratos cortos suele ganar también en precio; los neoclouds especializados cuestan menos de la mitad que los hiperescaladores. La segunda es la tentación de esperar a lo siguiente. Esperar a la próxima generación rara vez sale a cuenta: para cuando llega y escala, ya vas un ciclo por detrás. Mejor probar en hardware disponible y comprometerte cuando la utilización lo justifique. Juntas, el camino sobrio para la mayoría es empezar en hardware disponible y probado —a menudo Hopper—, validar la carga, y comprometerte a comprar capacidad solo cuando la utilización lo justifique. El modelo híbrido suele ganar: el hardware propio cubre el suelo, el alquilado cubre el techo.

Alquila cuando

El trabajo es a ráfagas o exploratorio, el proyecto es corto, o necesitas cómputo este mes mientras persisten los plazos del silicio nuevo.

Compra cuando

La utilización es sostenida y casi continua, la residencia o el aislamiento de datos importan, o el horizonte es de varios años donde el alquiler por hora se acumula.

¿NVIDIA o AMD?

NVIDIA tiene en torno al 80 % del mercado y sigue liderando el entrenamiento multinodo a gran escala, más por el ecosistema de software CUDA y NCCL que por el silicio en bruto. Es el camino seguro cuando vas a repartir un entrenamiento entre muchas tarjetas y nodos, y donde el mercado de alquiler es más profundo si necesitas capacidad ya.

AMD Instinct, con hasta 288 GB de memoria, se ha vuelto competitiva de verdad en inferencia de un nodo y modelos limitados por memoria sobre ROCm, y a veces ofrece más memoria por euro. La pega honesta no es el silicio sino la oferta: el mercado de alquiler de NVIDIA es mucho más profundo, así que para contratos cortos NVIDIA suele ganar también en precio. Te decimos cuál encaja con tu modelo y tu plazo, no cuál está de moda.

Potencia, refrigeración e inquilino único

Los aceleradores más nuevos consumen 1000 vatios o más cada uno, y ocho de ellos en un chasis producen más calor del que el aire puede sacar de forma razonable. La refrigeración líquida absorbe esa carga térmica y deja que las GPUs mantengan sus frecuencias bajo trabajo sostenido; las tarjetas de generación Hopper, a 700 vatios, aún pueden ir por aire, que es una razón más para que a veces la H200 sea la elección más simple. En Europa, además, el coste de la electricidad convierte la eficiencia energética en parte de la ecuación de propiedad, no en un detalle.

El inquilino único es la otra mitad. El nodo entero es tuyo, sobre un host AMD EPYC de alta frecuencia, con las GPUs, el tejido NVLink y el NVMe local dedicados a tu carga y sin otro inquilino compartiendo la máquina. Recibes root, tu elección de pila CUDA o ROCm, y el aislamiento físico que suelen pedir la residencia de datos y el cumplimiento —en la región que elijas, sea España o Latinoamérica, sobre una red que enrutamos de extremo a extremo.

Qué operamos, con honestidad

Montamos y operamos nodos GPU de inquilino único para entrenamiento e inferencia, y te decimos con la misma franqueza cuándo alquilar capacidad a un tercero te sale mejor que comprometerte con hardware mientras el mercado está tensado. Donde aportamos valor es en el nodo propio bien dimensionado y bien alimentado, sobre EPYC, en la región que necesites, para la carga sostenida que justifica tenerlo.

Y si los números aún no lo justifican, lo decimos: empieza alquilando capacidad probada, valida la carga y mide la utilización real durante unas semanas. Cuando el uso sostenido cruce el umbral, montamos el nodo propio que pase a salir más barato. Preferimos ese camino —probar barato, comprometerse tarde— a venderte hierro que se quede ocioso entre proyectos mientras el mercado de GPU sigue tensado.

Preguntas

Respondidas con claridad

Lo que se pregunta antes de elegir GPU para IA.

¿Qué es un servidor GPU?

Un servidor cuyo trabajo lo hacen sobre todo los procesadores gráficos, no la CPU. Para IA significa uno o varios aceleradores de centro de datos —NVIDIA B200 o H200, o AMD Instinct— cada uno con decenas o cientos de gigabytes de memoria de alto ancho de banda, unidos entre sí por NVLink o Infinity Fabric y a otros nodos por una red rápida. El papel de la CPU pasa a ser alimentar las GPUs y mover datos, no hacer las cuentas.

¿Qué GPU necesito de verdad?

Depende del tamaño del modelo y de si entrenas o infieres. La VRAM decide qué cabe sin partir un modelo entre tarjetas: un modelo de 70B en FP16 necesita unos 140 GB, así que una H200 de 141 GB o una B200 de 192 GB lo sostienen en una sola GPU. El ancho de banda decide la velocidad de generación de tokens, y FP4 casi duplica el rendimiento de inferencia donde la exactitud lo permite. Dimensionamos a la carga, no a la parte alta de la lista de precios.

B200 o H200: ¿lo más nuevo es siempre mejor?

No. La B200 da unas cuatro veces la inferencia y cerca del doble del entrenamiento de una H100, pero consume 1000 vatios, suele necesitar refrigeración líquida y arrastra largos plazos de entrega. Una H200 tiene memoria de sobra, software maduro, menor consumo y está disponible ya, y cubre la gran mayoría de las cargas. Vamos a Blackwell cuando la memoria o el rendimiento FP4 son la verdadera restricción, no por defecto.

¿Alquilar o comprar GPUs?

Alquila para trabajo a ráfagas o experimental, proyectos cortos, o cualquier cosa que necesites este mes mientras persisten los plazos del silicio nuevo. Compra —en un nodo dedicado o en colocation— cuando la utilización es sostenida y casi continua, cuando la residencia o el aislamiento de datos importan, o en un horizonte de varios años donde el alquiler por hora se acumula. Hacemos cualquiera de las dos y te decimos cuál favorecen los números.

¿NVIDIA o AMD?

NVIDIA tiene en torno al 80 % del mercado y sigue liderando el entrenamiento multinodo a gran escala, más por el ecosistema de software CUDA y NCCL que por el silicio en bruto. AMD Instinct, con hasta 288 GB de memoria, se ha vuelto competitiva de verdad en inferencia de un nodo y modelos limitados por memoria sobre ROCm. La pega honesta es la oferta: el mercado de alquiler de NVIDIA es mucho más profundo, así que para contratos cortos suele ganar también en precio.

¿Cuánta memoria necesito para que quepa mi modelo?

Como guía rápida, parámetros por dos bytes para FP16, o por uno para FP8. Un modelo de 70B ronda los 140 GB en FP16 o 70 GB en FP8, así que cabe en una H200 o B200 a precisión completa, o en tarjetas menores si lo cuantizas. Por encima, o saltas a una pieza de 288 GB o lo repartes entre GPUs por NVLink, que es donde empieza a importar el ancho de banda de interconexión.

¿Puedo tener un servidor GPU de inquilino único?

Sí, es lo que montamos. El nodo entero es tuyo, sobre un host AMD EPYC de alta frecuencia, con las GPUs, el tejido NVLink y el NVMe local dedicados a tu carga y sin otro inquilino compartiendo la máquina. Recibes root, tu elección de pila CUDA o ROCm, y el aislamiento que suelen pedir la residencia de datos y el cumplimiento.

Cuéntanos sobre tu modelo.

Tamaño del modelo, si entrenas o infieres y tu horizonte, y te decimos qué GPU y qué nodo encajan —y si alquilar sale mejor que comprar. Sin presión.