← Inicio

DeepSeek V4 Flash corre en una sola AMD MI300X y agita Hacker News

La carrera por la supremacía en inteligencia artificial ganó un nuevo capítulo silencioso, pero significativo, durante el fin de semana en el que un equipo de ingenieros de Doubleword consiguió ejecutar el modelo DeepSeek V4 Flash en una única GPU AMD Instinct MI300X. La historia se hizo viral en Hacker News, donde el relato técnico detallado sumó decenas de votos en pocas horas. Llamarlo hito no es exageración: hablamos de un modelo de mezcla de expertos (MoE) con 284 mil millones de parámetros — aunque con solo unos 13 mil millones activos por token — corriendo enteramente en la memoria de un solo acelerador, sin necesidad de un clúster distribuido.

El detalle más revelador del relato es que, hasta principios de mayo, esto sencillamente no funcionaba. La pila estándar de inferencia vLLM no cargaba V4 Flash en la MI300X, y los ingenieros tuvieron que atravesar un pantano de incompatibilidades de software. El principal obstáculo era el dialecto FP8: la MI300X, basada en CDNA 3, implementa una variante E4M3 propia de AMD/Graphcore, mientras que la MI325X y las placas más nuevas siguen el estándar OCP. Un kernel que asume la semántica OCP en la MI300X puede equivocarse por un factor de dos en el dominio de escala — lo que, traducido directamente, significa resultados corruptos. También faltaban kernels de atención optimizados, y el trabajo se convirtió en un diario de guerra contra los bordes afilados del ecosistema. Tras vencer cada uno de ellos, el equipo reportó alrededor de 2.699 tokens por segundo en inferencia.

¿ qué importa? Porque la MI300X fue diseñada precisamente para este tipo de carga. Ofrece 192 GB de memoria HBM3, 5,3 TB/s de ancho de banda y 2,6 PFLOPS en FP8, todo en un único módulo OAM. La inferencia de modelos de lenguaje está limitada por el ancho de banda de memoria, no por la capacidad bruta de cómputo. Cuando un modelo cabe entero en la memoria de una placa, los costos se desploman: se elimina la dependencia de interconexiones de alta velocidad entre GPUs, del escalado distribuido y de grandes reservas de VRAM compartida. Esa es la promesa que siempre hizo de AMD una alternativa atractiva a la hegemonía de Nvidia — y que ahora empieza a materializarse fuera de las diapositivas de marketing.

La implicación más amplia es la democratización del hardware. Si la inferencia de modelos de frontera pasa a correr en una placa única y asequible, el costo por token cae y la barrera de entrada para empresas pequeñas — e incluso para desarrolladores individuales — se reduce de forma dramática. Estructuralmente, también debilita el encierro del ecosistema CUDA: quien ejecuta V4 Flash en una MI300X demuestra, en la práctica, que es posible escapar del monopolio de software de Nvidia sin sacrificar rendimiento. El esfuerzo de la comunidad, incluidos los kernels escritos a mano del proyecto AgntroAI que triplicaron la velocidad de decodificación de una sola secuencia de 20,7 a 58,9 tokens por segundo, es la prueba viva de que el impulso ahora viene desde abajo.

Pero la pregunta que queda abierta es incómoda y honesta: el software sigue siendo el cuello de botella. Cada triunfo de estos se logra a costa de mucho trabajo manual contra la inmadurez de ROCm y la fragmentación de los dialectos FP8. La hipótesis de que AMD puede reescribir la economía de la IA depende por completo de que las grandes nubes y proveedores inviertan fuerte en esa pila de software. ¿Les conviene apostar por kernels optimizados para la MI300X, o el progreso seguirá dependiendo de los entusiastas? La respuesta definirá si este hito fue el comienzo de una era o apenas una victoria heroica y aislada.

Fuentes: Doubleword (Fergus Finn), SimpleNews, 1ban News

✓ Fuentes independientes cruzadas y verificadas antes de la publicación