Todo sobre DiffusionGemma: La IA de Google que revoluciona la velocidad local

Última actualización: 04/07/2026
  • Implementa un sistema de generación por difusión que produce bloques de 256 tokens en paralelo en lugar de secuencialmente.
  • Alcanza velocidades extremas de hasta 1.000 tokens por segundo en hardware NVIDIA H100 y 700 en RTX 5090.
  • Utiliza una arquitectura MoE de 26B parámetros con solo 3.8B activos, optimizando el uso de VRAM a unos 18 GB.
  • Se distribuye bajo licencia Apache 2.0, facilitando su despliegue local en entornos de desarrollo y computación de alto rendimiento.

IA Google DiffusionGemma

Google ha soltado el bombazo de DiffusionGemma casi sin hacer ruido, presentándonos un modelo abierto que le da una vuelta de tuerca a la forma de generar texto. A diferencia de lo que estamos acostumbrados, esta herramienta no busca ser la más inteligente del catálogo de la gran G, sino que se centra a tope en la velocidad de ejecución en GPU local, permitiendo que los desarrolladores tengan una respuesta inmediata aunque esto suponga sacrificar un pelín la calidad frente al estándar de Gemma 4.

Este movimiento estratégico no es casualidad, ya que Google parece querer plantar cara al ecosistema de modelos abiertos de China, donde nombres como Qwen o DeepSeek están marcando la pauta. Mientras que la lucha contra GPT o Claude se libra en la liga de los modelos cerrados y la máxima precisión, DiffusionGemma entra en el terreno de los pesos abiertos y la licencia Apache 2.0, abriendo la puerta a que cualquiera pueda retocar el software y desplegarlo en sus propias estaciones de trabajo.

¿Qué es exactamente DiffusionGemma y cómo cambia el juego?

Para entenderlo fácil, la mayoría de las IA que usamos son autorregresivas; es decir, escriben palabra por palabra, de izquierda a derecha. DiffusionGemma manda eso a paseo y utiliza una técnica de difusión basada en texto. Imagina que en lugar de una máquina de escribir que va letra a letra, tienes una imprenta masiva que estampa bloques completos de texto de una sola vez y luego los va puliendo hasta que quedan perfectos.

  Cómo descubrir música nueva en Spotify y no quedarte siempre en lo mismo

El sistema trabaja sobre un lienzo de 256 tokens. El modelo empieza con un montón de ruido (tokens aleatorios) y, a través de varias pasadas, va limpiando y refinando el contenido. Esta capacidad de atención bidireccional permite que cada token del bloque tenga en cuenta a todos los demás, algo que es un auténtico golazo en tareas no lineales como la generación de código, grafos matemáticos o incluso el análisis de secuencias de aminoácidos.

Rendimiento de DiffusionGemma

Arquitectura técnica: El poder del MoE y la difusión de estado uniforme

Bajo el capó, DiffusionGemma se apoya en una arquitectura Mixture of Experts (MoE). Aunque el modelo cuenta con un total de 26.000 millones de parámetros, en el momento de la inferencia solo pone en marcha 3.800 millones de parámetros activos. Esto es fundamental porque reduce drásticamente el consumo de recursos, permitiendo que el modelo funcione cómodamente en GPUs con unos 18 GB de VRAM, lo que lo hace compatible con tarjetas de consumo como la RTX 4090 o la 5090.

Para evitar la rigidez de los sistemas antiguos de enmascaramiento (estilo BERT), Google ha implementado la difusión de estado uniforme. En lugar de simplemente tapar palabras, el modelo sustituye los tokens originales por otros aleatorios y luego evalúa la probabilidad de cada uno. Si un token ya no encaja con el contexto que ha ido surgiendo, el modelo vuelve a añadir ruido y lo corrige, logrando un refinamiento dinámico y mucho más fluido.

  Driver NVIDIA: guía completa de actualización y configuración

Además, el flujo de trabajo alterna entre dos modos clave: el Incremental Prefill, que usa atención causal para gestionar el contexto de la instrucción, y la Reducción de Ruido, que emplea la atención bidireccional para limpiar el lienzo de tokens. Este proceso se apoya en el autocondicionamiento, donde el decodificador guarda su estado anterior para mejorar las predicciones en el siguiente paso.

Rendimiento bruto y hardware compatible

Si hablamos de números, DiffusionGemma es una auténtica bestia. Google afirma que puede alcanzar más de 1.000 tokens por segundo en una NVIDIA H100 y superar los 700 tokens por segundo en una RTX 5090. Estamos hablando de una velocidad hasta 4 veces superior a Gemma 4 en despliegues locales. Básicamente, ha desplazado el cuello de botella: ya no dependemos tanto de la velocidad de la memoria, sino de la capacidad de procesamiento de la GPU.

En cuanto a la compatibilidad, el modelo está optimizado para el ecosistema de Nvidia, soportando el formato BF16 y la cuantización NVFP4, que permite acelerar los cálculos casi sin perder precisión. Los desarrolladores pueden encontrarlo en Hugging Face, GitHub y vLLM, y se espera que la integración con llama.cpp llegue muy pronto, lo que facilitaría enormemente su uso en equipos más modestos.

Casos de uso ideales y el intercambio calidad-velocidad

No nos engañemos, DiffusionGemma no ha venido a sustituir a los modelos frontera como GPT-4 o Claude en tareas de razonamiento profundo. De hecho, en benchmarks como MMLU Pro o GPQA Diamond, este modelo queda por debajo de Gemma 4. El trato es claro: sacrificas un poco de finura y coherencia a largo plazo a cambio de una latencia ultrabaja.

  Guía de expertos VPN: comparativa, seguridad y usos reales

Por eso, brilla especialmente en situaciones donde la rapidez es la prioridad absoluta. Es ideal para editores inteligentes de código, asistentes de escritura en tiempo real o herramientas de OCR y procesamiento de documentos. Un ejemplo curioso es su capacidad para resolver Sudokus; mientras que las IA tradicionales sufren porque no pueden ver el futuro del texto, DiffusionGemma ve el bloque completo y ajusta los números basándose en todas las restricciones simultáneamente.

Para quienes operen en la nube, Google ofrece acceso a través de Cloud Model Garden y Nvidia NIM. Sin embargo, hay que tener ojo con la concurrencia: mientras que para un solo usuario es un rayo, en entornos con miles de peticiones simultáneas, los modelos autorregresivos tradicionales siguen siendo más eficientes en costes y gestión de lotes.

Esta innovadora herramienta representa un giro hacia la especialización, donde la velocidad de respuesta y la eficiencia del hardware local se vuelven los protagonistas. Al combinar una arquitectura MoE optimizada con un sistema de refinamiento de bloques, Google ha creado una alternativa abierta y extremadamente ágil que transforma la latencia en una ventaja competitiva, posicionándose como la opción preferida para quienes necesiten iteraciones instantáneas en sus flujos de trabajo de IA.