El 20 de agosto de 2026, un modelo de IA apareció en OpenRouter con un nombre (Ox Alpha), un ID (stealth/ox-alpha) y exactamente cero información sobre quién lo había creado. Nada de comunicado de prensa. Nada de logotipo. Nada de empresa.
Lo que sí tenía era un contexto de un millón de tokens, soporte para texto, imagen y vídeo, precio cero durante aproximadamente una semana, y una nota de OpenCode en X que decía tener capacidad para 100 billones de tokens al día. En seis días, la comunidad de desarrolladores procesó 44 billones de tokens reales antes de que alguien pusiera nombre al modelo.
El 26 de agosto, Bloomberg publicó la confirmación: detrás de Ox Alpha estaba Z.ai, el laboratorio de Pekín conocido por la serie GLM. El modelo se llamaba GLM-5.3-Flash. La semana de misterio había sido, en realidad, un test de producción a escala real.
Como verán, otro modelo chino que como Kimi K3: la IA china de 2.8 billones de parámetros que compite con los grandes del knowledge work.
En este artículo
Qué era Ox Alpha y cómo funcionaba
Ox Alpha es el nombre en clave con el que Z.ai (Zhipu AI) probó de forma anónima su modelo GLM-5.3-Flash en los días previos a su lanzamiento oficial. El modelo estuvo activo en OpenRouter y OpenCode desde el 20 de agosto hasta el 26 de agosto de 2026, con acceso gratuito y sin ninguna atribución de autoría.
Las especificaciones publicadas durante la ventana de prueba eran concretas: ventana de contexto de 1.048.576 tokens (1M), salida máxima de 131.072 tokens, entrada multimodal (texto, imagen y vídeo), y precio de 0 dólares por millón de tokens tanto en entrada como en salida. OpenRouter lo describía como “un modelo de razonamiento diseñado para coding, trabajo agéntico sostenido y cargas de producción”.
OpenCode anunciaba retención cero de datos para el tráfico que pasaba por su ruta. OpenRouter, sin embargo, indicaba en su página del modelo que el proveedor sí retenía prompts y completions, aunque sin usarlos para entrenamiento. Ambas declaraciones venían de actores distintos dentro de la misma cadena de solicitud, lo que dejaba un margen de ambigüedad que Z.ai no aclaró durante el período anónimo.
Cómo la comunidad lo identificó antes que nadie
La identidad de Ox Alpha no aguantó seis días en secreto porque alguien filtrara información interna. Aguantó seis días porque el fingerprinting técnico es más difícil de disimular que el estilo de escritura.
El método más determinante fue la comparación de tokenizadores. La herramienta open source modelprint ejecutó nueve pruebas de infraestructura sobre Ox Alpha y encontró coincidencia en seis de ellas con GLM-5.3 de Z.ai. Los cuatro conteos normalizados de tokens del vocabulario GLM coincidieron al completo, mientras que el mejor candidato alternativo solo igualaba dos de los cuatro. Según el análisis publicado el 22 de agosto, se ejecutaron 95 strings de prueba discriminatorias y se obtuvo una coincidencia exacta de 95/95 con el vocabulario de la generación GLM-5.
El segundo vector fue el comportamiento de la capa de servicio. Los mensajes de error del endpoint incluían el código 1214, idéntico al de la infraestructura documentada de Z.ai. El tercer vector: pruebas controladas con inputs de vídeo producían presupuestos de tokens que coincidían con el comportamiento conocido del codificador de GLM-5V-Turbo.
La teoría competidora más seria —que Ox Alpha era un modelo de Google Gemini, alimentada por publicaciones crípticas de investigadores de Google DeepMind el 22 de agosto— se descartó cuando el tokenizador y el codificador de vídeo no cuadraban con ningún modelo de esa familia. Cuando Z.ai reveló el modelo el 26 de agosto, confirmó que las cuatro clases de evidencia que la comunidad había identificado eran correctas.
Los números de uso: lo que dejó la semana de prueba
El volumen de actividad que generó Ox Alpha durante su período anónimo convirtió el lanzamiento en el mayor de la historia de OpenRouter por tokens procesados en las primeras 72 horas. Según datos publicados por la propia plataforma, el modelo alcanzó 11,6 billones de tokens en los tres primeros días. El récord anterior estaba en 4,4 billones para el mismo período.
En OpenCode, los datos al cierre del período anónimo el 26 de agosto mostraban 503.000 usuarios únicos, 13,12 millones de sesiones completadas, 44 billones de tokens procesados y una cuota del 10,6% sobre el total de tokens de la plataforma. En cuatro días, Ox Alpha había desplazado a DeepSeek de la primera posición después de 56 días consecutivos al frente.
El contexto de esos números importa. Según OpenCode, el 93% de los tokens de entrada se sirvieron desde caché, lo que significa que el total combina inputs frescos con contexto reutilizado durante sesiones largas de coding. Los 44 billones son un indicador de volumen de trabajo real, no de tráfico de demostración.
GLM-5.3-Flash: la arquitectura detrás de Ox Alpha
El 26 de agosto de 2026, Z.ai publicó en X: “Introduciendo GLM-5.3-Flash — previamente presentado como Ox Alpha, corriendo completamente sobre chips de IA chinos.” A las 13:59 UTC del mismo día, OpenRouter registraba el ID oficial: z-ai/glm-5.3-flash.
Arquitectura
GLM-5.3-Flash es un modelo de mezcla de expertos (MoE) con 320 mil millones de parámetros totales y 18 mil millones activos por token. Es el primer modelo de la serie GLM-5 con soporte multimodal nativo, entrenado sobre un corpus de 30 billones de tokens. Combina atención lineal para dependencias locales con atención dispersa para contexto global relevante. En contextos de un millón de tokens usa IndexPool para comprimir vectores de clave e índice y limitar la latencia y el uso de memoria.
Z.ai aclara que no es una versión reducida de GLM-5.3, sino un modelo con base nueva, arquitectura propia y entrenamiento independiente. El GLM-5.3 estándar —la línea de ciberdefensa con 743 mil millones de parámetros base— corre en paralelo como producto separado.
Rendimiento declarado
Según los datos publicados por Z.ai en el momento del lanzamiento, GLM-5.3-Flash supera a GLM-5.2 en todos los benchmarks reportados: DeepSWE v1.1 pasa de 46,2 a 63,4 puntos; AutomationBench sube de 26,2 a 48,8. El laboratorio afirma que el modelo se acerca a Claude Opus 4.8 en benchmarks de agentes, incluyendo GDPVal-AA v2 y DeepSWE.
Un test independiente —un run comunitario completo de 113 tareas en DeepSWE realizado por el investigador Ben Davis durante la ventana de stealth— resolvió el 58,4% de los problemas con un intento por tarea. La cifra se alinea con el 63,4 que Z.ai reporta para el mismo benchmark bajo sus condiciones de evaluación. Los números de Z.ai son vendor-reported; el run de Davis es una medición externa, aunque tampoco un benchmark certificado de forma independiente.
Infraestructura de servicio
Z.ai afirma que toda la semana de prueba anónima se sirvió sobre un cluster de decenas de miles de aceleradores de fabricación china, sin hardware de Nvidia. El laboratorio no identifica el fabricante de los chips. CNBC reportó el 28 de agosto que no pudo verificar la afirmación de forma independiente.
Para compensar las limitaciones de memoria y ancho de banda de los chips disponibles —especialmente en contextos de un millón de tokens—, Z.ai desarrolló un motor de inferencia propio sobre SGLang con cuantización W8A8, caché híbrida INT8/FP8/BF16 y una arquitectura Encode-Prefill-Decode desagregada. El resultado reportado es una mejora de 3x en rendimiento end-to-end respecto al baseline inicial sobre el mismo hardware.
Acceso y precios tras el período gratuito
El modelo GLM-5.3-Flash está disponible por tres vías desde el 26 de agosto de 2026:
API de Z.ai: $0,15 por millón de tokens de entrada, $0,03 por millón en caché y $0,50 por millón de salida. Con el descuento de lanzamiento del 50% vigente hasta el 9 de septiembre de 2026, esas cifras se reducen a la mitad.
Pesos abiertos: disponibles en Hugging Face bajo licencia MIT desde el día del lanzamiento. El despliegue local funciona sobre SGLang, vLLM y TokenSpeed. El checkpoint completo ronda los 328 GB, lo que requiere infraestructura de servidores para su uso en local.
OpenRouter: listado bajo el ID z-ai/glm-5.3-flash a $0,075 por millón de tokens de entrada y $0,25 por millón de salida (precios con descuento de lanzamiento). El endpoint stealth/ox-alpha ya no aparece en el catálogo activo.
Para comparar: GLM-5.3, el modelo insignia de la misma serie, cotiza a $1,40 por millón de tokens de entrada y $4,40 por millón de salida. Flash se posiciona aproximadamente a una novena parte del precio del flagship.
Lo que el modelo stealth reveló sobre cómo se lanza una IA en 2026
El episodio de Ox Alpha tiene una lectura técnica y una lectura estratégica. La técnica es sencilla: el tokenizador, el codificador de vídeo y los errores de la capa de servicio son huellas que no se pueden borrar con un nombre en clave. La comunidad lo identificó antes de que cualquier medio publicara una filtración.
La lectura estratégica es más interesante. Z.ai obtuvo 44 billones de tokens de uso real —en flujos de trabajo de coding agéntico, con contextos largos, desde usuarios que estaban dispuestos a poner código de producción en un endpoint sin nombre— antes de revelar el producto. Ese volumen de feedback genuino, a coste cero de adquisición de usuarios, no se consigue con un lanzamiento de prensa estándar.
El patrón tampoco es nuevo. Según análisis publicados durante la semana de stealth, Ox Alpha fue al menos el quinto lanzamiento anónimo en OpenRouter en 2026. Dos modelos anteriores —Hunter Alpha y Healer Alpha— correspondían a releases de Xiaomi MiMo que se revelaron después de cerrar su ventana de prueba. El mecanismo se ha normalizado como método de test a escala antes del lanzamiento oficial.
La pregunta que el episodio no resolvió es qué ocurrió con los prompts enviados durante la ventana anónima. OpenCode garantizaba retención cero en su ruta. OpenRouter declaraba que el proveedor sí retenía los datos, aunque sin usarlos para entrenamiento. Z.ai es ahora una entidad identificada con política publicada, pero los prompts enviados antes del 26 de agosto llegaron a un proveedor que aún era anónimo para quien los enviaba.
Preguntas frecuentes
¿Qué es Ox Alpha?
Ox Alpha fue el nombre en clave con el que Z.ai (Zhipu AI) probó su modelo GLM-5.3-Flash de forma anónima en OpenRouter y OpenCode entre el 20 y el 26 de agosto de 2026. Durante ese período, el modelo estuvo disponible gratis sin que ninguna empresa lo reclamara públicamente. El 26 de agosto, Z.ai lo confirmó a Bloomberg y publicó los pesos bajo licencia MIT.
¿Quién está detrás de Ox Alpha?
Z.ai, el laboratorio de Pekín conocido por la serie GLM (Generative Language Model). La empresa confirmó la atribución a Bloomberg el 26 de agosto de 2026 y publicó los pesos del modelo en Hugging Face el mismo día bajo licencia MIT. El nombre del producto es GLM-5.3-Flash.
¿Cómo supo la comunidad quién lo hizo antes del anuncio?
Principalmente por fingerprinting del tokenizador. La herramienta open source modelprint ejecutó 95 strings de prueba y obtuvo coincidencia exacta con el vocabulario GLM-5 en todas ellas. Los mensajes de error del endpoint coincidían con los de Z.ai (código 1214). Las pruebas con inputs de vídeo también reproducían el comportamiento conocido del codificador de GLM-5V-Turbo. Las cuatro clases de evidencia se confirmaron correctas con el reveal oficial.
¿Es GLM-5.3-Flash lo mismo que GLM-5.3?
No. Son productos distintos con arquitecturas diferentes. GLM-5.3-Flash es una MoE de 320 mil millones de parámetros totales y 18 mil millones activos, el primer modelo de la familia GLM-5 con soporte multimodal nativo. GLM-5.3 es la línea de ciberdefensa con 743 mil millones de parámetros base, enfocada en coding avanzado y seguridad ofensiva. Z.ai indica que Flash parte de una base de modelo nueva, entrenada de forma independiente.
