POR QUÉ IMPORTA
Sello: SEÑAL FUERTE. Un pull request abierto en vLLM, otro en SGLang y commits en dos proyectos independientes de serving para Apple Silicon ya tratan un identificador llamado qwen4_exp como una arquitectura real, con kernels dedicados. Alibaba nunca anunció fecha, precio ni especificación para Qwen4, pero el rastro de ingeniería es convergente y verificable en código público.En este artículo
Un rastro que nadie anunció, pero que todos ya están programando
Sello editorial: SEÑAL FUERTE. Mientras Alibaba mantiene silencio oficial sobre fechas y especificaciones del Qwen4, equipos de infraestructura de IA en al menos cuatro proyectos de código abierto ya están implementando soporte para un identificador de arquitectura llamado qwen4_exp. El pull request vllm-project/vllm#53909, titulado simplemente "Add qwen4 fuse op", está abierto desde fines de agosto de 2026, enviado desde un fork externo, sin conteo de parámetros, ficha de modelo ni fecha de lanzamiento adjuntos. Agrega kernels Triton dedicados para tres familias de operadores: HyperConnection, Qwen Sparse Attention y operaciones de estado PLE.
No es un PR aislado, es un patrón repetido en motores competidores
Lo que convierte esta pista de especulación en señal fuerte es la convergencia. Un día después, el 27 de agosto, un pull request en SGLang registró soporte nativo para el mismo identificador, con una clase llamada Qwen4ExpForConditionalGeneration, construida a partir de las mismas piezas arquitectónicas: GatedResidual, Gated DeltaNet, Qwen Sparse Attention y PLE. El trabajo se atribuye a un agente de codificación autónomo apodado Argus y aún no pasó la revisión de mantenedores, fallando las pruebas de integración continua. En paralelo, dos proyectos de serving para Apple Silicon, mlx-serve y mlx-vlm, mantenidos por desarrolladores sin relación directa con Alibaba, ya incluyen en sus repositorios clases y cachés específicos para qwen4_exp, incluyendo un error documentado sobre caché de prefijo que no restauraba correctamente el estado de modelos híbridos de esa familia.
La base real detrás del nombre en clave: Qwen3.8-Flash-Next ya está confirmado como vista previa
Esto no surge de la nada. El 26 de agosto, la propia Alibaba publicó, a través de la cuenta oficial del equipo Qwen, el modelo Qwen3.8-Flash-Next y lo describió textualmente como una vista previa abierta de la arquitectura del Qwen4, con 125 mil millones de parámetros totales, 6 mil millones activados por token y un esquema híbrido de Gated DeltaNet más atención dispersa. Ese punto es un hecho confirmado, no una filtración: está en la ficha oficial de Hugging Face y en el anuncio del propio equipo. La pregunta que responden los PR de ingeniería es distinta: muestran que los motores de inferencia ya tratan un modelo Qwen4 completo, etiquetado con el sufijo Exp, como algo lo suficientemente concreto como para justificar kernels dedicados, meses antes de cualquier anuncio de buque insignia.
El ingrediente picante: un modelo misterioso probándose en una arena pública
A esto se suma un hilo más especulativo. Desde el 9 de agosto, rastreadores de modelos anónimos identificaron una entrada llamada Kiana apareciendo en aproximadamente una de cada cinco batallas de Code Arena, una plataforma de comparación ciega de modelos. La cuenta que primero reportó el hallazgo apostó a que se trata de un modelo Qwen aún no revelado, citando como precedente el caso Kaleb, otra entrada anónima en la misma arena que fue confirmada como Qwen3.8 Max al día siguiente de su detección. Esto es rumor dentro de la señal mayor: no hay confirmación de Alibaba, no hay ficha de modelo y la atribución es la conjetura de una sola cuenta, aunque el historial de la arena favorezca la hipótesis.
Lo que aún falta para convertirse en noticia oficial
Ninguno de los artefactos encontrados trae conteo de parámetros del Qwen4 completo, precio, ventana de contexto ni fecha de lanzamiento. Los PR de vLLM y SGLang siguen sin fusionarse, lo que significa que siguen sujetos a cambios o abandono. Alibaba no mencionó el nombre Qwen4 en ninguna comunicación oficial hasta el cierre de este reporte, y el propio precedente de la empresa muestra que suele anunciar vistas previas de arquitectura, como Flash-Next, mucho antes del modelo principal, lo que podría significar tanto un lanzamiento inminente como una ventana aún de meses.
Qué cambia en la lectura de MaxAssistant
El valor real aquí no es la fecha, es la dirección. Alibaba ya apostó públicamente por una arquitectura que prioriza la innovación estructural sobre simplemente aumentar parámetros, y el hecho de que motores de inferencia de terceros ya estén optimizando para Qwen4 antes del anuncio oficial sugiere que el modelo ya circula en alguna etapa de prueba cerrada con socios de infraestructura. Quien dependa de Qwen para producción debe seguir los PR abiertos como termómetro de proximidad, sin tratarlo como cronograma. El nombre Kiana en Code Arena es la parte más frágil de la historia y merece leerse como chisme de bastidores, no como confirmación.
Fuentes
vLLM, pull request Add qwen4 fuse op: https://github.com/vllm-project/vllm/pull/53909 | OrcaRouter, Qwen 4 Leak: vLLM PRs Confirm Vision Input for the Flagship: https://www.orcarouter.ai/blog/qwen-4-leak-vllm-fuse-op | OrcaRouter, Kiana Qwen Mystery Model on Code Arena: https://www.orcarouter.ai/blog/kiana-qwen-mystery-model-leak | Qwen (@Alibaba_Qwen) en X, anuncio de Qwen3.8-Flash-Next: https://twitter.com/Alibaba_Qwen/status/1960383600000000000