CONFIRMADO: DeepSeek libera los pesos de V4-Flash-Vision-Exp

Sello editorial: CONFIRMADO. Base: el repositorio oficial de deepseek-ai en Hugging Face, con pesos, tokenizer, una implementación mínima de inferencia y licencia MIT. DeepSeek-V4-Flash-Vision-Exp es el primer modelo multimodal experimental de la familia V4. Tiene 305.000 millones de parámetros, parte de V4-Flash-0731 y añade un encoder visual y un Aligner. Fuente primaria: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

Lo que sabemos

La ficha oficial dice que sube fuerte en agente multimodal y mantiene el nivel en agente solo texto. En la tabla de DeepSeek: ApexBench Pass@1 pasa de 26,2 a 36,5 (Opus 4.8 en 39,4); Agents' Last Exam queda en 27,3, por encima de 25,7 de Opus 4.8; DeepSWE llega a 59,3 frente a 58,0 de Opus. En NL2Repo sigue atrás, 57,7 contra 69,7. El recorte es un agente que lee capturas, interfaces y gráficos y llama herramientas, no un VQA de vitrina. El repo trae recetas de vLLM y SGLang con DSpark. Relatos secundarios dicen que la API llegó hacia el 21 de agosto y los pesos unos diez días después.

Lo que aún no sabemos

No hay un blog largo ni un paper de visión en esta página. El precio de la API de visión, la ventana multimodal y la calidad en español no están en la ficha. Los benchmarks son de DeepSeek, no de un harness independiente. La etiqueta Exp sigue siendo experimental.

Por qué importa en la práctica

Quien arma agentes de pantalla, QA visual o lectura de dashboards gana un open-weight MIT de 305B en la zona de Opus 4.8 en algunas pruebas de agente multimodal, sin esperar a un laboratorio cerrado. No sustituye automáticamente a Fable 5.1 ni a Muse Spark: es el primer ojo de la línea V4, barato de licencia y pesado de hardware. Conviene probarlo en capturas de producto y tool use; no migrar producción solo con la ficha.