DeepSeek presentó V4-Flash-Vision-Exp, una versión multimodal experimental capaz de interpretar imágenes y capturas de pantalla. En pruebas publicadas por la compañía, el modelo se acerca a Claude Opus 4.8 en varias tareas de agentes, aunque todavía muestra diferencias importantes en los desafíos más complejos.
Claves del artículo
- DeepSeek-V4-Flash-Vision-Exp ya está disponible a través de la API de DeepSeek y suma comprensión visual a las capacidades de texto, razonamiento y agentes de V4 Flash.
- El modelo puede procesar imágenes y capturas de pantalla y actuar a partir de esa información visual.
- DeepSeek afirma que su rendimiento multimodal se acerca al de Claude Opus 4.8, de Anthropic.
- En los 11 benchmarks publicados, el nuevo modelo supera a Opus 4.8 en tres pruebas, pero queda detrás en las otras ocho.
- Las cifras proceden principalmente de evaluaciones de la propia DeepSeek, por lo que todavía falta una validación independiente amplia.
DeepSeek amplió su ofensiva en inteligencia artificial con DeepSeek-V4-Flash-Vision-Exp, un modelo experimental que incorpora capacidades visuales a V4 Flash. La novedad permite que el sistema no solo procese texto, sino que también pueda comprender imágenes y capturas de pantalla, una función especialmente relevante para el desarrollo de agentes de IA capaces de interactuar con interfaces, gráficos y entornos visuales.
El lanzamiento profundiza la evolución de DeepSeek desde los modelos de razonamiento hacia plataformas de agentes. Ese cambio también amplía el alcance de una compañía que irrumpió en el mercado internacional con una propuesta centrada en eficiencia y costos competitivos, un fenómeno que ya analizamos en Titular al explicar cómo DeepSeek modificó la competencia entre los principales laboratorios de inteligencia artificial.
De un modelo de texto a un agente capaz de interpretar imágenes
Hasta ahora, DeepSeek-V4-Flash estaba orientado principalmente al procesamiento textual. DeepSeek lo presentó como la alternativa más rápida y económica de la familia V4, con 284.000 millones de parámetros totales y 13.000 millones activos, frente a los 1,6 billones de parámetros de V4 Pro. Ambos modelos utilizan una ventana de contexto de hasta un millón de tokens.
V4-Flash-Vision-Exp agrega una capa decisiva: la capacidad de interpretar información visual sin abandonar las funciones de razonamiento, conocimiento general y ejecución de tareas mediante agentes.
Según DeepSeek, el modelo experimental “iguala a DeepSeek-V4-Flash en capacidades de texto, incluidos agentes, razonamiento y conocimiento del mundo” y logra un salto importante en las evaluaciones de agentes multimodales, hasta acercarse al rendimiento de Opus 4.8.
El modelo está disponible mediante la plataforma API de DeepSeek bajo el identificador deepseek-v4-flash-vision-exp. La compañía también incorporó soporte para esta versión en su sistema DeepSeek Harness.
Qué dicen realmente los benchmarks frente a Opus 4.8
La comparación con Anthropic requiere algunos matices. DeepSeek publicó resultados de 11 benchmarks en los que enfrentó su modelo experimental con Claude Opus 4.8. V4-Flash-Vision-Exp ganó tres y quedó detrás en ocho.
Entre los resultados más ajustados aparecen:
- Terminal Bench 2.1: 83,9 para DeepSeek frente a 85,0 de Opus 4.8.
- Toolathlon-Verified: 75,9 frente a 76,2.
- Chartography: 64,3 frente a 65,0.
- DeepSWE: DeepSeek obtuvo una ventaja de 1,3 puntos.
- Agents’ Last Exam: superó a Opus por 1,6 puntos.
- ZeroBench: quedó un punto por encima.
Las diferencias se amplían en otras pruebas. En NL2Repo, orientada a tareas sobre repositorios de código, DeepSeek registró 57,7 puntos frente a 69,7 de Opus 4.8, una brecha de 12 puntos. En DSBench-Hard, obtuvo 63,6 frente a 71,7.
Por lo tanto, describir al modelo como un reemplazo directo de Opus sería prematuro. Los números muestran una situación más específica: DeepSeek consiguió acercarse considerablemente a un modelo de Anthropic en determinadas tareas de agentes, pero todavía presenta diferencias relevantes en escenarios complejos.
Además, la comparación utiliza Opus 4.8 y no la generación más reciente de Anthropic. The Next Web señala que Claude Opus 5 fue presentado el 24 de julio de 2026 y que todavía no existe una evaluación pública equivalente entre ese modelo y V4-Flash-Vision-Exp.
El salto multimodal también necesita contexto
DeepSeek destaca especialmente las mejoras de V4-Flash-Vision-Exp frente al V4 Flash convencional. En ApexBench, por ejemplo, el resultado pasa de 26,2 a 36,5 puntos, mientras que Agents’ Last Exam sube de 25,2 a 27,3.
Sin embargo, existe una consideración metodológica importante. DeepSeek aclara que, durante esas evaluaciones, el modelo V4 Flash exclusivamente textual ignoraba los elementos multimodales de las pruebas. Parte de la diferencia, por lo tanto, surge naturalmente de comparar un sistema capaz de interpretar imágenes con otro que no puede hacerlo.
La propia compañía también informó que sus modelos fueron evaluados mediante DeepSeek Harness en modo minimal, con máximo nivel de esfuerzo, top_p de 0,95 y temperatura de 1,0. Son parámetros públicos y reproducibles, pero los resultados siguen siendo benchmarks publicados por el fabricante.
El verdadero desafío está en los agentes de IA
La incorporación de visión puede resultar más relevante que cualquier victoria puntual en un benchmark. Un agente que interpreta capturas de pantalla puede reconocer elementos de una interfaz, analizar gráficos, leer información visual y decidir qué acción ejecutar a continuación.
Esto amplía considerablemente los casos de uso potenciales en automatización, programación, control de aplicaciones y asistentes capaces de operar sobre interfaces gráficas.
DeepSeek ya venía desarrollando esa estrategia. Su familia V4 fue diseñada específicamente para mejorar las capacidades de agentes y puede integrarse con herramientas como Claude Code, OpenCode y GitHub Copilot. La compañía también desarrolló DeepSeek Harness, una infraestructura destinada a que los modelos puedan ejecutar tareas complejas utilizando herramientas externas.
La competencia entre laboratorios de IA, por lo tanto, empieza a desplazarse. Ya no alcanza con generar mejores respuestas de texto: los modelos deben percibir información, utilizar herramientas y completar procesos de varios pasos con la menor intervención humana posible.
DeepSeek-V4-Flash-Vision-Exp todavía lleva la etiqueta de experimental y sus resultados necesitan mayor validación independiente. Sin embargo, su lanzamiento muestra con claridad hacia dónde se dirige la compañía: combinar modelos eficientes con percepción visual y capacidades de agente para competir no solo por calidad absoluta, sino también por costo, velocidad y capacidad de automatización.
En ese terreno, incluso una pequeña diferencia de rendimiento frente a los modelos más avanzados puede resultar menos determinante si la brecha de costos permite desplegar agentes a gran escala. Esa relación entre capacidad y costo por tarea completada, más que la posición aislada en un benchmark, probablemente sea una de las métricas centrales de la próxima etapa de la competencia en inteligencia artificial.