DeepSeek presenta una IA que interpreta imágenes casi tan bien como Claude Opus 4.8
Si el lanzamiento de Kimi K3 y Qwen 3.8 no fue suficiente, Anthropic tiene otra preocupación más proveniente de China.
DeepSeek lanzó una versión experimental de su modelo insignia , el cual es capaz de interpretar imágenes y capturas de pantalla.
Sus creadores afirman que el rendimiento se acerca a Claude Opus 4.8 y puede probarse gratis.
De acuerdo con una publicación en su cuenta de X , DeepSeek-V4-Flash-Vision-Exp es una variante experimental del modelo V4 Flash que debutó hace unos meses.
Aunque esta versión parte de la misma base, la diferencia está en que ahora puede procesar contenido visual , una función que solo estaba reservada a la familia DeepSeek-VL.
La compañía explicó que el DeepSeek-V4-Flash-Vision-Exp conserva el mismo nivel de razonamiento y conocimiento general que V4 Flash en su versión de solo texto.
También hereda las capacidades de agente, lo que le permite interpretar imágenes y ejecutar tareas sin supervisión constante.
Es en esto último donde DeepSeek asegura que el rendimiento de Vision-Exp se acerca a Opus 4.8 , el modelo más avanzado de Anthropic.
Multimodality unlocks more agent use cases. 👀 V4-Flash-Vision-Exp works smoothly across agent frameworks, combining visual understanding with a wide range of tools to unlock more practical workflows.
2/n pic.twitter.com/pZFf8Yqw3D — DeepSeek (@deepseek_ai) August 21, 2026 Si bien Claude y ChatGPT ya ofrecen capacidades de visión multimodal avanzada, la ventaja con DeepSeek es que lo hace a un coste mucho menor que Opus 4.8 y el resto de modelos comerciales.
La compañía china ha decidido mantener el mismo esquema de precios de DeepSeek V4 Flash en su versión de texto, lo que significa que añadir visión no incrementa el valor.
Cómo usar DeepSeek-V4-Flash-Vision-Exp, el nuevo modelo que compite con Claude y ChatGPT El acceso a DeepSeek-V4-Flash-Vision-Exp se realiza a través de la API de la compañía .
El sistema admite entradas mixtas de texto e imagen que pueden enviarse en formato base64, a través de URLs externas o por medio de la API de archivos que también lanzó DeepSeek junto con el modelo.
La plataforma tokeniza las imágenes para efectos de facturación, con un máximo de 384 tokens por archiv o.
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en hipertextual.com — el contenido pertenece a Hipertextual.