DeepSeek vuelve a desafiar los límites de la inteligencia artificial con un avance técnico que podría redefinir la manera en que los modelos procesan información. Su nueva tecnología, denominada “vision-text compression”, convierte texto y documentos complejos en imágenes, reduciendo el consumo de recursos hasta 20 veces menos tokens sin sacrificar la comprensión del contenido.
El sistema se integra en el modelo DeepSeek-OCR (Optical Character Recognition), que aprovecha capacidades multimodales para transformar grandes volúmenes de texto en imágenes de alta resolución. Posteriormente, un decodificador especializado —el DeepSeek3B-MoE-A570M— interpreta esas imágenes, extrayendo los datos textuales con una eficiencia significativamente superior a la de los modelos tradicionales basados solo en texto.

Según los desarrolladores, el proceso alcanza una reducción de tokens de entre 7 y 20 veces, con una precisión de hasta 97% cuando la compresión es moderada. Sin embargo, al aumentar la compresión a los niveles más extremos, la exactitud baja al 60%, lo que sugiere un equilibrio clave entre ahorro computacional y fidelidad del contenido. Aun así, incluso una compresión de 2 a 3 veces podría representar un ahorro sustancial en los costos de operación de modelos de gran contexto.
Este enfoque aprovecha la fortaleza de la IA visual para manejar tablas, gráficos o datos estructurados, lo que lo hace especialmente útil en ámbitos científicos, financieros y médicos, donde la interpretación de información visual es crucial. Además, el modelo emplea una arquitectura basada en subredes y expertos especializados para procesar diferentes tipos de datos dentro de una misma tarea, mejorando su capacidad de análisis.

DeepSeek, que ya había sorprendido al mundo a inicios de 2025 por ofrecer rendimiento similar al de ChatGPT o Gemini con una fracción de los recursos, refuerza así su reputación como uno de los desarrollos más eficientes en IA generativa. El nuevo modelo DeepSeek-OCR y su arquitectura DeepEncoder ya están disponibles en Hugging Face y GitHub, invitando a la comunidad a experimentar con esta innovadora forma de compresión semántica visual.
Fuente: DeepSeek OCR Paper

