Image default
AIEmpresasNoticiasTecnología

DeepSeek revoluciona la eficiencia de la IA al comprimir texto en imágenes con DeepSeek-OCR

DeepSeek vuelve a desafiar los límites de la inteligencia artificial con un avance técnico que podría redefinir la manera en que los modelos procesan información. Su nueva tecnología, denominada “vision-text compression”, convierte texto y documentos complejos en imágenes, reduciendo el consumo de recursos hasta 20 veces menos tokens sin sacrificar la comprensión del contenido.

El sistema se integra en el modelo DeepSeek-OCR (Optical Character Recognition), que aprovecha capacidades multimodales para transformar grandes volúmenes de texto en imágenes de alta resolución. Posteriormente, un decodificador especializado —el DeepSeek3B-MoE-A570M— interpreta esas imágenes, extrayendo los datos textuales con una eficiencia significativamente superior a la de los modelos tradicionales basados solo en texto.

Según los desarrolladores, el proceso alcanza una reducción de tokens de entre 7 y 20 veces, con una precisión de hasta 97% cuando la compresión es moderada. Sin embargo, al aumentar la compresión a los niveles más extremos, la exactitud baja al 60%, lo que sugiere un equilibrio clave entre ahorro computacional y fidelidad del contenido. Aun así, incluso una compresión de 2 a 3 veces podría representar un ahorro sustancial en los costos de operación de modelos de gran contexto.

Este enfoque aprovecha la fortaleza de la IA visual para manejar tablas, gráficos o datos estructurados, lo que lo hace especialmente útil en ámbitos científicos, financieros y médicos, donde la interpretación de información visual es crucial. Además, el modelo emplea una arquitectura basada en subredes y expertos especializados para procesar diferentes tipos de datos dentro de una misma tarea, mejorando su capacidad de análisis.

DeepSeek, que ya había sorprendido al mundo a inicios de 2025 por ofrecer rendimiento similar al de ChatGPT o Gemini con una fracción de los recursos, refuerza así su reputación como uno de los desarrollos más eficientes en IA generativa. El nuevo modelo DeepSeek-OCR y su arquitectura DeepEncoder ya están disponibles en Hugging Face y GitHub, invitando a la comunidad a experimentar con esta innovadora forma de compresión semántica visual.

Fuente: DeepSeek OCR Paper

Posts relacionados

Sophos presenta Fusion, un sistema de defensa de ciberseguridad nativo de IA para responder a las amenazas modernas

Mario Rübke

Samsung anticipa un Galaxy Watch con IA más avanzada y mayor foco en la salud

Mario Rübke

Cirion Data Centers y Entel Digital se unen para impulsar infraestructura crítica para inteligencia artificial en Chile y Perú

Mario Rübke
Cargando.....