Deepseek представила OCR-систему, которая сжимает текст, содержащийся в изображениях, почти в 10 раз, сохраняя при этом 97% исходной информации. Эта технология позволяет языковым моделям обрабатывать документы значительно длиннее, обходя ограничения объема контекста. Система опирается на DeepEncoder — модель с 380 миллионами параметров, а также генератор текста Deepseek3B-MoE с 570 миллионами активных параметров. Она использует инновационный подход: вместо обработки текста в виде строк система работает с изображением текста, значительно сокращая количество необходимых «визуальных токенов». Для простых документов достаточно 64 токенов на страницу, а для сложных — до 800, в то время как конкуренты, например MinerU 2.0, требуют более 6000 токенов. Среди практических применений Deepseek предлагает использовать систему для сжатия истории диалогов в чат-ботах. Старые сообщения можно хранить в низком разрешении с потерей части деталей, напоминая процесс забывания в человеческой памяти. Такой подход помогает сохранить важное, сократить требования к памяти и ускорить работу модели, не увеличивая размер окна контекста бесконечно. Известный исследователь Андрей Карпати отметил, что обработка информации через изображение — более универсальный метод, который может позволить отказаться от токенизаторов, которые имеют множество ограничений, особенно при работе с редкими языками и различными артефактами. Такой подход может существенно упростить и повысить качество работы языковых моделей в будущем.