Tencent опубликовала омнимодальную модель Youtu-Parsing-Omni на Hugging Face
Tencent разместила на Hugging Face веса Youtu-Parsing-Omni — компактной модели для разбора документов, изображений, аудио и видео. Она формирует структурированный JSON и поддерживает запуск через распространённые инструменты инференса.

9 октября 2026 года Tencent опубликовала на Hugging Face веса Youtu-Parsing-Omni, плагин для vLLM и примеры инференса. В карточке проекта модель описана как компактная омнимодальная система с 5B параметров.
Youtu-Parsing-Omni принимает документы, обычные изображения, диаграммы, геометрические фигуры, аудио и видео, а результат представляет в виде структурированного JSON. Единая схема выбирается подсказкой задачи и охватывает семь семейств разбора. Для документов модель может возвращать элементы макета, текст, формулы и таблицы; для аудио и видео — временные сегменты, распознавание речи и описания содержимого.
Разработчики могут загрузить модель через Transformers. На странице также приведены команды для запуска сервера с vLLM и SGLang, а также варианты работы через Docker. Это позволяет использовать модель локально или подключать её к совместимому с OpenAI API интерфейсу, однако фактические требования к оборудованию и производительность в представленном фрагменте не указаны.
Tencent отмечает, что технический отчёт и открытый код оценки будут выпущены позднее.
Почему это важно
Модель объединяет разбор нескольких типов мультимедийных данных в одном интерфейсе и выдаёт структурированный результат. Для разработчиков это может упростить построение пайплайнов OCR, анализа документов и обработки аудио-видео, но показатели качества пока не приведены.