Исследования

Tencent выпустила первый публичный релиз фреймворка UniRL

Tencent опубликовала UniRL v0.1.0 — фреймворк для обучения мультимодальных моделей с подкреплением. В релиз вошли сценарии для диффузионных моделей, LLM и VLM, а также несколько алгоритмов и движков запуска.

Иллюстрация AIFoxNews к материалу: Tencent выпустила первый публичный релиз фреймворка UniRL
Иллюстрация AIFoxNews

Tencent 7 октября опубликовала первый публичный релиз UniRL v0.1.0. Проект позиционируется как фреймворк для обучения мультимодальных моделей с подкреплением и доступен для установки через пакетный менеджер pip.

В релизе предусмотрены отдельные точки входа для обучения диффузионных моделей, языковых и визуально-языковых моделей, улучшения промптов, а также объединённого обучения AR- и diffusion-моделей. Это позволяет использовать один проект для нескольких типов генеративных систем, не собирая отдельную инфраструктуру под каждый сценарий.

В состав UniRL вошли алгоритмы Flow-DPPO и DRPO, предложенные командой Tencent, а также GRPO, FlowGRPO и DiffusionNFT. Для выполнения rollout-операций заявлена поддержка trainside, SGLang и vLLM-Omni. Среда запуска построена на Ray и FSDP и поддерживает синхронизацию LoRA либо полных весов.

По описанию релиза, UniRL рассчитан на работу с широким набором мультимодальных и языковых моделей. Практический результат публикации — разработчики могут установить публичную версию фреймворка и использовать готовые точки входа для экспериментов с обучением моделей с подкреплением.

Почему это важно

Публикация объединяет в одном открытом фреймворке инструменты для обучения языковых, визуально-языковых и диффузионных моделей. Для разработчиков это означает доступ к готовой инфраструктуре и нескольким алгоритмам без необходимости начинать такую интеграцию с нуля.

Ответ строится только по опубликованным материалам сайта и может содержать ошибки — важное проверяйте по первоисточнику.