Ai2 представила открытую инфраструктуру Olmo-core 3 для обучения MoE-моделей
Ai2 выпустила Olmo-core 3 — обновлённый открытый стек для обучения разреженных MoE-моделей. По описанию компании, инфраструктура рассчитана на масштабирование до триллиона параметров при сохранении вычислительной эффективности.

Ai2 представила Olmo-core 3, новую версию инфраструктуры для разработки больших языковых моделей с архитектурой mixture-of-experts. В компании описывают её как полностью открытый стек обучения, созданный с учётом особенностей MoE-моделей.
В таких системах для каждого входного фрагмента активируется только часть специализированных компонентов — экспертов. Однако по мере роста модели увеличиваются требования к памяти, а также расходы на передачу данных и координацию между экспертами в кластере. Olmo-core 3 предназначена для снижения влияния этих накладных расходов.
В одном из приведённых бенчмарков Ai2 увеличила пул экспертов с 8 до 128, сохранив выбор 4 экспертов на каждый токен. Число активных параметров на токен оставалось примерно равным 3,2 млрд, тогда как общая ёмкость модели выросла с 4,6 млрд до 47 млрд параметров. При этом пропускная способность обучения снизилась менее чем на 5%.
По данным Ai2, тот же стек прошёл проверку на системах с более чем триллионом общих параметров. В компании также связывают Olmo-core 3 со следующим поколением семейства Olmo и продолжают открывать инструменты и инфраструктуру, используемые при создании моделей.
Почему это важно
Открытая инфраструктура для обучения MoE-моделей может быть полезна исследовательским группам и небольшим лабораториям, которым сложно самостоятельно разрабатывать средства масштабирования и распределения вычислений. Приведённые Ai2 результаты показывают, как рост общей ёмкости модели можно сочетать с близким числом активных параметров на токен.