Apple описала метод RISED для обучения универсальных LLM-агентов
Apple опубликовала работу RISED — метод обучения LLM-агента в нескольких интерактивных средах. Подход использует рубрики поведения для выбора данных и само-дистилляции.

Apple опубликовала исследовательскую работу RISED о совместном обучении LLM-агента в разных интерактивных средах. Метод применяет LLM-судью, который помечает каждую траекторию по заранее заданному словарю рубрик, общему для разных сред.
Эти профили используются для выбора данных, соответствующих поведенческому составу смешанного пакета, и для ограничения перекрытия уже выбранных примеров. Положительные рубрики дают учителю для on-policy само-дистилляции дополнительный сигнал на уровне токенов, а отрицательные помогают направлять генерацию от повторяющихся ошибок.
По данным Apple, RISED показал самый высокий средний pass rate по средам и занял первое или второе место в каждой отдельной среде. Работа опубликована в октябре 2026 года.
Почему это важно
RISED предлагает способ обучать агентов на неоднородных средах, используя не только числовую награду, но и текстовые описания желательного и нежелательного поведения.