Исследования

Microsoft представила Agent Lightning v1.0 для обучения агентов на реальных harness-системах

Microsoft Research Asia опубликовала Agent Lightning v1.0 — открытый фреймворк для reinforcement learning, который позволяет обучать агента в том же harness-окружении, где он работает при развёртывании.

Иллюстрация AIFoxNews к материалу: Microsoft представила Agent Lightning v1.0 для обучения агентов на реальных harness-системах
Иллюстрация AIFoxNews

7 октября 2026 года Microsoft Research представила Agent Lightning v1.0 и описала подход Harnessed Agentic RL. Его ключевая идея — не переносить цикл взаимодействия агента в отдельную обучающую систему: агент продолжает работать через собственный harness, а Agent Lightning наблюдает и записывает обращения к языковой модели через LLM-прокси.

Кодовая база фреймворка занимает примерно 3500 строк. В версии v1.0 также заявлена нативная поддержка Kubernetes: агенты запускаются как стандартные задания в собственных или облачных кластерах, а также на локальной инфраструктуре, без платных коммерческих sandbox-сервисов.

В качестве примера Microsoft Research приводит конвейер для coding agent на базе Qwen3.5-9B. По описанию компании, Pass@1 на SWE-bench Verified вырос с 41,8% до 56,4% — на 14,6 процентного пункта — при использовании примерно 6000 обучающих образцов. Такой подход должен упростить обучение агентов, чьё поведение зависит не только от модели, но и от управления контекстом, инструментов и среды выполнения.

Почему это важно

Фреймворк предлагает обучать агента в том же окружении, которое используется при работе, а не создавать отдельную копию его цикла. Для разработчиков это снижает объём интеграционной работы и даёт готовый путь к запуску экспериментов в Kubernetes.

Ответ строится только по опубликованным материалам сайта и может содержать ошибки — важное проверяйте по первоисточнику.