Apple изучила потери структуры при передаче рассуждений между моделями
В исследовании Apple от 29 сентября авторы проверили, насколько точно языковые модели передают древовидные выражения через естественный язык. Они обнаружили, что основная часть ошибок появляется уже при генерации описания.

Работа Apple рассматривает передачу структурированной информации между языковыми моделями как «круговой» процесс. Генератор превращает арифметическое выражение в текстовую задачу, а отдельная модель затем восстанавливает исходное выражение; символическая эквивалентность служит точным критерием проверки. Такой подход позволяет отделить качество генерации от качества извлечения.
Авторы проверили попарные комбинации шестнадцати моделей. Результат оказался асимметричным: при смене модели, которая создаёт описание, и модели, которая его интерпретирует, точность менялась до 60,4 пункта, а лучшая комбинация достигла 92,9%. При этом не менее 73,6% ошибок возникали на этапе генерации. На сложность влияли структура дерева, число операторов, глубина и правое ветвление, а не семейство модели.
Исследование также указывает на возможность обучения такого канала. Около 3600 примеров дообучения с соответствующими операторами и формами деревьев подняли все проверенные модели с открытыми весами выше необученной Gemini-3.1-Pro. В отдельном режиме с новыми операторами и словарём улучшение сохранилось, хотя разрыв с передовыми моделями остался.
Почему это важно
Результаты показывают, что при многошаговом взаимодействии моделей узким местом может быть не только рассуждение, но и перевод структурированных промежуточных данных в текст. Для агентных систем это делает важными формат обмена и отдельную проверку сохранности структуры.