NVIDIA описала детерминированное обучение в Megatron Core
NVIDIA представила рабочий процесс для воспроизводимого обучения крупных моделей: система фиксирует отпечатки вычислений по рангам и помогает находить первый источник расхождения между запусками.

В техническом блоге NVIDIA от 6 октября 2026 года описан подход к битовой детерминированности предварительного обучения в Megatron Core. Он должен обеспечивать одинаковую числовую траекторию для независимых запусков и для запуска, продолженного из контрольной точки, если конфигурация, данные, программное окружение и оборудование совпадают.
В основе рабочего процесса из PR #7262 — упорядоченные отпечатки тензоров, записываемые для каждого вычислительного ранга. Сначала сравниваются итоговые метрики, затем поиск расхождения сужается до этапа, модуля, операции или ядра. Такой метод позволяет отделить проблему в коммуникации, пересчёте, оптимизаторе или конкретном блоке модели от общей ошибки обучения.
По описанию NVIDIA, на трёх рабочих нагрузках Nemotron оптимизация снизила «налог детерминированности» примерно до 2% при использовании 2 432 GPU. Битовая идентичность сохранялась на протяжении 800 шагов. В публикации также описаны изменения на уровне ядер: например, писателям grouped-GEMM выделяются отдельные слоты вывода, а операции сокращения выполняются в фиксированном порядке.
Для проверки предлагается запускать одинаковую конфигурацию дважды и сравнивать отпечатки потерь, градиентов и других метрик на каждом шаге. Для сценария восстановления из контрольной точки отдельно сопоставляются параметры, состояние оптимизатора, состояние генератора случайных чисел, позиция в данных и последующие результаты.
Почему это важно
Битовая воспроизводимость превращает трудноуловимые расхождения в диагностируемые события: команда может повторить сбой, проверить изменение в стеке и продолжить прерванное обучение без смены числовой траектории.