NVIDIA описала развёртывание генеративного рекомендателя HSTU
NVIDIA показала в техническом блоге процесс запуска генеративной рекомендательной модели HSTU с Dynamo-Triton и привела результаты теста с кэшем KV.

NVIDIA 30 сентября 2026 года опубликовала описание развёртывания генеративного рекомендателя HSTU с Dynamo-Triton. В примере используется сквозной процесс вывода из набора recsys-examples: PyTorch AOTI компилирует модель ранжирования HSTU в нативные артефакты C++, а кэширование KV на базе FlexKV сохраняет повторно используемое состояние внимания и помогает не обрабатывать длинную историю пользователя заново. По данным NVIDIA, на GPU RTX PRO 6000 Blackwell Workstation Edition восьмислойная модель показала до 5,93 раза меньшую задержку при размере пакета 8 и стопроцентном попадании в GPU-кэш KV. Компания предлагает использовать руководство для воспроизведения экспорта, проверки и развёртывания.
Почему это важно
Материал показывает практический сценарий ускорения персонализации за счёт компиляции модели и повторного использования состояния внимания.