NVIDIA добавила в CUDA 13.1 явное распределение GPU-ресурсов через green contexts
В техническом блоге NVIDIA описала green contexts в CUDA 13.1: механизм позволяет разделять SM и очереди работ между задачами внутри одного процесса и точнее управлять их одновременным выполнением.

6 октября 2026 года NVIDIA рассказала о green contexts — механизме управления ресурсами GPU, который начиная с CUDA 13.1 доступен через Runtime API. Он предназначен для приложений, где в одном процессе одновременно работают, например, чувствительное к задержке ядро и крупная фоновая задача либо этап подготовки данных и AI-инференс.
Разработчик может создать green context для выбранного набора ресурсов, а затем создавать из него потоки. Работа, отправленная в эти потоки, будет связана с ресурсами контекста, а не с неявным состоянием устройства или потока вызовов. NVIDIA отдельно указывает на два сценария: распределение потоковых мультипроцессоров и явное выделение workqueues, чтобы уменьшить нежелательную сериализацию независимых задач.
По описанию компании, механизм является опциональным и добавочным: существующие приложения могут внедрять его постепенно, а для работы со всем устройством по-прежнему можно использовать традиционную модель Runtime API. В приведённом NVIDIA примере на GPU Blackwell задержка критического ядра уменьшилась с 0,140 до 0,007 миллисекунды. Этот показатель относится к конкретному сценарию тестирования, а не ко всем нагрузкам.
Почему это важно
Green contexts дают разработчикам более прямой контроль над совместным использованием GPU. Это может быть полезно для AI-систем, где задержку инференса нужно отделить от ресурсоёмких фоновых или коммуникационных операций.