PyTorch Conference 2026: программа и главные темы

PyTorch Conference 2026: программа и главные темы

Если хотите понять, куда движется индустрия машинного обучения, не читайте пресс-релизы модельных лабораторий. Читайте программу инфраструктурных конференций. PyTorch Foundation опубликовала расписание PyTorch Conference North America 2026, которая пройдёт 20-21 октября в Сан-Хосе, и оно читается как карта ближайших двух лет: агенты перестали быть демкой и стали инженерной дисциплиной, инференс окончательно свёлся к войне за KV-кэш, а PyTorch перестал быть фреймворком только для NVIDIA.

PyTorch Conference 2026 это главная ежегодная конференция экосистемы PyTorch, два дня технических докладов, воркшопов и дискуссий об открытом AI-стеке. В этом году программа разбита на треки: Core PyTorch (компилятор, рантайм, релизная инженерия), vLLM и инференс, агентный AI и «интеллект нового поколения». Ниже разбираю, что в каждом треке заслуживает внимания и почему.

Ключевые доклады: адаптивность вместо грубой силы

Тон конференции задают три кейноута, и их выбор сам по себе диагноз. Сара Хукер из Adaption выступит с докладом «Beyond Brute Force: The Era of Adaptive Intelligence»: её тезис в том, что следующий скачок даст не скейлинг, а архитектуры, которые продолжают учиться после деплоя, без полного переобучения, без катастрофического забывания и без оплаты бесконечных циклов файнтюнинга. Билл Джиа из Google Cloud покажет «Workload Fungibility in the Age of Agents»: long-horizon агенты, которые сами переносят сложные модельные нагрузки с GPU на TPU, перебирая квантизацию, генерацию кастомных ядер и стратегии шардирования почти без участия человека. Третья рамка от Мазина Гилберта, исполнительного директора Agentic AI Foundation при Linux Foundation: как агентная инфраструктура получает нейтральный дом для говернанса, пригодный для корпоративного опенсорса.

Из остальной сцены стоит отметить Джоэль Пино из Cohere с разговором об открытой науке и фундаментных моделях, Криса Латтнера из Qualcomm, Яну ван Грёнен из Meta с рассказом о мультисиликоновой экосистеме внутри компании и Марка Саруфима с интригующим «Linear Algebra for the Age of Research». Отдельный спонсорский кейноут AWS посвящён пути Trainium к нативному PyTorch.

Агенты везде, и это уже не маркетинг

Самый плотный кластер программы это агентное обучение. Организаторы прямо пишут: многошаговое RL с инструментами и длинным горизонтом перешло из разряда исследовательского любопытства в продакшн-требование. Meta покажет сквозной цикл RL-тренировки в PyTorch: инфраструктура роллаутов, связь тренера с сервингом, абстракции окружений, песочницы и компромиссы между on-policy и off-policy. Hugging Face представит OpenEnv, слой совместимости для публикации и запуска RL-окружений, который совместно развивают Meta, Unsloth, Prime Intellect, Modal, NVIDIA и Mercor. Идея проста: фронтир-лабы обучают модели внутри собственных харнессов, а открытая экосистема собирает модель, харнесс и тренировку у разных вендоров. OpenEnv должен закрыть этот зазор, и демо обещают такое, которое можно форкнуть и запустить на одной GPU.

Рядом сессии про Torchtitan RL с бит-в-бит воспроизводимым on-policy режимом (одна и та же модель для тренировки и генерации, чтобы артефакты системы не ломали дизайн награды), энтерпрайз-фреймворк Miles от RadixArk и практические SFT плюс GRPO в агентных средах. Ключевой сдвиг формулируется так: обучай агента, а не только модель.

Вторая половина агентного трека это агенты, которые строят сам PyTorch. В CI репозитория уже работает Claude: мейнтейнеры получают всё больше PR, написанных агентами, и отвечают симметрично, @claude в ишью и пул-реквестах, автоматический триаж, расследование падений CI и авторевертов, PR-ревью с явным списком разрешённых инструментов. Дрисс Гессус из Meta честно назвал доклад «Fighting Agents with Agents». Есть и философский край: сессия Arm про агентный синтез инференс-рантаймов, когда вместо одного руками вылизанного рантайма агентный харнесс собирает отдельный рантайм под каждую цель. Уже проверено против llama.cpp и MLX на Apple Silicon, а дальше его направили на железо, для которого базовой реализации не существовало вообще.

Третья часть это говернанс, и тут тон заметно трезвее, чем на типичной AI-конференции. Apple ставит вопрос предельно конкретно: если агент в три часа ночи мисконфигурирует сервис и уронит продакшн, кто отвечает? Доклад предлагает практическую модель того, что агенты могут чинить сами, что должны эскалировать и что никогда не покидает рук человека. Amazon расскажет о stateful-гардрейлах для мультиагентных потоков: непрерывный редтиминг и маленькие языковые модели как детерминированные фильтры с низкой латентностью против prompt injection и эксплойтов оркестрации. Capital One покажет четырёхслойную архитектуру валидации, где доверие к выводу модели это инженерная дисциплина: схемная типизация, калибровка уверенности, контрактная валидация, постоянная наблюдаемость.

vLLM: война за KV-кэш

Инференс-трек в этом году это по сути трек про память. vLLM представлен сессиями о переработанных абстракциях внимания (скользящие окна, спарсити, линейные варианты и гибриды теперь должны подключаться чище), о дизагрегированном сервинге и о десятке способов не держать KV-кэш в дорогой HBM дольше, чем нужно.

Команды Mistral AI, Amazon и Red Hat расскажут о трансфере KV между prefill и decode: двунаправленная передача, коннектор KV Push, аренда кэша для надёжности. По их данным, KV Push сокращает время до первого токена, а на Nemotron дизагрегированная схема доминирует по Парето над совмещённой на всех уровнях конкурентности. IBM представит нативный многоуровневый оффлоад KV-кэша, влитый в апстрим без внешних зависимостей: CPU-память работает универсальным транспортным хабом, дизайн не привязан ни к раскладке кэша, ни к бэкенду внимания, ни к схеме параллелизма. NVIDIA покажет Elastic Expert Parallelism для MoE-моделей: воркеры добавляются и удаляются на лету, эксперты перебалансируются под живым трафиком, с обнаружением сбоев и восстановлением.

Отдельно выделю lightning talk Huawei про модель-специфичные планировщики KV-кэша: у MLA, скользящего окна, Eagle и DeepSeek-V4 настолько разные требования, что единый планировщик больше не справляется, и предлагается схема «дефолтный планировщик плюс модельные плагины». Это хороший маркер того, насколько фрагментированными стали архитектуры внимания.

Мультисиликон: PyTorch больше не равен CUDA

Core-трек тихо фиксирует смену эпохи. Google представит TorchTPU, нативный бэкенд PyTorch для TPU: eager-first стек с лоуерингом ATen в StableHLO, продакшн-внедрения с партнёрами приватного превью и, главное, переход к открытой модели с публичным репозиторием на GitHub в ближайшее время. AWS покажет профилирование Trainium через обычный torch.profiler без изменений кода, вплоть до цикловых таймлайнов устройства и AI-ассистированного анализа узких мест. IBM расскажет о Torch-Spyre с Inductor-бэкендом для ускорителя Spyre. Intel добавляет нативную поддержку своих GPU в TorchComms через библиотеку oneCCL: заявляют больше 90% эффективности масштабирования на тысячах узлов системы Aurora в Аргоннской национальной лаборатории при тренировке TorchTitan.

NVIDIA, разумеется, никуда не делась: расширения NCCL под современные паттерны коммуникации, включая NCCL-EP для dispatch/combine в MoE и NCCL-M2N для zero-copy решардинга между несвязными сетками устройств. Последний уже используют, чтобы переносить снапшоты весов с тренеров на инференс-реплики при RL-роллаутах без промежуточной стадии через CPU.

Чтобы весь этот зоопарк не разваливался, экосистема строит Cross-Repository CI Relay: события из PR и пушей PyTorch в реальном времени уходят в репозитории внешних бэкендов на проверку совместимости до мержа. У Huawei это работает в связке с механизмом переиспользования тестов: 580 тысяч с лишним коммьюнити-тестов out-of-tree бэкенды получают из коробки, а стабильный релиз внешнего бэкенда укладывается в 30 дней после апстрим-обновления. Red Hat сообщает, что у Ascend NPU и RISC-V время обнаружения поломок сократилось с дней до минут. Параллельно идёт работа над стабильным ABI для C++-расширений, чтобы vLLM и SGLang не пересобирались под каждую версию PyTorch, с LLM-ассистированной миграцией нестабильных вызовов.

Из компиляторных вкусностей: вложенные graph break в Dynamo раньше давали O(N) дублирующихся разрывов и O(N²) трейсов фреймов при вызове глубиной N слоёв. Новая поддержка сокращает это до O(1) разрывов и O(N) трейсов, что означает большие захваченные графы и меньшее время трейсинга. Ещё одна любопытная ветка: device-aware раскладки тензоров, потому что size, stride и storage offset уже не описывают то, что нужно современным ускорителям, включая тайлинг и NUMA-размещение.

Физический AI и эдж: агенты выходят из дата-центра

Отдельная линия агентного трека посвящена железу в буквальном смысле. Meta покажет, как компилировать робот-политики из фреймворков вроде LeRobot или OpenVLA в переносимые рантайм-артефакты, которые работают на NVIDIA, Intel, ARM и даже микроконтроллерах без пересборки стека под каждую цель. Там же ExecuTorch как основа для локальных агентов: приватных, композитных и работающих без облака. Команда Rerun расскажет о мультимодальных даталоадерах для физического AI, где главная боль это голодание GPU на временных датасетах с сенсорикой. Boson AI закроет тему голосовым AI: сквозной пост-тренинг в PyTorch и сервинг с жёсткими ограничениями по латентности, включая расширение SGLang под аудио-нагрузки.

Эта часть программы важна не сама по себе, а как сигнал: агенты перестают быть чат-ботами в дата-центре. Когда политика робота компилируется на микроконтроллер тем же пайплайном, что и LLM на кластер, граница между «AI-инфраструктурой» и «embedded-разработкой» окончательно стирается.

Релизная инженерия: конвейер, который сам себя чинит

Ещё одна недооценённая тема это то, как PyTorch теперь выпускается. Андрей Талман из Meta расскажет о трёх изменениях: более быстрый и предсказуемый релизный процесс, непрерывная валидация Triton и vLLM против найтли-сборок PyTorch (поломки всплывают в апстриме раньше, чем доходят до пользователей) и AI-агенты, которые триажат CI, отделяют шум от регрессий и черновят фиксы. Показательно, что докладчики специально оговаривают границу: где агенты ускоряют релизную работу, а где решение всё ещё принимает человек.

Часто задаваемые вопросы

Когда и где пройдёт PyTorch Conference 2026?

Североамериканская конференция состоится 20-21 октября 2026 года в Сан-Хосе, Калифорния. Два дня докладов, воркшопов и панелей по всему открытому AI-стеку. Ранняя регистрация со скидкой была доступна до 4 сентября.

Что такое OpenEnv и зачем он нужен?

OpenEnv это открытый слой совместимости для RL-окружений, который совместно развивают Hugging Face, Meta, Unsloth, NVIDIA и другие. Он позволяет публиковать и запускать среды для агентного обучения независимо от модели и тренировочного стека, закрывая разрыв между закрытыми харнессами фронтир-лабораторий и открытой экосистемой.

PyTorch теперь работает на TPU и Trainium?

Да, и это одна из главных тем конференции. TorchTPU даёт нативный бэкенд PyTorch для Google TPU и переходит в опенсорс, AWS развивает нативный PyTorch на Trainium, а Torch-Spyre добавляет поддержку ускорителей IBM. Все три направления докладываются на конференции как продакшн-направления, а не эксперименты.

Итог

Программа PyTorch Conference 2026 рисует экосистему, где три вещи стали инженерной рутиной: агентное RL как стандартный этап пост-тренировки, KV-кэш как главный ресурс инференса и настоящая мультисиликоновая переносимость вместо монополии одного вендора. Если работаете с открытым AI-стеком, имеет смысл пройтись по полному расписанию и выбрать свои сессии заранее: плотность материала такова, что за два дня в Сан-Хосе можно увидеть больше о будущем инфраструктуры, чем за год чтения анонсов моделей.

← Все записи