Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
ActCam: jointly control camera and character motion in AI video
ActCam позволяет одновременно управлять движением камеры и персонажа в AI-видео без дополнительного обучения модели. Система принимает три входа: референс-изображение, видео-источник движения и траекторию камеры.
VISE: как заставить мультимодальную модель смотреть на изображение, а не угадывать
Мультимодальные модели часто генерируют текст на основе языковых паттернов, а не реального изображения. Исследователи из MBZUAI предложили VISE — фреймворк, заставляющий модель обращать внимание на визуальные токены.
AI-чипы 2026: OpenAI Jalapeno и IBM sub-1nm — гонка за энергоэффективность
OpenAI и IBM одновременно объявили о прорывах в AI-железе: 9-месячная разработка чипа Jalapeno и 3D-архитектура с 100 млрд транзисторов на площади ногтя.
NeuROK: как модель научилась предсказывать движение объекта по одному снимку
NeuROK решает задачу, которую физики считали невозможной без экспертных priors: по одному 3D-снимку объекта модель предсказывает, как он будет деформироваться при приложении силы. Conditional VAE + Lagrangian mechanics = kinematic state space.
Гибридные LLM против трансформеров: токенный разбор
Токенный анализ показал: гибридные модели выигрывают у трансформеров на open-class словах и открытых разделителях, но проигрывают на копировании n-грамм и закрывающих скобках.
FID — золотой стандарт генерации картинок — оказался неправ
Fréchet Inception Distance десять лет определял развитие генеративных моделей. Новое исследование показало, что FID можно оптимизировать напрямую — и результат опровергает сам FID.
AI, ML, Deep Learning и Generative AI: объяснение в одной картинке
Четыре термина, которые все путают: AI, машинное обучение, deep learning и генеративный ИИ. Объясняем разницу через洋葱-слои и реальные задачи — от детектирования аномалий до генерации текста.
Weave Router: модель-роутер для Claude Code, Codex и Cursor за 40-70% экономии
Weave Router — это open-source модель-роутер, который подключается к Claude Code, Codex и Cursor и автоматически перенаправляет каждый запрос нужной модели с экономией 40-70% на API-бюджете.
TokenSpeed-kernel: многосиликоновый LLM-инференс без боли
Ядерная система TokenSpeed-kernel решает главную проблему гетерогенного инференса: вместо того чтобы плодить AMD-специфичные пути в рантайме, она разделяет код на общее API и плагинные бэкенды. AMD MI355X с Gluon-ядрами достигает 3.6× ускорения против Triton.
Почему высокая вероятность ответа LLM не гарантирует его правильность
LLM, которые выдают высокую вероятность ответа, не всегда правы. Новое исследование объясняет, почему.