Блог об AI

Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.

Последние записи

ActCam: jointly control camera and character motion in AI video

ActCam: jointly control camera and character motion in AI video

ActCam позволяет одновременно управлять движением камеры и персонажа в AI-видео без дополнительного обучения модели. Система принимает три входа: референс-изображение, видео-источник движения и траекторию камеры.

VISE: как заставить мультимодальную модель смотреть на изображение, а не угадывать

VISE: как заставить мультимодальную модель смотреть на изображение, а не угадывать

Мультимодальные модели часто генерируют текст на основе языковых паттернов, а не реального изображения. Исследователи из MBZUAI предложили VISE — фреймворк, заставляющий модель обращать внимание на визуальные токены.

AI-чипы 2026: OpenAI Jalapeno и IBM sub-1nm — гонка за энергоэффективность

AI-чипы 2026: OpenAI Jalapeno и IBM sub-1nm — гонка за энергоэффективность

OpenAI и IBM одновременно объявили о прорывах в AI-железе: 9-месячная разработка чипа Jalapeno и 3D-архитектура с 100 млрд транзисторов на площади ногтя.

NeuROK: как модель научилась предсказывать движение объекта по одному снимку

NeuROK: как модель научилась предсказывать движение объекта по одному снимку

NeuROK решает задачу, которую физики считали невозможной без экспертных priors: по одному 3D-снимку объекта модель предсказывает, как он будет деформироваться при приложении силы. Conditional VAE + Lagrangian mechanics = kinematic state space.

Гибридные LLM против трансформеров: токенный разбор

Гибридные LLM против трансформеров: токенный разбор

Токенный анализ показал: гибридные модели выигрывают у трансформеров на open-class словах и открытых разделителях, но проигрывают на копировании n-грамм и закрывающих скобках.

FID — золотой стандарт генерации картинок — оказался неправ

FID — золотой стандарт генерации картинок — оказался неправ

Fréchet Inception Distance десять лет определял развитие генеративных моделей. Новое исследование показало, что FID можно оптимизировать напрямую — и результат опровергает сам FID.

AI, ML, Deep Learning и Generative AI: объяснение в одной картинке

AI, ML, Deep Learning и Generative AI: объяснение в одной картинке

Четыре термина, которые все путают: AI, машинное обучение, deep learning и генеративный ИИ. Объясняем разницу через洋葱-слои и реальные задачи — от детектирования аномалий до генерации текста.

Weave Router: модель-роутер для Claude Code, Codex и Cursor за 40-70% экономии

Weave Router: модель-роутер для Claude Code, Codex и Cursor за 40-70% экономии

Weave Router — это open-source модель-роутер, который подключается к Claude Code, Codex и Cursor и автоматически перенаправляет каждый запрос нужной модели с экономией 40-70% на API-бюджете.

TokenSpeed-kernel: многосиликоновый LLM-инференс без боли

TokenSpeed-kernel: многосиликоновый LLM-инференс без боли

Ядерная система TokenSpeed-kernel решает главную проблему гетерогенного инференса: вместо того чтобы плодить AMD-специфичные пути в рантайме, она разделяет код на общее API и плагинные бэкенды. AMD MI355X с Gluon-ядрами достигает 3.6× ускорения против Triton.

Почему высокая вероятность ответа LLM не гарантирует его правильность

Почему высокая вероятность ответа LLM не гарантирует его правильность

LLM, которые выдают высокую вероятность ответа, не всегда правы. Новое исследование объясняет, почему.