Блог об AI

Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.

Последние записи

TokenSpeed-kernel: многосиликоновый LLM-инференс без боли

TokenSpeed-kernel: многосиликоновый LLM-инференс без боли

Ядерная система TokenSpeed-kernel решает главную проблему гетерогенного инференса: вместо того чтобы плодить AMD-специфичные пути в рантайме, она разделяет код на общее API и плагинные бэкенды. AMD MI355X с Gluon-ядрами достигает 3.6× ускорения против Triton.

Почему высокая вероятность ответа LLM не гарантирует его правильность

Почему высокая вероятность ответа LLM не гарантирует его правильность

LLM, которые выдают высокую вероятность ответа, не всегда правы. Новое исследование объясняет, почему.

RiVER: как учить LLM без правильных ответов — и получать лучше

RiVER: как учить LLM без правильных ответов — и получать лучше

Reinforcement Learning without Ground-Truth Solutions: фреймворк RiVER тренирует LLM на задачах без эталонных ответов, используя ранговое сравнение решений и калибровку reward shaping.

Как выбрать правильный ML-алгоритм: практический фреймворк от Тим Мок

Как выбрать правильный ML-алгоритм: практический фреймворк от Тим Мок

Суть алгоритмов ML можно уложить в простую схему: сначала определяете тип задачи, потом смотрите на объём данных, и нужный инструмент находится сам.

Claude Tag: третья революция в работе с ИИ

Claude Tag: третья революция в работе с ИИ

Anthropic научила Claude работать внутри Slack: тегать как человека, разбивать проекты на шаги и писать 65% кода компании. Карпати говорит — это третья революция в интерфейсах ИИ.

Hallucination in World Models: как генеративные модели «видят» то, чего нет

Hallucination in World Models: как генеративные модели «видят» то, чего нет

Модели мира генерируют визуально убедительные траектории, которые тем не менее отклоняются от реальной физики. Исследователи из UC San Diego нашли способ предсказывать и предотвращать такие галлюцинации.

VISE: как заставить мультимодальную модель действительно смотреть на картинку

VISE: как заставить мультимодальную модель действительно смотреть на картинку

Новая архитектура VISE борется с системной проблемой мультимодальных LLM: модели «видят» не то, что на картинке, а то, что ожидают услышать. Два reward — геометрический и семантический — заставляют decoder обращать внимание на визуал. Результат: COCO +16.85 CIDEr, снижение галлюцинаций на 5 баллов Chair-I.

Sakana Fugu: модель-роутер, которая обходит Fable 5

Sakana Fugu: модель-роутер, которая обходит Fable 5

Японский стартап Sakana AI выпустил Fugu — модель, которая выступает диспетчером других моделей и при этом бьёт Fable 5 на Live Code Bench. Разбираемся, как это работает и зачем это нужно.

Multimodal LLM чувствительны к порядку данных: результаты аудита 18 моделей

Multimodal LLM чувствительны к порядку данных: результаты аудита 18 моделей

Аудит 18 мультимодальных LLM показал: ни одна не даёт одинаковый ответ при перестановке одних и тех же данных. Лучшая модель всё ещё меняет 13,4% ответов. Facet-Probe — пять метрик, которые стандартные бенчмарки не измеряют.

Как выбрать алгоритм машинного обучения: практический гид

Как выбрать алгоритм машинного обучения: практический гид

Линейная регрессия, KNN, SVM, случайный лес, градиентный бустинг и нейросети — в одном гиде. Без воды, с интуицией.