Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
RiVER: как учить LLM без правильных ответов — и получать лучше
Reinforcement Learning without Ground-Truth Solutions: фреймворк RiVER тренирует LLM на задачах без эталонных ответов, используя ранговое сравнение решений и калибровку reward shaping.
Как выбрать правильный ML-алгоритм: практический фреймворк от Тим Мок
Суть алгоритмов ML можно уложить в простую схему: сначала определяете тип задачи, потом смотрите на объём данных, и нужный инструмент находится сам.
Claude Tag: третья революция в работе с ИИ
Anthropic научила Claude работать внутри Slack: тегать как человека, разбивать проекты на шаги и писать 65% кода компании. Карпати говорит — это третья революция в интерфейсах ИИ.
Hallucination in World Models: как генеративные модели «видят» то, чего нет
Модели мира генерируют визуально убедительные траектории, которые тем не менее отклоняются от реальной физики. Исследователи из UC San Diego нашли способ предсказывать и предотвращать такие галлюцинации.
VISE: как заставить мультимодальную модель действительно смотреть на картинку
Новая архитектура VISE борется с системной проблемой мультимодальных LLM: модели «видят» не то, что на картинке, а то, что ожидают услышать. Два reward — геометрический и семантический — заставляют decoder обращать внимание на визуал. Результат: COCO +16.85 CIDEr, снижение галлюцинаций на 5 баллов Chair-I.
Sakana Fugu: модель-роутер, которая обходит Fable 5
Японский стартап Sakana AI выпустил Fugu — модель, которая выступает диспетчером других моделей и при этом бьёт Fable 5 на Live Code Bench. Разбираемся, как это работает и зачем это нужно.
Multimodal LLM чувствительны к порядку данных: результаты аудита 18 моделей
Аудит 18 мультимодальных LLM показал: ни одна не даёт одинаковый ответ при перестановке одних и тех же данных. Лучшая модель всё ещё меняет 13,4% ответов. Facet-Probe — пять метрик, которые стандартные бенчмарки не измеряют.
Как выбрать алгоритм машинного обучения: практический гид
Линейная регрессия, KNN, SVM, случайный лес, градиентный бустинг и нейросети — в одном гиде. Без воды, с интуицией.
Anthropic привлекла SpaceX Colossus: 17x рост API и 90% автономного кода
Anthropic на мероприятии Code w/ Claude 2026 объявила о партнёрстве со SpaceX и рекордном росте API — 17x год к году. Ключевые инсайты: SpaceX Colossus, мультиагентная оркестровка, Dreaming-режим и план Shopify выйти на 90% автономного кода.
QIMMA: почему арабские LLM-бенчмарки давали неверные результаты
Арабский — язык 400 миллионов человек, но его LLM-бенчмарки кишат ошибками: неправильные ответы, дубликаты, культурные стереотипы. QIMMA проверила 52 000 сэмплов из 14 бенчмарков и показала, сколько из них нужно выбросить.