Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
WeatherNext 2: ИИ предсказывает ураганы на 15 дней вперёд
Google DeepMind опубликовал WeatherNext 2 в Nature и выложил код с весами в открытый доступ. Модель даёт прогноз циклонов на 15 дней вперёд, обгоняет классические системы больше чем на сутки и считается за минуту на одном TPU.
Что ломается, когда LLM-агенты работают без присмотра 58 дней
Одна компания записала 6768 отказов своих 78 LLM-агентов за 58 дней. Главный вывод: драматичные сбои, под которые пишут все evals, составляют 1,7% — остальное скучнее и дороже.
Как один пример меняет LLM: выучено, потом забыто
Исследователь обучил 32 копии GPT-2, внедрив в каждую ровно один абзац про Beatles, и измерил, что осталось от него в готовой модели. Ответ неудобен для индустрии атрибуции данных.
FP8-обучение на AMD GPU: PyTorch ускорился на 13% из коробки
FP8-тренировка на AMD Instinct наконец работает без патчей: команды AMD и Meta влили оптимизации прямо в TorchAO и TorchTitan. Llama 3 8B получила +13,4% к throughput, а MoE-модели вроде DeepSeek-V3 вернули 89% потерь на квантизации.
Кросс-энтропия простыми словами: от gzip до обучения LLM
Одна и та же формула управляет архиватором gzip и обучением ChatGPT. Разбираем кросс-энтропию от робота с четырьмя командами до дистилляции больших моделей.
ConceptGuard: почему модели не умеют забывать избирательно
Существующие бенчмарки unlearning проверяют, забыла ли модель факты. ConceptGuard спрашивает другое: может ли она применять одну и ту же концепцию во вред или на пользу в зависимости от контекста. Ответ: почти нет.
Мо Гавдат: почему ИИ никогда не сделает вас счастливым
Мо Гавдат ушёл из Google в 2018 году, чтобы предупредить мир об ИИ. Теперь он говорит, что мы измеряем не то и ждём от технологий не того.
GRASP: градиентное планирование для мировых моделей
Мировые модели умеют предсказывать будущее, но планировать с ними на 50+ шагов вперёд почти невозможно. GRASP от BAIR решает это через коллокацию и хитрый трюк с градиентами.
Горький урок tool calling: почему код бьёт JSON
11 из 14 моделей вызывают инструменты через Python-код не хуже, чем через JSON, а семейство GPT-5.6 выигрывает 10,6%. При этом старые GPT-4o проваливают тест из-за одного бага с переносами строк.
SPEX: интерпретируемость LLM на масштабе тысяч компонентов
Классические методы интерпретируемости видят только отдельные признаки. SPEX и ProxySPEX из UC Berkeley находят взаимодействия между тысячами компонентов, применяя идеи из обработки сигналов.