Блог об AI

Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.

Последние записи

Квантизация LLM: иллюзия эквивалентности — почему точность обманывает

Квантизация LLM: иллюзия эквивалентности — почему точность обманывает

Новая работа демонстрирует: даже при сохранении точности, квантизация меняет поведение LLM на уровне отдельных решений. Введён метрический тест correctness agreement, который измеряет расхождение между оригиналом и квантованной моделью независимо от абсолютной точности.

Интеллект стал бесплатным: что дальше? Три вызова data-систем для агентов

Интеллект стал бесплатным: что дальше? Три вызова data-систем для агентов

Когда интеллект перестаёт быть дефицитом, на первый план выходят данные. BAIR из UC Berkeley описывает три новых вызова для data-систем в эпоху агентов — и предлагает конкретные архитектуры.

BAIR 2026: куда идут лучшие AI-исследователи и что это значит для индустрии

BAIR 2026: куда идут лучшие AI-исследователи и что это значит для индустрии

Разбираем список выпускников BAIR 2026: кто уходит в embodied AI, кто — в безопасность LLM, а кто основывает стартапы. Карта направлений, которые будут определять индустрию в 2026–2030.

UniClawBench: Первый бенчмарк способностей ИИ-агентов в реальных задачах

UniClawBench: Первый бенчмарк способностей ИИ-агентов в реальных задачах

Новый бенчмарк HKU MMLab оценивает проактивных ИИ-агентов не по сценариям, а по фундаментальным способностям. Лучшая модель (Claude Opus 4.8) решает лишь 47.5% задач — и это при закрытом цикле с обратной связью.

PyTorch Monarch на AMD: обучение LLM без чекпоинтов на 256 GPU

PyTorch Monarch на AMD: обучение LLM без чекпоинтов на 256 GPU

Meta перенесла PyTorch Monarch на AMD Instinct с ROCm. Отказоустойчивое обучение без чекпоинтов, восстановление за секунды, валидация на 256 GPU MI355.

One Streamer: Alibaba ломает задержку в диалоговых аватарах

One Streamer: Alibaba ломает задержку в диалоговых аватарах

Alibaba выпустила One Streamer — систему интерактивного аватара с дуплексной связью, работающую на одном трансформере. 25 fps, 200 мс отклика, никаких отдельных модулей. Анализ архитектуры и того, почему это важнее, чем кажется.

Miles: фреймворк RL post-training LLM от RadixArk

Miles: фреймворк RL post-training LLM от RadixArk

Miles от RadixArk — open source фреймворк для RL post-training LLM, который композирует SGLang, Megatron-LM, Ray и PyTorch в единую систему с поддержкой MoE, асинхронности и low-precision рецептов.

ECGLight: как ИИ превращает фото бумажной ЭКГ в диагноз за 30 секунд

ECGLight: как ИИ превращает фото бумажной ЭКГ в диагноз за 30 секунд

Новый фреймворк ECGLight оцифровывает бумажные ЭКГ по фото со смартфона и выявляет инфаркт миокарда с точностью 95.5% — всё на CPU, без GPU и интернета, за 30 секунд.

AMIE: ИИ от Google учится управлять хроническими болезнями, а не просто ставить диагнозы

AMIE: ИИ от Google учится управлять хроническими болезнями, а не просто ставить диагнозы

Google DeepMind опубликовал в Nature исследование AMIE — conversational AI для долгосрочного ведения хронических заболеваний. Система использует Gemini для анализа сотен страниц клинических рекомендаций и эмпатичного диалога с пациентами.

Scaling laws LLM: почему Kaplan ошибся, а Chinchilla права

Scaling laws LLM: почему Kaplan ошибся, а Chinchilla права

Как главные эмпирические законы глубокого обучения родились, оспаривались и пересматривались — от Kaplan 2020 до стены данных.