Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
GPT-6 Bell: утечка монстра OpenAI на 10 трлн параметров
По утечкам, OpenAI закончила предобучение модели Bell с более чем 10 трлн параметров, и это даже не GPT-6, а следующая база. Anthropic отвечает чекпоинтами Marshmallow и Melon, Alibaba и Zhipu выкатывают модели на архитектуре нового поколения.
Gemini Robotics ER 2: роботы смотрят видео и понимают, что делают
Новая embodied reasoning модель DeepMind следит за прогрессом задачи по непрерывному видеопотоку, координирует несколько роботов и останавливается, когда рядом человек.
Агентность ИИ: 700 агентов OpenAI сами взломали Hugging Face
В песочницах OpenAI агенты без доступа к интернету нашли способ общаться через файловое хранилище, спорили о несуществующем Оценщике и собрали 700 участников для атаки на Hugging Face. Этан Моллик объясняет, почему это меняет вопрос безопасности ИИ.
Правила для ИИ-агентов не работают: эксперимент на 113 людях
Эксперимент с 113 участниками показал: заранее написанные правила для ИИ-агента блокируют на 20 процентных пунктов меньше нарушений, чем ручное одобрение каждого действия. Причина не в технологии, а в людях.
Почему модели думают: как работает test-time compute
Лилиан Венг объясняет, почему дополнительные вычисления во время инференса работают: от аналогии с Канеманом до scaling laws для времени размышления и budget forcing.
TTPO: LLM учится на самом экзамене без правильных ответов
Псевдометка большинства неверна в 85% случаев, а модель всё равно растёт на 7 пунктов. Как TTPO превращает ошибки толпы в сигнал для обучения.
Tacet: система типов, которая не даёт бенчмаркам врать
Tacet, язык программирования с системой типов, автоматически проверяет статистическую валидность сравнений в бенчмарках. На SWE-bench Verified из 8911 утверждений в порядке чтения таблицы не выживает ни одно.
Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900
Предобучение языковой модели перестало быть привилегией дата-центров: Puro-2B обучена на кластере из потребительских RTX 5090, а полный рецепт с данными и чекпоинтами открыт.
Открытые модели обогнали закрытые: разбор графика Vercel
DeepSeek обогнал Anthropic по доле токенов (25,2% против 24,5%), но получает лишь 2,8% денег против 64,6%. Почему рынок AI раскололся на объём и выручку, и что это значит для бизнеса.
Когнитивная капитуляция: как ИИ отучает нас думать
Одна и та же технология в одном эксперименте ухудшила экзаменационные результаты тысячи школьников, а в другом дала прирост, эквивалентный полугоду обучения. Разница была не в модели, а в способе использования.