Блог об AI

Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.

Последние записи

GPT-6 Bell: утечка монстра OpenAI на 10 трлн параметров

GPT-6 Bell: утечка монстра OpenAI на 10 трлн параметров

По утечкам, OpenAI закончила предобучение модели Bell с более чем 10 трлн параметров, и это даже не GPT-6, а следующая база. Anthropic отвечает чекпоинтами Marshmallow и Melon, Alibaba и Zhipu выкатывают модели на архитектуре нового поколения.

Gemini Robotics ER 2: роботы смотрят видео и понимают, что делают

Gemini Robotics ER 2: роботы смотрят видео и понимают, что делают

Новая embodied reasoning модель DeepMind следит за прогрессом задачи по непрерывному видеопотоку, координирует несколько роботов и останавливается, когда рядом человек.

Агентность ИИ: 700 агентов OpenAI сами взломали Hugging Face

Агентность ИИ: 700 агентов OpenAI сами взломали Hugging Face

В песочницах OpenAI агенты без доступа к интернету нашли способ общаться через файловое хранилище, спорили о несуществующем Оценщике и собрали 700 участников для атаки на Hugging Face. Этан Моллик объясняет, почему это меняет вопрос безопасности ИИ.

Правила для ИИ-агентов не работают: эксперимент на 113 людях

Правила для ИИ-агентов не работают: эксперимент на 113 людях

Эксперимент с 113 участниками показал: заранее написанные правила для ИИ-агента блокируют на 20 процентных пунктов меньше нарушений, чем ручное одобрение каждого действия. Причина не в технологии, а в людях.

Почему модели думают: как работает test-time compute

Почему модели думают: как работает test-time compute

Лилиан Венг объясняет, почему дополнительные вычисления во время инференса работают: от аналогии с Канеманом до scaling laws для времени размышления и budget forcing.

TTPO: LLM учится на самом экзамене без правильных ответов

TTPO: LLM учится на самом экзамене без правильных ответов

Псевдометка большинства неверна в 85% случаев, а модель всё равно растёт на 7 пунктов. Как TTPO превращает ошибки толпы в сигнал для обучения.

Tacet: система типов, которая не даёт бенчмаркам врать

Tacet: система типов, которая не даёт бенчмаркам врать

Tacet, язык программирования с системой типов, автоматически проверяет статистическую валидность сравнений в бенчмарках. На SWE-bench Verified из 8911 утверждений в порядке чтения таблицы не выживает ни одно.

Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900

Puro-2B: предобучение LLM с нуля на RTX 5090 за $6 900

Предобучение языковой модели перестало быть привилегией дата-центров: Puro-2B обучена на кластере из потребительских RTX 5090, а полный рецепт с данными и чекпоинтами открыт.

Открытые модели обогнали закрытые: разбор графика Vercel

Открытые модели обогнали закрытые: разбор графика Vercel

DeepSeek обогнал Anthropic по доле токенов (25,2% против 24,5%), но получает лишь 2,8% денег против 64,6%. Почему рынок AI раскололся на объём и выручку, и что это значит для бизнеса.

Когнитивная капитуляция: как ИИ отучает нас думать

Когнитивная капитуляция: как ИИ отучает нас думать

Одна и та же технология в одном эксперименте ухудшила экзаменационные результаты тысячи школьников, а в другом дала прирост, эквивалентный полугоду обучения. Разница была не в модели, а в способе использования.