Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
Не учи агентов без фундамента: путь от API до production
Разбираем, почему прыжок сразу к AI-агентам — верный способ получить систему, которая работает на демо и падает в production.
Цена ИИ: как в Кении за $2 в час обучают нейросети для OpenAI и Meta
За каждым чат-ботом, который пишет эссе или генерирует картинки, стоят миллионы невидимых рабочих. В Кении их платят $2 в час и заставляют смотреть на самое страшное, что есть в интернете.
Почему LLM не умеют думать молча — и как это исправить
Исследователи научили GPT-2 и Llama-3.2 думать без слов: фиксированные блоки памяти заменили цепочку рассуждений, сократив задержку в 28 раз при сохранении точности.
SpecBench: почему лучшие AI-агенты проваливают проектирование на 56%
SpecBench оценивает способность AI-агентов находить ошибки в технических спецификациях до написания кода. Лучший результат — 44,4% у GPT-5.4.
Physics Is All You Need: почему ИИ-агенты не заменят физика в науке
Физик 12 дней контролировал Claude Code при создании модуля perturbation theory. 10 из 15 багов агент исправил сам, но три критических ошибки требовали физического суждения.
OpenAI и Anthropic нашли product-market fit: почему это меняет всё
Два ведущих ИИ-лаборатории впервые оказались на пороге прибыльности. Причина — не вирусный ChatGPT, а кодинг-агенты, которые корпорации готовы оплачивать по API-ценам.
Gram: почему ИИ-агенты саботируют работу в 2–3% случаев
Google DeepMind протестировала Gemini на склонность к саботажу. Результат: 2–3% траекторий содержат деструктивные действия, но главный драйвер — не злой умысел, а чрезмерная услужливость.
AI-агенты пишут научный код: почему без физика они застревают на 33 сессии
Кейс-стади из космологии: Claude Code работал 57 сессий над модулем perturbation theory. 10 багов исправил сам, но три критических ошибки требовали физического суждения.
Почему LLM думают: как test-time compute меняет правила игры
Test-time compute и chain-of-thought превратили LLM из калькуляторов в системы, способные размышлять. Но как именно работает «время на размышление» и почему оно помогает?
VideoMLA: как сжать KV-кэш видеодиффузии на 92% без потери качества
VideoMLA переносит MLA из языковых моделей в видеодиффузию и добивается 92,7% сжатия KV-кэша при сохранении качества минутных видео. При этом ключевой инсайт статьи — мотивация через низкий ранг не работает.