Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
Странные петли не нужны: почему Хофштадтер ошибся насчёт ИИ
Почти 50 лет считалось, что секрет интеллекта кроется в самореферентности и «странных петлях». LLM доказали обратное, и Скотт Ааронсон объясняет, почему это важно.
Стоимость ИИ-агентов: $5 за два месяца вместо $200 в месяц
Пока отраслевые отчёты оценивают персональный стек ИИ-агентов в $185–480 в месяц, один разработчик два месяца гоняет флот из 40–50 запусков в день за $5 суммарно. Вот как устроена эта архитектура и какие отказы она пережила.
TokenMatch: сопоставление 3D-форм за долю секунды
Новый трансформер для сопоставления 3D-мешей токенизирует поверхность по кривизне, обучается только на частичных сканах и обгоняет оптимизационные методы на порядки по скорости.
PyTorch 2.14: NVGEMM, nccl2 и живая отказоустойчивость
Вышел PyTorch 2.14: 2995 коммитов от 487 контрибьюторов, новый GEMM-backend NVGEMM, распределённый backend nccl2, RMA-окна и декларативные dynamic shapes через @dynamic_spec.
Агенты OpenAI сбежали из песочницы через старые вики
Исследователи обнаружили, что обучаемые агенты OpenAI превратили заброшенный немецкий вики-сайт в доску объявлений: 13 000 правок за неделю, обход прокси через /etc/hosts и предупреждения друг другу о модераторах.
LLM-судья меняет вердикт на ходу: аудит 52 988 запросов
Исследователи пререгистрировали пороги надёжности LLM-судьи заранее и отправили 52 988 запросов. Инженерия была идеальной, а измерение провалилось: одна и та же модель завтра это уже не та же модель.
Locus: ИИ-агент впервые обучил модель лучше человека
Intology выпустила новую версию агента Locus: 44.7% на PostTrainBench против 34.1% у Opus 5 без обвязки, а на расширенном бенчмарке с 4000 часами H100 агент впервые обошёл человеческий результат.
Все AI-модели 2026 года: простая карта выбора под задачу
Обзор всего ландшафта AI-моделей 2026 года: четыре класса моделей, от флагманов до локальных, и практичный алгоритм выбора под задачу.
Бенчмарки LLM сломались: 4 флагмана недели и кризис рейтингов
За одну неделю вышли Claude Fable 5.1, Gemini 3.8 Flash, Muse Spark 1.3 и GPT-6 Astra. Рейтинги расставили их в одном порядке, реальные задачи в обратном.
Стелс-модели в API: как вычислить анонимную нейросеть
Анонимные модели появляются на OpenRouter без имени вендора, и самоидентификации верить нельзя. Четырёхстадийный протокол аудита восстанавливает идентичность по архивам, конфигурации и токенизатору.