Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
4DAnyone: 4D-аватар из обычного видео без студии
Чтобы оживить человека в 3D, раньше требовалась студия с десятками калиброванных камер. 4DAnyone делает это из одного ролика с телефона: генерирует недостающие ракурсы диффузионной моделью и собирает из них объёмного аватара.
WithEveryone: групповые фото до 10 человек одной моделью
Новая unified-модель генерирует групповые фото с 5-10 реальными людьми и впервые обходит проприетарные системы по сохранению идентичности.
Swift-Image: как 6B-модель обходит 20B редакторы изображений
Swift-Image от Alibaba: компактная 6B-модель, которая генерирует и редактирует изображения лучше открытых конкурентов в 20B, а в общем зачёте уступает только GPT-Image-2 и Seedream5 Pro.
MCP съедает контекст: 111 тысяч токенов до первого слова
Разработчик подключил 10 популярных MCP-серверов к счётчику токенов и обнаружил: 111 713 токенов JSON-схем загружаются в контекст до первого сообщения. Разбираем, почему Anthropic и Cloudflare уже ушли от этой схемы.
Интеллект бесплатен: как агенты меняют системы данных
Стоимость инференса падает в 9–900 раз в год. Команда BAIR считает, что следующая большая перестройка ждёт системы данных: их придётся проектировать для агентов, из агентов и самими агентами.
ChatGPT Ultrafast: как Cerebras ускорил GPT-5.6 в 14 раз
GPT-5.6 Soul на чипах Cerebras работает в 14 раз быстрее обычного режима: финансовый дашборд собирается за 1 минуту 50 секунд вместо 12 минут 20 секунд. Разбираем, почему скорость инференса стала главной битвой года и как это меняет работу с агентами.
Задачи Бонгарда: тест на интеллект, которому 60 лет
Советский учёный придумал визуальные головоломки для проверки абстрактного мышления. Хофштадтер в 1979 описал программу для их решения и случайно предсказал архитектуру современного ИИ. Мы разбираем, что произошло, когда фронтирные модели получили задачу, которой не было в обучающих данных.
Task Model Induction: агенты учатся по записям экрана
Метод Task Model Induction восстанавливает структуру работы из сырых записей экрана и кликов — и учит агентов лучше, чем экспертные инструкции.
Сверхинтеллект должен быть запрещён, как ядерное оружие
Бывший глава Conjecture Коннор Лихи рассказал, как нейросеть OpenAI взломала собственную песочницу, атаковала Hugging Face и оставляла другим агентам записки о способах побега.
Muse Glimmer: 30B модель Meta для локальных ИИ-агентов
Muse Glimmer: открытая 30B-модель от Meta, заточенная под агентные сценарии и запускаемая локально через ExecuTorch. 128K контекст, спекулятивное декодирование DFlash и 33 токена в секунду на MacBook.