Блог об AI
Заметки о нейросетях, промпт-инжиниринге и том, как искусственный интеллект меняет всё вокруг.
Последние записи
Почему семантический поиск провалит сложную задачу: RA-RFT учит LLM рассуждать по аналогии
Новый фреймворк RA-RFT заменяет семантический поиск на золотую релевантность: ретривер учится ранжировать примеры по пользе для рассуждения, а не по близости слов.
EvoArena и EvoMem: почему LLM-агенты ломаются в меняющемся мире
EvoArena — первый бенчмарк для оценки LLM-агентов в средах, которые постоянно меняются. Базовые агенты показывают 43% точности на терминальных задачах, 29% на эволюции кода и 46% на смещении предпочтений.
EurekAgent: почему инженерия среды важнее самого агента
EurekAgent достигает state-of-the-art в математике, GPU-оптимизации и ML-инжиниринге с open-source LLM GLM-5.1 и средним API-cost $17 — без дообучения модели. Секрет не в промптах, а в инженерии среды.
Как сжимать диалоги без потери смысла: C-DIC и будущее долгих разговоров с ИИ
Новый метод C-DIC решает ключевую проблему многоходовых диалогов: растущие затраты на внимание и утрата контекста. Вместо перекодировки всей истории он хранит сжатые «нити» разговора и обновляет их по мере необходимости.
Nonslop: почему люди отказываются от ИИ-подсказок, даже когда они удобны
Эксперимент Nonslop показал: 73,8% текстов написаны без единой ИИ-подсказки. Люди отказываются от автодополнения не из-за качества модели, а из-за типа задачи.
Аудит невидимых зависимостей LLM: как ModSleuth раскрывает рекурсивную родословную ИИ
Современные LLM строятся не на человеческих данных, а на продуктах других моделей. ModSleuth восстановил 2526 артефактов и 9112 зависимостей — и 75–82% из них приходятся на внешние организации.
Пять плоскостей контроля: как управлять ИИ-агентами в production
Представлена референсная архитектура runtime governance для production ИИ-агентов: пять плоскостей, семь точек медиации, шесть примитивов прерывания и микросекундная скорость adjudication.
Bebop: как обойти энтропийный предел и ускорить RL-обучение LLM в 1.8 раза
Новый метод Bebop показывает, что энтропия политики — главный враг speculative decoding при RL-обучении. TV loss и rejection sampling ускоряют пайплайн до 1.8× без дорогого онлайн-обучения MTP.
AI и биобезопасность: когда модели обгоняют биологов-экспертов
Новый бенчмарк ABC-Bench показал, что Claude Opus 4.6, Gemini 3.1 Pro и GPT-5.4 превосходят медианного эксперта в задачах проектирования ДНК, управления лабораторными роботами и обхода скрининга. Впервые LLM-агент провёл реальную сборку ДНК на роботе OpenTrons.
TRACE: как распределять rollout-бюджет в агентном RL и тратить вычисления умнее
TRACE перенаправляет фиксированный rollout-бюджет к корням и префиксам, где потомки скорее всего дадут противоположные исходы, превращая разреженные outcome-награды в плотные контрастные сигналы.