Эксперимент: память агента улучшает успех на 22%. Узнайте, как RE-call превзошёл статичный CLAUDE.md в реальных задачах. Читайте!
В прошлом эксперименте мы проверили, может ли слой памяти остановить Claude Code от уверенного повторения ошибок проекта. Ответ был «да». Но была очевидная слабость: задачи измеряли правильность ответа, а не реальную работу с репозиторием. В этот раз мы сделали сложнее: агент должен был модифицировать код, запускать его и проходить детерминированный тест. Никаких судей-моделей, только факт: задача выполнена или провалена. Результат удивил: память улучшила успех на 22.2 процентных пункта по сравнению со статичным CLAUDE.md. Читайте, как мы это проверили и что это значит для ваших проектов.
Каждая задача требовала от Claude Code создания или изменения файлов в репозитории и запуска результата. В бенчмарк вошли задачи на детерминированную сортировку файлов, нормализацию Unicode, именование миграций, экранирование shell-команд, округление денег, стабильную сортировку, обработку переносов строк и генерацию файлов с golden-выводами. Ключевая деталь: у каждой задачи был детерминированный проверяющий — агент мог говорить «готово», но проверяющий смотрел только на итоговое состояние репозитория.
Мы прогнали каждую задачу через три конфигурации: чистый Claude Code, Claude Code с CLAUDE.md проекта, и ту же среду с памятью RE-call. Харнесс также проверял, что инструменты памяти реально доступны, прежде чем засчитывать сессию. Если слой памяти отсутствовал, вся парная ячейка отбрасывалась. В прогоне DeepSeek таких случаев было ноль.
Самое полезное сравнение — RE-call против статичного файла CLAUDE.md. Статичный файл дал 36.1% успеха, RE-call — 58.3%. Это улучшение на 22.2 пункта. Парные результаты ещё нагляднее: RE-call выиграл 17 сравнений, которые CLAUDE.md проиграл, а CLAUDE.md выиграл лишь одно. Эффект был сильнее всего на задачах, чувствительных к памяти: там RE-call улучшил успех на 45.8 процентных пунктов.
Это тот паттерн, который мы искали. Память не облегчила каждую задачу — она помогла, когда задача зависела от решения проекта, конвенции или известного сбоя, которых не было в непосредственном промпте.
Статичный CLAUDE.md показал себя хуже чистой конфигурации: 36.1% против 50.0%. Чистая конфигурация выиграла на 13.9 пунктов. Это не то, что мы ожидали. Похоже, статичный файл с инструкциями — это не автоматически система памяти. Он может добавить полезные указания, но также добавляет шум, ограничения или инструкции, которые конкурируют с задачей. RE-call работает иначе: вместо того чтобы помещать все исторические факты в постоянный промпт, он даёт агенту способ извлекать релевантную историю проекта, когда это нужно текущей задаче. Это различие важно.
Бенчмарк также измерял, что происходит внутри механизма памяти. В прогоне DeepSeek агент искал в памяти в 83.3% подходящих сессий. Когда он искал, он достигал полезного контекста в 85.0% случаев. В целом полезный контекст был достигнут в 70.8% сессий. Так что результат не в том, что «у модели было больше токенов». Слой памяти реально использовался, и в большинстве случаев он находил что-то полезное. Есть куда улучшать поиск: поиск не всегда хорош сам по себе — модели нужно найти правильное историческое решение, а не просто что-то похожее на слова из промпта.
Полный прогон DeepSeek стоил примерно $0.4964 по зафиксированным ценам API. Три ветки: чистая — $0.0824, CLAUDE.md — $0.0863, RE-call — $0.3277. RE-call использовал примерно в четыре раза больше токенов, чем статичная конфигурация. Это компромисс: слой памяти стоит дороже на каждой задаче, включая те, где память не нужна. Взамен он предотвращает гораздо более дорогой сбой, когда агент уверенно следует устаревшей конвенции, повторяет известную ошибку или тратит минуты на отладку проблемы, которую команда уже решила. Следующий инженерный вопрос — не помогает ли память, а как сделать поиск компактнее, быстрее и избирательнее.
Мы также начали тот же прогон с GPT-5.3 Codex. Этот прогон не является негативным результатом для GPT: провайдер упёрся в кредитный лимит и лимит запросов в полёте, пока шёл бенчмарк. Харнесс корректно отбросил затронутые парные ячейки, а не считал пропущенные сессии провалом модели. Только 40 из 72 парных ячеек были допустимыми, поэтому мы не используем этот прогон для утверждений о том, лучше или хуже GPT-5.3 Codex. Описательные цифры указывали в ту же сторону: чистая — 47.5%, CLAUDE.md — 30.0%, RE-call — 50.0%. Но прогон нужно повторить, устранив проблему с мощностью провайдера, прежде чем он станет валидным сравнением. Это операционный сбой, а не вывод о модели.
Этот эксперимент не показывает, что память делает агента в целом умнее. Он показывает нечто более узкое и полезное: производственный слой памяти может повысить вероятность того, что агент корректно выполнит реальную задачу в репозитории. В этом прогоне RE-call улучшил успех на 22.2 процентных пункта по сравнению со статичным файлом проекта. Он также улучшил успех по сравнению с чистой конфигурацией, хотя выигрыш был меньше — 8.3 пункта. Это различие важно: главная ценность не в добавлении инструкций, а в извлечении правильного контекста проекта, когда это важно. Первый эксперимент показал, что память делает ответы более правильными. Этот эксперимент показал, что улучшение выживает при контакте с репозиторием. Это тот результат, которого мы ждали.
Следующий шаг — чистое сравнение конкурентов: перезапустить GPT-5.3 Codex с достаточной мощностью провайдера, сравнить RE-call с другими системами памяти, сохранить те же задачи, сиды, проверяющие и шлюз допуска, публиковать отброшенные ячейки и операционные сбои вместе с баллами. Цель — не очередная лестная демонстрация, а выяснение, остаётся ли слой памяти полезным при смене моделей, вендоров и систем поиска. Это бенчмарк, который мы хотим запустить следующим.
Прямо сейчас попробуйте добавить слой памяти в вашего агента: начните с простого поиска по истории проекта в Postgres с pgvector. Замерьте успех на трёх реальных задачах до и после. Вы увидите разницу на задачах, где важны конвенции проекта.
Хочешь закрепить знания на практике?
Решай задачи на Algolit — интерактивная платформа для обучения
Начать бесплатно →