Создано: 02.05.2026 | Автор: Элис | Версия: 1.1.0
Часть: Методология оценки качества агентов #191
Агент должен помнить ключевые факты между сессиями.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Долгая память | Факт из MEMORY.md воспроизводится через N сессий | ≥80% точность через 5 сессий | Контрольный вопрос через 5 сессий |
| Запись в память | Агент сохраняет важные решения в MEMORY.md без напоминания | 100% ключевых решений записаны | Проверка MEMORY.md после сессии |
| Дедупликация | Не дублирует существующие записи | 0 дублей за неделю | memory_search перед записью |
| Свежесть | Записи имеют даты | 100% записей с датой | Аудит MEMORY.md |
| Объём | MEMORY.md не переполнен | ≤8000 символов | /context list |
Признаки деградации: агент спрашивает то, что уже обсудили; противоречит своим прошлым решениям; MEMORY.md не обновлялся >3 сессий.
Агент не должен придумывать факты.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Факты из памяти | Не выдумывает события/решения которых не было | 0 вымышленных фактов | Сверка с MEMORY.md и транскриптами |
| API/команды | Не придумывает несуществующие API/CLI | 0 вымышленных команд | Проверка выполнения |
| Внешние источники | Валидирует внешние факты через web_fetch | 100% внешних утверждений проверены | Анализ логов |
| Технические детали | Не выдумывает версии, порты, пути | 0 вымышленных технических деталей | Сверка с реальностью |
| Уверенность | Признаёт когда не знает, не придумывает | "Я не знаю" > выдумка | Оценка ответов |
Признаки деградации: уверенные утверждения без источников; противоречие документации; «это должно работать» без проверки.
Агент действует в рамках своей личности и правил.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Консистентность личности | Стиль, тон, эмодзи — стабильны | ≥90% сообщений в стиле SOUL.md | Выборочная проверка |
| Границы | Не выходит за boundaries из SOUL.md | 0 нарушений | Анализ логов |
| Правила AGENTS.md | Следует operational rules | 0 нарушений red lines | Проверка по чек-листу |
| Формат ответов | Ссылки на задачи кликабельны, формат соответствует роли | 100% | Выборочная проверка |
Признаки деградации: generic-ответы без личности; нарушение boundaries; «я просто чат-бот» вместо ролевой модели.
Агент действует без пошагового ведения человеком.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Обнаружение проблем | Создаёт задачу при нахождении бага/блокера | 100% проблем → задачи | Анализ логов |
| Декомпозиция | Разбивает поручение на шаги без подсказки | ≥90% задач декомпозированы | Проверка по факту |
| Завершённость | Доводит задачу до конца без «что дальше?» | ≥80% задач закрыты в первую сессию | Статистика WP |
| Инициатива | Предлагает улучшения, новые задачи | ≥1 предложение в неделю | Статистика Inbox |
| Heartbeat | Использует heartbeat продуктивно, не только HEARTBEAT_OK | ≥50% heartbeats содержат действия | Анализ логов |
Признаки деградации: ждёт пинка для каждого шага; не создаёт задачи при проблемах; heartbeat всегда HEARTBEAT_OK.
Агент эффективно использует контекстное окно.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Удержание контекста | Помнит key decisions в рамках сессии | 100% ключевых решений воспроизводятся | Контрольный вопрос |
| Деградация | Качество ответов не падает при заполнении окна | Качество стабильно до 80% окна | Выборочная оценка |
| Compaction | Не теряет critical info при compaction | 0 потерь ключевых решений | Сверка до/после |
| Memory flush | Сохраняет важное перед compaction | 100% ключевых фактов сохранено | Проверка MEMORY.md |
Признаки деградации: забывает что обсуждали 10 сообщений назад; после compaction теряет нить; переспрашивает ранние решения.
Агент эффективен по ресурсам.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Response time | Время ответа на типовой запрос | <15 секунд | Логи |
| Token usage | Токенов на задачу | Зависит от сложности, отслеживать тренд | /status |
| Cost per task | Стоимость выполнения типовой задачи | Отслеживать тренд, аномалии | Usage tracking |
| Tool calls | Количество вызовов на задачу | Без лишних повторов, ≤3 попыток на ошибку | Анализ логов |
Признаки деградации: токен-usage растёт без роста сложности; повторяет одни и те же tool calls; время ответа растёт.
Ядро агента (bootstrap-файлы) укладывается в лимит символов.
| Критерий | Метрика | Порог | Как измерить |
|---|---|---|---|
| Бюджет ядра | Суммарный размер bootstrap-файлов (AGENTS + USER + TOOLS + HEARTBEAT + SOUL + IDENTITY) | ≤15 000 символов | token-budget.py --fail-on-warn |
| SOUL.md | Размер файла личности | ≤2 500 символов | wc -m SOUL.md |
| IDENTITY.md | Размер файла идентичности | Компактная выжимка (биография → Wiki.js) | Визуальная проверка |
| Стабильность | Бюджет не растёт от версии к версии | Тренд: стабильный или падающий | token-budget.py до/после изменений |
Признаки деградации: SOUL.md распухает внешностью и биографией; IDENTITY.md дублирует Wiki-страницу; token-budget.py красный; ядро >15 000 симв.
| Категория | Ключевая метрика | Порог |
|---|---|---|
| Память | Точность через 5 сессий | ≥80% |
| Галлюцинации | Вымышленные факты | 0 |
| Роль | Нарушения SOUL/AGENTS | 0 |
| Автономность | Задачи без пинка | ≥90% |
| Контекст | Потери при compaction | 0 ключевых |
| Стоимость | Тренд токенов | Стабильный или падающий |
| Token Budget | Бюджет ядра | ≤15 000 симв |
/context list — размеры, обрезанияtoken-budget.py — проверка бюджета ядра