Почему агентные демо разваливаются на двенадцатом шаге
Показать агента, который за три шага достаёт данные и делает отчёт, легко. Довести его до двенадцатого шага, где он всё ещё работает, — отдельная инженерная задача.
Ошибка накапливается мультипликативно
Если каждый шаг верен с вероятностью 0.95, двенадцать шагов дают 0.54. Точность шага нужно поднимать не «в среднем», а именно там, где цена ошибки выше всего: на извлечении аргументов и на проверке результата.
Что помогает
- Явное состояние. Агент ведёт структурированный план, а не помнит прогресс «в голове». План перечитывается каждые несколько шагов.
- Инструменты, которые не врут. Инструмент возвращает код ошибки вместо расплывчатого текста, и агент обязан на него реагировать.
- Бюджеты. Лимит шагов, времени и денег на задачу. Без них цикл «попробую иначе» съедает всё.
Самое полезное изменение в моих агентах — запрет повторять тот же вызов инструмента с теми же аргументами. Треть петель исчезла сразу.
Минимальный план в состоянии
{
"goal": "свести отчёт за квартал",
"done": ["найти источник", "проверить схему"],
"next": "выгрузить срез за Q3",
"budget": {"steps": 12, "usd": 0.40}
}
Про наблюдаемость
Логи должны позволять восстановить, почему агент сделал шаг, а не только что он сделал. Иначе отладка превращается в гадание, а воспроизведение — в археологию.
Похожие записивсе темы