Градиент.

Почему агентные демо разваливаются на двенадцатом шаге

Показать агента, который за три шага достаёт данные и делает отчёт, легко. Довести его до двенадцатого шага, где он всё ещё работает, — отдельная инженерная задача.

Ошибка накапливается мультипликативно

Если каждый шаг верен с вероятностью 0.95, двенадцать шагов дают 0.54. Точность шага нужно поднимать не «в среднем», а именно там, где цена ошибки выше всего: на извлечении аргументов и на проверке результата.

Что помогает

  • Явное состояние. Агент ведёт структурированный план, а не помнит прогресс «в голове». План перечитывается каждые несколько шагов.
  • Инструменты, которые не врут. Инструмент возвращает код ошибки вместо расплывчатого текста, и агент обязан на него реагировать.
  • Бюджеты. Лимит шагов, времени и денег на задачу. Без них цикл «попробую иначе» съедает всё.
Самое полезное изменение в моих агентах — запрет повторять тот же вызов инструмента с теми же аргументами. Треть петель исчезла сразу.

Минимальный план в состоянии

{
  "goal": "свести отчёт за квартал",
  "done": ["найти источник", "проверить схему"],
  "next": "выгрузить срез за Q3",
  "budget": {"steps": 12, "usd": 0.40}
}

Про наблюдаемость

Логи должны позволять восстановить, почему агент сделал шаг, а не только что он сделал. Иначе отладка превращается в гадание, а воспроизведение — в археологию.

Кирилл Астахов

ML-инженер, собираю и гоняю модели в проде. Пишу о том, что проверил руками: инференс, обучение, оценка качества. Замечания и вопросы — на hello@p.my01.ru.