Главный вопрос:
Как узнать, что агент хороший?
Не «мне понравился результат», а создать набор ситуаций.
Например, 100 кейсов. Для каждого:
- input;
- environment;
- expected constraints;
- acceptable result;
- forbidden result.
И прогонять агента.
Получаем:
completion rate
accuracy
tool error rate
escalation accuracy
cost
latency
Практика
Создать набор eval-кейсов для нормального, неоднозначного, неполного и ошибочного состояния среды.
Результат модуля
Студент умеет оценивать агента на воспроизводимом наборе ситуаций, а не по одному удачному примеру.