Lex Humanitas показывает, где форма скрывает власть и подменяет смысл.

Модуль 16. Evals

Главный вопрос:

Как узнать, что агент хороший?

Не «мне понравился результат», а создать набор ситуаций.

Например, 100 кейсов. Для каждого:

  • input;
  • environment;
  • expected constraints;
  • acceptable result;
  • forbidden result.

И прогонять агента.

Получаем:

completion rate
accuracy
tool error rate
escalation accuracy
cost
latency

Практика

Создать набор eval-кейсов для нормального, неоднозначного, неполного и ошибочного состояния среды.

Результат модуля

Студент умеет оценивать агента на воспроизводимом наборе ситуаций, а не по одному удачному примеру.

Прокрутить вверх