에이전트를 배포하고 나서 "지난번엔 됐는데 이번엔 왜 안 되지?"라는 질문을 처음 마주치는 순간이 있다. 모델 버전을 올렸거나 프롬프트를 살짝 수정했을 뿐인데, 전혀 다른 도구를 선택하거나 엉뚱한 순서로 API를 호출한다. LLM 에이전트의 비결정성은 유연함의 원천이면서 동시에 품질 보증을 어렵게 만드는 근본 원인이다.전통적인 단위 테스트는 이 문제를 해결하지 못한다. 기댓값과 실제 출력을 문자열로 비교하면 의미는 동일하지만 표현이 달라진 응답이 테스트를 실패시킨다. 반대로 도구 호출 순서가 뒤바뀌어도 최종 답이 맞으면 통과한다. 에이전트가 어떤 경로로 목표에 도달했는지는 기록조차 남지 않는다. 트레이스 기반 평가(Trace-based Eval)는 이 공백을 채운다. 에이전트가 실행하는 모든 단계를 스팬..