다중 회화 에이전트 평가 메트릭: AEM 소개
도입부:
다중 회화 에이전트는 몇 번의 대화에 걸쳐 질문을 해결해야 하는 복잡한 시나리오에서 실력을 발휘합니다. 그러나, 이러한 에이전트를 평가하는 것은 전체 결과만을 확인하는 기존 방식으로는 충분하지 않습니다. 에이전트 평가 메트릭(AEM)은 대화의 각 턴(turn)에서 정확성을 측정하여 문제를 더 세밀하게 파악할 수 있습니다.
본문:
AEM은 특정 대화의 정확성을 분해 가능한 방식으로 평가합니다. 예를 들어, 다섯 번의 턴에 걸쳐 이루어진 대화에서 초기 턴 2에서 나타난 작은 오류가 이후 턴 전반에 어떻게 영향을 미치는지를 추적할 수 있습니다. 이를 통해 각 턴을 독립적으로 평가하면서도 전체적인 품질 향상을 도모할 수 있습니다. 하나의 초기 오류가 이후의 모든 실패 원인이 될 수 있기 때문입니다.

위의 그림은 기초적인 오류가 이후 여러 턴에 영향을 미침을 보여줍니다. 이와 같은 구조에서 턴별 평가를 통한 오류 격리가 가능합니다. AEM은 이러한 점에서 오류의 구체적인 원인이 어떤 턴에서 발생했는지를 정확히 파악할 수 있도록 도와줍니다.

이러한 분해-평가-통합 패턴은 단일의 모호한 점수가 아닌, 독립적으로 측정 가능한 합성 지표로 결과를 제공합니다. 이를 통해 새로운 차원(안전성 등)을 방향성에 맞게 추가 확장할 수 있습니다.
결론:
AEM은 다중 턴 대화에서 정확성을 세부적으로 분석하는 새로운 기준을 제시합니다. 이는 결과의 전체 실패가 아닌 특정 턴의 문제를 해결함으로써 품질을 향상시킬 수 있는 기반을 제공합니다. 다음 포스트에서는 이와 같은 방식으로 안전성을 평가하는 방법을 다루겠습니다.
[1] https://aws.amazon.com/blogs/machine-learning/agent-evaluation-metric-for-multi-turn-conversations/
AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!
(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기
