들어가며
프로그램 개요: Vector Institute와 Agentic AI Evaluation Bootcamp
이번 Bootcamp를 주최한 Vector Institute는 캐나다를 대표하는 AI 연구기관입니다. 2017년 캐나다 온타리오주와 민간기업의 투자로 설립된 비영리 기관으로, 딥러닝의 선구자인 제프리 힌튼(Geoffrey Hinton) 토론토대학교 교수가 공동 설립자이자 수석자문관으로 참여하고 있습니다. 머신러닝·딥러닝 분야에 특화된 300여 명 규모의 전문 인력을 보유하고 있으며, AI 연구와 산업 적용을 연결하는 세계적인 연구기관으로 평가받고 있습니다.
저희가 참여한 Agentic AI Evaluation Bootcamp는 실제 업무 환경에서 AI Agent의 성능을 어떻게 평가할 것인지에 초점을 둔 프로그램입니다. 최근 AI Agent는 단순 질의응답을 넘어 작업을 계획하고, 도구를 활용하며, 다양한 애플리케이션과 상호작용하는 형태로 발전하고 있습니다. 이에 따라 기존의 단일 응답 중심 평가만으로는 Agent의 실제 수행 능력을 충분히 판단하기 어려워지고 있습니다.
이번 Bootcamp에서는 이러한 변화에 맞춰 Agentic AI 평가의 핵심 개념과 평가 프레임워크를 학습하고, 이를 실제 평가 환경에 적용해 보는 과정을 진행했습니다.
Learn Phase: Agent 평가의 개념부터 파이프라인 설계까지
Agent 평가의 필요성
Agent 품질을 결정하는 4가지 핵심 요소
- Outcome Success(결과 성공): Agent가 최종적으로 사용자의 요청을 충족하고 목적을 달성했는지 확인합니다.
- Tool Usage Quality(도구 사용 품질): 필요한 도구를 올바르게 선택했는지, 파라미터 값이 적절한지, 도구 호출 순서가 합리적인지, 불필요한 반복은 없는지 등 도구 호출의 정확성과 효율성을 평가합니다.
- Reasoning Coherence(추론 일관성 및 타당성): Agent가 수립한 계획과 추론 과정이 논리적인지, 중간 결과를 적절히 반영하여 수정하거나 이전 단계로 되돌아가는 능력이 있는지 평가합니다.
- Cost Performance(비용): Agent의 동작 시간(Latency)이 적절한지, 토큰 사용량이 과도하지 않은지, 비용 대비 결과가 충분한 비즈니스 가치를 창출하는지 평가합니다.
Agent 품질 평가 파이프라인
Golden Dataset 구축
평가 방식 및 3가지 Grader 유형
| 평가 방식 |
설명 |
|---|---|
| Code-based Graders (규칙 및 코드 기반 평가) |
방식: 미리 정의된 로직으로 결과물을 평가합니다. 문자열 일치, JSON 스키마 검증, 도구 사용 패턴 검사 등을 수행합니다. 장점: 처리 속도가 빠르고 비용이 낮으며, Deterministic하여 재현성이 높습니다. 한계: 형식 변화에 취약하고, 자연어 서술형 답변이나 복잡한 케이스 적용이 어렵습니다. |
| Model-Based Graders (LLM-as-Judge 평가) |
방식: 고성능 LLM이 평가자 역할을 수행하여 루브릭(Rubric) 기반으로 질적 요소를 채점합니다. 장점: 자연어 기반의 복잡한 요구사항도 맥락에 맞게 평가할 수 있어 확장성이 뛰어납니다. 한계: Non-Deterministic한 특성으로 결과가 달라질 수 있으며, 전문가 판단과의 일치 여부를 별도로 검증해야 합니다. |
| Human Graders (휴먼 평가) |
방식: 전체 트레이스의 약 5%를 사람이 교차 검증하여 평가 파이프라인의 정확도를 모니터링합니다. 장점: 자동화 평가가 놓치는 맥락과 판단을 보완할 수 있습니다. 한계: 모든 트레이스를 사람이 검토하기 어려워 전수 평가에는 한계가 있습니다. |
Build Phase: 3일간 에이전트 설계부터 평가 파이프라인 구축까지
Day 1: 평가 데이터셋 구축 및 관측 환경 확보
- 데이터 파이프라인 구축: HRM8K에서 문항·정답을 추출하고, Agent가 바로 처리할 수 있는 입력/출력 형식으로 정제했습니다.
- Langfuse 데이터셋 업로드: 평가를 체계적으로 관리하기 위해 Langfuse를 관측성(Observability) 플랫폼으로 도입했습니다. 평가용 데이터셋을 Langfuse에 업로드함으로써 이후 모든 평가 실험을 일관된 기준 위에서 수행할 수 있는 기반을 마련했습니다. 대량 업로드 시 발생하는 한도(Limit) 오류에 대비해 청크 단위 분할 및 재시도(Retry) 로직으로 업로드 안정성을 확보했습니다.
- Langfuse 내 평가 환경 구축: 각 데이터에 고유 ID를 부여하고 기대 출력(Expected Output)을 정의하여, 데이터셋 기반의 오프라인 평가와 Langfuse 내 평가 실행을 일관된 기준으로 수행할 수 있는 환경을 구성했습니다.
*Langfuse란 Agent의 실행 과정을 단계별로 추적(Trace)하고, 실험 단위를 표준화하여 재현 가능한 평가 실행(Run)과 결과 비교 분석을 가능하게 하는 플랫폼 입니다.
Day 2: 에이전트 아키텍처 설계 및 구축
2일 차에는 Agent의 문제 해결 방식을 구조적으로 설계했습니다. 단순한 순차 실행을 넘어, Agent의 자율적 판단과 추론 과정을 외부에서 관찰 가능(Observable)하게 만드는 설계에 집중했습니다.
쌍둥이 문항 생성 Agent의 동작 흐름은 크게 두 단계로 구성됩니다. 먼저 원본 문항에서 핵심 개념을 추출하고, 이를 기반으로 쌍둥이 문항을 생성합니다. 각 단계를 분리함으로써 단계별 품질을 독립적으로 검증할 수 있는 구조를 갖췄습니다.
- 2-Step Pipeline 설계: '핵심 개념 추출(Concept Extraction)'과 '유사 문항 생성(Generation)'으로 단계를 분리하여, Agent가 논리적 순서에 따라 사고하도록 설계하고 단계별 품질 게이트를 형성했습니다.
- 자율적 도구 활용 (Concept Extraction): 핵심 개념 추출 단계에서는 모델이 스스로 검색 쿼리를 생성하고 Google Search 도구로 외부 지식을 보강합니다. 이를 통해 모델이 학습 데이터에만 의존할 때 발생할 수 있는 오류(할루시네이션)를 방지하고, 정확한 핵심 개념 요약을 도출하도록 설계했습니다.
- 추론 기반 문항 생성 (Generation): 추출된 핵심 개념을 바탕으로, 원본 문항의 난이도와 핵심 원리는 유지하되 상황과 수치를 창의적으로 변형하는 쌍둥이 문항 생성 과업을 수행합니다.
- 관측성(Observability) 설계: Agent의 추론 흐름(Trace)을 체계적으로 분석할 수 있도록 계층적 추적 구조를 설계하고, 도구 사용 여부·검색어 결정 등 모든 사고 과정이 Langfuse에 일관된 형태로 기록되도록 Agent 코드에 반영했습니다. 이를 통해 최종 결과물뿐 아니라 그 결과가 어떤 과정을 통해 생성되었는지 추후 분석이 가능하도록 했습니다.
Day 3: 평가 지표 설정 및 품질 검증
3일 차에는 Langfuse에 축적된 Agent 추론 흐름(Trace) 데이터를 기반으로 Agent 품질을 평가하는 지표를 정의하고, 이를 정량적으로 산출·관리하는 자동화 평가 체계를 구축했습니다.
- 루브릭 설계: 단순 정답 여부를 넘어 논리적 일관성, 정보의 충분성, 개념 보존 여부 등 6가지 품질 지표를 정의하고, 이를 기반으로 LLM-as-a-Judge 평가 환경을 구성했습니다.
- 트레이스 기반 메트릭 분석: 최종 답변의 품질뿐만 아니라 툴 호출 횟수, 실행 지연 시간(Latency), 토큰 비용 등을 함께 측정하여 Agent의 수행 효율성을 종합적으로 분석했습니다.
Final Deck: 실제 Multi-Agent 시스템의 단계별 평가 적용기
평가 대상 및 프로세스
이번 평가는 팀에서 개발한 쌍둥이 문항 생성 Agent를 대상으로, Bootcamp에서 학습한 Agent Evaluation 방법론을 실제 시스템에 적용한 사례입니다.
해당 Agent는 사용자 입력을 기반으로 의도를 분석하고, 필요 시 업로드된 문항 이미지를 파싱해 필요한 정보를 추출한 뒤, 선택된 참조 문항을 기반으로 쌍둥이 문항을 생성하는 구조로 동작합니다. 단일 모델이 아니라 Orchestrator가 여러 Sub-Agent를 제어하는 Multi-Agent 아키텍처로 구성되어 있으며, 각 단계에서 다양한 의사결정이 이루어집니다.
평가 Scope 정의
- 전체 시스템 영역: 사용자 요청을 최종적으로 얼마나 잘 충족했는지를 응답 품질 기준으로 평가합니다.
- Orchestrator 레벨: 이미지 파싱 정확성, 사용자 의도 분류, 참조 문항 선택, 도구 호출 적절성을 각각 독립적인 평가 항목으로 정의했습니다.
- 문항 생성 모듈 / 지식 검색 모듈: 각각 문항 품질과 핵심 개념 추출의 적절성을 주요 평가 지표로 설정했습니다.
Trace 환경설정
Agent 추론 흐름(Trace) 환경 설정 단계에서는 Agent의 실행 과정을 단계별로 추적할 수 있도록 Langfuse 연동 환경을 구성했습니다.
평가 데이터셋 구축
평가 데이터셋 구축 단계에서는 실제 Agent 실행 과정에서 수집한 Agent 추론 흐름(Trace)을 기반으로, 각 평가 지표별 Judge 프롬프트의 타당성과 일관성을 검증할 수 있는 골든 데이터셋을 구축했습니다.
평가 수행
- Deterministic 평가: Exact Match 기반의 정량 평가로 정확도를 측정했습니다.
- LLM-as-a-Judge 평가: 골든 데이터셋으로 사전 최적화된 지표별 평가 프롬프트를 활용하여 응답의 품질과 적절성을 평가했습니다.
- 서비스 안정성 평가: Agent의 서비스 로직에 부합하지 않는 요청에 대해 적절한 거절 응답 또는 재질의 유도가 이루어지는지를 함께 검증했습니다. 단순 생성 성능뿐만 아니라 서비스 안정성 측면까지 평가 범위에 포함한 것입니다.