1. 도입: 멀티모달 환경, 우리는 AI를 어떻게 평가해야 할까?
2. 품질 평가 방법 및 데이터 설계: 정량·정성 벤치마크
멀티모달 AI 모델이 품질의 측면에서 문제없이 동작하는지 확인하는 과정을 품질 평가라고 합니다. 쉽게 말하면, 모델에게 일종의 시험 문제를 주고, 이를 제대로 해결하는지 확인하는 과정이라고 생각하시면 됩니다. 이렇게 모델이 푼 결과를 어떻게 채점할 것인지에 따라 평가 방식이 나뉘며, 프로그램을 이용해 자동화할 수도 있고, 사람의 판단(설문조사 형식)으로 직접 평가할 수도 있습니다. 보통 프로그램 기반으로 자동화된 채점을 하는 것을 정량 평가, 사람이 수작업으로 채점하는 것을 정성 평가라고 부릅니다. 실제로 정량 평가와 정성 평가는 평가하려는 내용이 다르기 때문에, 시험 문제 역시 처음부터 독립적으로 설계하여 만들어집니다.
2.1 품질 정량 평가: 객관적 기준에 따른 자동 평가
멀티모달 AI 모델의 품질을 객관적으로 판단하기 위해, 공개 정량 벤치마크와 평가 기준을 활용하는 것이 일반적입니다. 마치 대학생이 되기 위해 한국의 고등학생들이 대학수학능력시험을 치르는 것처럼, 배포 전 멀티모달 AI 모델들은 기존 공개 벤치마크 기반 정량 평가를 거칩니다. 그러나 대부분의 공개된 정량 벤치마크들은 외국어 기반으로 구성되어 있습니다. 만일 멀티모달 AI 모델을 한국 시장에 배포하는 것이 목적이라면, 기존 공개 정량 벤치마크만으로는 B2B 현장의 품질을 보장하기 어렵습니다. 'KT 한국적 이미지 이해' 벤치마크는 이미지 기반 한국적 평가 데이터의 부재를 해결하고 한국적 맥락 이해와 지식의 깊이를 측정하기 위해 구축되었습니다. 'KT 테이블·차트 이해' 벤치마크는 한글 기반의 복잡한 서식 이해 능력을 평가하기 위해 구축된 벤치마크입니다. 이렇게 자체 구축된 벤치마크들과 기존 정량 평가 벤치마크들을 포함하여 함께 정량 평가를 진행했습니다.
2.2 품질 정성 평가: 실제 사용 환경을 반영한 시나리오 설계
멀티모달 AI 모델에 대한 정성 평가는 정량 평가로 잡아낼 수 없는 사람이 느끼는 미묘한 품질을 평가하기 위한 수단입니다. 예를 들어 수험생이 대학생이 되기 위해 수능 시험을 보았더라도 추가적인 학생의 역량을 증명하기 위해 논술이나 면접을 보는 것을 생각하시면 됩니다. 품질 정성 평가는 정량 점수 이면의 미세한 결함을 진단하기 위해, 이미지와 관련된 시각 지능(VLM) 영역과 음성과 관련된 음성 지능(SLM) 영역에 대해 자체적으로 구축된 총 2,500문항 규모의 정성 평가 데이터를 기반으로 평가됩니다. 이때 사용되는 정성 평가 문제들은 단순한 참·거짓 여부를 넘어, 멀티모달 AI 모델이 다양한 상황에서도 안정적으로 작동하는지 확인할 수 있도록, 실제 사용 환경을 반영하여 구성됩니다.
- VLM 영역 (1,500문항): 문서 이해, 문제 풀이, 한국 특화, 상황 이해, VLM Grounding으로 평가 영역을 구성했습니다. 문서 영역의 경우 통제된 디지털 문서만으로는 실제로 멀티모달 AI 모델이 사용되는 상황을 반영할 수 없기에, ‘물리적으로 훼손된 영수증', ‘손글씨’ 등의 실생활 데이터를 포함하고, 다른 영역에서도 '조명이 고르지 않은 이미지’, '저해상도 이미지' 등의 다양한 조건이 데이터셋에 포함되도록 했습니다.
- SLM 영역 (1,000문항): 실제 B2B 환경에서 발생하는 다양한 요구 사항을 반영하기 위해, 음성 번역과 음성 합성으로 나누어 평가 데이터셋을 구성했습니다.
- 음성 번역 (500문항): B2B 현장에서 빈번하게 발생하는 구어체 발화를 반영하여, 다양한 연령대와 성별의 화자를 포함한 한국어-영어 양방향 번역 데이터로 구성했습니다.
- 음성 합성 (500문항): 기쁨, 슬픔, 분노 등 총 10개의 감정 스타일이 명확히 반영되도록 시나리오를 구성하고, 장문(Long) 발화 능력을 검증할 수 있는 데이터셋을 구축했습니다.
2.3 정량·정성 평가의 신뢰성 확보
정량 평가 신뢰성 검증: 통계적 유의성 분석 기반 평가
정량 평가 수행 후, 멀티모달 AI 모델의 품질은 우열을 판단하기 위해서 수치로 채점됩니다. 예를 들어 한 평가 분야의 어떤 지표에 대해서 A 모델은 90점, B 모델은 85점을 얻었다고 가정해 봅시다. 이때, A 모델이 B 모델보다 품질이 높다고 할 수 있을까요? 아니면 두 모델 간 품질 차이는 큰 의미가 없으며 두 모델의 품질은 동등한 수준으로 봐야 할까요? 이러한 서로 다른 멀티모달 AI 모델들이 가지는 정량 지표 수치의 신뢰성을 평가하기 위한 방법으로 가장 많이 사용되는 방식이 통계적 유의성 평가입니다. 이 방법은 눈에 보이는 점수 차이가 평가 데이터의 우연한 조합으로 발생한 단순 오차인지, 아니면 다른 상황에서도 일관되게 나타날 진짜 실력 차이인지를 통계적으로 검증하여, 모델의 실제 우위를 판단하는 과정이라 할 수 있습니다.
정성 평가 신뢰성 검증: 평가자 간 일치도 기반 평가
정성 평가는 정량 평가와 달리 평가자의 해석과 판단이 개입되는 특성을 가지기 때문에, 동일 결과에 대해서도 평가자 간 점수 차이가 발생할 수 있습니다. 단순히 평균 점수를 산출하는 것만으로는 해당 결과가 일관된 기준에 기반한 것인지 판단하기 어렵기 때문에, 일관성을 검증하는 과정이 필요합니다. 이러한 정성 평가의 신뢰성을 확보하기 위해, 우리는 다수 평가자 기반의 교차 평가 방식을 적용했습니다. 총 26명의 전문 평가단(VLM 9명, 음성 번역 3명, 음성 합성 14명)을 구성하여 각 문항을 복수의 평가자가 독립적으로 평가하고 그 결과를 종합하는 방식으로 운영했습니다.
초기 평가 단계에서는 오류 사례 해석이나 세부 채점 기준에 대해 평가자 간 일부 시각 차이가 나타났습니다. 이를 해소하기 위해 평가 설계 의도와 항목별 판단 기준을 공유하는 일치 세션(Alignment Session)을 운영하여 평가 기준을 정렬하고, 동일한 기준에 기반한 평가가 이루어질 수 있도록 보완했습니다.
또한 평가 전반에 걸쳐 평가자 간 일치도를 정량적으로 확인하기 위해 Fleiss’ Kappa 지수를 활용했습니다. Fleiss’ Kappa는 다수 평가자 간 평가의 합의 수준을 측정하는 지표로, 높을수록 평가자들이 동일 문항에 대해 유사한 판단을 내렸음을 의미합니다. 일반적으로 0.2 이상일 경우 ‘Fair agreement(기본 수준의 합의)’로 해석됩니다.
본 평가에서는 해당 기준을 만족하는 수준의 평가자 간 일치도를 확보했으며, 이를 통해 정성 평가 결과를 신뢰 가능한 정량 지표로 활용할 수 있는 기반을 마련했습니다.
2.4 종합 분석 및 배포 판정
앞서 진행한 모든 시험(정량 평가, 정성 평가) 결과와 신뢰성 검증 지표를 한데 모아, 멀티모달 AI 모델의 최종 출시 여부를 결정하는 단계입니다. 대학 입학을 앞둔 수험생에 비유하자면 수능 성적(정량)과 논술·면접 결과(정성)를 모두 종합하여 최종 합격 여부를 판정하는 것과 같습니다. 정량·정성 평가의 결과에 치명적인 오류가 없고 품질 평가 기준에서도 비교 대상 모델 대비 동등 이상의 수준일 때 최종적으로 배포 판정을 받게 됩니다.
3. 평가 체계 적용 결과: 주목해야 할 4가지 품질 특징
이번 품질 평가를 통해 멀티모달 AI 모델들이 실제 서비스 환경에서 어떤 행동 특성을 보이는지 다각도로 확인했습니다. 3절에서는 전체 평가 결과 중 본 글에서 특별히 소개해 드리고 싶은 4가지 핵심 유형과 특징을 요약하여 소개합니다. 각 유형에 대한 구체적인 실제 사례와 데이터는 이어지는 4절에서 상세히 다룹니다.
3.1 SLM 음성 번역: 단순 받아쓰기를 넘어선 '지시 이행' 평가
음성 번역 평가는 단순한 번역 정확도를 넘어, 입력 음성을 제대로 이해하고 주어진 지시(번역)를 수행 하는지를 함께 확인했습니다.
한국어와 영어 음성 데이터를 기반으로 양방향 번역을 평가한 결과, 일부 문항에서 번역 대신 원문을 그대로 출력하는 사례가 관찰되었습니다. 이는 음성을 정확히 듣는 것과 실제로 번역을 수행하는 것이 서로 다른 문제임을 보여줍니다. 이러한 결과는 음성 번역 모델의 품질을 평가할 때, 번역 정확도뿐 아니라 음성 이해 능력과 지시 이행 여부를 함께 검증할 필요가 있음을 보여줍니다.
3.2 SLM 음성 합성: 감정 표현 및 발화 품질의 일관성
음성 합성(TTS) 평가는 다양한 실제 서비스 환경에서도 일관된 품질을 제공할 수 있는지를 검증하는 방향으로 평가했습니다.
기쁨, 슬픔, 분노 등 감정을 담아 말해야 하는 상황이나 긴 문장을 연속적으로 말해야 하는 환경에서 목소리 변화와 음질의 안전성을 중심으로 평가를 진행했습니다. 또한 평가자 성별과 연령대에 따른 점수 분포를 함께 분석하여 특정 사용자군에 치우치지 않고 균형 잡힌 품질을 제공하는지도 점검했습니다. 평가 결과, 단순 점수만으로는 확인하기 어려운 감정 표현의 차이와, 장문 발화 과정에서 일부 내용이 변경되거나 누락되는 문제와 같은 한계를 함께 확인할 수 있었습니다.
3.3 VLM (비전-언어): 인식과 추론 능력의 구분
VLM(비전-언어) 모델의 품질 평가는 단순히 이미지 내 객체나 텍스트를 정확하게 인식하는 수준을 넘어, 해당 정보를 기반으로 맥락을 이해하고 적절한 추론을 수행하는지를 함께 확인하는 방식으로 진행했습니다.
이러한 특성을 반영하여, 이미지를 제대로 보는 인식과 이를 바탕으로 이해하고 판단하는 추론 영역으로 평가를 구분했습니다. 평가 결과, 동일 수준의 품질로 보이더라도 실패 원인이 서로 다르게 나타났습니다. 어떤 경우에는 이미지 내 정보를 제대로 읽지 못해 틀렸고, 또 다른 경우에는 정보를 정확히 읽었음에도 이를 잘못 해석하면서 오답으로 이어졌습니다. 또한 그림자나 빛 번짐, 저해상도와 같은 품질이 좋지 않은 이미지의 경우에는 시각적인 정보를 읽는 능력이 저하되면서 결과에도 영향을 주는 사례가 확인되었습니다.
이러한 결과는 VLM 품질을 평가할 때 단순히 정답을 맞혔는지 여부만 보기보다는, 이미지를 제대로 인식했는지 그리고 이를 어떻게 해석했는지를 나누어 확인할 필요가 있음을 보여줍니다.
3.4 OMNI (삼중 모달): 다중 모달 통합 추론의 기술적 특성
시각·음성·발화 정보가 결합된 OMNI 환경에서의 멀티모달 AI 모델을 평가한 결과, 개별 정보에 대한 인식이나 단순한 상황 이해는 일정 수준에서 안정적인 성능을 보였습니다. 다만 여러 정보가 동시에 제공되는 상황에서는, 사건의 의도나 인과관계를 파악하는 과정에서 맥락이 끊기거나 추론이 흔들리는 사례가 관찰되었습니다.
특히 서로 다른 모달리티 정보가 함께 제시될 때, 어떤 정보를 더 중요하게 반영해야 하는지를 판단하지 못해 전체적인 판단이 어긋나는 경우가 나타났습니다. 이러한 결과는 OMNI 환경에서의 성능을 평가할 때, 단순한 개별 인식 능력뿐 아니라 여러 정보를 통합해 일관된 추론을 수행하는 능력까지 함께 확인할 필요가 있음을 보여줍니다.
4. 상세 사례 분석: 4가지 품질 특징의 실제 예시
앞서 3절에서 요약한 4가지 품질 특징이 실제 평가 과정에서 어떻게 나타났는지 구체적인 사례를 통해 살펴보겠습니다. 특정 모델의 우열을 가리기보다, 실제 비즈니스 환경에 멀티모달 AI 모델을 적용할 때 어떤 점을 고려하고 보완해야 하는지 시사점을 얻기 위한 분석 예시입니다.
4.1 SLM 음성 번역: 지시 이행 실패 사례
일부 사례에서 영어 음성을 한국어로 번역하라는 요청이 주어졌음에도, 원문 음성을 그대로 텍스트로 출력하는 오류가 관찰되었습니다. 이러한 오류는 단순 정답률과 같은 정량 지표로는 확인하기 어려운 유형입니다. 휴먼 기반 평가를 통해 모델이 요청을 제대로 이해하고, 요구된 작업을 정확하게 수행하는지, 즉 요청을 정확히 이행하는지 여부를 확인할 필요가 있음을 보여줍니다.
4.2 SLM 음성 합성: 스크립트 변형 및 축약 사례
평가 결과 일부 문항에서 전달해야 할 스크립트와 다르게, 문장이 축약되거나 표현이 임의로 변형되는 현상이 관찰되었습니다. 이러한 유형은 단순한 발화 자연스러움 문제가 아니라, 정보 전달 과정에서 의미가 달라지거나 누락될 수 있는 오류로 이어져 서비스 품질 안정성에 영향을 줄 수 있습니다. 이러한 사례는 음성 합성 모델의 품질을 평가할 때, 자연스러운 발화뿐 아니라 전달해야 할 내용을 얼마나 정확하게 유지하는지도 함께 확인할 필요가 있음을 보여줍니다.
4.3 VLM (비전-언어): 인식과 추론 간 불일치 사례
평가 과정에서 이미지 인식과 추론 결과를 나누어 확인한 결과, 동일한 이미지에 대해서도 두 단계 간 결과가 일관되지 않게 나타나는 사례가 관찰되었습니다.
이를 보다 정확히 확인하기 위해, 동일한 이미지에 대해 다른 문항을 구성했습니다:
- (인식) 이미지 속 글자나 객체 등 시각 정보를 읽는 문항
- (추론) 장면의 의미나 요소 간 관계를 해석하는 문항
그 결과, 이미지 내 객체나 텍스트 등은 비교적 정확히 인식했음에도, 이를 바탕으로 한 장면 해석에서 오답이 발생한 사례가 나타났습니다. 반대로 필요한 정보를 충분히 읽어내지 못했음에도 도메인 지식을 활용하여 추론을 맞힌 경우도 확인되었습니다.
이러한 사례는 단순히 정답률만으로는 VLM의 오류가 '인식' 단계에서 발생했는지, '추론' 단계에서 발생했는지 구분하기 어렵다는 한계를 보여줍니다. 반면 두 단계를 분리하여 평가하면 오류의 근본적인 원인을 훨씬 명확하게 파악할 수 있습니다.
4.3.1 이미지 품질에 따른 인식 성능
평가 과정에서 이미지의 품질에 따른 인식 성능 차이도 함께 확인되었습니다. 그림자나 빛 번짐, 작은 글씨 등 시각 정보가 명확하지 않은 경우에는, 텍스트나 객체를 정확히 읽지 못하는 사례가 관찰되었습니다. 일부만 부분적으로 인식되거나 잘못 해석되면서, 이후 추론 결과에까지 영향을 받는 패턴이 나타났습니다. 이러한 사례는 이미지 품질이 모델의 인식 정확도에 직접적인 영향을 줄 수 있으며, 그 영향이 이후 추론 단계까지 이어질 수 있음을 보여줍니다.
|
|
4.4 OMNI (삼중 모달): 부분 정보에 의존한 추론 오류 사례
멀티모달 환경에서는 여러 정보를 함께 고려해 판단하는 능력이 중요합니다. 평가 과정에서 일부 모델이 여러 단서를 종합하지 못하고 특정 정보에만 의존해 잘못된 결론을 내리는 사례가 관찰되었습니다. 예를 들어, 시각적으로 강하게 드러나는 요소나 발화 중 일부 단서에만 주목하고, 다른 정보를 충분히 반영하지 못해 전체 맥락과 다른 판단을 내리는 경우가 나타났습니다.
이러한 사례는 모델이 개별 정보를 인식하는 능력과는 별개로, 여러 정보를 함께 고려해 일관된 판단을 수행하는 과정에서 일부 단서에 치우친 오류가 발생할 수 있음을 보여줍니다.
예를 들어, 아래 사례 이미지에서는 인물이 밤하늘을 가리키고, 음성에서는 한 화자가 “그 사람임에 틀림없어!”라고 말한 후, 다른 화자가 “그건 단순한 천체의 빛일 뿐”이라고 상황을 설명합니다. 이 경우 전체 맥락을 이해하려면 두 번째 화자의 설명을 반영해, 해당 상황을 그림의 인물이 손가락으로 가리키는 별에 관한 것으로 판단해야 합니다. 그러나 일부 모델은 이 음성 정보를 충분히 반영하지 못하고, 시각적으로 강조된 행동과 일부 발화에만 기반해 인물(손가락의 주체) 자체에 집중하는 패턴을 보였습니다.
따라서 OMNI 환경에서의 멀티모달 AI 모델의 품질을 평가할 때는 개별 정보 인식뿐 아니라, 여러 정보를 종합해 일관된 추론을 수행하는 능력까지 함께 확인할 필요가 있습니다.
4.5 사례 분석을 통해 확인된 멀티모달 품질 검증의 특성
이번 평가에서 확인된 사례들은, 단순한 정답률 중심의 평가만으로는 실제 환경에서 발생하는 문제를 충분히 파악하기 어렵다는 점을 보여줍니다. 실제 서비스 환경에서는 동일한 유형의 문제라도 입력 조건에 따라 결과가 달라지며, 단순히 오답 여부만으로는 오류의 원인을 설명하기 어렵습니다.
이에 이번 평가에서 정량 지표뿐 아니라 정성 평가 로그, 오답 사례 분석과 맥락 기반 해석을 함께 수행하여 모델의 동작 특성을 보다 구체적으로 파악했습니다. 특히 각 오류에 대해 어떤 상황에서, 어떤 정보가 제대로 반영되지 않았는지를 중심으로 분석함으로써, 단순 점수 이상의 의미 있는 결과를 도출할 수 있었습니다.
이러한 접근은 모델 간 품질 비교를 위한 것이 아니라, 실제 B2B 환경에서 모델을 적용할 때 필요한 활용 가능성 판단 기준을 마련하는 데 목적이 있습니다. 결국 중요한 것은 모델의 순위가 아니라, 서비스 맥락에 따라 적용 가능 여부를 판단하고, 보완이 필요한 영역을 구체적으로 식별하는 것입니다.
5. 결론: B2B 서비스 적용을 위한 품질 평가 체계 고도화 방향
이번 품질 평가의 의의는 단순히 품질이 높은 모델을 선정하는 데 그치지 않고, 실제 비즈니스 환경에서 발생할 수 있는 오작동과 위험 요소를 사전에 확인할 수 있는 실질적인 평가 기준을 마련했다는 점에 있습니다.
텍스트, 음성, 이미지가 복합적으로 작용하는 환경에서는 벤치마크 총점과 같은 단순 점수만으로는 모델의 품질을 충분히 설명하기 어렵습니다. 따라서 단순 품질 비교를 넘어, 결함의 원인을 추적하고 상황별 위험 요소를 판단할 수 있는 기준이 필요합니다. 평가 기준이 실제 환경에 맞게 지속적으로 정교해질수록, 서비스 도입 과정에서 발생할 수 있는 문제를 사전에 예방하고 보다 근거 있는 의사 결정을 내릴 수 있습니다.
이를 위해 우리는 향후 다음과 같은 방향으로 평가 체계를 고도화할 계획입니다.
향후 평가 고도화 방향
- 이미지 및 문서 이해 영역: 실제 사업 환경에서 발생하는 다양한 형태의 복잡한 데이터를 반영하고, 단순 인식과 맥락 기반 이해 및 추론 능력을 명확히 구분하여 평가
- 음성 영역: 사투리·구어체·고난도 번역 시나리오 등 다양한 형태 데이터 확대
- 지시 이행: 음성 기반 지시 이행 평가(Speech IFEval 등) 도입을 통해 실제 환경에서의 수행 능력 검증 강화
- 평가 체계 고도화 : 정량·정성 평가를 결합한 기존 체계를 확장하고, 자동 평가(LLM Judge)를 활용한 평가 효율성 및 확장성 확보
맺음말
본 글은 멀티모달 AI의 품질을 어떤 평가 체계로, 어떤 기준으로 검증하는지에 대한 우리의 설계·운영 경험을 정리한 것입니다. 향후 평가 체계 설계와 운영에 참고가 되기를 바라며 긴 글 끝까지 읽어주셔서 감사합니다.