Tech Dive

이제 다국적 고객과 대화합니다: 다국어 음성인식기 기술 동향

안녕하세요. KT 기술혁신부문에서 AX서비스플랫폼 개발을 담당하고 있는 윤제열입니다.

제가 속해 있는 팀은 AICC 및 AI 응용 비지니스를 위해 STT(Speech-To-Text), TTS(Text-To-Speech), SV(Speaker Verification), SD(Speaker Diarization) 엔진을 발굴하고 검토하여 패키징 후 최상의 품질을 제공하는 업무를 수행하고 있습니다. 또한, 운영 효율화를 위한 AMP(AICC Management Portal), Connect HUB 기술을 개발하여 사업에 적용하고 있습니다. 여기에서는 다국어 음성 인식 기술 동향과 모델별 특성 및 검토 결과를 소개하겠습니다.


다국어 음성 인식기의 필요성

영화 “터미널(The Terminal, 2004)”의 주인공 빅토르 나보르스키는 모국에서 발생한 쿠데타로 여권이 무효화되자, 미국 입국 심사 과정에서 곤란한 상황에 처합니다. 영어를 거의 구사하지 못하는 그는 심사관의 설명을 알아듣지 못해 곤혹을 치르는데, 이는 다국어 인식기 부재가 낳은 전형적인 사례입니다. 

글로벌화가 가속화됨에 따라 공항/항구, 국제 회의, 다국적 기업 등에서 다양한 언어를 사용하는 사람들이 동시에 존재합니다. 이때 언어 장벽은 단순한 불편을 넘어 행정적·법적 문제와 개인의 사회적 고립, 서비스 품질 저하를 초래할 수 있습니다. 더군다나 우리나라의 2025년 기준 외국인 인구는 약 4.9%로 역대 최다이며 계속 증가세를 보이고 있습니다. 크지 않게 느껴질 수도 있지만 한국에 거주하는 외국인의 수는 대도시인 대구광역시보다도 많습니다. 이러한 면을 생각해볼 때, 발생할 수 많은 문제와 곤란한 상황을 다국어 음성 인식기를 통해 상당 부분 해결할 수 있습니다.


음성인식기의 발전 과정

먼저, 단일어 음성 인식기에서 다국어 인식기로의 발전 역사를 간략하게 살펴보겠습니다.

01.jpg

그림 1. 음성 인식기 발전 과정


  1. Rule-Based 음성 인식기(1950~1990s): 이 시기에 개발된 음성 인식 기술은 주로 숫자와 같은 제한된 단어들만 인식할 수 있는 능력을 가지고 있었습니다. 이러한 초기 시스템은 단독 발음 인식 시도를 포함했으나, 여러 가지 문제로 인해 상용화에 어려움을 겪었습니다. 특히, 노이즈가 많은 환경에서는 음성 인식의 정확도가 낮아져 사용이 제한적이었습니다. 이러한 기술적 한계로 인해, Rule-Based 음성 인식기는 상업적으로 성공을 거두지 못하고, 이후 더 발전된 기술들이 필요하게 되었습니다.

  2. HMM (Hidden Markov Model) 기반 음성 인식기 (1990s~2000s): 단어 인식률이 향상되었지만, 상용화에는 여전히 낮은 인식 성능이 문제였습니다. 그럼에도 불구하고 상용화를 시도한 사례도 있었습니다. 대표적인 툴킷으로는 HTK (Hidden Markov Toolkit)가 있으며, 1997년에는 “본부, 본부나와라 본부”라는 호출어를 이용한 음성 자동 다이얼 기능이 휴대폰에 탑재되었습니다.

  3. DNN-HMM(Deep Neural Network - Hidden Markov Model) 기반 음성 인식기 (2000s~2010s): 문장 형태의 음성을 인식하며, 상용화 수준의 기술로 발전했습니다. 대표적인 툴킷인 Kaldi는 국내외에서 널리 사용되며, 제한된 도메인에서 여전히 높은 성능을 보입니다. KT는 기가지니, 상담 Assist, 보이스봇, B2B 사업에 이를 상용화했습니다. Kaldi는 음소 공유 방식으로 다국어 인식 모델을 개발하려 했으나, 데이터 부족과 DNN-HMM 아키텍처의 한계로 인해 높은 성능을 달성하지 못했습니다. 따라서 다국어 지원을 위해 개별 언어 음성 인식 모델을 사용하기도 했습니다. 이러한 이유로 LID(Language Identification Detector) 기술 연구가 활발히 진행되었습니다.

  4. Transformer 기반 음성인식기 (2017~현재): 기존 아키텍처에 혁신적인 변화를 가져왔습니다. 방대한 데이터를 효율적으로 학습하여 다국어 음성인식기에 널리 사용됩니다. 대표적인 toolkit으로는 Wenet(conformer), icefall(zipformer), Espnet 등이 있습니다. KT는 기존의 kaldi(DNN-HMM)에서 순차적으로 Transformer 기반 한국어 음성 인식기로 전환하고 있습니다. 모든 데이터를 라벨링하는 데 많은 비용이 들기 때문에 SSL(Self-Supervised Learning) 기법을 도입하여 오픈 모델인 wav2vec2와 HuBERT를 활용하고 있습니다. 지도 학습을 위한 오픈 모델로는 Whisper와 Nvidia의 Canary-1b-v2 모델이 있으며, 현재도 많은 다국어 음성인식 모델이 출시되고 있습니다.

    

최근 다국어 음성인식기 동향

현재까지 검토한 다국어 음성 인식기에 대해 설명하겠습니다. 이 과정에서 각 모델의 강점과 약점을 면밀히 분석하여, 특정 언어 또는 도메인에 가장 적합한 다국어 음성 엔진을 식별하는 데 중점을 두었습니다. 이러한 분석은 다양한 음성 인식 기술의 성능을 비교하고, 각 모델이 제공하는 기능과 제한 사항을 이해하는 데 도움을 주었습니다.

검토한 다국어 인식 모델은 Whisper[1,2], SONIOX[3], Azure AI Speech[4], Sense Voice[5], Dolphin[6]로 구성되어 있습니다. 각 모델의 기본 정보는 표 1.에 정리되어 있습니다.

02.jpg

표 1. 각 모델의 기본 정보

Whisper (OpenAI)

OpenAI가 개발한 Whisper는 음성 인식 기술 분야에서 강력한 성능과 다국어 지원을 통해 새로운 기준을 제시하고 있습니다. Whisper의 주요 모델에는 Whisper V2가 2022년 12월에 출시되었고, 그 뒤를 이어 Whisper V3가 2024년 2월에, 마지막으로 Whisper V3-turbo가 2024년 10월에 발표되었습니다. 그러나 Whisper는 실시간 사용이 어렵고 리소스를 많이 소모하는 특성을 가지고 있어, 서비스에 적합하지 않은 단점이 존재합니다. 

 이러한 문제를 해결하기 위해 OpenAI는 디코더 레이어의 수를 32개에서 4개로 줄인 Whisper V3-turbo를 공개하였습니다. 하지만 이 모델 역시 여전히 실시간 사용이 어려운 상황이며, 디코더 레이어를 줄인 결과로 인해 특정 언어의 성능 저하가 발생하고, 입력 언어를 영어로 변환하는 기능이 제대로 작동하지 않게 되었습니다. 이와 같은 문제를 해결하기 위해 Systran은 CTranslate2를 적용하여 Whisper V3 모델의 성능을 유지하면서도 추론 속도를 향상시킨 fast-whisper 모델을 발표하였습니다. 현재에도 Whisper의 실시간성을 확보하기 위한 연구가 활발히 진행되고 있으며, 이와 관련된 다양한 시도가 이루어지고 있습니다[7, 8]. Whisper의 주요 모델별 특성은 표 2.와 같이 정리되어 있습니다.

03.jpg
표 2. Whisper의 주요 모델별 특성

SONIOX

SONIOX는 2020년에 설립된 AI 스타트업으로, 기존 음성 인식의 한계를 넘어서는 혁신적인 기술을 선보이며 주목받고 있습니다. 비지도 학습(Self-supervised Learning) 접근법을 도입하여 언어 데이터의 제약 없이 높은 정확도와 실시간 성능을 구현한 것이 핵심입니다. 현재 서비스 중인 v2(2025년)는 60가지 언어를 실시간으로 제공하며, 혼합 언어 인식이 가능합니다. 즉, 한국어와 영어가 섞인 대화도 원활하게 인식하고 전사할 수 있습니다. 다른 다국어 음성 인식은 문장 단위로 언어를 처리합니다. 표 3.은 SONIOX 음성 인식기의 주요 특징을 보여줍니다.

04.jpg

표 3. SONIOX 음성 인식기의 주요 특징

Azure AI Speech

Azure AI Speech는 마이크로소프트에서 제공하는 음성 기술 서비스로, 다양한 환경에서 활용될 수 있는 솔루션입니다. 클라우드 기반 또는 온프레미스 환경에서 모두 적용할 수 있어, 고객의 필요에 따라 유연하게 선택할 수 있는 장점을 가지고 있습니다. 높은 성능을 자랑하는 다국어 음성 인식 기능으로, 이를 통해 여러 언어의 음성을 정확하게 인식할 수 있습니다. 

또한, 대화 속에서 여러 화자를 구분할 수 있는 화자 분리 기능을 제공하여, 최대 10명까지의 화자를 정확하게 인식하고 구분하는 성능을 보입니다. 이러한 기능은 특히 회의나 그룹 대화에서 유용하게 사용될 수 있습니다. 더불어, Azure AI Speech는 음성을 실시간으로 다른 언어로 번역하는 기능도 지원하여, 다양한 언어를 사용하는 사용자 간의 원활한 소통을 가능하게 합니다[9]. Azure AI Speech의 주요 기능에 대한 자세한 내용은 표 4.에서 확인할 수 있습니다.

05.jpg

표 4. Azure AI Speech의 주요 기능

Sense Voice

Sense Voice는 공개용 small 모델과 비공식 large 모델을 제공합니다. small 모델은 지도 학습 방식을 기반하며, large 모델은 지도 학습과 비지도 학습을 결합한 하이브리드 방식입니다. small 모델은 5개 언어에 대해 초저지연 실시간 음성 인식을 지원하고, 음성 언어 식별, 음성 감성 인식, 오디오 이벤트 판별 기능을 제공합니다. 다음 표 5.는 Sense Voice의 주요 특성을 보여줍니다.

06.jpg

표 5. Sense Voice의 주요 특성

Dolphin

서양의 대표적인 다국어 음성 인식 모델 Whisper가 있다면, 동양에는 다국어 음성 인식 모델 Dolphin이 있다는 큰 포부로 오픈된 모델입니다. Whisper는 동양언어, 특히 중국어 방언에서 낮은 성능 문제를 개선하기 위해 개발되었으며, 동아시아, 남아시아, 동남아시아, 중동 지역의 40개 동부 언어와 22개 중국 방언에 대한 인식 정확도를 높이는 데 중점을 두었습니다. 오픈된 지 얼마 되지 않아서 지속적인 업데이트를 모니터링할 필요가 있습니다. 

단점으로는 띄어쓰기가 없는 음성학적 단위나 문맥으로 단어를 구분하는 언어(중국어, 일본어 등)들이 많이 학습되어 한국어 인식시 띄어쓰기가 잘되지 않아 서비스 적용하기 위해서는 띄어쓰기에 대한 후처리 모듈이 필요합니다. 표 6은 Dolphin 모델에 대한 주요 내용입니다.

07.jpg

표6. Dolphin모델의 주요 내용



다국어 모델 인식 성능 측정

이번 장에서는 테스트 셋과 다국어 음성 인식 성능에 대해 설명합니다. 테스트 셋의 언어는 국내 체류 인원과 국내 콜센터에서 주로 지원하는 언어를 기준으로 선정했습니다. 2024년 법무부 통계에 따르면 외국인 장기 체류자는 다음과 같습니다[10]: 중국(약 95만 명), 베트남(약 30만 명), 태국(18만 명), 미국(약 17만 명), 우즈베키스탄(약 9만 명), 필리핀(약 7만 명), 일본(약 6만 명), 러시아(6만 명). 이 중에서 국내 콜센터에서 주로 지원하는 중국어, 베트남어, 영어, 러시아어, 일본어에 대한 다국어 인식기 성능을 측정하였습니다.

Test Data Set
다국어 음성 인식기의 성능 측정을 위해 오픈 DB의 평가셋을 사용하여 음성 인식 정확도를 평가했습니다. 또한 화자 분리 성능 측정을 위한 테스트셋을 추가로 구성했습니다. 테스트셋 구성은 다음과 같습니다. 다국어 음성 인식기의 테스트셋은 표 7.과 같습니다.

08.jpg
표 7. 다국어 음성 인식기 테스트셋


AI Hub의 다국어 음성 테스트셋은 주로 일상 대화와 방송 콘텐츠로 구성되어 있습니다[11]. 일본어, 러시아어, 중국어는 각각 약 10시간 분량으로 시사, 대중문화, 과학 등 다양한 주제를 포함한 일상적인 대화를 다룹니다. 영어는 약 10시간 분량으로 드라마, 다큐멘터리, 시사 프로그램 등에서 추출된 데이터입니다.

FLEURS (Few-shot Learning Evaluation of Universal Representations of Speech) 데이터셋은 구글에서 제작하였으며 위키피디아의 내용을 바탕으로 한 다국어 음성 데이터입니다[12,13]. 여행, 과학, 기술, 문화 등 다양한 주제의 내용을 원어민이 낭독한 음성으로 구성되어 있습니다. 이 데이터셋은 번역 및 다국어 인식 측정을 가능하게 하여 보편적인 성능을 평가하는 데 사용됩니다.

LibriSpeech는 오디오북을 기반으로 한 영어 음성 데이터셋으로, 음성 인식 모델 성능 평가에 널리 사용됩니다[14].

화자 분리를 측정하기 위한 데이터셋은 표 8.과 같습니다. 화자 분리 성능 테스트를 위해 AI Hub의 다중 발화 DB에서 발화 문장이 10개 이상인 화자 15명을 선별했습니다. 다양한 주제와 환경(라디오, 유튜브, 방송)에서 테스트 셋을 구성했습니다. 테스트 파일은 1~8명의 화자를 랜덤하게 이어붙여 생성하고, 각 화자의 전사 결과를 정답지로 정의했습니다.

09.jpg

표 8. 화자 분리 측정을 위한 데이터셋


성능 측정 및 고찰

  • 다국어 음성 인식기 성능 측정
다국어 음성 인식기의 모델별 성능을 측정하고, Azure AI Speech의 화자 분리 성능과 Speech Translation 성능을 평가했습니다. 그림 2와 표 9.는 Azure, Soniox, Whisper-v3-turbo, Sense Voice, Dolphin의 언어별 성능을 상세히 보여줍니다. 성능 측정에 따라 성능 차이가 발생할 수 있습니다. Azure의 성능 측정 시점은 2025년 3월이며, Soniox는 2025년 4월입니다.

10.jpg

그림 2. STT Model Radar Chart


11.jpg

표 9. 음성인식 모델의 언어별 성능 


영어 데이터셋으로는 LibriSpeech, AI-Hub, Fleurs를 평가했습니다. Soniox는 LibriSpeech(6.28%), Fleurs(5.19%), AI-Hub(5.81%)에서 가장 높은 정확도를 기록했습니다. Whisper는 LibriSpeech와 Fleurs에서 높은 정확도를 보였으나, AI-Hub에서는 낮은 정확도를 나타냈습니다. 이는 AI-Hub 데이터의 특성으로 인한 성능 저하 때문입니다. AI-Hub의 영어 데이터는 한국어 방송 콘텐츠를 영어로 더빙한 것으로, 한국어 고유명사(이름, 지역명 등)에서 인식률이 크게 저하되었습니다. Whisper 모델을 특정 도메인 서비스에 사용하려면 해당 도메인에 대한 fine-tuning이 필요합니다. Dolphin은 영어 인식을 제공하지 않으며, 훈련 데이터에 영어가 포함되어 있지 않습니다.

AI-Hub와 Fleurs 데이터셋으로 일본어 평가를 진행했습니다. 모든 모델의 성능이 우수했습니다. 일본어의 뛰어난 성능은 여러 측면에서 분석할 수 있습니다. 일본어는 "자음+모음"의 조합으로 이루어진 개음절(음절의 끝이 모음이 경우) 구조를 가지고 있어 규칙적이며, 음절 수가 적어 모델 훈련에 유리합니다. 또한, 일본어 훈련 데이터의 품질 등 다양한 요인이 영향을 미쳤을 것입니다.

Fleurs 데이터셋으로 평가한 중국어에서 모든 모델이 높은 성능을 보였습니다. 그중 Sense Voice는 3.25%로 가장 우수하며, Whisper는 3.94%로 두 번째로 좋은 성능을 기록했습니다.

베트남어 Fleurs 데이터셋 평가에서 Soniox는 3.27%로 가장 높은 정확도를 기록했으며, Whisper는 4.35%의 정확도를 보였습니다.

AI-Hub 데이터셋으로 테스트한 러시아어에서 Soniox는 2.87%의 높은 정확도를 기록했습니다.

Soniox는 영어, 베트남어, 러시아어에서 뛰어난 성능을 보이며, Whisper는 일본어에서 우수한 성능을 나타냅니다. 또한, Sense Voice는 중국어에서 가장 뛰어난 성능을 보여줍니다. 이는 모델의 성능이 언어에 따라 달라질 수 있음을 시사하며, Soniox와 Whisper는 모든 언어에서 안정적으로 높은 정확도를 유지하였습니다.

  • 화자 분리 성능 측정
다중 화자 분리는 회의 및 방송 콘텐츠에서 주로 사용됩니다. 검토한 모델 중 다중 화자 분리를 지원하는 것은 Azure와 Soniox입니다. Azure는 최대 10명까지 안정적인 화자 분리가 가능하며, Soniox는 20명까지 지원합니다. 화자 분리 성능은 일반적으로 DER(Diarization Error Rate)로 측정하지만, 이는 시간 정보만으로 결과를 평가하므로 고객이 즉시 확인할 수 있는 지표는 아닙니다. 따라서 음성 인식과 화자 분리 성능을 통합적으로 평가하기 위해 WDER(Word Diarization Error Rate)를 사용하여 성능을 측정했습니다[15]. 측정은 Azure만을 사용하여 진행했습니다.

화자 분리 성능 측정은 표 8.에 정의된 화자별 데이터를 사용하여 1명에서 8명까지의 화자를 랜덤하게 테스트 데이터로 생성하여 진행했습니다. 성능 측정을 위한 규칙은 다음과 같습니다.

  1. 발화자의 순서에 따라 발화자1, 발화자2,..., 발화자8로 맵핑합니다.
  2. 예상되는 발화자 수를 설정하되, 발화자 수 설정은 하지 않습니다.
  3. 발화자별 인식된 STT 결과와 정답지를 이용해 CER을 측정합니다.
  4. 식 1에 따라 발화자별 CER을 전체 음절 수, 삽입 오류, 삭제 오류, 치환 오류를 사용해 다시 계산합니다.
         여기서 K는 정답지의 전체 화자 수, N은 정답지의 전체 음절 수, sub는 잘못 인식된 음절 수, Del은 누락된 음절 수,             Ins는 정답지에 없는 추가된 음절 수를 의미합니다.

14.png

식 1. WDER 측정 방법


측정 결과는 그림 3와 표 10.에 나타납니다. WDER은 낮을수록 좋은 성능을 의미합니다. 화자가 1명일 때 측정하는 것은 두 가지 의미가 있습니다. 첫째, 한 명이 발화한 내용을 여러 명으로 분리하는지 확인하고, 둘째, 모델의 기본 음성 인식 성능을 평가하기 위함입니다. Azure의 경우, 1명 화자에 대한 성능은 약 9%로, 해당 테스트셋에서 한국어 음성 인식 성능은 준수한 편입니다.

2명 화자의 경우, 1명 화자와 동일한 결과를 보여 화자 분리가 잘 이루어졌음을 나타냅니다. 8명 화자까지 측정했을 때 WDER은 1명 화자와 약 2%p 차이로, 화자 분리 성능이 뛰어난 것으로 보입니다. 7명 화자일 경우 가장 낮은 성능을 보였는데, 이는 음성 특성이 비슷한 남성 화자가 많아 발생한 결과입니다. 화자 특성이 뚜렷할수록 화자 수가 많아도 분리 정확도가 높음을 확인할 수 있었습니다.

12.jpg

그림 3. & 표 10. 화자 분리 성능 측정 결과


  • Whisper 모델별 성능 측정
Whisper 모델에는 여러 최적화 모델이 있습니다. 각 최적화 모델별 성능을 평가하여 서비스시 동시접속 채널수와 하드웨어 사양을 참고하기 위하여 진행하였습니다. 실험 환경은 다음과 같습니다. HP 노트북(GPU는 RTX4060 8G, CPU는 인텔 i9-14900hx 2.4GHz~5.8GHz)을 사용하여 측정하였습니다. 측정 값은 입력 데이터, 환경에 따라 다를 수 있음으로 본 기고의 측정 값은 경향성으로 참고해 주시기 바랍니다.

먼저, 측정 데이터는 Librispeech에서 10개를 랜덤하게 추출하였으며, 재생 시간은 약 75초입니다. 측정한 모델은 표 11에 정리된 Large-v3, Large-v3 turbo, faster-large-v3-ct2를 사용하였습니다. Whisper는 실시간 스트리밍 방식이 아닌 배치(batch) 방식으로 처리되므로 RTF(Real-Time Factor) 대신 총 처리 시간(Elapsed Time)으로 측정하겠습니다. Whisper는 30초 단위로 처리되도록 설계되었으며, 실시간 음성 인식기는 20ms~250ms 단위로 처리됩니다. 일반적으로 RTF가 1보다 작으면 실시간성이 있다고 판단합니다. RTF가 0.5라고 가정하면, Whisper는 15초 후에 인식 결과를 받을 수 있어 실시간으로 보기에는 어렵습니다. 만약 100ms의 입력을 사용하면 50ms 후에 인식 결과를 받을 수 있어 실시간 서비스에 적합하다고 판단 할 수 있습니다.

13.jpg

표 11. 모델, 디바이스, 모델 양자화에 따른 측정 결과


표 11.은 모델, 디바이스, 모델 양자화에 따른 측정 결과를 보여 줍니다. 여기서 데이터 타입은 양자화를 나타내며, fp16은 whisper의 기본 형 타입을 나타냅니다. int8_float32는 모델의 양자화를 int8로 메모리 사용량을 줄이고, 연산은 float32로 처리하라는 의미입니다. int8 또는 int16은 모델 양자화와 연산을 모두 정의한대로 처리하라는 의미입니다. 측정된 데이터에서는 양자화에 따른 성능 차이가 적지만, 많은 데이터를 실험하면 양자화에 따른 성능 저하가 발생할 것으로 예상합니다. 앞서 설명한 대로 Large-v3-turbo는 영어로 번역하는 기능이 정상 동작하지 않으므로, faster-large-v3-ct2만을 고려하겠습니다. 서비스 시 faster-large-v3-ct2는 영한 번역기만 사용하면 되기 때문입니다. 디바이스가 CPU일 경우, int8 또는 int8_float32로 양자화했을 때 약 1.4정도의 배속이 나오지만, 서비스에 적용하기에는 어려움이 있을 것으로 보입니다. 

일반적으로 서비스되는 보이스봇 상담Assist의 경우, 발화 이후 1초안에 인식 결과를 받게되면 실시간성이 있다고 판단을 합니다. CPU를 사용할경우 최대 입력 크기를 30초에서 1.4초 이하로 줄여야 하므로 인식 성능이 많이 저하될 것으로 판단됩니다. GPU 사용하고 int8로 양자화를 한다면 최대 입력 크기를 18초 이하로 설정할 경우 실제 실시간 인식기보다는 느리지만 어느 정도 사용은 가능할 것으로 판단됩니다. 추가로 검토가 필요한 것은 최대 입력 크기를 줄였을때 인식 성능 정확도에 미치는 영향도를 확인할 필요가 있습니다.


결론

표 12.는 지금까지 검토한 모델들의 장점과 단점을 정리한 내용입니다. 다음과 같은 환경에서 각각의 모델을 사용할 수 있을 것 같습니다. Azure의 경우 Cloud API를 이용할 수 있고, 사용량이 적은 서비스에 적합할 것으로 보입니다. SONIOX는 사용량이 많고 높은 인식성능을 필요로하는 서비스에 적합합니다. 중국어에 대한 높은 인식 성능이 필요하고 실시간성이 필요한 서비스의 경우 Sense Voice가 적합해 보입니다. Whisper는 실시간성이 필요없는 대규모 다국어 인식에 적합할 것으로 보입니다. 하지만, Open 모델(Sense Voice, Whisper)의 가장 큰 단점은 유지보수에 추가 비용이 많이 발생한다는 것입니다. 일반적으로 외국어의 경우, 한국어 전사 비용에 비하여 2배 이상의 데이터 가공 비용이 발생합니다. 이러한 점을 장단점들을 고려하여 적합한 서비스에 사용해야 할 것 같습니다.

14.jpg

표 12. 각 모델별 장단점 비교



향후 계획

지금까지 다국어 음성 인식 모델의 검토 내용을 정리했으며, 추가 검토가 필요한 사항도 확인했습니다. 다국어 음성 인식기를 활용해 다국어 실시간 상담 대화록, 보이스봇, 키오스크 등 다양한 서비스에 활용이 가능할 것으로 예상합니다.

그림 4는 다국어를 이용한 가상 시나리오 화면입니다. 다국어 실시간 대화록으로, 외국어를 하지 못해도 상담이 가능한 서비스로 동시 통역과 유사합니다. 외국인 고객의 발화가 실시간으로 원어와 한국어로 번역되어 대화록에 표시되며, 상담사가 한국어로 말하면 고객의 언어로 TTS 변환하여 전달하는 서비스입니다. 또한, 고객의 감정과 상담에 도움이 되는 정보도 제공합니다.

KT 100번 상담 Assist에 외국인 전문 상담사분들을 대상으로 Pilot 추진 예정이며, 상담 품질에 대한 피드백 검토 및 수합 후, 일반 상담사분들도 외국인 상담이 가능하도록 추진할 예정입니다.

19.png


그림 4. 다국어를 이용한 가상 시나리오 


참고자료

[11] AI-Hub

윤제열

KT AICC의 음성 인식 및 음성 신호 처리를 담당하고 있습니다.

이전 글