안녕하세요, KT Frontier AI Lab에서 비전 인코더(Vision Encoder)의 연구 및 개발을 담당하는 김재석, 김영진 그리고 김현우입니다. 최근 AI 기술의 발전은 언어 모델의 한계를 허물고 있습니다. 과거 텍스트만 이해하던 모델에서 벗어나, 이제는 이미지, 음성, 비디오 등 여러 종류의 데이터를 동시에 인식하고 처리하는 것이 새로운 주류로 부상하고 있습니다. 이에 대응하기 위해 저희가 개발한 이중 언어 비전 인코더(bi-lingual vision encoder)를 소개 드리고자 합니다.
비전 인코더란 무엇인가?
비전 인코더는 간단히 말해 이미지의 시각적 정보를 고차원의 벡터(vector)로 변환하는 역할을 하는 신경망 모델입니다. 사람은 이미지를 보고 그 안에 담긴 객체, 상황, 분위기 등을 종합적으로 이해하지만, 컴퓨터는 이미지를 단순히 픽셀(pixel)의 집합으로 인식할 뿐입니다. 비전 인코더는 이 픽셀 데이터 속에서 핵심적인 특징들을 추출하고 압축하여, 컴퓨터가 의미를 파악할 수 있는 숫자들의 배열, 즉 임베딩(embedding) 벡터로 만들어냅니다.
이 임베딩 벡터는 이미지의 '의미'를 담고 있는 좌표값과 같습니다. 비슷한 이미지는 벡터 공간상에서 가까운 위치에, 전혀 다른 이미지는 먼 위치에 존재하게 됩니다. 예를 들어, '강아지' 이미지들의 임베딩 벡터들은 서로 가까이 모여 있고, '고양이' 이미지들의 벡터들과는 어느 정도 거리를 두게 됩니다. 이러한 임베딩 벡터를 생성할 수 있는 모델 구조는 다양하지만, 저희 KT는 자체 비전 인코더의 구조로 ViT(Vision Transformer)[1] 를 채택하였고 학습 방법으로 CLIP(Contrastive Language-Image Pre-Training)[2]을 기반으로 학습을 진행 하였습니다. 이후 본문에서는 KT에서 개발한 이 비전 인코더를 편의상 ‘KT-CLIP’이라 칭하겠습니다.
Vision Transformer
<그림 1.> Vision Transformer architecture
ViT는 <그림 1.>에서 볼 수 있듯 Convolutional layer를 사용하여 이미지를 여러 개의 패치(patch)로 나누고 이를 순차 데이터처럼 처리함으로써, 자연어 처리 분야에서 성공을 거둔 트랜스포머(Transformer) 아키텍처를 이미지 인식 문제에 적용한 모델 구조입니다.
일반적인 ViT는 각 패치의 위치 정보를 전달하기 위한 위치 임베딩으로 '학습 가능한 절대 위치 임베딩(Absolute Positional Embedding)' 방식을 사용하여 이미지의 공간 정보를 학습합니다. 이 방식은 각 이미지 패치의 고정된 위치 값을 학습하지만, 학습 시 설정된 해상도나 비율과 다른 이미지를 처리할 때 성능이 크게 저하되는 한계를 가집니다.
이러한 단점을 보완하기 위해 KT-CLIP은 '2D-RoPE (Rotary Position Embedding)'를 적용했습니다. 2D-RoPE는 각 패치의 절대적인 위치가 아닌, 패치 사이의 상대적인 위치 관계를 인코딩합니다. 이 덕분에 모델은 이미지의 전체적인 공간 구조를 더 유연하게 이해할 수 있으며, 다양한 해상도와 비율의 이미지가 입력되어도 정보 왜곡을 최소화하고 안정적인 성능을 유지할 수 있습니다.
Contrastive Language-Image Pre-Training
KT-CLIP의 학습은 대조 학습 (Contrastive Learning) 방식을 통해 이루어집니다. 대조 학습은 예를 들어, (강아지 이미지, "귀여운 강아지" 텍스트) 쌍은 서로 가깝게 만들고, (강아지 이미지, "도도한 고양이" 텍스트) 쌍은 서로 멀어지도록 학습하여, 모델이 이미지와 텍스트 간의 의미적 유사도를 정확하게 측정하도록 훈련됩니다.
비전 인코더의 대조 학습은 자세한 세팅의 변경이 있지만 저희가 채택 한 방법은 CLIP입니다. KT-CLIP은 ViT구조의 비전 인코더와 “Transformer encoder only” 구조의 텍스트 인코더를 CLIP 방식으로 학습 시킨 모델입니다.
<그림 2.> Contrastive learning 기반 CLIP
CLIP 비전 인코더는 이미지 / 텍스트 교차 검색의 핵심
최근 인공지능 기술의 발전으로 이미지와 텍스트, 두 가지 다른 양식의 데이터를 함께 이해하고 검색하는 교차검색 (Cross-modal Retrieval) 기술이 주목받고 있습니다. "해변에서 노을을 바라보는 커플"이라는 문장으로 이미지를 찾거나, 특정 이미지와 비슷한 분위기의 문장을 찾아내는 것이 바로 그 예시입니다. 이러한 마법 같은 기술의 중심에는 이미지를 컴퓨터가 이해할 수 있는 언어로 번역하는 비전 인코더가 있습니다.
CLIP기반 비전 인코더가 이미지-텍스트 교차검색이 가능한 이유는 비전 인코더가 만들어낸 이미지 임베딩과, 텍스트 인코더(Text Encoder)가 만들어낸 텍스트 임베딩을 같은 벡터 공간(latent space) 상에 위치 시키기 때문입니다. 즉, "석양이 지는 바다"라는 텍스트의 임베딩 벡터와 실제 석양이 지는 바다 이미지의 임베딩 벡터를 최대한 가까운 위치에 있도록 학습 시키는 것입니다.
이미지와 텍스트의 지식을 잘 정렬 하여 텍스트가 주어졌을 때 매칭되는 이미지를 정확히 찾아 내는 것이 대조 학습으로 학습 된 비전 인코더의 기본 목표이며 평가 대상입니다.
비전 인코더 평가
교차 검색 능력을 평가하기 위해 CLIP 모델의 평가 방법은 이미지 분류(Image classification) 데이터를 바탕으로 평가 하는 “제로샷 이미지 분류(zero-shot image classification)”과 캡션(Image captioning) 데이터를 바탕으로 평가 하는 “이미지 텍스트 검색(image-text retrieval)” 방식이 주로 사용됩니다.
<표 1.> CLIP 모델 평가 방법
Multimodal Large Language Model(MLLM)의 '눈', 비전 인코더
<그림 3.> Vision Language Model의 일반적인 구조
CLIP 비전 인코더는 이미지 / 텍스트 교차 검색의 역할 뿐 아닌 멀티모달 언어모델에서 매우 중요한 역할을 갖고 있습니다. <그림 3.>에서 볼 수 있듯, 멀티모달 언어모델이 세상을 시각적으로 인식하는 '창문'이자 '눈'의 역할 입니다. 언어 모델이 텍스트를 넘어 시각 정보를 이해하고 추론하기 위해서는 이미지를 의미 있는 임베딩으로 변환하는 과정이 필수적인데, 바로 이 역할을 비전 인코더가 담당합니다. 최근 다수의 연구 결과[3], [4], LLM 백본이나 학습 데이터가 동일한 조건에서도 비전 인코더의 성능이 MLLM의 전체 성능을 좌우하는 주요 요소임이 확인되었습니다.
KT-CLIP을 소개합니다
KT-CLIP은 한국어 문맥을 깊이 있게 이해하는 능력, 특히 정보가 풍부하고 구체적인 상세 캡션(Dense Caption)에 대한 탁월한 대응 능력을 핵심 목표로 개발된 모델입니다. 단순히 한국어에만 집중하는 것을 넘어, 이미지 속 텍스트 인식 능력까지 갖추었으며, 영어와 한국어 모두에서 뛰어난 성능을 발휘하는 이중 언어(Bi-lingual) 모델을 지향합니다. 이러한 고성능 모델을 구현하기 위해, 연구팀은 상업적으로 사용 가능한 대규모 이미지/텍스트 페어 데이터를 수집하고 번역을 통해 방대한 한국어 데이터를 확보했습니다. 목표 영역이 확장됨에 따라 이미지 합성, 캡션의 생성 작업 등이 수행되었고 개별적인 검증을 포함한 정제 작업을 통해 최종 학습 데이터를 구축할 수 있었습니다. 여기에 모델에 적용된 기법들 및 학습에 적용된 기법들의 전체적인 검증 및 최적화를 위한 다각적인 노력을 더하여 모델의 완성도를 한층 끌어올렸습니다.
<그림 4.> 약식 KT-CLIP 개발 프로세스
KT-CLIP성능 평가 결과
<그림 5.> 경쟁 다국어 모델들과의 벤치마크 영역 별 평균 성능 비교
<표 2.> KT-CLIP 및 경쟁 모델들의 이미지 분류 및 검색에 대한 한글과 영어 평가 결과 (*각종 모델들의 이름은 순서가 정해져 있지 않지만 일반적으로 모델 구조적 및 학습 방법 특징 (예시: ViT구조, H(600M)규모, patchsize 14, 학습제한 방법론 KT-CLIP, 목표 해상도 448)을 포함합니다.)
<그림 5.>는 한글을 지원하는 다국어 모델들[4, 5, 6]과 각 영역의 벤치마크(Benchmark) 성능 평균을 비교 한 결과입니다. 이를 통하여 KT-CLIP은 뛰어난 영어 성능을 갖추면서 한글 환경에서는 큰 차이의 높은 성능을 달성했음을 보여줍니다. 특히 더 많은 파라미터를 사용 한 SigLIP2-ViT-g 모델과 비교해도 우수한 성능을 갖는 것을 확인할 수 있습니다.
<참고> 영역 별 포함된 벤치마크
영어 이미지 분류: ImageNet 및 ImageNet 파생 데이터셋에 대해 측정된 제로샷 이미지 분류 Top1 성능 평균
한글 이미지 분류: 영어 이미지 분류 데이터셋에서 클래스명의 한글 번역 후 측정된 제로샷 이미지 분류 Top1 성능 평균
영어 캡션 검색: 짧은 캡션(COCO), 정밀 캡션(Urban1k), OCR 능력이 필요한 캡션(TextCaps)를 대상으로 측정 된 R@1 성능 평균
한글 캡션 검색: 짧은 캡션(COCO), 정밀 캡션(Urban1k)을 한글 번역 한 후 측정 된 R@1 성능 평균
기본에 충실한 KT-CLIP
비전 인코더의 성능을 평가할 때 특화된 영역도 중요하지만 가장 기본이 되는 성능이 매우 중요하며, 제로샷 이미지 분류와 이미지-텍스트 검색의 평가에 대해 대표적인 벤치마크가 바로 ImageNet와 COCO입니다.
ImageNet: 1,000개의 객체 클래스에 해당하는 약 128만 개의 이미지로 구성된 대규모 데이터셋으로 , Vision Encoder가 이미지 속 핵심 객체를 얼마나 잘 인식하고 구별하는지, 즉 모델의 가장 기본적인 객체 인식(Object Recognition) 능력을 측정
COCO: 복잡한 일상 속 장면과 여러 객체가 함께 등장하는 이미지들로 구성되어 있으며 , Encoder가 단일 객체를 넘어 객체 간의 관계, 행동, 장면의 전반적인 맥락(Context)을 얼마나 잘 이해하는지 평가하는 데 매우 중요
ImageNet
COCO
English Class: Tiger Korean Class: 호랑이
English Caption: A cat in between two cars in a parking lot.
Korean Caption: 주차장에 있는 두대의 차 사이에 고양이가 있다.
<표 3.> ImageNet 및 COCO 벤치마크의 데이터 샘플
<그림 6.> ImageNet 및 COCO의 영어, 한국어에 대한 성능 평가 결과
KT-CLIP은 <그림 6.>에서 볼 수 있듯 ImageNet-EN와 COCO-EN에서 최고의 성능은 아니지만 경쟁력 있는 성능을 보였으며, 각 클래스명과 캡션을 한글로 번역하여 평가하는 ImageNet-KR와 COCO-KR의 경우 모든 비교 모델들을 큰 차이로 앞서며 한국어에 특화된 강점을 보였습니다.
정밀 캡션에 특히 강한 KT-CLIP의 비밀: 시퀀스 길이
K-TCLIP은 단순히 "공원에 있는 개"라고 말하는 것을 넘어, "해 질 녘 공원에서, 골든 리트리버 강아지가 즐겁게 빨간색 원반을 쫓고 있다"라고 구체적으로 설명하는 '정밀 캡션'에 특히 강한 모델입니다.
정밀 캡션에 대한 평가는 이미지에 대한 충분히 많은 정보가 주어졌을 때 매칭되는 올바른 이미지를 정확히 찾을 수 있는지 확인할 수 있으며, 이미지에 대한 구체적인 분석 능력을 같이 확인 할 수 있는 평가입니다.
Urban1k-EN
Urban1k-KR
Densely Captioned Images (DCI-EN)
English Caption:
This image captures an overcast day with a crowd, many holding umbrellas, gathered on a city street to celebrate a victory event. In the center, an open-top double-decker bus with banners commemorating the "WIGAN WARRIORS 2010 GRAND FINAL WINNERS" is visible, with people on the bus actively engaging with the crowd. The architecture hints at a European town with traditional buildings, including one with a half-timbered façade. Advertisement banners with a website address are draped over the side of the bus. Despite the rainy weather indicated by the umbrellas, the atmosphere appears joyous, with the attendees' focus on the bus and its passengers.
Korean Captaion:
이 이미지는 흐린 날, 많은 사람들이 우산을 들고 도시 거리에서 승리 행사를 축하하기 위해 모인 모습을 담고 있습니다. 중앙에는 "WIGAN WARRIORS 2010 GRAND FINAL WINNERS" 라고 적힌 배너가 부착된 오픈탑 이층 버스가 보입니다. 버스 위에 있는 사람들은 관중과 적극적으로 교류하고 있습니다. 건축양식은 유럽의 전통적인 도시를 연상시키며, 절반은 나무로 된 외관을 가진 건물이 포함되어 있습니다. 버스 옆면에는 웹사이트 주소가 적힌 광고 배너가 걸려 있습니다. 우산이 비 오는 날씨를 암시하지만, 분위기는 버스와 그 안의 승객들에게 집중된 참석자들로 인해 즐거워 보입니다.
English Caption:
This is a wooden gazebo with an Asian inspired roof. The roof itself is made of a series of rods that slope to the ground along with other building materials. There are wooden posts that hold up the roof of the gazebo and there is a geometrically shaped table located inside of the gazebo. A walkway leads up to the gazebo and there is a handrail on the staircase of the walkway. The ground near the gazebo overlooks the gazebo and is sparsely covered with grass. There are a lot of trees of all shapes, sizes and varieties in the area. One tree even hangs over the gazebo on the right side. When you look past the gazebo, you can see a mountain range in the distance. Above the mountain range, you can see the clear and bright sky.
<표 4.> 정밀 캡션 평가 벤치마크인 Urban1k 및 DCI의 샘플 데이터
<그림 7.> 정밀 캡션에 대한 모델 평가 결과
KT-CLIP은 <그림 7.>과 <표 5.>에서 확인할 수 있듯, 한글과 영어 관계없이 정밀 캡션에 대한 검색 능력을 평가 하였을 때, 매우 큰 성능 강점을 확인할 수 있었습니다. 이렇게 정밀 캡션을 더 잘 처리할 수 있기 위해서는 학습 데이터를 구성하는 것을 기본으로 여러 복합적인 작업이 필요하지만 가장 중요한 요소 중 하나는 ‘시퀀스 길이(Sequence Length)’ 입니다.
<그림 8.> 작은 모델에서 수행 된 시퀀스 길이와 일반 캡션 및 정밀 캡션간의 trade off 분석 실험 결과
최근의 많은 CLIP 모델들은 효율성을 고려하여 77 내외의 짧은 시퀀스 길이를 채택해왔고 최근에는 더욱 적은 32를 선택하기도 합니다. 하지만 이는 복잡하고 긴 문장으로 구성된 정밀 캡션을 처리하는 데 한계를 만듭니다. <그림 8.>은 짧은 길이의 시퀀스 길이로 학습을 진행하는 경우 짧은 텍스트에 해당하는 ImageNet와 COCO에 대해 약간 더 좋은 모습을 보이지만, 긴 문맥에 대한 이해가 필요한 Urban1k에서의 성능이 크게 저하되는 것을 확인할 수 있었습니다. KT-CLIP은 이러한 한계를 극복하고 '깊이 있는 이미지 이해'로 나아가기 위해, 시퀀스 길이와 일반적인 벤치마크 및 정밀 캡션에 대한 벤치마크 성능간의 trade-off를 계산하여 77보다 훨씬 긴 128을 의도적으로 채택했습니다.
<표 5.>KT-CLIP의 시퀀스 길이 설정에 따른 성능 변화 추가 분석 결과
물론, 데이터 및 다른 학습 최적화를 바탕으로 정밀 캡션에 최적화 된 만큼 <표 5.>에서 확인 할 수 있듯 시퀀스 길이를 다른 모델들과 동일한 조건으로 통일하여 비교했을 때 역시 모든 지표에서 KT-CLIP이 정밀 캡션에서 큰 강점을 갖는 것을 확인 할 수 있습니다.
비디오까지 이해하는 KT-CLIP의 무한한 잠재력
<그림 9.> 비디오 벤치마크 평가 결과
KT-CLIP의 학습은 비디오에 대한 별도의 학습 단계가 포함되지 않았습니다. 하지만 놀랍게도 <그림 9.>에서 KT-CLIP은 별도의 비디오 데이터 학습 없이도, 글로벌 모델들과 대등하거나 그 이상의 비디오 이해 능력을 갖추고 있음을 보여주었습니다. 특히 정밀 비디오 캡션에 속하는 PVD-Bench에서 더 강한 모습을 볼 수 있는데 이는 KT-CLIP이 정밀 캡션에 대한 강력한 일반화(Generalization) 능력을 간접적으로 볼 수 있는 매우 인상적인 결과입니다.
결론적으로, KT-CLIP은 단순히 이미지에 특화된 모델이 아니라, 그 핵심 역량을 바탕으로 처음 접하는 비디오 도메인에서도 뛰어난 '제로샷(Zero-shot)' 성능을 발휘하는 강력한 MLLM 백본임을 증명합니다. 이는 향후 비디오 검색, 요약, 분석 등 다양한 멀티모달 서비스로 확장될 수 있는 높은 잠재력을 보여주는 결과입니다.
<그림 10.> 비디오평가를 위한 비디오 임베딩 추출 과정
MSR-VTT (Video)
PVD-Bench
English Caption: a man cooks burgers and bacon on a grill
English Caption: The video shows a person's hand using a microscope by panning the camera from bottom to top of the microscope. The person is adjusting the microscope. The video also shows the microscope's various components, such as the stage and objective lenses.
<표 6.> 비디오 평가 데이터의 샘플
OCR 능력을 갖춘 KT-CLIP
<그림 11.> Vision Encoder의 광학 문자 인식 처리 능력에 대한 평가 결과
TextRecognition(OCRBenchV2 subset)
OCRCrop KR* (* 자체 구축 벤치마크)
TextCaps
Icdar KR(ICDAR 2019 MLT KR subset)
English Caption: CHASERDEMO
English Caption: CHASERDEMO Korean Caption: 날 좋아하는 거 알아
English Caption: Several bottles of Dr. Laffer's Trickle Down Austerity are lined up against a white wall.
Korean Caption: 침묵과 사색의 통로'라는 글귀 아래 '쉿! 조용히'라는 메시지가 적혀 있습니다.
<표 7.> OCR 능력 평가를 위한 데이터셋 샘플
<그림 11.>에서 KT-CLIP은 이미지 속 텍스트를 인식하여 검색하는 능력을 갖는 것을 확인할 수 있습니다. 한국어와 영어의 글자 단위의 분류 능력과 텍스트와 환경이 어우러진 표현에 대한 처리 능력을 측정한 결과, 영어 단어 검색을 제외한 평가에서 우수한 성능을 갖는 것을 확인할 수 있었습니다. 특히 한국어 OCR 성능에서 탁월한 모습을 보였습니다. 이는 KT-CLIP이 단순히 이미지를 보는 것을 넘어, 이미지에 포함된 텍스트 정보까지 정확하게 읽고 이해하는 능력을 갖추었음을 의미합니다.
Native-resolution inference으로 성능의 지평을 넓힌 KT-CLIP
<그림 11.>에서 다른 평가와 다르게 짧은 영어 단어 인식에 해당하는 TextRecognition-EN에서 KT-CLIP의 성능이 타 모델 대비 열세 인 것을 관찰할 수 있었습니다. TextRecognition-EN과 OCRCrop KR은 다른 평가 데이터와 이미지 비율의 측면에서 큰 차이를 갖고 있습니다. 기존의 Vision encoder 모델들은 이러한 이미지 입력을 처리하기 위해 이미지를 일정한 고정된 해상도(예: 224x224, 448x448)로 강제 변환하는 경우가 많습니다. 하지만 이는 이미지 속 텍스트 정보를 심각하게 훼손할 수 있으며 특히 가로로 긴 길이의 이미지가 많이 포함된 텍스트 데이터에서 큰 위험이 될 수 있습니다.
Resized input
Native
<표 8.> Fixed resolution과 Native resolution의 샘플
우리는 이러한 문제를 해결하기 위해 이미지의 원본 해상도와 비율을 최대한 유지한 채로 모델에 입력하는 Native-resolution inference를 적용하는 추가 평가를 진행하였습니다.
<그림 12.> Native resolution을 적용 한 후의 OCR 능력 평가 결과
KT-CLIP은 'Native-resolution inference' 방식을 통해 이미지의 원본 해상도와 비율을 최대한 유지하여 입력했을 때, 기존의 고정 해상도의 입력으로 평가 한 결과 대비 OCR 성능이 폭발적으로 향상되는 것을 <그림 12.>에서 확인할 수 있었습니다. 특히 종횡비의 차이가 매우 큰 Text recognition EN과 OCRCrop KR에서 변화가 크게 확인되었습니다. 이미지의 원본 비율을 유지하지 않고 임의로 변경할 경우 초래될 수 있는 정보 손실의 위험성을 보여주는 부분으로, 이러한 문제를 반영해 개발된 KT-CLIP의 강점을 확인할 수 있습니다.
OCR 관련 영역 뿐 아니라 다른 영역의 벤치마크에서 Native resolution inference의 이점이 확인되었으며, 이에 대한 평가 결과를 함께 첨부합니다.
<그림 13.> 주요 벤치마크의 원본 이미지 그대로 사용 한 평가 결과
맺음말
저희 KT-CLIP은 나아가 멀티모달 언어모델의 개발로 확장되고 있습니다. 강력한 이미지 이해 능력을 기반으로 사용자 여러분께 보다 편리하고 안정적인 경험을 제공하기 위해 앞으로도 지속적인 연구와 개발을 이어가겠습니다.
아울러 KT-CLIP의 구축에 많은 도움을 주신 신동균 님을 비롯한 Vision AI 팀의 모든 팀원분들, 그리고 저희를 이끌어주신 문일현 팀장님께도 진심으로 감사드립니다.
앞으로도 응원과 관심 부탁드리며, 다시 한번 진심 어린 감사의 인사를 전합니다
Reference
[1] An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
[2] Learning Transferable Visual Models From Natural Language Supervision
[3] PaLI: A Jointly-Scaled Multilingual Language-Image Model
[4] SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features