Tech Dive

ICDAR 2026 발표논문 소개 및 연구 동향 공유

이미지

KT Evidence Unit과 Document AI 연구 동향

2026년 9월 20일 · KT AX미래기술원 Frontier AI Lab Physical AX담당 한연지

안녕하세요, KT AX미래기술원 Frontier AI Lab Physical AX담당에서 문서 AI를 연구하고 있는 한연지 책임연구원입니다. 

2026년 8월 30일부터 9월 4일까지 오스트리아 빈 TU Wien에서 열린 ICDAR 2026(International Conference on Document Analysis and Recognition)에 참석해, 팀에서 진행한 연구 *"Ontology-grounded Chunking for Parser-Independent Retrieval"*을 발표하고 문서 AI 분야의 최신 연구 흐름을 현장에서 확인했습니다.

먼저, 이 글의 전체 흐름

장
내용
1장
ICDAR 2026 학회 소개 및 주요 연구 분야
2장
키노트가 제시한 Document AI의 방향
3장
KT 연구 성과 소개
4장
현장에서 확인한 최신 연구 동향


이 글이 다루려는 질문은 하나입니다.


"파싱을 아무리 잘해도 생성형 AI의 답변이 틀리는 이유는 무엇인가?"


결론부터 말씀드리면, 원인은 파서의 정확도 뿐만 아니라 파싱 결과를 검색 단위로 묶는 방식에 있었습니다. 이 글을 다 읽으시면 (1) 요소 단위 청킹이 왜 구조적으로 오답을 만드는지, (2) 다양한 파서에서 흔들리지 않는 청킹을 어떻게 설계했는지, (3) 그 결과 검색·답변 품질이 각각 얼마나 향상됐는지를 구체적인 수치와 함께 확인하실 수 있습니다.


1. 학회 소개 — ICDAR 2026 @ TU Wien

이미지

ICDAR은 IAPR(국제패턴인식협회)이 주관하는 문서 분석·인식 분야의 대표 국제학회입니다. 1991년 프랑스 Saint-Malo에서 처음 열린 뒤 올해 20번째를 맞았고, 2005년에는 서울에서도 열린 바 있습니다. 2026년 개최지는 오스트리아 빈, 장소는 TU Wien이었습니다.

ICDAR에서 다루는 문서의 범위는 굉장히 넓습니다. 역사 문서나 필기 문서부터 표, 수식, 차트와 그림이 포함된 복잡한 문서까지 다양한 형태를 다룹니다.

연구 분야도 문서 처리의 전 과정을 포함하고 있습니다. 

이미지에서 글자나 표, 그림과 같은 요소를 찾아내는 문서 인식, 찾아낸 요소의 의미와 관계를 이해하고 질문에 답하는 문서 이해, 그리고 최근에는 이해한 정보를 바탕으로 스스로 계획을 세우고 도구까지 활용하는 Agentic Document AI로 연구 범위가 확장되고 있습니다.

즉, 단순히 문서를 잘 읽는 것을 넘어 문서를 이해하고, 추론하고, 실제 작업으로 연결하는 방향으로 발전하고 있습니다.

2. 키노트가 제시한 Document AI의 방향

이미지

① C. V. Jawahar (IIIT Hyderabad) — The Changing Landscape of Document Understanding 
문서 이해 연구가 걸어온 길을 세 개의 화살표로 정리했습니다. 수작업 특징 → 학습된 표현, 개별 태스크 → 통합 모델, 명시적 구조 → 암묵적 멀티모달 추론. 다만 복잡한 레이아웃, 긴 문맥, 다국어는 여전히 end-to-end 모델 하나로 풀리지 않는 난제로 남아 있다고 짚었습니다.

② Christoph Rass (Osnabrück University) — From Archives to Algorithms and Back 
역사학자의 관점에서 문서 이해에 필요한 세 가지를 요구했습니다. 규모(수백만 페이지), 표현(그래프·온톨로지로 불확실성까지 모델링), 검증(전수 검토가 불가능할 때 전문가의 역할). 20세기 아카이브의 등록 카드처럼 타자와 수기가 섞이고 오기가 남아 있는 자료를 다루려면, 결국 요소 간 관계를 명시적으로 표현해야 한다는 이야기였습니다.

③ Tong Sun (Adobe, Senior Director) — From Document Understanding to Document Agency 
문서 이해를 넘어 추론·계획·도구 사용을 지원하는 협업 지능으로 가야 한다는 메시지였습니다. PDF 위에서 요약·질의뿐 아니라 후속 작업까지 실행하는, "이해"에서 "행위"로의 전환입니다.

세 키노트를 관통하는 공통점은 "모델을 키우는 것만으로는 안 되고, 문서의 구조와 관계를 어떻게 표현할 것인가가 남은 문제" 라는 인식이었습니다. 저희 발표가 다룬 문제의식과 정확히 같은 지점입니다.

3. KT 발표 논문 — Ontology-grounded Chunking for Parser-Independent Retrieval

이미지


"A reader never sees the whole document — only what the chunks preserve." 리더(LLM)는 문서 전체를 보지 않습니다. 청크가 보존한 것만 봅니다.

저자: 한연지 · 나재민 · 사공락 (KT Frontier AI Lab Physical AX담당) 


한 줄 요약: 파서 위에서 동작하는 온톨로지 기반 의미단위 문서 구조 재구성 기술 — 파서가 찾은 요소를 관계로 이어 근거 단위(Evidence Unit) 로 검색합니다.


3-1. 연구 배경 ① — 의미 파편화(semantic fragmentation)

이미지


사람은 문서에서 "실험에 사용한 수질 조건"을 찾을 때 제목 +본문 + 표를 한 덩어리로 보고 거의 즉시 답을 찾습니다. 반면 파서 출력을 그대로 청킹하면 하나의 영역을 여러개로 쪼갤 수 있습니다.


쪼개진 청킹의 문제는 검색 단계에서 나타납니다. 질문 "What were the water quality conditions used in the experiments?" 를 하면, 리더(LLM or VLM)는 top-k(보통 3)만 봅니다. 그래서 캡션만 읽고, 정답인 수치는 보지 못한 채 답을 생성합니다. 정답이 문서 안에 분명히 있는데도 도달 불가능(answer unreachable) 한 상태가 되는 것이죠. 파싱은 완벽했지만 청킹이 근거를 끊어 놓은 경우입니다.


3-2. 연구 배경 ② — 파서마다 다른 출력

또 다른 문제는 한 파서에 맞춰 튜닝한 청커가 다른 파서에서는 동작하지 않는다는 점입니다. 같은 문서를 세 파서에 넣으면 결과가 이렇게 갈립니다.

파서
표 처리 방식
캡션 처리
DocuSee (KT 자체 파서)
표를 하나의 블록으로 유지
표 바깥에 분리
MinerU (상하이 AI Lab)
표를 행(row) 단위 조각으로 분리
표 바깥에 분리
Docling (IBM)
표를 하나의 블록으로 유지
캡션을 표 본문 안에 포함

같은 페이지인데 청크 경계가 세 파서 모두 다릅니다. 여기서 연구 목표가 정해졌습니다.


3-3. 제안 방법 — Evidence Unit(EU)

이미지


Evidence Unit(EU)은 사람의 눈이 페이지를 묶어 보는 방식을 모방해, 표·차트·그림 같은 시각 요소 하나를 앵커로 두고 그것을 설명하는 제목·문단·캡션·단위 라벨을 모두 하나의 청크로 묶은 "완결된 근거 단위" 입니다. 핵심은 파서를 교체하는 것이 아니라 파서 출력 위에 관계(relation) 레이어를 한 겹 올리는 것입니다.


설계 원칙은 세 가지입니다.


  • 파서는 요소를 "찾고", EU는 요소를 "잇는다" — 역할을 분리합니다.
  • 검색 단위를 텍스트 조각에서 근거로 재구성합니다.
  • 누락 없음 — 모든 요소는 반드시 정확히 하나의 EU에 소속됩니다.


3-4. 1단계 — 역할 정규화(Normalization)


이미지

파서마다 Section-header, title, SectionHeader처럼 같은 역할에 다른 이름을 붙입니다. 이를 하나의 공용 어휘(온톨로지)로 통일하는 단계입니다.

매칭은 3단계로 진행합니다.

  1. 정확 매칭 — DSO 온톨로지의 skos:altLabel을 조회합니다. 대부분의 요소가 여기서 커버됩니다.
  2. 의미 추론 — 온톨로지에 없는 새 라벨은 임베딩으로 가장 가까운 역할에 매칭합니다 (cos ≥ 0.80).
  3. 내용 기반 보정 — 내용과 위치로 역할을 구체화합니다. 예를들어, 표 위에 붙은 짧은 표기 "(Unit: cases, %)" 는 본문(plain_text)이 아니라 unit_label로 재지정됩니다.

3-5. 2단계 — 3-Phase 그룹핑(Grouping)

정규화된 역할을 바탕으로 요소들을 EU로 묶습니다. 세 단계를 순서대로 적용합니다.

Phase A · 시각 앵커링 (거리 기준) 표·차트·그림이 유닛의 시작점(seed)이 되고, 캡션·단위 라벨·헤더가 공간적으로 가까우면 같은 그룹으로 묶습니다.

d_spatial = gapY + diffX < τ ⟹ 같은 Evidence Unit

Phase B · 전역 의미 할당 (의미 기준) 문단은 "가장 가까운" 유닛이 아니라 "의미가 가장 맞는" 유닛에 배정합니다. 각 문단은 모든 EU를 후보로 두고 전역 매칭을 수행합니다.

argmax_j max_k cos(e_para, e_member_k^(j)), τ_sem = 0.40

최근접(nearest) 매칭이 아니라 전역(global) 매칭이라는 점이 핵심입니다. 표 바로 아래에 있지만 실제로는 다른 표를 설명하는 문단이 흔하기 때문입니다.

Phase C · 구조적 마무리 (읽기 순서 기준) 남은 요소는 섹션 경계와 읽기 순서로 묶습니다. 이 단계 덕분에 모든 요소가 하나의 EU에 매칭되고, 누락이 발생하지 않습니다.

3-6. 실험 결과

실험 파이프라인은 네 단계로, 검색 품질과 LLM 답변 품질 측면에서 진행하였습니다.

이미지

A. 검색 품질 — OmniDocBench(CVPR 2025), 9종 문서 유형, QA 1,551쌍(텍스트/그림/표 근거)

지표
의미
w/o EU
w/ EU
변화 Δ
Avg LCS
(Coverage)
관련 근거가 얼마나 함께 묶였나
0.5006
0.7968
+59% (상대)
Recall@1
올바른 근거가 1위로 나오는 비율
0.150
0.507
3.4배
Recall@3

0.686
0.852
+0.166
Recall@5

0.834
0.914
+0.080
MinK ↓
올바른 근거까지 몇 개를 봐야 하나 
2.58
1.74
-33%
가장 큰 향상은 K = 1 지점에서 나타났습니다. top-1 하나만 봐도 완전한 근거가 잡힌다는 뜻이고, top-k를 늘리지 않고도 리더(LLM or VLM)가 볼 문맥의 질이 달라집니다.

B. 다양한 파서 — 세 파서 모두 같은 방향으로 개선


트랙
ΔLCS
ΔR@1
ΔMinK
어노테이션(정답 레이아웃)
+0.30
+0.36
−0.84
Docling
+0.23
+0.30
-0.82
MinerU
+0.26
+0.38
-0.91
DocuSee
+0.28
+0.38
-0.96


정답 레이아웃뿐 아니라 실제 파서 세 개 모두에서 향상 폭이 유지되었습니다. "운 좋게 파서 하나"의 효과가 아니라 Evidence Unit 구축 자체의 효과라는 의미입니다.


C. End-to-End 답변 품질 — DocVQA(WACV 2021, 편지·양식·송장), ANLS


파서
w/o EU
w/ EU
상대 향상
Docling
0.434
0.496
+14.3%
MinerU
0.559
0.605
+8.2%
DocuSee
0.539
0.636
+17.9%


Evidence Unit 적용 후 세 파서 모두에서 End-to-End 답변 품질이 향상되었습니다. 특히 DocuSee는 ANLS가 0.539에서 0.636으로 상승해 17.9%의 가장 큰 상대 향상을 보였습니다. 이는 EU가 검색 단계의 근거 품질 개선에 그치지 않고 최종 LLM 답변 품질 향상까지 이어졌음을 보여줍니다.


4. 현장에서 확인한 4대 연구 트렌드


이미지


이번 ICDAR 2026을 한 문장으로 요약하면 인식(Recognition) → 이해(Understanding) → 에이전트(Agency) 로의 이동이었습니다. 발표 논문과 워크숍에서 관찰한 네 가지 흐름을 공유드립니다.


① Agentic Document AI — 고정 파이프라인에서 오케스트레이션으로


파싱 → 검색 → 생성과 같은 고정 파이프라인 대신 중간 결과를 보고 다음 행동을 결정하는 에이전트 구조에 대한 연구가 늘었습니다.


  • CPAgent — 도구 증강 차트 파싱
  • REPLICA — 에이전트 기반 문서 충실 재구성
  • AdaNav — 질의 적응형 다중 granularity 긴 문서 탐색
  • 스프레드시트 에이전트 검색, 임상 보고서용 근거 기반 에이전트 추론
  • 박사과정 컨소시엄에 "Agentic Systems for Complex Document Understanding" 주제 등장


② Structure-aware RAG & 지식 표현 — 검색 단위의 재정의


검색 단위가 "텍스트 조각"에서 "구조가 보존된 근거" 로 옮겨가고 있었습니다. 저희 연구와 가장 가까운 트랙입니다.


  • HKGC — 계층적 지식 그래프 구조 인지 RAG
  • RAGXDoc — 구조화 지식 검색 + 설명 가능한 리랭킹
  • LMS-Retrieval — 레이아웃·모달리티·구조 인지 검색
  • From Chunks to Graphs — 학습 없는 멀티모달 late interaction (CVC)
  • ★ KT Evidence Unit — 문서 요소를 관계로 묶은 근거 단위


③ VLM 시대의 OCR — 범용 vs 특화


"낮은 CER만으로는 부족하다" 는 문제의식이 공유되면서, 평가축이 환각·강건성·효율로 확장되고 있었습니다.


  • DANIEL vs Qwen, TrOCR vs Qwen2.5-VL 정면 비교, VLM OCR 환각 분석
  • LiteDoc — 대형 문서 모델을 경량 태스크 인코더로 증류


④ 문서 레이아웃 구조 인식 — LLM 시대에도 구조가 신뢰의 핵심


  • Reading Order Inference for Complex Layouts
  • DC Award "Combining Images and GNNs" — 그래프 기반 필자 식별
  • TableSeq — 구조·내용·레이아웃 통합 생성
  • 페이지를 넘는 표 재구성
  • Identify–Locate–Link — end-to-end 키-값 추출 (IBM Docling팀)


Insight. 문서 AI는 단순 OCR·텍스트 청킹을 넘어, 구조를 이해하고 근거 단위로 정보를 보존하는 방향으로 빠르게 진화하고 있습니다. 동시에 고정 파이프라인보다 에이전트 기반 오케스트레이션과 구조 인식을 결합해 더 신뢰도 높은 검색·추론·응답을 만드는 것이 핵심 경쟁력이 되고 있습니다.


5. 맺음말과 다음 단계 


이미지

"A document is not just text to cut — it is evidence to keep together." 문서는 단순히 잘라낼 텍스트가 아니라, 함께 지켜야 할 근거입니다.

이번 ICDAR 2026에서 가장 크게 확인한 것은 문서 AI의 경쟁 지점이 "얼마나 정확히 읽는가"에서 "읽어낸 것을 어떤 단위로 보존하고 어떻게 이어 쓰는가"로 옮겨가고 있다는 점이었습니다. 키노트 세 편이 각각 다른 관점에서 같은 이야기를 했고, Structure-aware RAG 트랙 전체가 같은 방향을 가리키고 있었습니다.

저희가 제안한 Evidence Unit도 같은 흐름 위에 있습니다. 리트리버나 리더를 교체하지 않고 파서가 추출한 문서 요소를 의미적으로 재구조화하는 레이어만 추가해도 검색 Recall@1이 3.4배, DocVQA ANLS가 최대 17.9% 개선되었습니다. 이는 문서 요소를 어떤 의미 단위로 재구성하느냐가 검색과 답변 품질 모두에 중요한 영향을 준다는 것을 보여줍니다.

다음 단계로는 세 가지를 준비하고 있습니다.

  1. 문서·페이지를 넘는 EU — 상호참조와 인용 연결을 이용해 여러 페이지에 걸친 근거를 하나로 구성
  2. EU + 크로스인코더 리랭커 — 근거 단위 수준의 정밀 재정렬
  3. EU 수준 청킹 벤치마크 구축 — 현재는 청킹 품질을 직접 측정할 표준 벤치마크가 없어 LCS·MinK 같은 지표를 자체 정의해 사용했습니다. 이 부분을 공개 가능한 형태로 정리하는 것이 목표입니다.

앞으로도 학회 현장에서 얻은 인사이트를 DocuSee와 KT의 문서 AI 제품에 연결해 모델이 실제로 읽을 수 있는 완전한 근거 단위를 만드는 일에 기여하겠습니다. 끝까지 읽어주셔서 감사합니다.


함께한 사람들

Frontier AI Lab 조직의 천왕성(wangsung.chun), 박상민(ethan.park), 김민철(mincheol9166.kim), 나재민(jaemin.na), 사공락(rock.sakong), 송영택(yeongtaek.song), 안종길(jonggil.ahn), 정재협(jaehyup.jeong), 김선우(sw99.kim), 도우찬(woochan.do), 유혜원(hyewon.yoo), 윤기범(kibum.0927), 조문선(munsun.jo), 손소영(soyeong.sohn), 이채원(chaewon.lee9)이 함께했습니다. 시스템 개발 및 구축에 있어서 도우찬, 안종길님이 많은 도움을 주고 있습니다.


감사의 말

선행 연구부터 코어 엔진 개발, 각 엔진이 유기적으로 동작할 수 있는 파이프라인 구축, 그리고 실제 프로덕트 배포까지 전 과정을 함께 만들어 온 담당 한 분 한 분께 정말 감사드립니다. 덕분에 저희 담당은 연구 아이디어를 실제 서비스로 연결하고, 제품의 프로토타입에서 프로덕트까지 한계를 끌어올리는 값진 경험을 할 수 있었습니다. 함께해 주신 모든 담당원분들께 진심으로 감사의 말씀을 전합니다.

한연지

AI 기술을 통해 사람들의 삶을 더욱 풍요롭고 편리하게 만드는 데 기여하고 싶습니다

←이전 글
ICDAR 2026 발표논문 소개 및 연구 동향 공유 - kode