KT Agentic AI Lab A-Pattern부서는 Agentic Fabric[1]의 Intelligence Layer에서 핵심 구성 요소인 Model Router를 연구·개발하고 있습니다. 이전 Tech Article[2]에서는 Multi-LLM 운영 환경에서 LLM Gateway를 효율적으로 적용한 사례를 중심으로, Model Router의 서빙 관점에서의 엔지니어링 접근을 소개했습니다. 본 글에서는 Model Router의 개념과 해결하고자 하는 문제를 설명하고, KT가 제안하는 Model Router의 설계와 구조를 소개합니다.
Model Router 필요성
현재 우리는 KT의 믿:음 K 2.0, SOTA K, Llama K뿐 아니라 GPT, Gemini, Claude 등 다양한 LLM을 활용할 수 있습니다. 그러나 실제 LLM 서비스, Agent 서비스, 나아가 MAS(Multi-Agent Service)를 구현하는 과정에서 이들 모델을 효과적으로 활용하고 있는지에 대해 확인이 필요합니다.
LLM 응용 서비스를 개발하는 과정에서는 일반적으로 여러 LLM을 연동하여 비교·평가한 뒤, 서비스 목적에 가장 적합한 모델을 선정합니다. 이때 적합성의 기준은 단순한 응답 품질뿐 아니라 추론 비용까지 함께 고려되어야 합니다. 특히 상용 서비스를 전제로 할 경우, 추론 비용은 핵심 의사결정 요소가 됩니다. 다수의 LLM을 비교하는 것만으로도 품질과 비용 측면에서 일정 수준의 효율화가 가능하지만, 모든 사용자 요청을 단일 LLM로 처리하는 방식은 품질과 비용의 균형 측면에서 최적이라고 보기는 어렵습니다.
일반적으로 LLM은 파라미터, 학습 데이터, 연산량이 증가할수록 성능이 멱법칙(power law) 형태로 향상된다는 scaling law를 따릅니다[3, 4]. 동시에 모델 규모가 커질수록 추론 비용 역시 증가합니다. 그림 1의 LLM1~3은 이러한 scaling law를 따르는 모델들의 예시로, 비용과 품질 간에 양의 상관관계가 존재함을 보여줍니다. 물론, LLM4와 같이 다른 모델(=LLM2) 대비 비용은 높고 품질은 낮아 후보군에서 제외되는 경우도 있습니다. 결국, 사용자는 비용과 품질 간의 균형에 따라 LLM1~3 중 하나를 선택하게 됩니다. 이 때, 만약 사용자 요청의 특성에 따라 LLM을 동적으로 선택할 수 있다면, 단일 모델로는 달성하기 어려운 품질과 비용의 동시 최적화를 기대할 수 있습니다. 그림 1의 예시에서는 Model Router를 통해 기존 후보군 일부가 제외되며, 전체 비용–품질 공간에서 보다 효율적인 운영 지점에 도달할 수 있음을 보여줍니다. 이와 같이, Model Router의 목적은 다양한 LLM을 동적으로 조합하여 단일 LLM 대비 우수한 품질과 비용 효율을 동시에 달성하는 데 있습니다[5, 6].
그림1. LLM 간의 비용-품질 비교 예시
대표적인 모델 라우팅 방식 소개
Model Router가 사용자의 요청에 따라 동적으로 LLM을 선택하기 위한 방식은 크게 아래와 같습니다.
i. 사용자 선호 기반 라우팅
용자 선호 기반 라우팅은 <사용자 요청, LLM별 선호도> 데이터로 구성된 데이터를 활용하여 Routing Model을 지도학습하는 방식입니다. 직관적으로 설계하기 쉬우며, 카테고리 제약 없이 요청 단위로 세밀한 라우팅이 가능하다는 장점이 있습니다. 그러나 target LLM이 변경될 때마다 Router 재학습이 필요하다는 구조적 한계가 있으며, 고품질의 선호도 데이터를 대규모로 확보하기 어렵다는 현실적인 제약이 존재합니다.
대표적인 사용자 선호도 기반 Model Router에는 [7,8] 등이 있습니다.
그림2. 사용자 선호 기반 라우팅 과정
ii. 카테고리 기반 라우팅
카테고리 기반 라우팅은 사용자 요청을 사전에 정의된 카테고리로 분류한 뒤, 각 카테고리에 대응하는 LLM으로 매핑하는 방식입니다. 이를 위해서는 (1) 카테고리 정의, (2) Category Classifier 모델 개발, (3) 카테고리–LLM 매핑 정책 수립이 필요합니다. 이 방식은 분류 품질과 매핑 정책에 따라 전체 성능이 결정된다는 한계를 가지지만, Category Classifier가 target LLM과 loosely coupled 구조를 가지므로 상용 환경에서 LLM 교체에 유연하게 대응할 수 있습니다. 또한 <사용자 요청, category> 데이터는 선호도 데이터보다 확보가 용이하다는 장점이 있습니다.
대표적인 카테고리 기반 Model Router에는 [9, 10] 등이 있습니다.
그림3. 카테고리 기반 라우팅 과정
저희는 위 두 가지 관점 중, 상용 서비스가 가능한 ii. 카테고리 기반 라우팅 기법을 통해 Model Router를 구현하였습니다.
Model Router의 카테고리 구분
카테고리 기반 라우팅을 적용하는 Model Router의 구현은 카테고리 체계를 정의하는 것에서 출발합니다. 다양한 분류 기준이 존재하지만, 대표적으로 활용되는 기준은 다음과 같습니다.
- Dewey Decimal Classification (DDC)[11]: 도서관에서 사용하는 지식 분류 체계로, 모든 학문 분야를 10개 대분류로 나누고 숫자로 세분화해 체계적으로 정리하는 방식
- Bloom’s Taxonomy[12, 13]: 학습 목표의 인지적 난이도를 구분하는 교육 이론으로, 기억 → 이해 → 적용 → 분석 → 창조처럼 사고 수준을 단계적으로 구분하는 방식
Model Router는 Domain과 Level 기준에, LLM 평가 벤치마크에서 일반적으로 활용되는 Task 기준을 포함하여 카테고리를 3차원 구조(Task, Level, Domain)로 정의했습니다. 또한 각 차원은 세부 하위 카테고리로 구성하여 보다 정밀한 요청 분류가 가능하도록 설계했습니다[14].
- Task (12): Translation, Summarization, Math Problem Solving, Code Tasks, Text Editing, Image Generation, Creative Writing, Planning/Reasoning, Classification, Factoid QA, Chat, Unknown
- Domain (10): Mathematics/Statistics, Finance/Economics, Computing/Programming, Health/Medicine, Science/Technology, Law, Politics, Humanities/Society/Culture, Daily Life, Uncategorized
- Level (Level은 2가지의 타입 중 하나를 활용)
- Type1 (3): Easy, Intermediate, Hard 등의 1~3 Level
- Type2 (1): 하위 카테고리 값의 가중합
- Reasoning Depth & Steps
- Constraint/Requirement Density
- Accuracy/Verification Demand
- Domain Specificity
그림 4는 사용자 요청을 Task, Level, Domain 기준에 따라 분류한 예시를 보여줍니다.
그림4. 카테고리 기반 라우팅 예시
Model Router 소개
Model Router는 카테고리 기반 라우팅 기법을 적용한 구조로, 사용자 요청을 카테고리로 분류한 뒤 사전에 정의된 routing policy에 따라 여러 LLM 중 하나로 라우팅합니다. Routing policy는 {카테고리 → LLM} 형태의 매핑 정책으로, 특정 카테고리에 속하는 요청을 어떤 LLM으로 처리할 것인지 정의합니다.
구체적으로 이러한 처리를 담당하는 Model Router의 주요 구성 요소는 다음과 같습니다.
- TLD Classifier: 사용자의 요청을 입력 받아 Task, Level, Domain으로 구성된 카테고리를 생성
- 카테고리는 Routing Policy 생성 단계에서 Quality Evaluator에 전달되어, Task-specific LLM-as-a-Judge[15]를 선택하는데 사용됨
- 카테고리는 추론 단계에서 Routing Policy Optimizer를 통해 생성된 routing policy 정보에 따라 사용자의 요청을 LLM으로 라우팅하는데 사용됨 - Quality Evaluator: 최적의 LLM을 식별하기 위한 LLM 응답 품질 데이터를 생성
- Routing Policy Optimizer: Routing Policies 후보군을 생성하고, 그 중 품질/비용 관점의 Pareto-optimal routing policies 들을 식별하여 최적의 routing policy를 선택
1. Routing Policy 생성 단계
Routing policy 생성 단계는, 1-1.사용자 요청에 대응하는 LLM 별 품질/비용 정보를 획득하는 과정과 이를 바탕으로 구성할 수 있는 수많은 routing policy 후보군 중에서 1-2.품질/비용 관점의 최적 routing policy를 식별하는 과정으로 구성됩니다.
1-1. 품질/비용 정보 획득
Routing policy를 구성하기 위해서는 사용자 요청에 대응하는 LLM 별 품질/비용 정보가 필요합니다. 그림 5는 LLM 별 품질/비용 정보를 수집하는 과정을 나타냅니다.
- Step0: Routing Policy 를 정의하기 위한 User Query를 수집
- Step1: User Query를 target LLMs에 입력하여, 응답 데이터를 수집 (이 응답 데이터에 비용 정보 포함되어 있음)
- Step2: 카테고리 별 LLM-as-a-Judge를 활용하기 위해서 User Query를 카테고리로 분류
- Step3: 카테고리 별 LLM-as-a-Judge를 활용하여 <User Query, LLM Response> 쌍에 대한 품질 평가 수행
- 최종: User Query에 대한 LLM 별 품질/가격 정보 획득
상기 과정을 통해 수집한 정보를 활용하여 그림1과 같은 품질/비용 그래프를 구성할 수 있습니다.
그림5. 품질/비용 정보 획득 과정
1-2. Pareto-optimal Routing Policy 식별
사용자 요청의 특성에 따라 서로 다른 LLM을 선택하는 전략은, 단일 모델을 일괄 적용하는 방식보다 비용과 품질 측면에서 우수한 조합을 형성할 수 있습니다. 상대적으로 단순한 요청에는 경량 모델을 적용하여 비용을 절감하고, 복잡하거나 고난도의 요청에는 고성능 모델을 활용함으로써 전체 시스템 차원의 평균 품질을 유지하거나 향상시키면서 총 추론 비용을 낮출 수 있습니다. 이러한 상황은 비용과 품질이라는 두 목표를 동시에 고려하는 다목적 최적화 문제로 해석할 수 있습니다. 이때 한 목표를 개선하면서 다른 목표를 악화시키지 않는 해들의 집합이 형성되며, 이를 비용–품질 관점의 Pareto-optimal 상태라고 정의합니다[6, 17]. 그림 6은 target LLMs의 품질과 비용 정보를 통해 Pareto-optimal Routing Policies를 식별하는 과정을 도식화한 그림입니다.
- Step1: 1-1 품질/비용 획득 과정
- Step2: Routing policy 후보군들을 확보
- Routing policy는 {카테고리 → 하나의 LLM} 매핑이므로 LLM 4개를 가정한다면, 총 360 카테고리(10x12x3) 별 LLM 종류 4를 가만하여 4^360 개의 경우의 수를 가지는 routing policy가 존재할 수 있음 - Step3: 비용-품질 관점에서의 파레토 최적에 해당하는 routing policy들 만을 식별
- 파레토 최적에 해당하는 routing policy는 다른 모든 routing policy에 비해 품질 and/or 비용 관점에서 우위를 가지고 있는 최적의 routing policy 임 - Step4: 요구사항에 기반하여 파레토 최적 중 하나의 routing policy를 선택
- 단일 LLM으로는 도달하기 어려웠던 고품질·고효율의 운영 지점을 실현할 수 있음
그림6. Pareto-optimal Routing Policy 식별 과정
2. 라우팅 단계
Model Router는 사용자 질의를 수신하면 이를 실시간으로 분석하여 Task, Level, Domain 카테고리를 분류하고, 사전에 정의된 routing policy에 따라 적절한 LLM을 선택합니다. 이 과정에서 TLD Classifier는 라우팅 오버헤드를 최소화하면서도 정확하고 일관된 분류 성능을 유지해야 합니다. 즉, routing policy 생성 단계가 오프라인 최적화를 담당한다면, 라우팅 단계는 해당 정책을 실시간 환경에서 효율적으로 실행하는 온라인 추론 과정이라 할 수 있습니다.
Model Router에서는 사용자 질의의 길이와 복잡도에 따라 TLD Classifier를 Encoder 기반 모델(예: KoBigBird[18, 19])과 Decoder 기반 모델(예: Qwen-3-4B[20])을 혼합하여 운용합니다. Encoder 모델은 상대적으로 적은 리소스로 동작하며 빠른 추론이 가능하다는 장점이 있지만, 입력 컨텍스트 길이에 제약이 있습니다(예: 대형 BERT 계열 모델의 경우에도 약 8k 수준). 반면 Decoder 모델은 더 긴 입력 컨텍스트를 처리할 수 있으나, 연산량이 많아 상대적으로 추론 지연과 오버헤드가 증가하는 한계가 있습니다. TLD Classifier는 지도학습 기반으로 학습되며, 학습 데이터는 Teacher Model을 활용한 지식 증류(knowledge distillation) 방식으로 구축합니다[21].
그림7. 라우팅 과정
Model Router 적용 실험
Model Router의 성능을 검증하기 위해, 세 가지 GPT 계열 모델을 대상으로 실험을 수행했습니다.
- Dataset
- 출처: NIA-Helpfulness, KoAlpaca, Won-Instruct, HAERAE, OIG-small-chip2-ko, KoChatGPT, HRC 등
- 개수: calibration=1.5k, test=1.5k
- 샘플링 방식: TLD 카테고리를 고려한 부분 계층화 방식 - Target LLMs
- gpt-4.1
- gpt-4.1-mini
- gpt-oss-120b
Model Router의 성능 평가는 다음의 절차로 진행되었습니다. 먼저 calibration 데이터를 활용하여 Routing Policy를 생성하고, 이후 생성된 정책을 test 데이터에 적용하여 일반화 성능을 측정했습니다[5, 9]. 표1은 test 데이터에 대한 비용-성능 결과를, 그림 8은 calibration 데이터와 test 데이터 각각에 대한 비용–품질 결과를 보여줍니다. calibration 단계에서는 세 가지 GPT 모델의 비용·품질 지점과 함께 Pareto-optimal Routing Policy들이 외곽선 상에 표시되어 있습니다. 이 중 하나의 정책을 최종 선택하였으며, 해당 정책을 test 데이터에 적용한 결과를 단일 모델 성능과 함께 비교하였습니다.
실험 결과, Model Router는 GPT-4.1 대비 품질을 유지하면서(101%) 비용은 약 56% 수준으로 절감하는 결과를 보였습니다. 이는 단일 고성능 모델을 일괄 적용하는 방식 대비, 요청 특성에 따른 동적 라우팅 전략이 비용–품질 균형 측면에서 실질적인 개선을 달성했음을 시사합니다.
| Quality |
Cost |
|
|---|---|---|
| GPT-4.1 |
1289 |
5.45 |
| GPT-4.1-mini |
1253 |
0.978 |
| GPT-OSS-120b |
1258 |
1.73 |
| Model Router |
1296 (GPT-4.1 대비 101%) |
3.04 (GPT-4.1 대비 56%) |
Reference
- KT is targeting the corporate AI market by unveiling its AI (Artificial Intelligence Transformation). https://www.mk.co.kr/en/it/11976000
- KT. 2025. Multi LLM 운영 환경을 위한 효율적인 LLM Gateway 적용 사례. KODE Tech Blog. https://kode.kt.com/blog/article/8119
- Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., & Amodei, D. (2020). Scaling laws for neural language models. arXiv.
- Hoffmann, J., Borgeaud, S., Mensch, A., Buchatskaya, E., Cai, T., Rutherford, E., … Sifre, L. (2022). Training compute-optimal large language models. arXiv.
- Chen, L., Zaharia, M., & Zou, J. (2023). FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance. arXiv.
- Šakota, M., Peyrard, M., & West, R. (2024). Fly-Swat or Cannon? Cost-Effective Language Model Choice via Meta-Modeling. In Proceedings of the 17th ACM International Conference on Web Search and Data Mining (WSDM 2024) (pp. 606–615). Association for Computing Machinery.
- Ong, I., Almahairi, A., Wu, V., Chiang, W.-L., Wu, T., Gonzalez, J. E., Kadous, M. W., & Stoica, I. (2024). RouteLLM: Learning to Route LLMs with Preference Data. arXiv.
- Lu, K., Yuan, H., Lin, R., Lin, J., Yuan, Z., Zhou, C., & Zhou, J. (2023). Routing to the expert: Efficient reward-guided ensemble of large language models. arXiv.
- Hu, Q. J., Bieker, J., Li, X., Jiang, N., Keigwin, B., Ranganath, G., Keutzer, K., & Upadhyay, S. K. (2024). RouterBench: A benchmark for multi-LLM routing system. arXiv.
- Lu, Y., Liu, R., Yuan, J., Cui, X., Zhang, S., Liu, H., & Xing, J. (2025). RouterArena: An open platform for comprehensive comparison of LLM routers. arXiv.
- Dewey, M. (1876). A classification and subject index for cataloguing and arranging the books and pamphlets of a library. (Centennial facsimile text). Forest Press Division, Lake Placid Educational Foundation.
- Bloom, B. S., Engelhart, M. D., Furst, E. J., Hill, W. H., & Krathwohl, D. R. (1956). Taxonomy of educational objectives: The classification of educational goals. Handbook I: Cognitive domain. David McKay.
- Anderson, L. W., & Krathwohl, D. R. (Eds.). (2001). A taxonomy for learning, teaching, and assessing: A revision of Bloom’s taxonomy of educational objectives. Longman.
- Lu, Y., Liu, R., Yuan, J., Cui, X., Zhang, S., Liu, H., & Xing, J. (2025). RouterArena: An open platform for comprehensive comparison of LLM routers. arXiv.
- Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., … Stoica, I. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. arXiv.
- Hari, S. N., & Thomson, M. (2023). Tryage: Real-time, intelligent routing of user prompts to large language models. arXiv.
- Liu, Y., Zhang, H., Miao, Y., Le, V.-H., & Li, Z. (2024). OptLLM: Optimal assignment of queries to large language models. In Proceedings of the IEEE International Conference on Web Services (ICWS 2024) (pp. 788–798). IEEE.
- Yang, K., Jang, Y., Lee, T., Seong, J., Lee, H., Jang, H., & Lim, H. (2023). KoBigBird-large: Transformation of transformer for Korean language understanding. In Proceedings of the 13th International Joint Conference on Natural Language Processing and the 3rd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 1058–1066). Association for Computational Linguistics.
- Warner, B., et al. (2024, December 19). Finally, a replacement for BERT: Introducing ModernBERT. Hugging Face Blog.
- Qwen Team. (2024). Qwen3-7B Technical Report. Alibaba Cloud / Qwen.
- Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv.