Dev Stories

로봇에게 눈과 귀, 그리고 판단력을 — On-Device VLA Agent 개발기

안녕하세요. KT ITOps 본부에서 K RaaS 플랫폼의 VLA Agent를 개발하고 있는 이진혁 선임입니다.


들어가며

이 글에서는 로봇이 사람처럼 보고, 듣고, 판단하고, 행동하기 위해 필요한 기술인 VLA Agent(Vision-Language-Action Agent)가 무엇인지, 그리고 K RaaS 플랫폼에서 "Bring Intelligence to Every Robot" 이라는 비전 아래, 이를 어떻게 로봇 폼팩터에 상관없이 탑재 가능한 On-Device 형태로 구현했는지를 소개하고자 합니다. 로봇 서비스에 AI를 접목하는 데 관심이 있는 분이라면, 멀티모달 에이전트의 설계 철학부터 실제 서비스 적용까지의 여정에서 실질적인 인사이트를 얻으실 수 있을 것입니다.



1. 로봇은 왜 아직 '똑똑하지' 않은가

최근 몇 년간 대규모 언어모델(LLM)의 발전은 눈부셨습니다. AI는 이제 사람의 말을 이해하고, 이미지를 분석하며, 복잡한 추론까지 수행할 수 있습니다. 그러나 한 가지 질문을 던져볼 필요가 있습니다. "AI가 사람의 말도 이해하고 이미지도 분석할 수 있는 시대인데, 왜 로봇은 아직도 눈앞의 고객이 무엇을 원하는지 스스로 파악하지 못하는 걸까?"


그 이유는 로봇의 두뇌에 해당하는 부분에 있습니다. 기존의 로봇 시스템에도 카메라, 마이크, 네비게이션 등 다양한 모듈이 탑재되어 있습니다. 문제는 이 모듈들을 누가, 어떻게 연결하느냐입니다. 기존 방식에서는 개발자가 사전에 모든 시나리오를 예측하고, "카메라에 사람이 감지되면 → 인사 음성을 재생하고 → 정해진 좌석으로 이동한다" 와 같은 규칙을 하나하나 직접 프로그래밍합니다. 로봇은 이 스크립트를 충실히 따를 뿐, 예상하지 못한 상황에서는 아무런 판단도 내리지 못합니다.


사람이 서비스하는 방식을 떠올려 보면 차이가 분명합니다. 레스토랑 직원은 고객이 들어오면 눈으로 일행의 인원수와 특성을 파악하고, 말을 걸어 요구를 듣고, 그에 맞는 행동을 즉석에서 판단합니다. 어린 자녀를 동반한 가족이라면 안전한 안쪽 자리를 안내하고, 외국인 고객이 영어로 말을 걸면 영어로 응대합니다. 이 모든 판단은 사전에 프로그래밍된 것이 아니라, 여러 감각에서 들어오는 정보를 종합하여 상황을 이해하고, 그에 맞는 행동을 직접 선택한 결과입니다.


로봇에게 이와 같은 능력을 부여하기 위해 등장한 개념이 바로 VLA Agent(Vision-Language-Action Agent) 입니다.



2. VLA Agent란 무엇인가

VLA Agent는 이름 그대로 시각(Vision), 언어(Language), 행동(Action) 세 가지 역량을 갖춘 지능형 에이전트입니다. 

에이전트 중심의 설계


역량

에이전트에게 제공하는 것

비유

Vision

시각 정보 — 공간의 구조를 파악하고, 사람의 특징을 이해

Language

대화 능력 — 고객의 말을 이해하고 응답을 생성

귀와 입

Action

행동 수단 — 이동, 안내, 물건 전달 등 물리적 동작

팔과 다리


기존 로봇이 "정해진 순서대로 모듈을 실행하는 파이프라인" 이었다면, VLA Agent는 "AI가 상황을 판단하고, 필요한 행동을 스스로 선택하여 활용하는 구조" 입니다. VLA Agent의 AI 에이전트는 매 순간 어떤 행동을 취할지 자율적으로 결정합니다.


이러한 구조가 가능한 이유는, VLA Agent가 여러 종류의 정보를 동시에 이해하는 멀티모달(Multimodal) 방식으로 상황을 파악하기 때문입니다. 카메라로 본 영상, 마이크로 들은 음성, 센서로 감지한 위치 정보 등 서로 다른 형태의 정보가 하나의 에이전트 안에서 통합되어, 단일 감각으로는 불가능한 종합적인 상황 이해를 가능하게 합니다.


예를 들어, "여러 명의 고객이 함께 입장하고 있다"는 것을 인식하려면 시각(인원수와 동행 구성 파악)과 공간 정보(입구 방향에서 접근 중)가 동시에 필요합니다. "영어로 메뉴를 문의하는 고객"을 이해하려면 음성(영어 인식)과 시각(고객이 메뉴판을 가리키고 있음) 정보가 결합되어야 합니다. VLA Agent는 이처럼 여러 모달리티를 동시에 활용하여 하나의 맥락으로 이해하고, 그 맥락에 기반하여 다음 행동을 결정합니다.


01.jpg

그림 1. VLA Agent — AI 에이전트가 중심에서 Vision, Language를 기반으로 상황에 따라 Action을 활용



3. K RaaS 플랫폼과 On-Device VLA Agent

KT의 K RaaS 플랫폼은 로봇 폼팩터에 상관없이 탑재 가능한 On-Device VLA Agent를 제공합니다. 서빙 로봇, 안내 로봇, 배송 로봇, 휴머노이드 등 다양한 형태의 로봇에 동일한 VLA Agent를 탑재하여, 로봇이 자율적으로 고객과 상호작용할 수 있도록 설계되었습니다.


. 핵심 특징

K RaaS VLA Agent는 다음 세 가지 원칙을 기반으로 설계되었습니다.


첫째, AI 에이전트 중심의 오케스트레이션. 기존 로봇 시스템에서는 개발자가 모듈 간의 연결을 사전에 규칙으로 정의했습니다. K RaaS VLA Agent에서는 이 역할을 AI 에이전트가 대신합니다. 에이전트가 상황을 멀티모달로 이해하고, 필요한 모듈을 그때그때 선택하여 호출합니다. 이를 통해 사전에 예측하지 못한 상황에서도 유연하게 대응할 수 있으며, 새로운 기능이 추가되더라도 에이전트가 이를 도구로 인식하여 자연스럽게 활용할 수 있습니다.


둘째, On-Device 기반. 핵심 추론은 로봇 디바이스에서 수행하고, 클라우드는 보조적 역할로 한정합니다. 이를 통해 네트워크 장애 상황에서도 기본적인 서비스가 유지되며, 고객 음성이나 영상 데이터가 외부로 전송되지 않아 프라이버시를 보호합니다.


셋째, 폼팩터 무관성. VLA Agent의 소프트웨어 아키텍처를 하드웨어로부터 분리하여, 서빙 로봇이든 안내 로봇이든 휴머노이드든 동일한 에이전트 소프트웨어를 탑재할 수 있습니다. 로봇의 물리적 행동(Action)만 폼팩터에 맞게 추상화하면 됩니다.


02.jpg

그림 2. K RaaS VLA Agent 핵심 특징 — AI 에이전트 중심 오케스트레이션, On-Device 기반, 폼팩터 무관성


②. Robot MCP — 로봇의 능력을 도구로 정의하다

K RaaS VLA Agent의 핵심 설계 요소 중 하나는 Robot MCP(Model Context Protocol) 입니다. Robot MCP는 로봇이 보유한 다양한 능력을 AI 에이전트가 호출할 수 있는 표준화된 도구(Tool) 형태로 정의하는 계층입니다.


일반적인 MCP가 LLM에게 웹 검색이나 데이터베이스 조회와 같은 디지털 도구를 제공한다면, Robot MCP는 여기에 더해 좌석 검색, 고객 정보 조회, 로봇 Action 명령, 시각 정보 업데이트 등 로봇 서비스에 특화된 도구를 제공합니다. AI 에이전트는 대화의 맥락과 멀티모달 상황 이해를 바탕으로, 이 도구들 중 적절한 것을 스스로 선택하여 호출합니다.



03.jpg

그림 3. Robot MCP 구조 — 로봇의 능력이 도구로 정의되고, AI 에이전트가 상황에 따라 선택적으로 호출



4. VLA Agent는 어떻게 작동하는가 — 실제 서비스 시나리오

추상적인 아키텍처만으로는 VLA Agent의 작동 방식을 이해하기 어렵습니다. 레스토랑 서빙 로봇을 예시로, 고객이 입장하는 순간부터 좌석 안내까지의 전체 흐름을 살펴보겠습니다. 이 시나리오에서 주목할 점은, 각 단계에서 에이전트가 모달리티를 통합하여 어떻게 활용하는지입니다.

①. 고객 인식 — 에이전트가 "눈"을 사용하는 순간

VLA Agent는 Vision 정보를 통해 주변을 지속적으로 관찰하며 다음과 같은 정보를 활용 가능합니다.


  • 사람 감지 및 특징 파악: 시야 내 사람의 수와 위치를 파악하고, 동행 구성(성인, 어린이 등)이나 소지품 같은 고객의 특성을 인식합니다.

  • 공간 맥락 이해: 현재 로봇 주변의 공간 상태 — 빈 좌석 위치, 통로 혼잡도, 고객의 접근 방향 등을 파악합니다.

  • 시선 및 제스처 인식: 얼굴과 손의 움직임을 분석하여 고객이 로봇에게 관심을 보이고 있는지 판단합니다.


에이전트는 이 시각 정보들을 종합하여 "고객이 서비스를 원하고 있다" 고 판단하고, 사용자의 음성 Input을 받아 대화를 시작할 수 있습니다. 여기서 핵심은, 대화를 시작할지 말지를 사전에 정해진 규칙이 아니라 에이전트가 멀티모달 정보를 종합하여 자율적으로 판단한다는 점입니다.

②. 대화와 의사결정 — 에이전트가 "도구"를 고르는 순간

고객의 음성이 텍스트로 변환되어 에이전트에게 전달되면, VLA Agent는 이 음성 정보와 이미 확보한 시각 정보를 결합하여 상황을 이해합니다.


예를 들어, 고객이 "4명이서 왔는데, 창가 자리 있어요?" 라고 말하면, 에이전트는 Robot MCP에 정의된 도구 중 좌석 검색 도구가 필요하다고 판단합니다. 이때 에이전트는 이미 파악한 시각 정보(동행자 수와 구성, 유모차 유무 등 고객 특성)도 함께 고려하여 더 정확한 검색 조건을 구성합니다.


  1. 에이전트 판단: 음성과 시각 정보를 종합하여 "좌석 검색이 필요하다"고 결정

  2. 도구 선택: Robot MCP의 좌석 검색 도구를 호출하여 4인 창가 좌석 조회

  3. 고객 확인: 로봇 음성을 통해 고객에게 안내 ("Table-5 창가석으로 안내할까요?")

  4. 응답 분석: 고객의 응답을 분석하여 후속 행동 결정


이처럼 에이전트가 매 순간 어떤 도구를 사용할지 스스로 결정하는 것이 기존의 규칙 기반 로봇과의 결정적인 차이입니다.

③. 물리적 행동 — 에이전트가 "손과 발"을 사용하는 순간

고객이 좌석 안내에 동의하면, 에이전트는 이번에는 Robot MCP의 로봇 Action 도구를 선택합니다. 이때 에이전트가 내리는 명령은 "Table-5로 고객을 안내하라" 라는 추상적인 형태입니다. 이 추상적 명령이 로봇에 전달되면, 이를 구체적인 네비게이션 경로와 모터 제어 신호로 변환하여 실행합니다.


이 전체 과정에서 에이전트는 V, L, A를 상황의 흐름에 따라 활용했습니다. 눈(Vision)으로 고객과 공간을 파악하고, 귀(STT)로 요청을 듣고, 머리(LLM)로 판단하며, 입(TTS)으로 확인하고, 발(Action)로 안내하는 — 사람의 자연스러운 서비스 흐름과 닮은 과정입니다.



5. 멀티모달 상황 이해 — VLA Agent의 핵심 역량

VLA Agent가 기존 로봇과 근본적으로 다른 점은, 여러 감각 채널의 정보를 하나의 맥락으로 통합하여 상황을 이해한다는 것입니다. 이것이 멀티모달 상황 이해이며, VLA Agent의 가장 핵심적인 역량입니다.

단일 모달리티의 한계

카메라만으로는 "저 사람이 무엇을 원하는지" 알 수 없습니다. 마이크만으로는 "말하는 사람이 어디에 있는지" 파악할 수 없습니다. 각각의 감각은 단편적인 정보만 제공합니다.

멀티모달 통합의 힘

VLA Agent는 이 단편적인 정보들을 조합하여 풍부한 상황 인식을 만들어냅니다.


상황

Vision으로 보는 것

Voice로 듣는 것

에이전트의 종합 판단

외국인 고객 입장

성인 2명, 큰 여행 가방

영어 발화

"영어 응대, 짐 보관 안내 후 좌석 안내"

단골 고객 방문

1명, 빈 좌석 3개 확인

"항상 앉던 자리로 부탁해요"

"고객 정보 조회 후 선호 좌석 안내"

비언어적 도움 요청

고객이 주위를 두리번거림

(발화 없음)

"도움이 필요한 상황, 먼저 말 걸기"


세 번째 사례가 특히 흥미롭습니다. 고객이 아무 말도 하지 않았지만, 감지한 비언어적 신호(두리번거리는 행동)만으로도 에이전트는 "도움이 필요한 상황"이라고 판단하고, 먼저 다가가 말을 걸 수 있습니다. 이는 음성 입력에만 의존하는 기존 로봇에서는 불가능한 대응입니다.


이처럼 VLA Agent의 멀티모달 이해는 단순히 "여러 입력을 받는 것"이 아니라, 여러 입력을 하나의 상황 인식으로 융합하여 더 나은 판단을 내리는 것입니다.



6. On-Device의 의미 — 왜 로봇 위에서 직접 구동하는가

VLA Agent를 클라우드가 아닌 로봇 디바이스 위에서 직접 구동하는 것은 단순한 기술적 선택이 아니라, 서비스 품질과 직결되는 전략적 결정입니다.

실시간 응답성

레스토랑에서 고객이 다가왔을 때, 로봇이 2~3초 뒤에 반응한다면 자연스러운 상호작용이 성립하지 않습니다. On-Device 처리는 네트워크 왕복 지연을 제거하여, 수백 밀리초 이내의 즉각적인 반응을 가능하게 합니다. 특히 고객의 특징을 파악하고 공간 상태를 분석하는 과정은 프레임 단위의 실시간 처리가 필수적이므로, On-Device 구동의 이점이 가장 크게 드러나는 영역입니다.

네트워크 독립성

로봇이 운용되는 현장(레스토랑, 호텔, 병원 등)의 네트워크 환경은 항상 안정적이지 않습니다. Wi-Fi 간섭, 일시적 네트워크 장애, 대역폭 제한 등 다양한 변수가 존재합니다. On-Device VLA Agent는 네트워크 상태와 무관하게 핵심 기능을 유지하여, 서비스 안정성을 확보합니다.

데이터 프라이버시

카메라로 촬영된 고객의 영상, 마이크로 수집된 음성 등 민감한 데이터가 디바이스 밖으로 전송되지 않습니다. 모든 처리가 로봇 내부에서 완결되므로, 개인정보 보호 규정 준수가 구조적으로 보장됩니다.


표 1. 클라우드 방식과 On-Device 방식 비교

비교 항목

클라우드 방식

On-Device 방식

응답 지연

수백 ms ~ 수 초

수십 ~ 수백 ms

네트워크 의존

높음 (장애 시 서비스 중단)

낮음 (독립 운용 가능)

프라이버시

데이터 외부 전송 필요

디바이스 내 처리 완결

운용 비용

API 호출 비용 누적

초기 디바이스 비용만 발생

확장성

서버 증설 필요

로봇 단위 독립 확장



7. 폼팩터 무관 탑재 — 하나의 에이전트, 다양한 로봇

K RaaS VLA Agent의 또 다른 핵심 가치는 로봇의 형태와 무관하게 동일한 에이전트를 탑재할 수 있다는 점입니다.

이를 가능하게 하는 핵심 설계는 Action 추상화 계층입니다. VLA Agent 내부에서 VLA Agent가 내리는 판단("좌석 A로 안내하라")은 추상적인 명령 형태로 표현됩니다. 이 추상적 명령이 Action으로 전달되면, 각 로봇의 하드웨어 특성에 맞는 구체적인 동작으로 변환됩니다.


예를 들어, 동일한 "좌석 A로 안내" 명령이라 하더라도:

  • 서빙 로봇은 바퀴를 이용한 자율주행으로 경로를 따라 이동하고,

  • 안내 로봇은 팔을 들어 방향을 가리키며 음성으로 안내하고,

  • 휴머노이드는 고객 곁으로 걸어가 자연스러운 제스처와 함께 직접 에스코트합니다.


에이전트의 두뇌(VLA Agent)와 감각(Vision, Voice)은 공유하되, 행동 수단(Action)만 로봇 폼팩터에 맞게 교체하는 구조입니다. Robot MCP에 해당 로봇의 Action 도구만 새로 등록하면, 에이전트 전체를 새로 개발할 필요 없이 새로운 유형의 로봇에 곧바로 탑재할 수 있습니다.

04.jpg

그림 4. 폼팩터 무관 탑재  — 에이전트의 두뇌와 감각은 공유, Action만 로봇에 맞게 교체



맺음말

VLA Agent는 로봇이 단순한 자동화 장치를 넘어, 상황을 이해하고 자율적으로 판단하는 지능형 서비스 제공자로 진화하기 위한 핵심 기술입니다.


이 글에서 소개한 내용을 정리하면 다음과 같습니다.


  • VLA Agent는 AI 에이전트를 중심으로 Vision, Language 정보를 통합하여 상황에 따라 선택적으로 행동하는 지능입니다.

  • 멀티모달 상황 이해를 통해 단일 감각으로는 불가능한 종합적 판단을 내리며, 이것이 기존 규칙 기반 로봇과의 근본적인 차이입니다.

  • Robot MCP를 통해 로봇의 능력을 표준화된 도구로 정의하여, 에이전트가 자율적으로 활용하고 새로운 기능을 유연하게 확장할 수 있습니다.

  • On-Device 구동으로 실시간 응답성, 네트워크 독립성, 데이터 프라이버시를 동시에 확보합니다.

  • 폼팩터 무관 설계로 다양한 로봇에 동일한 에이전트를 탑재할 수 있어, 확장성과 유지보수 효율성을 극대화합니다.

후속 계획

저희는 현재 다음과 같은 방향으로 VLA Agent를 고도화하고 있습니다.

  1. 감정 인식 통합: 고객의 표정과 음성 톤을 분석하여 감정 상태를 파악하고, 이에 맞춘 응대 전략을 적용합니다. 이 역시 멀티모달 이해의 확장입니다.

  2. R2R(Robot to Robot) 협업 : VLA Agent가 탑재된 여러 로봇이 서로 상황 정보를 교환하며, 역할을 분담하고 자율적으로 협업하는 R2R 구조를 고도화합니다.


로봇이 사람과 자연스럽게 상호작용하는 미래는 더 이상 먼 이야기가 아닙니다. VLA Agent가 그 미래를 한 발 앞당기는 데 기여할 수 있기를 기대합니다. 


VLA Agent 외에도, 아래 링크를 통해 K RaaS Physical AI 생태계를 구성하는 주요 서비스들을 확인하실 수 있습니다.

  1. K RaaS(Robot as a Service) Platform
  2. K RaaS R2R(Robot to Robot) Agent
  3. K RaaS Order/Delivery Agent

References

  1. Brohan, A., et al. "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control." arXiv preprint arXiv:2307.15818, 2023.

  2. Xiao, B., et al. "Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks." arXiv preprint arXiv:2311.06242, 2023.

  3. Radford, A., et al. "Robust Speech Recognition via Large-Scale Weak Supervision." Proceedings of ICML, 2023.

  4. Model Context Protocol Specification. Anthropic. What is the Model Context Protocol (MCP)? - Model Context Protocol



이진혁

ITOps 본부에서 Physical Device 에 탑재되는 Multimodal AI Agent 관련 기술 연구 및 개발을 담당하고 있습니다.

이전 글