AI 에이전트가 손으로 가리키는 시대, XR 속 'AgentHands' 이야기

Interactive Physical AI... 인간처럼 AI가 '행동'하려면 여러 기술이 필요하다고 생각했는데요. 하나씩 퍼즐이 맞춰지는 것 같네요. 빠르면 2년 안에?

쉬운 설명

주방에서 누군가 "왼쪽 기름 써"라고 했는데 기름병이 나란히 두 개 놓여 있다면 무척 헷갈리죠. 이럴 때 손가락으로 딱 가리켜주면 단번에 이해할 수 있는데요. AgentHands는 바로 이런 답답함을 해결하기 위해 나온 연구예요. XR(확장현실) 헤드셋을 쓴 사용자가 눈앞의 물건에 대해 AI에게 물어보면, AI가 말로만 답하는 대신 진짜 사람 손처럼 생긴 가상의 손을 띄워 직접 가리키거나 짚어주면서 설명해 줍니다. 말과 손짓이 동시에 딱 맞아떨어지니 헷갈릴 일이 확 줄어드는 거죠.

요약

이번에 소개해 드릴 AgentHands는 구글 XR Labs 연구팀이 발표한 논문으로, 인간-컴퓨터 상호작용(HCI, 사람과 컴퓨터가 더 편하게 소통하는 방법을 연구하는 분야) 분야에서 최고 권위를 자랑하는 학회인 CHI 2026에 채택되었습니다. 제1저자인 Ziyi Liu는 퍼듀(Purdue) 대학교 소속이자 구글 학생 연구원으로 이번 연구에 참여했는데요. 연구팀은 기존 대화 방식의 문제를 "정신적 매핑 간극"이라고 표현했어요. 쉽게 말해 AI가 "왼쪽에 있는 거요"라고 말했을 때, 사용자가 머릿속으로 '정확히 어떤 물건을 말하는 거지?'라며 다시 한번 추측하고 맞춰봐야 하는 번거로움이 생긴다는 뜻입니다.

지금까지의 대화형 AI 에이전트는 주로 텍스트나 음성으로만 답을 줬습니다. 하지만 눈앞에 실제나 가상의 물체가 여러 개 놓인 XR 환경에서는 말만으로 대상을 콕 집어 설명하기가 쉽지 않죠. AgentHands는 이 문제를 풀기 위해 LLM(거대언어모델, 챗GPT 같은 AI 대화 모델)이 답변을 만들 때 손동작 신호(이벤트)를 함께 생성하도록 설계했습니다. 즉, 답변 속에 '이 타이밍에 바로 이 물체를 가리켜라'라는 명령이 함께 들어가서 가상의 손이 해당 물체 위에서 직접 움직이게 만든 거예요. 이렇게 하면 사용자가 헷갈릴 위험도 줄고, AI와의 대화도 훨씬 자연스러워진다는 것이 연구팀의 설명입니다.

활용 포인트

개발자분들이라면 이 연구를 XR 기반 비서 기능이나 AR 내비게이션 앱에 접목해 볼 수 있습니다. 예를 들어 창고에서 물건 찾기를 돕는 AR 앱을 만들 때, 단순히 "오른쪽 세 번째 칸"이라고 글자로 띄우는 대신 가상의 손 모델이 그 칸을 직접 짚어주도록 UX를 한 단계 끌어올릴 수 있죠. 기획자나 제품 매니저(PM) 입장에서는 음성 안내 위주였던 스마트 글라스나 XR 기기에 '제스처 동기화'라는 새로운 기능을 추가 기획 아이템으로 검토해 볼 만합니다. 교육 콘텐츠 제작자라면 실험 기구 사용법이나 조립 매뉴얼을 다룰 때, AI 튜터가 부품을 하나하나 손으로 짚어가며 가르쳐주는 방식을 참고해 볼 수도 있겠네요.

학습자나 일반 독자 입장에서는 지금 당장 써볼 수는 없지만, 앞으로 스마트 글라스나 XR 헤드셋 속 AI 비서가 어떤 모습으로 진화할지 미리 엿볼 수 있는 흥미로운 사례예요. 평소 기술 연구나 논문에 관심이 많으시다면, CHI 학회에 실린 HCI 논문들을 둘러보며 'LLM+제스처' 같은 키워드로 비슷한 연구들을 함께 찾아보는 것도 최신 흐름을 파악하는 데 큰 도움이 됩니다.

주의 사항

이 연구는 CHI 2026 학회에 발표(예정 또는 채택)된 논문으로, 아직 실제 시판 제품에 적용된 기술은 아닙니다. 실제 XR 헤드셋 기기 성능, 손 모델링을 실시간으로 구현하는 속도, 조명 변화나 물체 인식 오류 같은 다양한 현실 환경에서의 안정성은 논문 속 실험 환경과 다를 수 있어 상용화까지는 추가 검증이 필요해 보여요. 아울러 원문 자료 중 일부(논문 PDF 파일)는 본문 텍스트가 정상적으로 추출되지 않아, 세부적인 실험 방법이나 구체적인 수치 지표까지는 이번 글에서 모두 확인하지 못했다는 점도 미리 참고해 주세요.

자체 검증

원문 자료(디스커스 파이토치 게시글, 구글 리서치 페이지, CHI 2026 논문 PDF)를 꼼꼼히 대조해 본 결과, 연구팀이 구글 XR Labs 소속이라는 점, 제1저자인 Ziyi Liu가 퍼듀 대학교 소속이자 구글 학생 연구원으로 참여했다는 점, 그리고 CHI 2026 학회에 채택된 논문이라는 점은 자료 1(디스커스 글)을 통해 사실로 확인했습니다. 다만 '정신적 매핑 간극'이라는 표현 뒤에 이어지는 구체적인 시스템 구조나 실험 결과, 수치 지표 등은 자료 1의 본문이 중간에 끊겨 있고, 자료 2(구글 리서치 페이지)는 팀 소개 문구 위주이며, 자료 3(PDF)은 텍스트가 정상 추출되지 않아 이번 글에서는 명확히 확인하기 어려웠습니다. 따라서 본문에서는 확인 가능한 사실만을 담았으며, 세부적인 기술 구현 방식은 억측을 피해 이해하기 쉬운 일반적 수준으로 정리했습니다.

태그

#AI #XR #HCI #제스처인식 #CHI2026 #구글리서치 #확장현실

원문

참고자료

← 새정보 전체 보기