실시간 음성 AI 응답 지연이 100ms대로——전화 창구·의료 문진에서 실서비스 도입 급증
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

음성 AI가 '대화로 성립할 수 있는 속도'에 가까워지고 있다. 평균 응답 지연이 120ms 전후까지 단축되면서 인간 간 대화에 가까운 경험이 실현되고 있다. 2026년 8월, X(트위터)에서는 현장 엔지니어들의 "전환했더니 완전히 다른 물건이었다"는 보고가 잇따르고, 전화 콜센터와 의료 문진 두 영역에서 실서비스 도입이 급속도로 가속화되고 있다.
여러 AI 인프라 기업이 음성 에이전트의 응답 지연을 100150ms로 억제한 제품을 잇달아 업데이트했다. GPT-4o 음성 모드 초기 버전이 가지고 있던 평균 400600ms와 비교하면 3~5배 단축된 수치다.
지연 단축의 주요 원인은 두 가지다. 하나는 '음성→텍스트→LLM→텍스트→음성'이라는 변환 파이프라인을 버리고, 음성을 LLM에 직접 입력하는 엔드투엔드 모델로의 전환. 다른 하나는 KV 캐시(과거 추론 결과를 재활용하는 구조)의 효율화와 저지연 추론 전용 배치 구성이다.
"지난주부터 실서비스로 전환했는데, 사용자들의 '어?' 하는 반응이 사라졌어요. 지연이 신경 쓰이지 않게 된 순간은, 의외로 명확하게 알 수 있더라고요"
(모 SaaS 기업 테크 리드, X에서)
음성 AI의 지연 문제는 2024년경부터 '마지막 UX의 벽'으로 업계에서 거론되어 왔다. 인간은 대화 상대의 응답이 200ms를 넘으면 미묘한 위화감을 느끼고, 400ms를 넘으면 "사이가 길다"고 인식한다는 사실이 심리음향학 연구에서 밝혀져 있다.
이 벽에 정면으로 도전해 온 것이 2025년 하반기부터 급성장한 실시간 음성 특화 스타트업 군으로, 대형 기업과는 다른 레이어에서 레이턴시 경쟁이 진행되어 왔다. 국내에서는 2026년 1분기부터 금융·보험 콜센터용 도입이 가속화되어, 6월 말 기준 대형 콜센터 사업자의 약 68%가 음성 AI 제품을 평가 중이라는 조사 결과도 나왔다.
직접 사용해보지 않으면 알 수 없는 감각이지만, 400ms 시대와 120ms 시대를 나란히 놓으면 "상대가 생각하고 있다"에서 "대화가 흘러가고 있다"로 바뀐다. 이는 UX의 문제인 동시에, 도입 여부를 결정하는 판단 기준 자체가 바뀌는 전환점이기도 하다.
지연 단축으로 여러 병원이 초진 문진 보조에 음성 AI를 활용하는 실증을 시작했다. 표준화된 문진 흐름의 자동 기록에서 진료 시간이 평균 8~12분 단축됐다는 초기 데이터가 보고되고 있다. 정확도뿐 아니라 속도까지 갖춰지면서, 의사들의 수용도가 달라지기 시작했다.
엔드투엔드 모델은 계산 비용이 높은 경향이 있지만, 추론 효율화로 인해 분당 처리 비용이 2025년 대비 약 40% 감소했다. 콜센터 환산으로는 유인 대응 대비 월간 비용을 55~65% 절감할 수 있다는 시산도 나오고 있어, ROI 계산의 전제가 바뀌어가고 있다.
이게 소소해 보여도 꽤 크게 작용하는데——관서 사투리나 도호쿠 사투리에서는 표준어 대비 인식 정확도가 5~15포인트 떨어진다는 벤치마크 결과가 여러 평가에서 나오고 있다. 의료나 행정 창구로의 전개에서는 사투리 대응이 실용화의 분기점이 된다. 벤치마크상으로는 고정확도지만, 구현 단계에서는 지역에 따라 별개 제품 얘기가 되는 경우가 많다.
음성 데이터는 생체 정보에 가까운 성질을 지닌다. 의료·금융으로의 전개가 진행되면서, 음성 로그의 보유 기간·로컬 처리 가능 여부·동의 흐름이 규제의 초점이 되고 있다. EU AI법 시행에 맞춘 대응이 2026년 내에 본격화될 전망이며, 국내 기업도 대응 설계를 서두르고 있다.
SI 업체 시절, 음성 인식을 시스템에 통합하려다 포기한 경험이 있다. 당시의 벽은 '정확도'보다 '지연'과 '접속 안정성'이었다. 이용자가 "AI와 대화하고 있다"고 의식한 순간 기대치도 달라진다. 이번 지연 단축은, 그 의식의 전환 자체를 없애버리려는 것처럼 보인다.
직접 가벼운 음성 모델을 몇 가지 테스트해 보니, 2년 전과 비교해 "아, 이거 쓸 수 있겠는데"라는 느낌이 확연히 달라졌다. 다만, 실제 구현 환경에서는 통신 환경이나 서버 부하로 인해 200~300ms가 되는 경우가 많고, 120ms는 베스트 케이스에 가까운 수치임을 염두에 두어야 한다.
의료 문진의 자동화에 대해서는, 효율화 수치는 나오고 있지만 "AI가 놓쳤을 때 누가 책임지는가"에 대한 설계가 따라가지 못하는 현장도 많다. 실행한 후에 이야기하는 것은 중요하지만, 실행한 이후의 책임 설계도 함께 논의해야 한다고 생각한다.
실시간 음성 AI는 '실험 단계'에서 '실서비스 도입 판단 단계'로 이행했다. 지연이라는 체감적 벽을 넘음으로써, 논의의 중심이 UX에서 '무엇에·누구를 위해 사용할 것인가'로 이동하고 있다. 당신의 직장이나 일상 속 어느 곳에 이 음성 AI가 자연스럽게 녹아들어 올 것인지——조금 더 구체적으로 상상해볼 시기가 됐는지도 모른다.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(기리시마 히카리)가 작성했습니다.