
R2T2는 음성을 실시간으로 확정하고 T3PO는 번역 시점을 스스로 결정
사람을 위한 자막에서 AI가 즉시 읽고 실행하는 ‘실시간 귀’로 확장
중국 넷이즈 유다오가 공개한 실시간 음성인식·동시통역 기술이 AI 에이전트 시대의 새로운 인터페이스로 주목받고 있다.
핵심은 단순히 말을 번역하는 데 있지 않다. 사람이 끝까지 말하기를 기다리지 않고 음성을 안정된 텍스트로 확정한 뒤, 번역 모델이 언제 읽고 언제 출력할지를 실시간으로 판단한다. 이렇게 만들어진 결과를 사람이 보는 데서 끝내지 않고 AI 에이전트가 곧바로 분석하고 실행할 수 있도록 설계한 것이 특징이다.
유다오가 공개한 구조의 앞단에는 실시간 음성인식 모델 Confucius4-R2T2, 뒤에는 실시간 번역 모델 Confucius4-T3PO가 있다.
80ms 단위로 듣고, 한번 확정한 문장은 고치지 않는다
R2T2는 Qwen3-ASR을 기반으로 만든 실시간 자동음성인식 모델이다.
80ms에서 2초 사이의 짧은 오디오 단위를 순차적으로 처리하며, 한 번 출력한 문장을 뒤에서 다시 수정하지 않는 ‘append-only’ 구조를 사용한다. 실시간 자막에서는 앞 문장을 고쳐도 큰 문제가 없지만, AI 에이전트가 그 문장을 명령이나 데이터로 즉시 사용할 경우에는 문제가 달라진다.
앞서 확정된 문장이 뒤늦게 바뀌면 이미 실행된 작업과 새 문장이 충돌할 수 있기 때문이다.
유다오는 R2T2의 이런 구조가 실시간 자막뿐 아니라 LLM 에이전트, NLP 파이프라인, 동시통역에 적합하다고 설명한다. GitHub
오픈AI·엔비디아와의 비교, 어디까지 사실인가
유다오는 R2T2와 OpenAI의 GPT-Live-Transcribe가 같은 음원을 처리하는 실시간 비교영상도 공개했다. 다만 이 영상만으로 어느 모델이 전체적으로 우위라고 결론 내릴 수는 없다. GitHub
유다오가 공개한 영어 음성인식 벤치마크에서는 R2T2가 엔비디아 Nemotron보다 낮은 오류율을 기록한 항목들이 있다.
예를 들어 AMI 데이터셋에서 R2T2의 WER은 11.37%, Nemotron은 24.19%였고, Giga-clean에서는 각각 9.60%와 13.81%였다. 반대로 일부 상용 시스템은 R2T2보다 더 낮은 오류율을 기록한 데이터셋도 있다. GitHub
따라서 정확한 표현은 “유다오가 공개한 일부 실시간 ASR 벤치마크에서 엔비디아 Nemotron보다 낮은 오류율을 기록했고, OpenAI GPT-Live-Transcribe와 직접 비교영상을 공개했다” 정도다.
‘OpenAI와 NVIDIA를 넘어섰다’고 일반화하기에는 아직 근거가 부족하다.
T3PO는 ‘언제 번역할지’를 스스로 결정한다

R2T2가 음성을 안정적으로 문자로 바꾸는 역할이라면, T3PO는 그 문장을 언제 번역할지를 판단한다.
T3PO는 약 140억 파라미터 규모의 중·영 양방향 텍스트 동시통역 모델이다. 입력이 들어올 때마다 READ, 즉 조금 더 기다릴 것인지, WRITE, 즉 지금 번역을 내보낼 것인지를 결정한다.
문장을 너무 일찍 번역하면 문맥을 놓칠 수 있다. 반대로 끝까지 기다리면 동시통역의 의미가 사라진다.
유다오는 이 정확도와 지연시간의 균형을 맞추기 위해 Pareto-aware 강화학습을 적용했다고 설명한다. 또한 이미 확정한 번역을 다시 고치지 않고 KV-cache를 재사용해 반복 계산을 줄인다. GitHub
중요한 점은 T3PO가 자체적으로 음성을 받는 모델은 아니라는 것이다.
T3PO는 텍스트-텍스트 모델이고, 음성 통역을 하려면 R2T2 같은 스트리밍 ASR을 앞단에 연결해야 한다. 유다오 역시 공식 문서에서 이 구조를 명시하고 있다. GitHub
오픈형 구조…하지만 라이선스는 모델마다 다르다
T3PO는 Hugging Face와 ModelScope에서 내려받아 로컬 환경에서 구동할 수 있다. GGUF 양자화 버전도 공개됐으며 Q6_K 약 12.1GB, Q5_K_M 약 10.5GB 수준이다. Hugging Face
R2T2 역시 코드와 모델 체크포인트가 공개돼 있지만 라이선스는 구분된다.
소스코드는 Apache 2.0으로 배포되지만 모델 가중치는 NetEase Model Use License가 적용된다. 따라서 전체 시스템을 ‘완전한 오픈소스’라고 부르기보다는 로컬 구축과 개발이 가능한 공개형 AI 스택으로 보는 편이 정확하다. GitHub
사람을 위한 번역에서 AI를 위한 입력으로
이 기술이 흥미로운 이유는 번역의 사용자가 달라지고 있기 때문이다.
기존 동시통역은 외국어를 사람이 알아듣도록 바꾸는 기술이었다.
에이전트 시대에는 통역 결과를 AI도 함께 읽는다.
해외 회의에서 외국인이 말하면 R2T2가 음성을 확정된 텍스트로 바꾸고, T3PO가 이를 실시간 번역한다. 이후 AI 에이전트는 계약 조건이나 가격, 일정, 기술 용어를 추출해 회의록을 만들고 필요한 자료를 검색하거나 후속 작업을 실행할 수 있다.
유다오는 실제 서비스에서도 AI 동시통역을 확대하고 있다. 회사는 올해 1분기 AI 동시통역 매출이 전년 동기 대비 100% 이상 증가했으며 음성 대 음성 실시간 번역 기능도 추가했다고 밝혔다. The Motley Fool
Next Insight 분석 | 번역 정확도보다 중요한 것은 AI가 ‘언제부터 믿고 실행할 수 있느냐’

동시통역 기술은 오랫동안 정확도를 중심으로 경쟁해왔다.
하지만 AI 에이전트가 통역 결과를 곧바로 다음 작업의 입력으로 사용하기 시작하면 기준이 달라진다.
몇 점 더 높은 번역 정확도만큼 중요한 것이 언제부터 그 문장을 확정된 정보로 믿을 수 있느냐다.
R2T2가 한번 출력한 문장을 되돌리지 않는 이유도 여기에 있다. T3PO가 매 순간 READ와 WRITE를 결정하는 이유도 같다.
사람은 앞 문장이 조금 수정돼도 이해할 수 있다. 하지만 AI가 이미 그 문장을 바탕으로 검색하거나 계산하거나 명령을 실행했다면 수정 비용은 훨씬 커진다.
결국 동시통역은 단순 번역 서비스에서 AI 에이전트의 실시간 입력 장치로 성격이 바뀌고 있다.
앞으로의 경쟁은 누가 가장 자연스럽게 번역하느냐뿐 아니라, 누가 가장 빨리 안정된 정보를 만들어 AI가 믿고 다음 행동으로 넘어가게 하느냐에서 벌어질 가능성이 크다.
넷이즈 유다오의 R2T2와 T3PO가 보여주는 변화도 바로 그 지점에 있다.
작성·취재 | Next Insight News 김귤연 기자
이메일 | nextinsight.news@gmail.com
카카오톡 | Next Insight News 비즈니스 채널
홈페이지 | nextinsightnews.com
참고자료
NetEase Youdao Confucius4-R2T2 공식 GitHub
NetEase Youdao Confucius4-T3PO 공식 GitHub
NetEase Youdao Confucius4-T3PO Hugging Face
OpenAI GPT-Live-Transcribe 공식 문서
Youdao 2026년 1분기 실적발표 자료
#넷이즈유다오 #Confucius4 #R2T2 #T3PO #실시간음성인식 #동시통역 #AIAgent #OpenAI #NVIDIA #NextInsightNews
Next Insight 분석을 정리해 보내드립니다.

