MS AI, 첫 스트리밍 음성인식·Voice 2.1 공개…저지연 보이스 에이전트 승부수
마이크로소프트 AI가 MAI-Transcribe-2-Streaming과 Voice 2.1·Flash를 공개. 60개 언어 실시간 전사·초저지연 TTS로 대화형 보이스 에이전트를 겨냥했다.
마이크로소프트 AI(MAI)가 2026년 10월 1일(현지시간) 첫 스트리밍 음성인식 모델 ‘MAI-Transcribe-2-Streaming’과 다국어 텍스트음성변환(TTS) ‘MAI-Voice-2.1’·‘MAI-Voice-2.1-Flash’를 동시에 공개했다. 회사는 이를 “대화형 보이스 에이전트를 위한 빠르고 유연한 빌딩 블록”이라고 규정했다. SiliconANGLE 등 외신 보도를 종합하면, 핵심은 말을 끝낼 때까지 기다리지 않고 부분 전사(partial)를 흘려보낸 뒤 확정본을 확정하는 WebSocket 스트리밍 구조와, 같은 화자 정체성을 유지한 채 언어를 넘나드는 TTS다. Artificial Analysis 스트리밍 STT 리더보드에서 최종·부분 전사 모두 정확도 1위를 기록했다고 마이크로소프트는 밝혔다. 다만 벤치마크 수치의 세부 표는 공개 페이지 차트에 의존하는 만큼, 본고는 회사 측 질적 주장과 교차 보도된 가격·지연 수치를 중심으로 정리한다.
> 핵심 정리
> - 공개일: 2026.10.1 — MAI-Transcribe-2-Streaming + MAI-Voice-2.1 / 2.1-Flash
> - STT: 60개 언어, 연속 자동 언어 감지…부분 전사 후 확정 전사(WebSocket)
> - MS 주장: Artificial Analysis에서 최종·부분 전사 정확도 1위, 정확도-지연 Pareto 전선
> - 지연: MS 블로그 “오디오 수신 후 첫 partial 약 100ms대” / SiliconANGLE “첫 가설 평균 약 320ms(네트워크 등 변수)”
> - 내부 평가: 실시간 받아쓰기·자막에서 단어 출현이 최근접 경쟁사 대비 2배 빠름(MS)
> - 가격: 스트리밍 STT 연말까지 시간당 $0.54…비스트리밍 MAI-Transcribe-2는 지난달 $0.10/시간
> - TTS: 23언어·26로케일, Voice 2.1 $22/1M자 · Flash $15/1M자, Flash는 45초 오디오·E2E 150ms
> - 배포: Microsoft Foundry, OpenRouter(보이스), Vercel, Azure Voice Live, LiveKit(곧)…Azure는 공개 미리보기
무슨 일이
MAI는 이미 비스트리밍 전사 모델 MAI-Transcribe-2를 선보인 바 있다. 이번 스트리밍 변형은 오디오가 도착하는 동안 잠정 결과를 계속 갱신하고, 발화가 끝나면 최종 전사를 확정한다. SiliconANGLE은 Vercel AI Gateway 목록과 회사 설명을 인용해, 콜센터 자막·보이스 에이전트처럼 “사용자가 말을 끝내기 전에 처리·응답을 시작할 수 있는” 용도를 강조했다.
같은 날 공개된 Voice 2.1 계열은 듣기(STT)와 말하기(TTS)를 한 루프로 묶으려는 포석이다. 마이크로소프트 AI 블로그는 “보이스 에이전트는 듣고·이해하고·결정하고·말하는 루프”이며, 각 구성 요소가 대화가 대화처럼 느껴지는 시간 창을 벌거나 좁힌다고 설명했다. Transcribe-2-Streaming과 Voice-2.1-Flash를 짝지으면 양끝에서 시간을 되찾아, 가운데 추론·도구 호출에 여유를 준다는 논리다.
어떻게·기술
스트리밍 STT는 첫 가설(partial)을 내보낸 뒤 맥락이 쌓이면 수정하고, 안정된 전사를 바로 커밋한다. 마이크로소프트는 “오디오를 받은 지 불과 100ms를 조금 넘는 시점에 첫 partial”이 나온다고 썼다. SiliconANGLE은 이와 별도로 “첫 전사 가설이 평균 약 320ms 안에 나온다”고 전하면서, 네트워크와 후속 AI 응답 속도에 따라 체감 지연이 달라진다는 회사 측 유보를 함께 적었다. 두 수치는 측정 구간(모델 내부 vs 체감 평균)이 다를 수 있어, 본고는 병기한다.
Microsoft Learn 문서에 따르면 MAI-Transcribe-2-Streaming은 현재 공개 미리보기(public preview)다. 통합 경로는 OpenAI Realtime 호환 WebSocket 기반 Realtime API와 Azure Speech SDK 두 갈래로 안내된다. 중간 결과로 현재 전사를 갱신하고, 최종 결과로 구간을 확정하는 패턴이 공통이다.
TTS 쪽에서는 Voice 2.1이 “한 보이스가 언어를 바꿔도 같은 화자로 남고, 각 언어의 토착 억양을 탄다”는 점을 내세운다. 영어→중국어→독일어처럼 전환해도 화자 정체성이 유지된다는 설명이다. Flash는 동일 언어·교차언어 화자 지원을 유지한 채 고용량·저지연에 맞춘 변형이다. 양측 모두 수초의 참조 오디오로 보이스 클로닝이 가능하며, 오남용을 막는 동의(consent) 가드레일이 내장됐다고 회사는 밝혔다. 데모로는 MAI Playground의 ‘Chatter’가 소개됐다.
숫자·스펙
- MAI-Transcribe-2-Streaming: 60개 언어, 연속 자동 언어 감지. 연말까지 도입가 오디오 시간당 $0.54(MS). 지난달 비스트리밍 MAI-Transcribe-2는 시간당 $0.10으로, SiliconANGLE은 스트리밍이 잠정 결과를 계속 돌려내느라 처리량이 더 크다고 해석했다.
- 정확도·지연(MS 주장): Artificial Analysis에서 최종·부분 전사 정확도 1위, 정확도 대 지연 평가에서 Pareto 전선. 내부 평가상 실시간 받아쓰기·자막에서 단어가 최근접 경쟁사 대비 2배 빠르게 나타남. AA 공개 페이지에서 특정 WER·초 단위 수치를 본고가 직접 확정하지는 못함.
- MAI-Voice-2.1: 23개 언어·26개 로케일, $22 / 100만 자.
- MAI-Voice-2.1-Flash: 동일 언어 지원, 45초 오디오 생성 시 종단간 지연 150ms, 추론 55% 가속, 유사 모델 대비 약 60% 저렴(MS), $15 / 100만 자.
- 가용성: 세 모델 모두 Microsoft Foundry. 보이스 모델은 OpenRouter. Vercel, Azure Voice Live. LiveKit은 곧 지원 예정(MS).
배경
이번 발표는 MAI가 ‘Copilot 비용 구조’를 스스로 줄이려는 흐름과도 맞닿아 있다. SiliconANGLE은 7월 보도를 환기하며, MAI CEO 무스타파 술레이만(Mustafa Suleyman)이 오픈AI·앤트로픽 프론티어 모델 비용에 부담을 느껴 MAI 계열을 강화했고, “앤트로픽에 많은 돈을 내고 있으니 그 비용을 줄이고 궁극적으로 없애는 것이 목표”라고 블룸버그에 밝혔다고 전했다. 같은 기사에 따르면 보이스 에이전트 루프의 가운데에는 추론 모델 Mai-Thinking-1이 자리하고, STT·추론·TTS를 분리하면 품질·지연·비용을 개발자가 더 세밀히 조절할 수 있다.
경쟁 구도에서는 Deepgram·AssemblyAI·ElevenLabs·OpenAI Realtime 등 실시간 음성 스택이 이미 시장을 형성하고 있다. MAI의 차별점 주장은 ‘스트리밍 STT 정확도 리더보드 1위 + Flash급 TTS 지연·가격’의 조합이다. 다만 1위 주장의 세부는 벤치마크 제공사 차트와 회사 보도자료에 의존하므로, 독립 재현 평가가 이어질 여지가 있다. 동시에 MAI는 자사 Playground 데모 Chatter로 STT·TTS를 한 화면에서 보여 주며, ‘모델 나열’이 아니라 ‘에이전트 루프 완결’을 제품 메시지의 중심에 놓았다. 이는 Azure Voice Live·Foundry 배포와 맞물려, 기존 Speech 서비스 고객을 MAI 계열로 끌어들이려는 채널 전략으로도 읽힌다.
엇갈린 시각·한계
낙관론은 분명하다. 부분 전사가 mid-sentence 도구 호출·추론을 가능하게 하면, 콜봇·튜터링·다국어 어시스턴트의 ‘침묵 구간’이 줄어든다. Flash의 150ms E2E와 $15/1M자 가격은 대용량 응답 시나리오에서 매력적이다.
회의론도 있다. 첫째, Azure 문서는 공개 미리보기라 SLA가 없고 프로덕션 비권고라고 명시한다. 둘째, SiliconANGLE이 전한 320ms 평균과 MS 블로그의 100ms대 첫 partial은 독자가 혼동하기 쉽다. 네트워크·엔드포인팅·후단 LLM까지 포함한 ‘대화 턴 지연’은 별개 지표다. 셋째, 보이스 클로닝은 브랜드 일관성에 도움이 되지만, 동의 가드레일의 실효성은 실제 남용 사례와 감사 로그로 검증돼야 한다. 넷째, Artificial Analysis 1위는 MS가 강조한 사실이나, 본고가 AA 차트에서 특정 WER(예: 2.5%)이나 최종 지연(예: 0.13초)을 수치로 확인하지는 못했다. 따라서 정확도 주장은 회사 발표와 리더보드 존재를 인용하는 선에서 멈춘다.
한국 기업·개발자에게
국내 팀에는 세 가지 실무 포인트가 있다. 첫째, 이미 OpenAI Realtime 호환 WebSocket을 쓰는 스택이라면 Foundry·Realtime API 경로로 전환·A/B가 상대적으로 수월하다. Speech SDK가 필요한 레거시 콜센터·미팅 자막도 공식 가이드가 있다. 둘째, 가격표를 기능별로 쪼개 보라. 비스트리밍 $0.10/시간과 스트리밍 $0.54/시간은 용도가 다르다. 실시간 자막·에이전트만 스트리밍으로 두고, 배치 회의록은 저가 경로를 유지하는 식이 합리적이다. TTS도 브랜드 내레이션은 2.1, 대량 IVR·알림은 Flash로 나누는 구성이 MS의 포지셔닝과 맞다. 셋째, 한국어를 포함한 다국어 서비스라면 “한 보이스·다중 언어·토착 억양” 주장을 실제 한국어·영어 혼용 시나리오에서 직접 들어봐야 한다. 23개 언어 목록에 한국어가 포함되는지는 배포 채널(Foundry·OpenRouter) 스펙 시트로 재확인하는 것이 안전하다. 클로닝·동의 가드레일은 금융·공공 고객 대면 서비스에서 컴플라이언스 체크리스트에 넣어야 한다.
전망
MAI의 이번 삼종 세트는 ‘프론티어 LLM 하나로 음성을 때운다’는 접근과 거리를 두고, STT·추론·TTS를 분리해 지연 예산을 설계하라는 메시지에 가깝다. Copilot·Azure 생태계에 실릴 경우 배포 파급은 크지만, 미리보기 단계와 벤치마크 세부의 투명성이 단기 관전 포인트다. LiveKit 연동·연말 도입가 종료 이후 가격, AA 리더보드에서의 지속 순위, 그리고 한국어·동아시아 억양에서의 체감 품질이 국내 도입 속도를 가를 것이다. 보이스 에이전트 경쟁이 ‘누가 더 똑똑한가’에서 ‘누가 더 사람처럼 끊김 없이 말하는가’로 옮겨 가는 국면에서, MAI는 정확도 1위 주장과 Flash급 TTS로 그 전장에 본격 합류했다. 앞으로 관전할 지표는 리더보드 순위만이 아니다. 부분 전사를 도구 호출에 실제로 묶었을 때의 오작동률, 다국어 전환 시 화자 일관성, 클로닝 가드레일의 차단 로그 공개 여부 등이 기업 도입 결정에 더 직접적으로 작용할 전망이다.
— SSOK.AI 그록기자
참고 자료
- Microsoft AI, "Our first streaming transcription model debuts at no. 1 on Artificial Analysis" (2026.10.1) — https://microsoft.ai/news/our-first-streaming-transcription-model/
- SiliconANGLE, "Microsoft targets ultra-realistic voice agents with its first streaming transcription model" (2026.10.1) — https://siliconangle.com/2026/10/01/microsoft-targets-ultra-realistic-voice-agents-with-its-first-streaming-transcription-model/
- Microsoft Learn, "MAI-Transcribe-2-Streaming overview" (public preview) — https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe-2-streaming
- Artificial Analysis, Speech-to-Text Streaming leaderboard — https://artificialanalysis.ai/speech-to-text/streaming



