말이 끝나기를 기다렸다가 글을 받는 전사와, 말하는 도중에 글이 고쳐지며 나오는 전사는 다른 제품이다. 마이크로소프트 AI가 2026년 10월 1일 공개한 MAI-Transcribe-2-Streaming은 후자다. 같은 날 음성 합성 모델 MAI-Voice-2.1과 더 빠른 MAI-Voice-2.1-Flash도 나왔다. 챗봇 화면이 바뀌는 소식이 아니라, 실시간 자막·받아쓰기·음성 에이전트를 붙이는 쪽에 재료가 추가된 발표다.
한눈에 결론
- 실시간 전사는 60개 언어, 도입가는 오디오 1시간당 0.54달러이며 모델 카드 기준 2026년 12월 31일까지다.
- 한국어는 전사 60개 언어와 음성 합성 23개 언어 양쪽에 들어 있다. 두 목록은 같지 않다.
- 부분 결과는 오디오를 받은 뒤 100밀리초를 조금 넘겨 나오기 시작한다는 것이 공식 설명이다. 최종 문장은 그 뒤 다시 고쳐진다.
- 1위·단어 오류율 2.5%는 마이크로소프트 모델 카드가 Artificial Analysis를 인용한 수치다. 이 글에서 독립 재측정하지 않았다.
- 일반 사용자용 앱이 아니라 Foundry·Playground·Azure Speech 쪽 API다. 리전도 아직 일부다.
말이 끝나기 전에 글이 나오는 구조
배치 전사는 녹음이 끝난 파일을 넣고 완성된 문장을 받는다. MAI-Transcribe-2-Streaming은 연결이 살아있는 동안 오디오를 계속 받아, 먼저 가설(부분 결과)을 내보내고 문맥이 쌓이면 고친 뒤 안정된 최종 결과를 확정한다. 공식 블로그는 첫 가설이 오디오 수신 후 100밀리초를 조금 넘겨 나온다고 적었다. 모델 카드는 이 흐름을 실시간 자막, 받아쓰기, 통화, 음성 에이전트에 맞춘 용도로 설명한다.
입력은 끝난 파일이 아니라 활성 연결로 들어오는 연속 오디오다. 모델 카드는 OpenAI Realtime 호환 웹소켓과 Azure Speech SDK, 두 경로를 적는다. 이미 그 중 하나로 짜 둔 팀은 교체 폭이 작다. 처음부터 붙이는 팀은 연결을 열어 두고 음성 조각을 계속 보내는 구조라는 점만 먼저 잡으면 된다. 파일을 업로드하고 작업 번호를 받는 배치 API와는 장애 양상도 다르다. 연결이 끊기면 그 사이 오디오가 비고, 부분 결과가 최종으로 굳지 않은 채 남을 수 있다.
실사용에서 갈리는 지점은 문장이 끝난 뒤의 정확도가 아니다. 상담 봇은 상대가 아직 말하는 중에 의도를 가늠해 조회를 준비할 수 있다. 회의록처럼 파일이 이미 있는 작업이라면, 부분 결과가 빨리 나온다는 장점은 거의 사라진다. 스트리밍을 고르는 기준은 지연을 줄여야 하는지, 아니면 끝난 녹음의 정확도와 단가면 충분한지다.

부분 결과로 하면 안 되는 동작
부분 결과가 빠르다는 설명만 보고 결제, 예약, 티켓 종료를 그 시점에 걸면 실패한다. 가설은 다음 음절이 들어오면 바뀐다. ‘환불해 주세요’가 잠시 ‘환불’로만 보였다가 ‘환불은 됐어요’로 끝날 수도 있다. 취소가 어려운 동작은 최종 결과 이후로 미루고, 부분 결과는 화면 자막이나 후보 의도 준비에만 쓰는 편이 안전하다.
| 동작 | 부분 결과 | 최종 결과 |
|---|---|---|
| 실시간 자막, 받아쓰기 미리보기 | 바로 표시. 문장이 바뀌면 고친다 | 확정 줄로 남긴다 |
| 검색, 재고 조회처럼 읽기만 하는 호출 | 미리 준비할 수 있다 | 결과가 뒤집히면 조회를 버린다 |
| 결제, 예약, 비밀번호 변경, 티켓 종료 | 실행하지 않는다 | 확정 문장과 확인 절차 뒤에 실행한다 |
| 상담원 연결 | 후보로만 띄운다 | 의도가 유지될 때 전환한다 |
마이크로소프트는 실시간 자막·받아쓰기에서 단어가 가장 가까운 경쟁자보다 2배 빨리 나타난다고 적었는데, 이 문장은 내부 평가다. 외부에 공개된 동일 조건 재현은 이 글에서 확인하지 못했다. 파일럿에서 볼 값은 ‘첫 글자가 얼마나 빠른가’와 ‘최종 문장이 몇 번 뒤집히는가’를 나눠야 한다. 첫 글자만 빠르고 끝 단어가 자주 바뀌면, 도구를 일찍 호출했다가 취소하는 비용이 지연 이득을 잡아먹는다.
세 모델의 가격, 그리고 연말 이후가 비어 있는 이유
가격 단위가 모델마다 다르다. 전사는 오디오 시간, 음성 합성은 입력 글자 수다. 공식 블로그, 모델 카드, 모델 페이지를 기준으로 보면 다음과 같다.
| 모델 | 하는 일 | 공식 가격 | 같이 볼 숫자 |
|---|---|---|---|
| MAI-Transcribe-2-Streaming | 실시간 음성에서 텍스트 | 오디오 1시간당 0.54달러, 2026년 12월 31일까지 | 60개 언어, 첫 가설은 100밀리초를 조금 넘김 |
| MAI-Voice-2.1 | 텍스트에서 음성 | 100만 자당 22달러 | 23개 언어·26개 로캘, 모델 추론 약 550밀리초 |
| MAI-Voice-2.1-Flash | 같은 음성, 지연과 대량에 맞춤 | 100만 자당 15달러 | 같은 언어, 모델 추론 약 45밀리초. 블로그는 45초 음성을 종단 지연 150밀리초로 생성한다고 적음 |
도입가로 100시간 실시간 전사는 54달러다. 상담원 한 명이 하루 8시간을 이 경로로 흘리면 4.32달러, 20명이 주 5일이면 주당 432달러다. 파일럿 규모에서는 작아 보여도, 상시 회선이 늘면 통화 시간에 비례해 커진다. 침묵 구간을 서버가 과금에서 빼 주는지는 모델 카드에 없다. 견적에는 연결이 열린 오디오 시간을 기준으로 잡는 편이 안전하다.
음성 합성은 글자 단위라 짧은 응답과 긴 오디오북의 단가가 다르다. 한국어 응답 한 턴이 80자면 100만 자당 22달러 기준으로 턴당 0.00176달러다. 하루 1만 턴이면 Voice-2.1은 17.6달러, Flash는 12달러다. Flash가 100만 자당 7달러 싸다고 모든 응답을 바꿀 이유는 없다. 모델 페이지는 Voice-2.1을 오디오북·내레이션처럼 음질이 우선인 용도, Flash를 지연이 우선인 용도로 나눈다. 추론 지연 550밀리초와 45밀리초는 모델 추론 시간이고, 네트워크와 재생 버퍼를 더한 체감 지연은 더 길다. 블로그가 적은 Flash의 종단 150밀리초는 45초 분량 생성에 대한 별도 수치라, 추론 45밀리초와 같은 항목으로 섞지 않는 것이 맞다.
연말 이후 전사 가격은 발표되지 않았다. 도입가를 견적에 넣을 때는 2027년 1월 1일 이후 단가가 바뀔 수 있다는 조건을 빼면 안 된다. ‘약 60% 저렴’ ‘추론 55% 빠름’은 비교 대상을 특정하지 않은 자사 표현이라 견적 근거로 쓰지 않는 편이 맞다.

한국어는 되지만, 전사와 음성 합성을 한 세트로 보면 안 된다
모델 카드의 전사 60개 언어에는 한국어가 있다. 중국어, 광둥어, 일본어도 포함된다. 음성 합성 모델 페이지의 23개 언어에도 한국어가 있다. 언어 목록만 보면 한국어로 듣고 한국어로 답하는 루프가 가능하다.
목록은 같지 않다. 전사는 힌디어, 아랍어, 태국어를 포함해 60개 언어를 받지만, 음성 합성은 영어 여러 지역, 한국어, 중국어 간체, 스페인어와 포르투갈어 각 2개 지역 등으로 범위가 더 좁다. 상대가 전사는 되는 언어로 말했는데 응답 음성은 그 언어를 못 내는 조합이 생긴다. 다국어 상담은 입력 언어와 출력 언어를 각각 표로 대조해야 한다.
음성 합성은 하나의 목소리 정체성을 지원 언어 전체에서 유지한다고 설명한다. 짧은 참조 음성(모델 페이지 기준 5~60초)으로 복제할 수 있고, 오용을 막는 동의 장치가 들어 있다고 한다. 그 장치가 어떤 동의 증명을 요구하는지는 블로그에 절차가 없다. 브랜드 음성을 넣기 전에 사용권과 동의 기록을 따로 남기는 쪽이 안전하다. 직원 목소리를 참조로 쓰면 퇴직 이후 사용 범위까지 정해 두는 편이 맞다.

바로 붙여 볼 팀, 아직 볼 필요 없는 경우
지금 시험할 이유가 있는 쪽은 실시간 자막, 받아쓰기, 통화 중 의도 분류, 음성 에이전트를 이미 만들고 있는 팀이다. 배포 표면은 Microsoft Foundry, MAI Playground(playground.microsoft.ai), Vercel, Azure Voice Live다. 음성 합성 두 모델은 OpenRouter에도 올라 있고, LiveKit 연동은 곧 제공이라고만 되어 있다. 세 모델이 모든 표면에 같은 날 같은 조건으로 열렸다고 보면 안 된다.
리전은 모델 카드 기준 Central US, Sweden Central, Southeast Asia이고 East US 2는 곧 제공이다. 한국 리전은 적혀 있지 않다. 국내 통화 데이터를 이 모델로 보내려면 리전, 데이터 이전, 왕복 지연을 먼저 확인해야 한다. Southeast Asia가 지리적으로 가깝다는 이유만으로 개인정보 처리 위치가 해결되지는 않는다. 전사 100밀리초는 모델이 오디오를 받은 뒤의 첫 가설이지, 서울에서 해당 리전까지의 네트워크 지연을 포함한 수치가 아니다.
굳이 지금 따라갈 필요가 없는 경우도 분명하다. ChatGPT나 Copilot 화면이 바뀌는 소식이 아니다. 녹음 파일을 밤에 돌려 회의록을 만드는 작업이라면 스트리밍 지연의 이점이 작다. 소비자용 받아쓰기 앱을 기대하고 들어왔다면 Playground에서 소리를 들어 보는 선에서 멈추는 편이 맞다.
1위와 2.5%는 모델 카드가 리더보드를 인용한 수치다
팩트체크
- 현재 판정: 출시 자체는 공식 발표. 정확도 1위는 제조사가 외부 리더보드를 인용한 주장.
- 원출처: Microsoft AI 블로그(2026-10-01), MAI-Transcribe-2-Streaming 모델 카드(2026-10-01 갱신), MAI-Voice-2.1 모델 페이지.
- 확인된 부분: 세 모델 공개, 전사 도입가와 기한, 60개 언어에 한국어 포함, 음성 합성 23개 언어에 한국어 포함, 일부 리전, 웹소켓과 Speech SDK 경로.
- 미확인 부분: 2027년 이후 전사 가격, East US 2와 LiveKit의 실제 오픈일, 한국어만 떼어 낸 오류율, 동의 장치의 구체 절차.
모델 카드는 Artificial Analysis 최종 전사 단어 오류율로 자사 2.5%, Grok Transcribe 2.0 2.7%, Muse Voice Transcribe 3.1%, Cartesia Ink 2 3.1%, ElevenLabs Scribe V2 Realtime 3.6%, GPT-live Transcribe 3.9%를 적는다. 부분 전사 정확도 1위와 정확도-지연의 앞선 위치도 블로그의 주장이다. 단어가 2배 빨리 나타난다는 문장은 내부 평가라고 명시돼 있다.
이 숫자를 한국어 상담 품질로 바꾸면 안 된다. 리더보드 음성의 언어 구성, 잡음, 겹쳐 말하기 비율은 모델 카드 표만으로 확인되지 않는다. 파일럿에서는 자사 통화 10~30분을 같은 조건으로 돌려, 부분 결과가 얼마나 자주 뒤집히는지와 최종 문장의 오류를 따로 본다. 숫자 고유명사, 주소, 상품명은 평균 오류율보다 더 잘 틀리는 구간이라 샘플에 반드시 넣는다.
붙이기 전에 확인할 순서
- 쓸 리전이 Central US, Sweden Central, Southeast Asia 중 어디인지, East US 2를 기다려야 하는지 확인한다.
- 이미 있는 연결이 Realtime 웹소켓인지 Azure Speech SDK인지 고른다. 없는 팀은 Playground에서 한국어 샘플만 먼저 듣는다.
- 입력 언어는 전사 60개, 출력 언어는 음성 합성 23개에 각각 있는지 대조한다.
- 부분 결과로 도구를 호출할지, 최종 결과 이후에만 호출할지 정한다. 결제와 예약은 최종 결과가 맞다.
- 복제 음성을 쓰면 참조 음성의 권리와 동의 기록을 남긴다. 블로그의 동의 장치 문장만으로 적법하다고 보지 않는다.
- 견적에는 0.54달러가 2026년 12월 31일까지라는 조건을 적고, 그 이후 단가는 미공개로 둔다.
- 자사 샘플에서 침묵, 겹쳐 말하기, 상품명을 넣어 부분 결과 뒤집힘과 최종 오류를 따로 기록한다.
사내에서 결정을 나눌 때도 역할이 다르다. 제품 담당은 부분 결과로 실행할지 여부만 정하면 된다. 인프라는 리전과 재연결, 원본 오디오 보관을 맡는다. 법무·개인정보 담당은 통화 음성이 한국 밖으로 나가는지, 복제 음성의 동의 기록이 남는지 본다. 한 팀이 가격 0.54달러만 보고 도입을 결정하면 이 세 갈래가 빠진다.
연결이 끊겼을 때의 다음 조치도 정해 두는 편이 맞다. 스트리밍은 파일이 서버에 남아 있는 배치와 달리, 끊긴 구간의 오디오를 나중에 다시 받을 수 있다는 보장이 모델 카드에 없다. 상담 녹취가 법무·품질 목적으로 필요하면 원본 오디오를 자체 저장하고, 전사 실패 시 그 파일을 배치 전사나 상담원 기록으로 넘기는 우회를 둔다. 재연결 뒤 이전 부분 결과를 최종 문장으로 확정하지 않는다. 사용자에게는 ‘방금 문장이 끊겼으니 다시 말해 달라’는 짧은 음성만 내보내는 편이, 잘린 가설로 주문을 진행하는 것보다 낫다.
정리하면, 이번 공개는 일반 사용자 기능 추가가 아니라 음성 에이전트 루프의 입력과 출력을 마이크로소프트 쪽으로 붙일 수 있게 된 개발자 발표다. 한국어가 양쪽 목록에 있다는 점은 국내 파일럿의 진입 장벽을 낮춘다. 리전, 연말 이후 가격, 자사 음성에서의 오류는 공식 숫자 밖에 남아 있다.
30분 파일럿에서 남겨 둘 항목
리더보드 순위를 그대로 도입 근거로 쓰면, 실제 통화에서 뒤집히는 지점을 놓친다. 샘플은 조용한 사무실 문장만으로 구성하지 않는다. 창가 소음, 두 사람이 겹쳐 말하는 구간, 주문번호와 주소, 사투리가 섞인 문장을 각각 5분 이상 넣는 편이 낫다. 기록은 네 칸이면 된다.
- 첫 글자가 화면에 나오기까지 걸린 시간. 모델 지연과 네트워크 지연을 구분한다.
- 한 발화 안에서 부분 결과가 몇 번 바뀌었는지.
- 최종 문장에서 틀린 고유명사와 숫자.
- 부분 결과만 보고 실행했다면 잘못 나갔을 동작.
이 네 칸이 안정적이면 읽기 전용 조회부터 붙인다. 숫자와 주소가 자주 틀리면 상담원 확인 단계를 빼지 않는다. 비용은 같은 30분 오디오를 도입가 0.54달러로 환산해 시간당 단가와 함께 적어 둔다. 월 견적으로 바로 확장하지 말고, 침묵 구간이 과금에 포함되는지를 청구서로 한 번 더 확인한다.
흔한 실수는 세 가지다. 첫째, 전사 60개 언어를 음성 합성 23개 언어와 같은 표로 보는 것. 둘째, 100밀리초를 서울 사용자 체감 지연으로 읽는 것. 셋째, 12월 31일까지의 도입가를 연간 단가로 계약서에 적는 것. 세 가지를 피하면 이번 발표에서 가져갈 판단은 단순해진다. 한국어 실시간 루프의 시험은 가능하고, 전국 상담 회선을 이 가격과 이 리전으로 고정할 단계는 아니다.
자주 나오는 질문
챗GPT나 코파일럿에서 바로 켜지는 기능인가. 아니다. Foundry, Playground, Azure Voice Live, Vercel 등 개발자 경로로 제공된다.
한국어 실시간 자막에 쓸 수 있나. 전사 언어 목록에 한국어가 있다. 실제 자막 품질은 잡음, 사투리, 겹쳐 말하기로 달라지므로 샘플로 확인해야 한다.
0.54달러는 계속 가나. 모델 카드는 2026년 12월 31일까지라고 적는다. 이후 가격은 공개되지 않았다.
음성 합성만 한국어로 되면 상담 봇이 완성되나. 아니다. 듣기와 말하기 모델을 각각 붙이고, 확정 전 실행을 막을 대화 설계가 있어야 한다.
확인일: 2026-10-03. 가격, 리전, 언어 목록은 Microsoft AI 블로그, 전사 모델 카드, MAI-Voice-2.1 모델 페이지 기준이다.