SpaceXAI(공식 사이트 x.ai)가 2026년 9월 18일 Grok Voice Transcribe 2.0을 공개했습니다. 새 음성 인식 모델이 아니라, 이미 쓰던 Speech-to-Text API의 후속 모델입니다. 회사는 가격을 올리지 않고 오류를 줄였다고 했고, 문서상 기본 모델도 2.0으로 바뀌었습니다.
한눈에 결론
- Grok Voice Transcribe 2.0은 2026년 9월 18일 공개된 음성-텍스트 변환 모델이다.
- 배치 시간당 0.10달러, 스트리밍 시간당 0.20달러로 1.0과 같다. 화자 분리·타임스탬프·핵심어가 포함된다.
- 회사는 1.0 대비 정확도가 약 두 배라고 했고, 짧은 다국어 문장 오류율은 20.6%에서 6.8%로 낮아졌다고 밝혔다.
- Artificial Analysis 스트리밍 정확도에서 32개 모델 중 1위라고 회사·벤치마크 측이 공개했다. 비스트리밍은 1위가 아니다.
- 1.0은 수주 내 종료 예정이므로, 유지가 필요하면 모델명을 고정해야 한다.
새 모델은 깨끗한 스튜디오 음성보다 전화·차량·짧은 명령처럼 조건이 나쁜 오디오를 기준으로 내세웠습니다.
1.0과 비교해 실제로 바뀐 것
이번 발표의 핵심은 새 브랜드가 아닙니다. 같은 API에서 모델 이름만 grok-voice-transcribe-2.0으로 고르면 됩니다. 회사는 기존 연동이 코드 변경 없이 정확도 개선을 받는다고 적었습니다. 개발자 문서(2026-09-18 갱신)는 모델 이름을 생략하면 기본값이 2.0이라고 안내합니다.
기반은 Grok Voice의 오디오 모델입니다. SpaceXAI는 이 엔진이 하루 수만 건의 고객 지원 통화, 수백만 시간 분량의 영상 나레이션, 테슬라 차량의 Grok 음성 비서에 쓰인다고 설명했습니다. 2.0은 그 실사용 오디오를 더 잘 받아 적도록 후속 학습한 버전입니다.
기능 목록은 1.0에서 크게 벗어나지 않습니다. 파일·URL 배치 변환, 실시간 스트리밍, 단어 단위 타임스탬프와 신뢰도, 추가 요금 없는 화자 분리, 최대 8채널 독립 변환, 요청당 최대 100개 핵심어 지정, 숫자·날짜·금액·전화·이메일의 표기 정리, ‘음’ ‘어’ 같은 군더더기 제거, 스트리밍에서 발화 종료를 예측하는 Smart Turn이 포함됩니다. 지원 포맷은 WAV, MP3, WebM, OGG, M4A입니다.
제한도 그대로입니다. REST와 스트리밍 모두 초당 요청 10회, 스트리밍 동시 세션은 팀당 100개입니다. 리전은 문서 기준 us-east-1입니다. 속도 제한이 풀렸다는 공지는 없습니다.

회사는 스튜디오 한 화자보다 끊기는 전화선, 겹치는 목소리, 계정 번호처럼 짧은 고유정보를 기준으로 성능을 설명했습니다.
‘정확도 두 배’를 어떻게 읽어야 하나
홍보 문장만 보면 모든 조건에서 오류가 절반이 된 것처럼 보입니다. 공식 글이 실제로 내놓은 숫자는 더 좁습니다. 회사 내부 평가 네 가지(영어 고객 지원 전화, Grok 대화, 계정 코드·이메일 같은 고유정보, 19개 언어의 짧은 명령)에서 1.0보다 오류가 줄었고, 전화 통화 세트에서는 회사가 시험한 모델 중 가장 낮았다고 했습니다.
독자가 바로 확인할 수 있는 수치는 짧은 문장 세트입니다. 언어를 알아챌 맥락이 거의 없는 차량·음성 비서 명령에서 단어 오류율이 20.6%에서 6.8%로 떨어졌습니다. 상대 감소는 약 67%입니다. ‘정확도 두 배’라는 문장은 이 내부 평가를 뭉뚱그린 표현으로 읽는 편이 맞습니다.
팩트체크
현재 판정: 일부 사실. 출시·가격·기본 모델은 공식 확인. ‘세계 최고’와 ‘모든 조건에서 두 배’는 과장 소지가 있다.
- 원출처: SpaceXAI 공식 글 Introducing Grok Voice Transcribe 2.0 (2026-09-18), 개발자 문서 Speech to Text (같은 날 갱신), Artificial Analysis 스트리밍 리더보드 및 해당 계정 게시.
- 확인된 부분: 모델명 grok-voice-transcribe-2.0. 배치 0.10달러/시간, 스트리밍 0.20달러/시간. 화자 분리·타임스탬프·핵심어 포함. 문서상 기본 모델 2.0. 1.0은 수주 내 종료 예정. 회사 내부 짧은 문장 오류율 20.6%→6.8%. Artificial Analysis가 스트리밍 최종 전사 정확도 1위(2.7% WER, 발화 종료 후 0.49초)를 공개.
- 미확인 부분: 한국어 공식 지원 여부와 한국어 오류율. 내부 네 세트의 원데이터와 독립 재현. 1.0 정확한 종료일. API 종량 한도와 엔터프라이즈 별도 단가.
- 해석 주의: 비스트리밍 AA-WER는 2.3%(1.0의 4.0%에서 개선)이나 59개 모델 중 5위로 공개됐다. 스트리밍 1위와 ‘모든 벤치마크 1위’는 다르다. 지연 시간은 Muse, ElevenLabs Scribe v2 Realtime보다 길다는 비교가 같이 나왔다.
다국어는 회사가 가장 큰 개선으로 적었습니다. 수십 개 언어를 자동 감지하고, 녹음 중간에 언어가 바뀌어도 한 번에 따라간다고 합니다. 다만 공식 비교 차트에 나온 짧은 문장 언어는 이탈리아어, 중국어, 일본어, 스페인어, 포르투갈어, 아랍어, 폴란드어, 러시아어, 터키어, 스웨덴어, 프랑스어, 광둥어, 히브리어, 핀란드어, 네덜란드어, 힌디어, 독일어, 노르웨이어, 덴마크어입니다. 한국어는 이 목록에 없습니다. ‘수십 개 언어’에 한국어가 들어가는지는 공식 문서가 따로 확정하지 않았습니다. 한국어 콜센터·차량 명령에 넣기 전에 실제 샘플로 확인하는 편이 안전합니다.
가격은 그대로인데 기본값이 바뀐다
가격표는 1.0과 동일합니다. 녹음 파일을 한꺼번에 넘기는 배치는 오디오 1시간당 0.10달러, 실시간 스트리밍은 1시간당 0.20달러입니다. 화자 분리, 단어 타임스탬프, 핵심어 지정이 별도 요금이 아닙니다. 회사 비교 차트는 ElevenLabs Scribe v2, Deepgram Nova-3보다 단가가 낮다고 그렸습니다. 타사 단가는 요금제·약정에 따라 달라질 수 있으므로, 이 글에서는 SpaceXAI 공식 가격만 기준으로 둡니다.

가격은 1.0과 같고, 문서상 기본 모델과 짧은 문장 오류율에서 차이가 납니다.
실무에서 더 중요한 변화는 요금이 아니라 기본값입니다. 공식 발표문은 2.0이 ‘곧’ 기본 모델이 되고, 1.0은 수주 안에 종료된다고 했습니다. 같은 날 문서는 이미 기본값을 2.0으로 적습니다. 모델 이름을 코드에 안 넣은 연동은 이미 2.0을 타거나, 곧 타게 됩니다.
1.0을 유지해야 하는 경우는 명확합니다. 기존 프롬프트·후처리가 1.0의 오탈자 패턴에 맞춰져 있거나, 규제 문서에 모델 버전이 고정돼 있거나, A/B 테스트가 끝나지 않은 경우입니다. 이때는 요청에 grok-voice-transcribe-1.0을 명시해야 합니다. 종료 날짜는 ‘수주 내’만 나와 있으므로, 고정만 하고 일정을 안 보면 어느 날 호출이 거절될 수 있습니다.
바로 갈아타도 되는 사람과 한 박자 둬야 하는 사람
지금 바꾸는 편이 나은 쪽은 이렇습니다.
- 영어 고객 지원 통화, 회의 녹음, 영상 자막처럼 실사용 소음이 많은 오디오를 대량으로 변환하는 팀.
- 화자 분리와 단어 타임스탬프가 필요한데 추가 과금을 피하고 싶은 경우.
- Loom처럼 영상 설명을 텍스트로 넘겨 후속 작업(검색, 코드, 업무 기록)에 붙이는 워크플로. Atlassian은 Loom 기존 엔진보다 정확하다고 공식 글에 인용됐습니다.
- 모델 이름을 안 넣고 호출 중이라, 기본값 변경을 통제해야 하는 운영 담당자.
바로 바꿀 필요가 없거나, 바꿔도 체감이 작을 수 있는 쪽은 따로 있습니다. 이미 스튜디오급 한 화자 녹음만 다루고 Whisper 등 자체 호스팅으로 비용이 거의 없는 경우, 한국어만 쓰고 오류율을 공개값으로 확인하지 못한 경우, 스트리밍에서 0.2초 안쪽 응답이 필수인 음성 에이전트입니다. Artificial Analysis가 공개한 스트리밍 수치는 2.0이 더 정확하지만, 최종 전사가 발화 종료 후 0.49초로 일부 경쟁 모델보다 느립니다. 정확도와 응답 속도의 우선순위가 반대면 리더보드 1위가 정답이 아닙니다.
개인 Grok 앱 사용자에게 이번 발표가 설정 화면의 새 토글을 의미하지는 않습니다. 대상은 API와 음성 에이전트를 붙인 제품입니다. 테슬라 차량 Grok 비서가 같은 날 바로 바뀌었는지는 이번 글에 없습니다. 엔진 기반이 같다고 해서 차량 배포 일정이 같지는 않습니다.
전환 전에 확인할 여섯 가지
모델을 바꾸기 전에 아래만 점검하면 발표문을 제품 결정으로 옮길 수 있습니다.
- 코드·콘솔에 모델명이 고정돼 있는가. 비어 있으면 기본값 변경의 영향을 이미 받습니다.
- 실제 서비스 언어, 특히 한국어 샘플 20~50개를 2.0과 1.0에 같이 넣어 고유명사·숫자·주소를 비교했는가.
- 제품명, 의료·법률 용어, 사내 약어를 핵심어(최대 100개)로 넣었는가.
- 화자 분리가 필요한 회의인지, 한 화자 받아쓰기인지 먼저 나눴는가.
- 스트리밍이라면 0.5초 안팎 지연을 허용하는가. 더 빠른 응답이 필요하면 정확도만 보고 고르면 안 됩니다.
- 1.0 종료 전에 롤백 경로를 남겼는가. 수주 뒤 1.0 호출이 막히면 고정 문자열만으로는 부족합니다.

모델명 고정, 한국어 샘플, 핵심어, 화자 분리, 지연 시간, 1.0 유지 여부를 먼저 가릅니다.
테스트는 깨끗한 낭독보다 실패가 나던 파일을 쓰는 편이 낫습니다. 회사도 평가 세트를 전화 잡음, 짧은 명령, 철자가 중요한 계정 정보로 잡았습니다. 기존에 틀리던 구간이 줄었는지만 보면 리더보드 숫자보다 판단이 빨라집니다.
자체 확인은 복잡할 필요가 없습니다. 최근 한 주 동안 사람이 고친 자막·상담 메모 30건을 모아 1.0과 2.0에 같은 파일로 넣고, 고유명사·숫자·이메일이 맞았는지만 세면 됩니다. 단어 오류율 공식까지 가지 않아도 ‘고친 횟수’가 줄었는지로 충분합니다. 줄어들지 않았다면 리더보드 1위는 그 워크로드의 근거가 아닙니다.
자주 나오는 실수는 세 가지입니다. 첫째, 모델명을 비워 두고 결과가 좋아진 줄 아는 경우입니다. 기본값이 이미 바뀌었을 수 있어, 개선을 2.0 덕으로 단정하려면 이름을 명시해야 합니다. 둘째, 한국어 콜센터에 바로 넣는 경우입니다. 공개 비교 언어에 한국어가 없고, 짧은 명령에서 언어 감지가 특히 어렵다고 회사가 직접 적었습니다. 셋째, 스트리밍 음성 비서를 정확도만 보고 교체하는 경우입니다. 같은 리더보드에서 2.0은 더 정확하지만 최종 전사가 더 느린 축에 있습니다.
보안·보관도 빠지기 쉽습니다. 통화 녹음과 계정 번호가 들어가는 요청은 로그에 원문이 남는지, 보관 기간이 어디 계약에 있는지를 모델 점수와 별개로 봐야 합니다. 이번 발표는 정확도와 요금이지, 데이터 보관 정책의 변경 공지가 아닙니다.
지금 내릴 수 있는 판단
Grok Voice Transcribe 2.0은 새 음성 비서 앱이 아니라, 같은 가격의 변환 엔진 교체입니다. 영어·다국어 실사용 오디오를 API로 넣고 있다면 샘플 비교 후 기본값을 2.0으로 맞추는 쪽이 합리적입니다. 한국어 전용, 초저지연, 자체 호스팅 비용 구조라면 발표문만으로 옮길 이유는 없습니다.
확인해야 할 다음 지점은 세 개입니다. 1.0 종료 날짜, 한국어를 포함한 공식 언어 목록, 비스트리밍 리더보드에서 5위에 머무르는지입니다. 이 세 가지가 나오기 전에는 ‘최고 정확도 모델로 전면 교체’보다 ‘기본값을 인지하고 샘플로 검증’이 맞습니다.
자주 묻는 질문
지금 바로 2.0을 쓰나?
개발자 문서 기준으로는 모델명을 생략하면 2.0이 기본입니다. 발표문은 ‘곧 기본값’이라고 해 두었으므로, 운영 코드에는 모델명을 명시하는 편이 안전합니다.
한국어를 공식 지원하나?
회사는 수십 개 언어와 자동 감지를 말했습니다. 공개된 짧은 문장 비교 언어 19개에는 한국어가 없습니다. 지원 여부는 미확인입니다.
1.0을 계속 쓸 수 있나?
지금은 grok-voice-transcribe-1.0으로 고정하면 됩니다. 종료 시점은 수주 내로만 나와 있습니다.
출처: SpaceXAI 공식 발표, Speech to Text 문서, Artificial Analysis 스트리밍 리더보드. 확인일 2026-09-20.