오픈AI 의존 벗어나는 MS, 실시간 음성 받아쓰기 3종 공개…"60개 언어 지원"
첫 스트리밍 전사 모델 'MAI-트랜스크라이브-2-스트리밍' 출시, 자체 평가 기준 오류율 2.5%…스타트업 수노는 '목소리와 음악을 한 번에' 만드는 AI 내놔
[SNS 타임즈- LA] AI 전문 뉴스레터 '더 딥뷰(The Deep View)'는 최근 "마이크로소프트는 한때 첨단 서비스를 구동하는 데 오픈AI의 최상위 모델에 거의 전적으로 의존했지만, 이제는 자체 모델 출시를 늘리고 있다"고 짚었다.
이 분석을 뒷받침하듯 MS는 지난 1일 현지시간 자사 최초의 실시간 음성 받아쓰기 모델 'MAI-Transcribe-2-Streaming'을 공개했다.
이 모델은 사람이 말하는 도중에 음성을 글자로 바꿔 주는 인공지능이다.
오디오를 끊김 없는 흐름 형태로 받아 말이 끝나기를 기다리지 않고 글자를 내보내는 방식으로, 60개 언어를 지원한다.
녹음이 끝난 파일을 통째로 받아 글자로 옮기는 기존 'MAI-Transcribe-2'와 달리, 말하는 동안 중간 결과를 계속 갱신하다가 문장이 끝나면 최종본을 확정한다.
MS는 이 모델이 출시 시점에 인공지능 성능 분석 업체 아티피셜 애널리시스(Artificial Analysis)의 '단어 오류율(WER) 순위표' 1위에 올랐다고 밝혔다.
단어 오류율은 최종 받아쓰기 결과에서 잘못 옮겨진 단어의 비율을 뜻하며 낮을수록 정확하다.
더 딥뷰에 따르면 xAI의 그록, 메타, 오픈AI 모델을 앞질렀다.
MS가 제시한 수치는 최종 결과 기준 2.5%다. 다만 이 수치는 MS가 발표한 것이다.
그러나 일부 분석 매체는 해당 평가 기관의 공개 스트리밍 순위표에 이 모델이 아직 반영되지 않아 독립적인 검증 결과는 확인할 수 없다고 지적했다.
속도도 강조점이다. MS는 음성을 받은 뒤 이르면 100밀리초(1000분의 1초 단위, 0.1초) 만에 글자를 내놓을 수 있다고 설명한다.
이런 짧은 지연 시간은 AI 서비스에 실질적인 차이를 만든다. AI가 사용자의 말이 끝나기 전부터 내용을 파악하고 작업을 시작할 수 있기 때문이다.
실시간 자막이나 받아쓰기에서는 MS 내부 평가상 가장 가까운 경쟁 모델보다 두 배 빠르다는 것이 MS의 주장이다.
한 분석 매체가 정리한 자료에는 말이 끝난 뒤 최종 결과가 나오기까지 0.13초가 걸려, 같은 조건에서 그록 보이스 트랜스크라이브 2.0(0.49초)과 뮤즈 보이스 트랜스크라이브(0.16초)보다 짧았다.
이용 요금은 오디오 1시간당 0.54달러다. 연말까지 적용되는 도입 특가라고 한 분석 매체는 전했다. 완성된 앱이 아니라 개발자가 자사 서비스에 붙여 쓰는 API(프로그램 연결 규격) 형태로 제공된다.
MS는 같은 날 글자를 음성으로 읽어 주는 '텍스트 음성 변환(TTS)' 모델 두 종도 함께 내놓았다. 'MAI-Voice-2.1'은 MS가 가장 강력한 다국어 TTS 모델로 소개한 제품으로, 지원 범위를 23개 언어, 26개 지역(로케일)으로 넓혔다.
로케일은 같은 언어라도 국가나 지역에 따라 달라지는 발음과 표현 체계를 가리킨다.
'MAI-Voice-2.1-Flash'는 지원 언어는 같지만, 동시에 많은 요청이 몰리고 응답 속도가 중요한 환경에 맞게 최적화됐다.
한 매체는 이 경량형이 약 45초 분량의 오디오를 만들기 시작하기까지 150밀리초가 걸리며, 처리 속도가 표준형보다 55% 빠르다고 MS가 측정했다고 전했다.
음성 AI가 소프트웨어와 기기 전반에서 사람과 자연스럽게 대화하는 '음성 에이전트'의 기반으로 떠오르면서 이 시장을 노리는 곳은 MS만이 아니다.
음악 생성 AI로 알려진 수노(Suno)도 같은 날 새 모델 '스피치(Speech)'를 공개했다.
수노는 이를 목소리와 음악을 하나의 완결된 트랙으로 함께 만들어 내는 최초의 오디오 모델이라고 소개했다.
사용자가 글을 입력하고 원하는 목소리와 음악 스타일을 설명하면, 그에 맞는 목소리의 낭독에 어울리는 오리지널 배경음악이 입혀진 결과물이 나온다.
수노는 한 달간 소규모 사용자 테스트를 거쳐 이를 전체 이용자에게 베타(시험판)로 열었다.
해당 기능은 웹과 모바일에서 쓸 수 있다.
수노는 시험판 단계라 완벽하지 않다고 직접 밝혔는데, 영국식 억양이 호주식으로 흘러가거나 극적인 쉼이 지나치게 과장되는 경우가 있다는 설명이다. 배경음악을 끄는 옵션이 있고, 생성 가능한 길이는 최대 약 8분이다.
더 딥뷰는 MS의 최근 모델들이 모두 특정 분야에 특화돼 있다는 점에 주목했다.
MS AI의 첫 추론 모델 'MAI-Thinking-1', 코딩 지원에 집중한 'MAI-Code-1.1-Flash', 가장 진보한 이미지 모델 'MAI-Image-2.6'이 그 예다.
이 매체는 분야별로 모델을 나누면 자원을 한곳에 집중해 품질과 성능을 끌어올릴 수 있고, 규모가 작은 이들 모델이 내놓은 우수한 벤치마크(성능 비교 시험) 결과가 이를 보여 준다고 분석했다.
반대로 폭넓은 용도를 아우르는 범용 모델을 만드는 데는 막대한 자원이 든다는 것이다.
업무마다 AI를 특정 용도로 쓰는 기업 고객을 겨냥하기에도 적합한 전략이라는 평가다. 이 매체는 엔지니어에게는 날씨 패턴을 알려 주고 수학도 푸는 범용 모델보다 최고 수준의 코딩 모델이 더 중요하다는 예를 들었다.