Microsoft、自社開発の音声認識AIモデル「MAI-Transcribe-1」を公開——25言語でWhisperを超える精度、GPU費用は半減

Microsoftは2026年4月2日、自社開発の音声認識AIモデル「MAI-Transcribe-1」のパブリックプレビューを開始した。同時に音声生成モデル「MAI-Voice-1」、テキスト→画像生成モデル「MAI-Image-2」の3モデルをMicrosoft Foundryおよびデベロッパー向けのMAI Playgroundで公開した。

MAI-Transcribe-1は主要25言語に対応した音声認識(Speech-to-Text)モデルだ。業界標準ベンチマーク「FLEURS」での評価では、単語誤り率(WER)3.8%を達成し、OpenAI Whisper large-v3、GPT-Transcribe、Google Gemini 3.1 Flash-Liteを上回り、対応25言語中11言語でトップの精度を記録した。GPU処理コストは競合製品比で約50%削減されており、エンタープライズ向けにコスト効率が高い設計となっている。

https://microsoft.ai/news/today-were-announcing-3-new-world-class-mai-models-available-in-foundry/

同モデルはバックグラウンドノイズ、低品質音声、複数人が同時に話す状況など、現実の過酷な収録環境での利用を想定して構築されている。ビジネス向けの主な活用シーンとしては、会議のリアルタイム文字起こし、コールセンターの通話分析、動画字幕の自動生成、アクセシビリティ対応、音声エージェント構築などが挙げられる。

音声生成モデルMAI-Voice-1は1枚のGPUで60秒分の表現豊かな音声を1秒未満で生成できる。MAI-Image-2はテキストから画像を生成するモデルで、Arena.aiの画像モデルリーダーボードで第3位にデビューした。Microsoftは、これらのモデルがすでにCopilot、Bing、PowerPointなどの自社製品に組み込まれていると説明している。

関連記事

最新ニュース記事

  1. 医療機関のキャッシュレス利用56%に 希望は78%、若年層では「病院選び」にも影響

  2. GMOフィナンシャルゲートとローソン、LINE活用の飲食注文実験開始 オフィス配送と店舗受取に対応

  3. LINEヤフー、Yahoo!ニュースのエキスパート知見をAIで提供 「Agent i」に第一弾「ふらおレシピ」搭載

  4. 介護現場に今も残る「大量FAX」、生成AIは事務負担をどこまで減らせるか

  5. Cursor開発元アニースフィア、コードホスティング新サービス「Origin」提供開始 GitHub連携も

  6. 駅前留学NOVA運営元、AI英会話アプリ「AI留学」提供開始 24時間スピーキング練習に対応

  7. グーグル、コーディング特化の新モデル「Gemini 3.7 Flash」公開 開発ベンチマークで大幅向上

  8. メタ、オープンウェイトAI「Muse Glimmer」公開 300億パラメータで手元のPC稼働を想定

  9. アンソロピック、Claude Coworkに「スキルを記録」機能 画面操作の実演を再利用可能な自動化へ

  10. グーグル、AIエージェント「Gemini Spark」を日本のAI Proユーザーへ拡大 24時間体制でタスク代行

365AIニュースセンター最新記事

  1. 不登校からの復学へ!お子様の心を動かす7つのきっかけ

  2. 入学できないことも?「フリースクール入学拒否問題」の現実とその対処法

  3. フリースクール中学校・通信制高校生の卒業後の進路:進学以外の就職という選択肢

  4. 中学生の不登校、30万人突破 – 教育現場の危機と新たな希望

  5. 【専門家が伝える】不登校のお子様を持つ親御様の「心の荷」を軽くする5つのヒント

  6. 不登校脱出への道?フリースクールの魅力と注意点-親子で考える新たな一歩-

  7. Amazonが「プライムデー夏祭り」を六本木で開催!

  8. 甘いとうもろこしとフライドチキンの絶妙コンビ。夏限定!「もろこしチーズバーガー」新登場