Microsoft、自社開発の音声認識AIモデル「MAI-Transcribe-1」を公開——25言語でWhisperを超える精度、GPU費用は半減

Microsoftは2026年4月2日、自社開発の音声認識AIモデル「MAI-Transcribe-1」のパブリックプレビューを開始した。同時に音声生成モデル「MAI-Voice-1」、テキスト→画像生成モデル「MAI-Image-2」の3モデルをMicrosoft Foundryおよびデベロッパー向けのMAI Playgroundで公開した。

MAI-Transcribe-1は主要25言語に対応した音声認識(Speech-to-Text)モデルだ。業界標準ベンチマーク「FLEURS」での評価では、単語誤り率(WER)3.8%を達成し、OpenAI Whisper large-v3、GPT-Transcribe、Google Gemini 3.1 Flash-Liteを上回り、対応25言語中11言語でトップの精度を記録した。GPU処理コストは競合製品比で約50%削減されており、エンタープライズ向けにコスト効率が高い設計となっている。

https://microsoft.ai/news/today-were-announcing-3-new-world-class-mai-models-available-in-foundry/

同モデルはバックグラウンドノイズ、低品質音声、複数人が同時に話す状況など、現実の過酷な収録環境での利用を想定して構築されている。ビジネス向けの主な活用シーンとしては、会議のリアルタイム文字起こし、コールセンターの通話分析、動画字幕の自動生成、アクセシビリティ対応、音声エージェント構築などが挙げられる。

音声生成モデルMAI-Voice-1は1枚のGPUで60秒分の表現豊かな音声を1秒未満で生成できる。MAI-Image-2はテキストから画像を生成するモデルで、Arena.aiの画像モデルリーダーボードで第3位にデビューした。Microsoftは、これらのモデルがすでにCopilot、Bing、PowerPointなどの自社製品に組み込まれていると説明している。

関連記事

最新ニュース記事

  1. ファミリーマート、新業態「FAMIMA」始動 初の旗艦店を7月10日に麻布台オープン

  2. xAI、新型AIモデル「Grok 4.5」発表 コーディングとエージェント処理に特化

  3. OpenAI、新世代音声モデル「GPT-Live」発表 ChatGPT音声を全面刷新

  4. Meta、画像生成AI「Muse Image」発表 Instagramなどに順次展開

  5. Anthropic、「Claude Cowork」をモバイル・ウェブに拡大 ノートPCを閉じても処理継続

  6. 紀伊半島の旅は南紀白浜から「INFINITO HOTEL&SPA 南紀白浜」が誇るインフィニティビューの絶景と源泉かけ流し

  7. アドビ、企業向け生成AIワークフロー基盤「Firefly Graph」提供開始

  8. Hyundai、人型ロボット「Atlas」がW杯ラウンド16に登場 史上初のライブ試合運用

  9. 累計40万件突破の100円保険「熱中症お見舞い金」がLINEに登場!手軽な備えと歩く習慣で猛暑を乗り切る

  10. 生成AI活用企業の7割超、社外に「積極公表せず」 アマナ調査で判明

365AIニュースセンター最新記事

  1. 不登校からの復学へ!お子様の心を動かす7つのきっかけ

  2. 入学できないことも?「フリースクール入学拒否問題」の現実とその対処法

  3. フリースクール中学校・通信制高校生の卒業後の進路:進学以外の就職という選択肢

  4. 中学生の不登校、30万人突破 – 教育現場の危機と新たな希望

  5. 【専門家が伝える】不登校のお子様を持つ親御様の「心の荷」を軽くする5つのヒント

  6. 不登校脱出への道?フリースクールの魅力と注意点-親子で考える新たな一歩-

  7. Amazonが「プライムデー夏祭り」を六本木で開催!

  8. 甘いとうもろこしとフライドチキンの絶妙コンビ。夏限定!「もろこしチーズバーガー」新登場