2026年8月27日木曜日 掲載メディア5Newsについて🌓
🇯🇵 JP ▾
速報
東邦ガス、5年ぶりに初戦突破 JR四国に勝利 都市対抗野球 BOJ deputy chief keeps door open to September rate increase Kioxia plans new chip fab in Japan to meet AI memory demand 日本製鉄かずさマジックvs東海理化のスタメン発表 都市対抗 Starting this fall, you’ll be able to take a Pokémon Jet flight to Japan 「レスレリアーナのアトリエ」サービス終了へ 開始から約3年で Mark Walter’s company says Dodgers not for sale 教員1人で対応せず録音を カスハラ対策の指針公表へ 文科省 「Twitter」が帰ってきた? 元Twitter法務のスタートアップが新SNS立ち上げ Xとは係争中 前衛美術家の草間彌生さん死去 97歳 水玉模様絵画、世界で活躍 東邦ガス、5年ぶりに初戦突破 JR四国に勝利 都市対抗野球 BOJ deputy chief keeps door open to September rate increase Kioxia plans new chip fab in Japan to meet AI memory demand 日本製鉄かずさマジックvs東海理化のスタメン発表 都市対抗 Starting this fall, you’ll be able to take a Pokémon Jet flight to Japan 「レスレリアーナのアトリエ」サービス終了へ 開始から約3年で Mark Walter’s company says Dodgers not for sale 教員1人で対応せず録音を カスハラ対策の指針公表へ 文科省 「Twitter」が帰ってきた? 元Twitter法務のスタートアップが新SNS立ち上げ Xとは係争中 前衛美術家の草間彌生さん死去 97歳 水玉模様絵画、世界で活躍
テクノロジー

「あー」「えー」などを自動削除しつつリアルタイムで文字起こししできる音声認識モデル「Gemini 3.5 Transcribe」をGoogleが発表

GIGAZINE ·
「あー」「えー」などを自動削除しつつリアルタイムで文字起こししできる音声認識モデル「Gemini 3.5 Transcribe」をGoogleが発表

親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト

ノイズや複雑な専門用語、話し言葉などにも苦しむことなく、生の音声データから正確で洗練された書式設定済みテキストを生成できる音声認識モデル「 Gemini 3.5 Transcribe 」をGoogleが発表しました。 Introducing Gemini 3.5 Transcribe https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ 「 Gemini 3.5 Transcribe 」は音声エージェント、リアルタイム字幕ツール、通話内容分析パイプラインなど、どんな開発ワークフローにでもシームレスに組み込めるよう設計された文字起こしAIで、Live APIとInteractions APIの2つのAPI経由で利用可能です。

Live APIは、対話型音声アプリ向けに1秒未満のレイテンシーで継続的双方向ストリーミングを提供するもの。Interactions APIは録音された音声を話者ごとに識別した上で、単語単位のタイムスタンプ付きで文字起こしをしてくれます。 すでにAndroidの音声入力機能「 Rambler 」やmacOS版Geminiの音声機能などを通じて、Gemini 3.5 Transcribeの恩恵はユーザーに届いていますが、今後、開発者はGoogle AI StudioのGemini APIやGemini Enterprise Agent Platformでも、Gemini 3.5 Transcribeを活用して同種の機能を構築できるようになります。 文字起こしでは「あー」「えー」のように、相づちや次の言葉を考える間に発しただけの特に意味のない間投詞を自動的に削除します。平均の単語誤り率(WER)はストリーミング時で4.0%、非ストリーミング時だと2.6%を達成。対応言語は85以上で、専門用語や独自のつづりに対応するカスタム語彙の追加にも対応しています。 先行する文字起こしモデル「Chirp 3」と比べると大幅な進化を遂げており、Artificial Analysisによる測定では、最終的な文字起こしまでの所要時間が70%短縮されたとのこと。 以下は102言語の音声認識・言語評価モデル用多言語音声データセット・FLEURSのストリーミング時ベンチマークスコア。値が低いほど優秀で、Gemini 3.5 TranscribeはChirp 3をはじめとした他モデルより優秀と評価されています。

・関連記事 OpenAIが文字起こしAI「GPT Transcribe」と「GPT Live Transcribe」をリリース - GIGAZINE すべての文字起こしAIモデルをサポートするGGMLベースの文字起こしライブラリ「transcribe.cpp」、ほぼそのままでwhisper.cppと置き換え可能 - GIGAZINE 日本語にも対応したオープンソースの文字起こし専用音声認識モデル「Transcribe」をCohereが発表 - GIGAZINE 無料で日本語もサポートしリアルタイム音声アプリをWhisperより高精度で開発できるオープンソースAIツールキット「Moonshine Voice」 - GIGAZINE Mistral AIが文字起こしAI「Voxtral Mini Transcribe V2」と「Voxtral Realtime」を発表 - GIGAZINE 無料&広告なしで音声をテキストに変換できるアプリ「Notely Voice」レビュー、ネット接続不要でスマホのみでWhisperを実行して長文メモを簡単に作れる - GIGAZINE Metaが1600以上の言語に対応した文字起こしAI「Omnilingual ASR」を公開 - GIGAZINE 無料で音声テキスト変換がオフラインで可能なオープンソースアプリ「Handy」 - GIGAZINE

You can read the machine translated English article Google has announced 'Gemini 3.5 Transcr… .

GIGAZINEで全文を読む ›

この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。

GIGAZINEのその他の記事

すべて見る ›

テクノロジーのその他の記事

すべて見る ›