2026年10月9日金曜日 掲載メディア5Newsについて🌓
🇯🇵 JP ▾
速報
› ブックオフに不正アクセス、最大約643万件の個人情報流出 氏名、住所、ハッシュ化パスワードなど› Trump says U.S. won’t attack Iran before midterm elections› 子どもを持つ未来を当たり前に LGBTQファミリー写真展 香川› Anthropic、Claudeへの“虐待”を利用ポリシーで禁止 影響工作の規定も集約› 「タクシー代を節約」自転車2台盗んだ自衛官を停職10日 山口› ローソン、215万件の個人情報漏えい 「ユーザー本人に情報を表示する機構」に不正アクセス› 映画の推し事:米軍の特権“証拠映像”はこう撮った 「東京上空300メートル」› IDCFクラウド障害、顧客データ「取り出し・復元困難」 復元は顧客側のバックアップ頼み› Apple、10月13日に「Welcome home.」イベント開催› Tokyo walks away with two spots on 50 Best Bars list› ブックオフに不正アクセス、最大約643万件の個人情報流出 氏名、住所、ハッシュ化パスワードなど› Trump says U.S. won’t attack Iran before midterm elections› 子どもを持つ未来を当たり前に LGBTQファミリー写真展 香川› Anthropic、Claudeへの“虐待”を利用ポリシーで禁止 影響工作の規定も集約› 「タクシー代を節約」自転車2台盗んだ自衛官を停職10日 山口› ローソン、215万件の個人情報漏えい 「ユーザー本人に情報を表示する機構」に不正アクセス› 映画の推し事:米軍の特権“証拠映像”はこう撮った 「東京上空300メートル」› IDCFクラウド障害、顧客データ「取り出し・復元困難」 復元は顧客側のバックアップ頼み› Apple、10月13日に「Welcome home.」イベント開催› Tokyo walks away with two spots on 50 Best Bars list
テクノロジー

最大8人の話者を識別しつつリアルタイム文字起こしできるAIモデル「NVIDIA Nemotron 3 Diarization」がオープンモデルとして公開される

GIGAZINE ·
最大8人の話者を識別しつつリアルタイム文字起こしできるAIモデル「NVIDIA Nemotron 3 Diarization」がオープンモデルとして公開される

親愛なる読者の皆さまへ。ご存じの通り価格高騰などの悪影響でサーバー運営がとても苦しい状態です。回線や台数を整理し見直せる部分は全て見直しましたが、やはりまだ危険水域です。このままだと1ページを10分割ぐらいして無理矢理PVを増やさざるを得なくなってしまいます。そこで、GIGAZINEの物理的なサーバーたちを、たった1円でも良いので親愛なる読者の皆さまに支援してもらえればとっても助かります!今すぐ寄付は上のボタンから! ・ これまでGIGAZINEを支援してくれたメンバーのリスト

NVIDIAが音声認識AIモデル「 NVIDIA Nemotron 3 Diarization 」を公開しました。最大8人の話者を識別しつつリアルタイムでの文字起こしが可能です。 Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization https://huggingface.co/blog/nvidia/nemotron-diarization NVIDIA Nemotron 3 Diarizationの動作例は以下の動画で確認できます。話者の切り替わりを正しく認識しつつ、正確に文字起こしできています。 Argmax Pro SDK 3 - YouTube

NVIDIA Nemotron 3 Diarizationは「話者を識別する処理」と「文字起こしする処理」を別々に実行します。話者識別は「あらかじめ各人物の声色を登録する」というシステムではなく、「登場する話者を順番に『話者1』『話者2』と認識していく」というシステムを採用しています。

学習データは公開データセットや David AI からライセンス供与されたデータセットを利用したとのこと。話者識別性能を競う Voice ArenaのDiarization Bench ではMetaのMuse Voice Transcribeなどを上回って参加モデルの中でトップの成績を収めました。

テストに含まれる音声データの例が以下。4人の話者による会話音声で、重複する部分が多くて人間でも聞き分けが難しい音声ですが、NVIDIA Nemotron 3 Diarizationはかなり正確に話者を識別できました。

Nemotron 3 Diarization ranked #1 of 12 systems in @voicearena_ai 's initial Diarization-Bench results. Its 14.72% error rate was ~24% lower than the runner-up. Here’s a four-speaker comparison from the benchmark. Full results: https://t.co/q3iXtsmHcz pic.twitter.com/066OrH0Lji

NVIDIA Nemotron 3 Diarizationのデモは以下のリンク先で確認できます。 Live Speaker Diarization - a Hugging Face Space by nvidia https://huggingface.co/spaces/nvidia/nemotron-diarization NVIDIA Nemotron 3 Diarizationはオープンモデルとして公開されており、以下のリンク先で配布されています。ライセンスは OpenMDW-1.1 です。 nvidia/Nemotron-3-Diarization · Hugging Face https://huggingface.co/nvidia/Nemotron-3-Diarization

・関連記事 Apple Watchで周囲の音を聞き取ってAIが分析する「Audio Intelligence」はどうやってプライバシーを保護するのか - GIGAZINE Microsoftが文字起こしAI「MAI-Transcribe-2」をリリース、Gemini 3.5 Transcribeより5倍高速&GPT-Transcribeより10倍高速 - GIGAZINE Metaがリアルタイム文字起こしAI「Muse Voice Transcribe」をリリース - GIGAZINE 「あー」「えー」などを自動削除しつつリアルタイムで文字起こししできる音声認識モデル「Gemini 3.5 Transcribe」をGoogleが発表 - GIGAZINE 「Qwen3.8-Omni-Flash」リリース、Gemini 3.8 Flashに匹敵する音声・映像処理性能を達成 - GIGAZINE

You can read the machine translated English article NVIDIA Nemotron 3 Diarization, an AI mod… .

GIGAZINEで全文を読む ›

この要約はメディアの公開フィードから5Newsが集約したものです。 文脈も含めた全文はgigazine.netにあります — コンテンツの権利はGIGAZINEに帰属します。

GIGAZINEのその他の記事

すべて見る ›

テクノロジーのその他の記事

すべて見る ›