その他 – とれまがニュース

経済や政治がわかる新聞社や通信社の時事ニュースなど配信

とれまが – 個人ブログがポータルサイトに!みんなでつくるポータルサイト。経済や政治がわかる新聞社や通信社の時事ニュースなど配信
RSS
製品 サービス 企業動向 業績報告 調査・報告 技術・開発 告知・募集 人事 その他
とれまが >  ニュース  > リリースニュース  > その他

CPUだけで動く日本語音声認識エンジンを開発、認識精度でWhisper large-v3・Google STTを大きく上回る

合同会社 Third Door

CPUだけで動く日本語音声認識エンジンを開発、認識精

JSUT全量5,000発話の同一条件比較で文字誤り率1.86%。ノートPC(Apple M4)のCPUで実時間の約13倍速で動作。ブラウザで試せるデモを公開


合同会社Third Door(本社:東京都港区)は、GPUを必要とせず一般的なPCのCPUだけで動作する日本語音声認識(STT)エンジンを開発しました。公開評価データ「JSUT basic5000」の全量5,000発話を用いた同一条件の比較において、文字誤り率(CER)1.86%を記録し、OpenAI社の「Whisper large-v3」(3.15%)およびGoogle社の「Google Speech-to-Text」(3.29%)を上回りました。処理速度はノートPC(Apple M4)のCPU上で実時間の約13倍速です。
本エンジンは、ブラウザから試せるデモページで公開しています。
デモページ: https://third-door.net/stt/
[画像1: https://prcdn.freetls.fastly.net/release_image/180552/1/180552-1-a39d1e647f06f510cbb1b7c226f38870-1261x806.png?width=536&quality=85%2C75&format=jpeg&auto=webp&fit=bounds&bg-color=fff ]


■ 開発の背景 ― 音声はAIの「入口」になる
生成AIの普及により、AIとの対話手段はテキストから音声へ広がりつつあります。電話応対の自動化や音声アシスタントにおいて、音声認識はAIシステムの最初の入口であり、その品質がシステム全体の品質を決定づけます。
音声対話システムでは、音声認識が1文字を誤るだけで、後段のAIがまったく別の意図として応答してしまいます。また、応答までの時間が長いと会話は不自然になります。さらに、高精度な音声認識の多くはGPUやクラウドAPIを前提としており、回線ごとにGPUを用意することや、音声データを外部に送信することが難しい用途では導入の障壁となっていました。
当社は「精度」「速度」「動作環境」の3点を同時に満たす音声認識エンジンの開発に取り組みました。
■ 評価結果
比較の妥当性を担保するため、以下の条件を統一して評価しました。
- 評価データ:JSUT basic5000(公開日本語音声コーパス)の全量5,000発話- 正解ラベル:人手で整備された読み仮名データ(jsut-label)- 採点方法:文字誤り率(CER)。記号・句読点を除去し、表記ゆれの正規化は3システムすべてに同一処理を適用- 速度測定:同一マシン(Apple M4搭載ノートPC、CPUのみ)で1発話ずつ逐次処理
[画像2: https://prcdn.freetls.fastly.net/release_image/180552/1/180552-1-f3c83c80b9a99b31e2a34661809a6473-2400x1520.png?width=536&quality=85%2C75&format=jpeg&auto=webp&fit=bounds&bg-color=fff ]


主な結果は以下のとおりです。
- 認識誤りを約4割削減:CER 1.86%は、比較対象2システム(3.15%/3.29%)に対し誤り率で約4割少ない水準です- 5,000発話中約3,700発話を完全一致:完全一致率73.4%は、比較対象(63.0%/59.4%)を10ポイント以上上回ります- モデルサイズ約5分の1でCPU動作:Whisper large-v3の約5分の1のパラメータ数でありながら精度で上回り、同一CPU上で約12倍高速に動作します
■ 英語音声認識でも同等の成果
同一の設計方針を英語にも適用し、公開評価データ「LibriSpeech test-clean」の全量評価において、単語誤り率(WER)1.91%(CPU動作版は2.24%)を記録しました。同一採点条件のWhisper large-v3(2.47%)を上回っています。
■ 想定される活用領域
- 電話応対の自動化(AIによる一次応対、要件のヒアリング)- 会議・商談の議事録作成- 音声データを外部に送信できない環境での文字起こし(オンプレミス運用)- 組込み機器・エッジ環境での音声インターフェース
GPUを必要としないため、1台のサーバーで多数の同時処理を行う構成や、既存のPC資産を活用した導入が可能です。
■ デモページを公開
ブラウザから実際の認識精度と応答速度を体験できるデモページを公開しています。
デモページ: https://third-door.net/stt/
(「開始」ボタンを押してマイクに話しかけると、その場で認識結果が表示されます。最新版のChrome/Edge/Safari、およびマイクの使用許可が必要です)
■ 今後の展開
当社は本音声認識エンジンをAI電話応対システムに組み込み、音声対話サービスとして提供してまいります。
英語版デモの公開および対応言語の拡充も順次進めてまいります。

会社概要
- 会社名:合同会社 Third Door- 所在地:東京都千代田区神田和泉町1番地6-16 ヤマトビル405- 代表者:鴨志田 雅樹- 設立:2023年12月- 事業内容:AIシステムの研究開発、AI技術コンサルティング- URL:https://third-door.net/
本件に関するお問い合わせ
- LINE:https://lin.ee/5fndIVe

プレスリリース提供:PR TIMES

CPUだけで動く日本語音声認識エンジンを開発、認識精

記事提供:PRTimes

記事引用:アメーバ?  ブックマーク: Google Bookmarks  Yahoo!ブックマークに登録  livedoor clip  Hatena ブックマーク  Buzzurl ブックマーク

ニュース画像

一覧

とれまがマネー

とれまがマネー

IR動画

一覧

とれまがニュースは、時事通信社、カブ知恵、Digital PR Platform、BUSINESS WIRE、エコノミックニュース、News2u、@Press、ABNNewswire、済龍、DreamNews、NEWS ON、PR TIMES、LEAFHIDEから情報提供を受けています。当サイトに掲載されている情報は必ずしも完全なものではなく、正確性・安全性を保証するものではありません。当社は、当サイトにて配信される情報を用いて行う判断の一切について責任を負うものではありません。

とれまがニュースは以下の配信元にご支援頂いております。

時事通信社 IR Times カブ知恵 Digital PR Platform Business Wire エコノミックニュース News2u

@Press ABN Newswire 済龍 DreamNews NEWS ON PR TIMES LEAF HIDE

Copyright (C) 2006-2026 sitescope co.,ltd. All Rights Reserved.