Cekura Bench logo

Cekura Bench

実際の電話通話で音声間モデルを比較するベンチマーク

Artificial Intelligence Developer Tools SaaS

概要

  • 9種類のリアルタイム音声モデルを、同一の電話エージェント環境・プロンプト・ツール・電話回線で公平に比較できるベンチマークです。
  • 診療予約とメディケア受付の82シナリオを各3回実行し、正しい結果への到達と全項目の保存成功を合格条件としています。
  • 各通話の文字起こし、ツール呼び出し、評価スコアを公開し、結果を追跡・検証できる透明性を備えています。

主な評価結果・特徴

  • GPT Realtime 2.1は3回すべてで成功したシナリオが79.3%となり、最も高い信頼性を記録しました。
  • Phonic v1は中央値1.60秒の応答時間で最速、GPT Realtime 2.1 Miniは1分あたり0.020ドルで最も低コストでした。
  • Flux、GPT-4.1、ElevenLabs Flashを組み合わせたカスケード構成は成功率82.9%で、全リアルタイムモデルを上回りました。

こんな人におすすめ

  • 音声AIや電話エージェントを開発し、モデルごとの信頼性・速度・精度・コストを実際の通話で比較したいチームに適しています。
  • ベンチマーク結果の根拠となる通話記録やテストケースを確認し、再現可能な評価を行いたい研究者やエンジニアに向いています。
  • 導入モデルの選定や音声AIシステムの改善にあたり、STT・TTSを含む複数の評価データを参照したい方に役立ちます。
投票数: 143
← 投稿一覧に戻る