Cue v5 logo

Cue v5

音声エージェントが、いつ止まり、待ち、応答すべきかを判断できるようにする

Artificial Intelligence Developer Tools GitHub Open Source

概要

  • 音声エージェントの文字起こしや推論、音声合成とは別に、会話のどの瞬間に発話するかを判断するリアルタイム意思決定レイヤーです。
  • 通話者とエージェントの音声を160ミリ秒ごとに分析し、LLMが発話内容を考える一方で、Cueが発話のタイミングを制御します。
  • 高速な会話反射を担うSystem 1のように機能し、LLMの深い推論と連携して自然な音声対話を支援します。

主な特徴と評価結果

  • STOP、PAUSE、RESPONDの3アクションにより、割り込みや発話終了と、相づち・雑音・未完の発言中の間を区別します。
  • TurnBenchでは学習データを使用せずに割り込み再現率80%を達成し、会話の割り込み検知性能を検証しています。
  • AMI会議データでは、v4の24%からv5で61%へ割り込み再現率が向上し、誤検知率10%以下の運用点で評価されています。

こんな人・用途におすすめ

  • 電話対応や会話型AIを開発しており、ユーザーへの割り込み、応答の早すぎ・遅すぎといった問題を改善したいチームに適しています。
  • 公開済みのモデル重み、コード、研究資料を活用して、自社の音声エージェントへ統合したり独自検証を行ったりできます。
  • 多言語・多アクセントでのテスト、バグ報告、実行環境の改善など、音声対話技術の発展に貢献したい開発者にも向いています。
投票数: 0
← 投稿一覧に戻る