Qwen-Audio-3.1 logo

Qwen-Audio-3.1

音声・オーディオ・リアルタイムボイスのためのAIスタック

Artificial Intelligence API Audio

概要

  • 音声認識、音声合成、リアルタイム会話、オーディオ理解、音声コンテンツ生成を一つにまとめた、開発者向けの音声AI基盤です。
  • 多言語・方言対応から音声や効果音の生成まで、音声を扱うさまざまなアプリケーションの開発に活用できます。

主な特徴

  • ASRは多言語・方言の音声認識に対応し、対応モデルでは話者分離も可能です。ASR-Nextはキャプション生成、イベント特定、音声QA、推論を支援します。
  • TTSは感情や話し方、速度などを制御した多言語・クロスリンガル音声合成に対応し、TTS-Nextでは音声・効果音・背景音も生成できます。
  • リアルタイム機能では、割り込みに対応した全二重の音声会話に加え、関数呼び出しやウェブ検索を組み込めます。

こんな人におすすめ

  • 音声アシスタント、文字起こし、会話型アプリケーションなど、音声を中心としたプロダクトを開発するエンジニア。
  • 動画や音声コンテンツの制作、吹き替え、効果音生成など、クリエイティブ用途で音声AIを活用したいチーム。
投票数: 0
← 投稿一覧に戻る