fish-audio logo
fish-audio

Fish Audio: Transcribe 1

出典の説明(英語)

Transcribe 1 is a speech-to-text model from Fish Audio. It is suited for audio transcription with automatic language detection and can return timestamped word-level segments when alignment details are requested.

概要

モデル仕様

コンテキスト
情報なし
最大出力
情報なし
アーキテクチャ
audio->transcription
トークナイザー
Other
知識カットオフ
情報なし
モデレーション
いいえ
OPENROUTER

料金の詳細

OpenRouterと同期した料金です。トークン料金は100万トークン単位です。

音声の長さ
$0.0001
1秒あたり
API

クイックスタート

ローカルにOPENROUTER_API_KEYを設定してください。Pythonにはrequestsが必要です。JavaScriptはNode.jsで実行し、キーはサーバー側で管理してください。

APIドキュメント

curl --fail-with-body https://openrouter.ai/api/v1/audio/transcriptions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -F 'model=fish-audio/transcribe-1' \
  -F 'file=@audio.wav'
機能とモダリティ

入力出力

入力
audio
出力
transcription
API

対応APIパラメータ

利用可能なプロバイダー

1 プロバイダー

確認日: 2026年9月7日

OpenRouterでプロバイダーを見る

可用性、遅延、スループット、ルーティングは常時変化します。最新情報は出典ページで確認してください。

OpenRouter

Fish Audio

情報なし
コンテキスト
情報なし
最大出力
情報なし
fish-audio

4 モデル

すべてのモデル
fish-audio logofish-audio

Fish Audio: S1

S1 is a multilingual text-to-speech model from Fish Audio. It is suited for voice applications that need broad emotional expression, using parenthetical controls to guide speaking style across its supported...

コンテキスト
情報なし
入力
text
出力
speech
UTF-8バイト: $15 100万UTF-8バイトあたり
モデル詳細を見る
fish-audio logofish-audio

Fish Audio: S2 Pro

S2 Pro is a multilingual text-to-speech model from Fish Audio. It is suited for expressive narration and multi-speaker dialogue, with natural-language controls for speaking style and emotion.

コンテキスト
情報なし
入力
text
出力
speech
UTF-8バイト: $15 100万UTF-8バイトあたり
モデル詳細を見る
fish-audio logofish-audio

Fish Audio: S2.1 Pro Free (free)

S2.1 Pro Free is the no-cost variant of Fish Audio S2.1 Pro, intended for testing, prototyping, and low-volume applications. It provides the same synthesis capabilities without production latency or availability...

コンテキスト
情報なし
入力
text
出力
speech
入力: 無料 100万トークンあたり出力: 無料 100万トークンあたり
モデル詳細を見る
fish-audio logofish-audio

Fish Audio: S2.1 Pro

S2.1 Pro is a production-oriented text-to-speech model from Fish Audio. It is suited for multilingual voice applications, expressive narration, and dialogue synthesis, with open-ended natural-language controls for speaking style and...

コンテキスト
情報なし
入力
text
出力
speech
UTF-8バイト: $15 100万UTF-8バイトあたり
モデル詳細を見る