Reelina

xAI STT v1 — Reelina AI サウンド

ISO 639-1言語コード(フィリピノ語は「fil」を使用)。このパラメータの設定に関係なく、モデルは対応するあらゆる言語の音声を文字起こしします。これを設定し、text_normalization=trueと組み合わせることで、数値、通貨、単位をその言語の書記形式に整形できます。自動言語検出を使う場合は未設定のままにしてください。

テキスト正規化

trueの場合、逆テキスト正規化(Inverse Text Normalization)を有効にします。これは文字起こしのテキスト表記に関する設定であり、音声フォーマットには影響しません。

話者分離

trueの場合、話者分離(スピーカーダイアライゼーション)が有効になります。結果内の各単語には、検出された話者を識別するspeaker_idフィールドが含まれます。

マルチチャンネル

trueの場合、各オーディオチャンネルを個別に文字起こしします。

フィラーワード

trueの場合、フィラー(「あの」「えー」など)が文字起こしに含まれます。false(デフォルト)の場合は自動的に除去されます。

文字起こしで優先させたいキーワード(例:製品名)。最大100語、各語は最大50文字。

ヘッダーなしのRAW音声用のフォーマットヒント。コンテナ形式(mp3、wavなど)の場合は自動検出されるため、値を「auto」に設定してください。

サンプルレート(Hz)。RAW音声(pcm、mulaw、alaw)の場合のみ必須です。

オーディオチャンネル数(2〜8)。マルチチャンネルのraw音声の場合のみ必須です。コンテナ形式の場合は自動検出されます。

xAI STT v1 について

xAI STT v1は、音声を正確でフォーマット済みのテキストに書き起こす、プロダクショングレードのspeech-to-textモデルです。自動言語検出、単語単位のタイムスタンプ、話者分離、マルチチャンネル文字起こし、逆テキスト正規化を備えた24以上の言語に対応。

仕様

提供元xAI
種類音声生成
1回あたりの費用 1 クレジット
入力テキストプロンプト

xAI STT v1 の代替モデル

このワークスペースで同じ用途に使えるモデル。価格が近い順に並んでいます。クレジット残高はすべてのモデルで共通です。

よくある質問

xAI STT v1 とは?
xAI STT v1は、音声を正確でフォーマット済みのテキストに書き起こす、プロダクショングレードのspeech-to-textモデルです。自動言語検出、単語単位のタイムスタンプ、話者分離、マルチチャンネル文字起こし、逆テキスト正規化を備えた24以上の言語に対応。
xAI STT v1 の料金は?
xAI STT v1 は1回の実行につき 1 クレジットで、Reelina の残高から差し引かれます。正確な費用は「生成」を押す前に表示され、1つの残高ですべてのモデルを利用できます。モデルごとの個別契約はありません。
xAI STT v1 を使うには何が必要ですか?
作りたいものを説明するテキストプロンプト。アップロードは不要です。
生成物を商用利用できますか?
生成したものはあなたのものです(利用規約と使用許諾ポリシーの範囲内)。業務上重要な用途では、選んだモデルのライセンスをご確認ください。
ファイルはどのくらい保存されますか?
アップロードされたファイルは結果の生成にのみ使われます。作成物は既定で非公開で、生成から1週間後にすべて削除されます。

ほかをお探しですか? すべてのモデルを見る.