xAI STT v1 — Reelina AI サウンド
ISO 639-1言語コード(フィリピノ語は「fil」を使用)。このパラメータの設定に関係なく、モデルは対応するあらゆる言語の音声を文字起こしします。これを設定し、text_normalization=trueと組み合わせることで、数値、通貨、単位をその言語の書記形式に整形できます。自動言語検出を使う場合は未設定のままにしてください。
trueの場合、逆テキスト正規化(Inverse Text Normalization)を有効にします。これは文字起こしのテキスト表記に関する設定であり、音声フォーマットには影響しません。
trueの場合、話者分離(スピーカーダイアライゼーション)が有効になります。結果内の各単語には、検出された話者を識別するspeaker_idフィールドが含まれます。
trueの場合、各オーディオチャンネルを個別に文字起こしします。
trueの場合、フィラー(「あの」「えー」など)が文字起こしに含まれます。false(デフォルト)の場合は自動的に除去されます。
文字起こしで優先させたいキーワード(例:製品名)。最大100語、各語は最大50文字。
ヘッダーなしのRAW音声用のフォーマットヒント。コンテナ形式(mp3、wavなど)の場合は自動検出されるため、値を「auto」に設定してください。
サンプルレート(Hz)。RAW音声(pcm、mulaw、alaw)の場合のみ必須です。
オーディオチャンネル数(2〜8)。マルチチャンネルのraw音声の場合のみ必須です。コンテナ形式の場合は自動検出されます。
xAI STT v1 について
xAI STT v1は、音声を正確でフォーマット済みのテキストに書き起こす、プロダクショングレードのspeech-to-textモデルです。自動言語検出、単語単位のタイムスタンプ、話者分離、マルチチャンネル文字起こし、逆テキスト正規化を備えた24以上の言語に対応。
仕様
| 提供元 | xAI |
|---|---|
| 種類 | 音声生成 |
| 1回あたりの費用 | 1 クレジット |
| 入力 | テキストプロンプト |
xAI STT v1 の代替モデル
このワークスペースで同じ用途に使えるモデル。価格が近い順に並んでいます。クレジット残高はすべてのモデルで共通です。
よくある質問
- xAI STT v1 とは?
- xAI STT v1は、音声を正確でフォーマット済みのテキストに書き起こす、プロダクショングレードのspeech-to-textモデルです。自動言語検出、単語単位のタイムスタンプ、話者分離、マルチチャンネル文字起こし、逆テキスト正規化を備えた24以上の言語に対応。
- xAI STT v1 の料金は?
- xAI STT v1 は1回の実行につき 1 クレジットで、Reelina の残高から差し引かれます。正確な費用は「生成」を押す前に表示され、1つの残高ですべてのモデルを利用できます。モデルごとの個別契約はありません。
- xAI STT v1 を使うには何が必要ですか?
- 作りたいものを説明するテキストプロンプト。アップロードは不要です。
- 生成物を商用利用できますか?
- 生成したものはあなたのものです(利用規約と使用許諾ポリシーの範囲内)。業務上重要な用途では、選んだモデルのライセンスをご確認ください。
- ファイルはどのくらい保存されますか?
- アップロードされたファイルは結果の生成にのみ使われます。作成物は既定で非公開で、生成から1週間後にすべて削除されます。
ほかをお探しですか? すべてのモデルを見る.
