xAI STT v1 — Reelina AI 声音
ISO 639-1 语言代码(菲律宾语使用“fil”)。无论此参数如何设置,模型都会转写任何受支持语言的语音——将其与 text_normalization=true 一起设置,可将数字、货币和单位按该语言的书写形式进行格式化。留空则自动检测语言。
文本规范化
此设置控制的是转录文本的格式,而非音频格式。
说话人分离
设为 true 时,启用说话人分离。结果中的每个词都会包含一个 speaker_id 字段,用于标识检测到的说话人。
多声道
设为 true 时,将独立转录每个音频通道。
语气词
设为 true 时,转录中会包含语气词(例如“嗯”“啊”);设为 false(默认)时,将自动移除这些语气词。
希望转写结果偏向识别的关键词(例如产品名称)。最多 100 个词条,每个词条最多 50 个字符。
原始/无头音频的格式提示。对于容器格式(如 mp3、wav 等)会自动检测,请将值设为 'auto'。
采样率(Hz)。仅原始音频(pcm、mulaw、alaw)需要设置。
音频通道数(2-8)。仅在多通道原始音频时需要。容器格式会自动检测。
关于 xAI STT v1
xAI STT v1 是一款生产级 speech-to-text 模型,可将音频转录为准确、格式规范的文本。支持 24 种以上语言的自动语言检测、词级时间戳、说话人分离、多声道转录及逆文本规范化。
规格参数
| 提供方 | xAI |
|---|---|
| 类型 | 音频生成 |
| 单次运行费用 | 1 积分 |
| 输入 | 文本提示词 |
xAI STT v1 的替代模型
此工作区中能完成同样任务的模型,按价格接近程度排列。你的积分余额在所有模型间通用。
常见问题
- xAI STT v1 是什么?
- xAI STT v1 是一款生产级 speech-to-text 模型,可将音频转录为准确、格式规范的文本。支持 24 种以上语言的自动语言检测、词级时间戳、说话人分离、多声道转录及逆文本规范化。
- xAI STT v1 多少钱?
- xAI STT v1 每次运行 1 积分,从你的 Reelina 余额中扣除。点击「生成」前会显示准确费用,一份余额通用于所有模型——无需为每个模型单独订阅。
- 使用 xAI STT v1 需要准备什么?
- 一段描述你需求的文本提示词。无需上传。
- 生成结果可以商用吗?
- 你生成的内容归你所有,须遵守我们的条款与可接受使用政策。用于关键业务前,请查看所选模型的许可条款。
- 我的文件会保存多久?
- 上传文件仅用于生成你的结果。作品默认私密,生成一周后全部删除。
在找别的? 浏览全部模型.
