All models

s2.1-pro

Fish AudioAudio
110.28 Credits
Get your API key
s2.1-pro

用新一代语音能力完善自然配音工作流

Fish Audio S2.1 Pro 是 Fish Audio 推荐的生产语音模型,用于文本转语音与声音克隆。官方资料描述它相对 S2 Pro 改善了质量、延迟和吞吐,适合需要自然声音并持续制作配音的应用。本平台通过 model: s2.1-pro 明确选择此型号,沿用文本、音色参考、输出格式与任务回调接口。

Fish Audio模型品牌
文本转语音模型类型
声音克隆任务能力

规格与接口特性

在选型前明确型号、输入输出与调用方式。

模型选择
HTTP 请求头 model: s2.1-pro
平台接口
POST /fish/tts;text 为必填输入
音频交付
同步返回 audio_url;支持 callback_url 异步回调
输出格式
mp3、wav、pcm;wav 与 pcm 均返回 WAV 容器
声音参考
reference_id 或单个 references 样本,二者互斥
韵律控制
prosody.speed 控制语速,prosody.volume 控制音量增益

能力描述结合公开模型资料与本平台文档;实际参数、输出和计费规则以对应 API 和定价栏目为准。

核心能力

了解 s2.1-pro 适合解决的声音任务。

面向生产的语音升级

官方将 S2.1 Pro 定位为推荐生产型号,并说明其相对 S2 Pro 的质量、延迟和吞吐改善。选型时应在自己的文稿和声音样本上检查这些变化,不能把官方方向性描述转换为固定延迟或并发承诺。

复用已有声音资产

可通过 reference_id 使用已有声音,也可在一次请求中提供参考录音与准确逐字稿。沿用声音素材有助于比较新旧型号,但生成结果仍需要检查语气、发音与角色一致性。

在同一接口中组织制作任务

使用文本与格式设置提交合成,完成后取得 audio_url。长稿可以配置 callback_url,先保存任务编号,再接收完成结果;应用无需把一个等待中的任务展示为已交付音频。

适用场景

从具体内容和交付方式出发选择。

规模化内容配音

对经常更新的知识内容、商品讲解或产品教程,先选取代表性文稿评估,再逐步迁移制作流程。保存模型与音色信息,便于出现表达差异时定位设置。

自然声音的应用交互

将导航、讲解和帮助文本转为可播放音频,关注真实用户听到的清晰度与等待体验。此入口交付音频链接,实时对话应用需另行设计播放与缓冲。

已有配音流程的升级评估

用相同音色和文本比较 S2 Pro 与 S2.1 Pro,检查专有名词、长句、停顿和后期处理量。通过小批次试听决定迁移范围,避免直接批量替换已有成片。

如何选择这个模型

结合文稿、音色与制作成本进行比较。

显式使用新一代型号

本入口仍默认 s2-pro,使用 S2.1 Pro 应设置 model: s2.1-pro。不要仅依据“推荐生产型号”的官方定位就假定一次未指定型号的请求已经使用了它。

用自己的样本衡量升级收益

官方资料没有为本页面提供可承诺的固定改善百分比。比较音质、任务等待、校听和修订成本,再决定是否替换现有流程;长篇稳定朗读也可保留 S1 作为候选。

开始使用

先试听,再扩展到正式内容。

准备文稿与声音

明确朗读目的,校对文稿,选择保存音色或准备参考录音与逐字稿。

生成短样并校听

显式指定 s2.1-pro,用代表性段落确认发音、节奏和输出格式。

接入制作工作流

保存设置和任务编号,在完成后取得音频链接,再安排播放、剪辑或内容交付。

使用边界

了解合成方式与交付范围。

  • 此入口用于文本转语音,不等同于语音识别、音乐生成或原生实时音频流。长篇内容应分段制作并安排校听,检查数字、缩写与专有名词。
  • 一次性克隆仅接受一个公开 HTTPS MP3/WAV 录音样本及其准确逐字稿,不接受 Base64、data URI 或带凭据的 URL;不会自动保存长期音色。
  • format=pcm 返回 WAV 容器,不能直接作为裸 PCM 字节处理;opus 不受支持。生成参数的支持范围和实际计费请查看本平台 API 文档与定价。

常见问题

解答使用 s2.1-pro 时的常见疑问。

S2.1 Pro 相对 S2 Pro 有什么变化?

官方说明 S2.1 Pro 改善质量、延迟与吞吐,并将其列为推荐生产模型。这里不承诺具体改善幅度;应以自己的文稿、声音与实际调用结果做迁移评估。

型号应该写在哪里?

通过 HTTP 请求头 model 指定 s2.1-pro。不指定时默认 s2-pro;音色 reference_id 属于声音选择,与合成型号分别设置。

保存声音与一次性克隆怎么选?

固定角色或系列内容可用 reference_id 复用声音;单次项目可以用 references 提供录音与逐字稿。两者互斥,一次性克隆只接受一个参考样本。

怎样控制语速和输出格式?

prosody.speed=1.0 表示原速,volume 使用 dB,0 表示不改变音量。可选择 mp3、wav 或 pcm;后两者都使用 WAV 容器,MP3 码率可选 64、128 或 192。

长稿怎样跟踪完成结果?

设置 callback_url 后先保存 task_id 和 started_at,等待完成回调,也可按任务编号查询。取得 audio_url 才表示可以进入播放或编辑环节。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 s2.1-pro 用到你的下一项配音任务

从代表性文稿开始,在试听与实际交付中判断它是否适合。