您的位置首页生活百科

Fish Audio(超自然语音生成模型)

Fish Audio(超自然语音生成模型)

的有关信息介绍如下:

Fish Audio(超自然语音生成模型)

Fish Audio是超自然语音生成模型,基于200万小时音频数据训练,提供40亿参数的S1和5亿参数的S1-mini双版本,通过RLHF技术支持多语言、多情感表达及高度拟人化语音合成,适用于影视配音、虚拟交互等场景。其采用Dual-AR架构与分组有限标量矢量量化技术,支持10秒声音克隆与多语言混合生成,并提供开源模型架构 。2025年5月28日接入第三方平台AigcPanel扩展应用生态,6月3日开放20次/月免费声音克隆服务。6月4日登顶TTS-Arena榜单并支持13种语言,次日披露语音陪伴场景半年营收达400万美元。6月6日成为GitHub热门开源项目,6月8日公布Dual-AR架构与50+情感标记技术细节,6月12日推出4B旗舰版与0.5B轻量版模型 。同年10月21日升级S1模型,实现首帧延迟低于500毫秒的流式传输,语音克隆成本降至竞品六分之一 。

想要了解更多“Fish Audio(超自然语音生成模型)”的信息,请点击:Fish Audio(超自然语音生成模型)百科