节省近50%GPU计算!通义百聆开源新一代语音交互模型
创始人
2025-12-24 16:16:06
0

阿里通义百聆家族近日开源新一代语音交互模型Fun-Audio-Chat-8B。

新模型兼具高智商和高情商,具备出色的共情能力,与之对话,仿佛与懂你的人聊天。

在OpenAudioBench、VoiceBench、UltraEval-Audio、MMAU、MMSU、SpeechFunctionCall等权威基准测评中,Fun-Audio-Chat-8B斩获SOTA,超过同量级开源模型。

目前,百聆家族成员包括“会说话”的语音转文字模型Fun-ASR、“听得懂”的文字转语音模型Fun-CosyVoice3。

最新开源的模型Fun-Audio-Chat-8B主打语音对语音功能——“能听会说”。

用户可与模型音频对话,适用于语音聊天、情感陪伴、智能设备和语音客服等多种场景。

无任何情绪标签或提示词情况下,它能通过语义、语气、语速、停顿、重音等细微信号,感知对方的情绪状态,并给出恰到好处的关切、安慰或鼓励式回应。

此外,用户可尝试角色扮演,量身定制语音的情绪、说话风格、语速、高低音和音量等。

而模型能保持“原有智商”,主要得益于两个创新的音频模型训练模式。

一是采用 Core-Cocktail两阶段训练策略,先快速学新本事,再把“新本事”和“老底子”融合起来,为了避免学新东西把原来的能力忘掉(灾难性遗忘),第一阶段训练得到的模型和原始的纯文本大模型参数合并后,再进行微调。

二是与人类偏好对齐。通过多阶段和多任务的后训练设计,模型在真实对话场景中能更好地理解用户语音内容与情绪线索,作出更自然、更符合人类期望的回应。

值得注意的是,新模型通过压缩-自回归-解压缩的双分辨率端到端设计,音频帧率降到业界最低的5Hz,在保证语音质量的同时节省近50% GPU计算。

目前,用户可在魔搭社区、HuggingFace和GitHub下载模型自行体验。

相关内容

热门资讯

赴重庆巴南一品之约:泡温泉、享... 12月24日,从巴南区传出消息,一品街道将于12月26日(本周五)开展为期一个月的首届“温泉暖冬・乐...
流量聚力量 瓷韵育新风 晨光洒在宋代龙窑的斑驳窑壁上,历史沉淀于清代镇窑的红砖肌理中……在国家5A级旅游景区景德镇古窑民俗博...
【直播】元旦游上海,松江临港专... 想解锁有文化、有乐趣的元旦假期?12月25日中午12点锁定上观新闻直播间,“旅选上海,超级元旦”文旅...
传奇数学家小野健加入AI初创公... 参考消息网12月24日报道美国《华尔街日报》网站近日刊登题为《传奇数学家为何“出走”学界,加入24岁...
西安:“大唐之旅”焕新升级 12月23日,游客在街区以冬日长安雪景为主题的场景中拍照。近期,经过焕新升级的西安长安十二时辰主题街...
原创 A... 定焦One(dingjiaoone)原创 作者 | 陈颐 编辑 | 方展博 当下的AI应用市场,正在...
中国下半年新上线AI应用共20... 钛媒体App 12月24日消息,Quest Mobile发布的《2025下半年AI应用交互革新与生态...
节省近50%GPU计算!通义百... 阿里通义百聆家族近日开源新一代语音交互模型Fun-Audio-Chat-8B。 新模型兼具高智商和高...
池州九华山:云海漫峰峦 仙境落... 本文转自:人民网-安徽频道 2025年12月23日,安徽池州九华山花台景区,一场绝美的云海景观悄然铺...