StepAudio 2.5 Realtime 上线!真人级实时语音对话能力,千万人设任你打造
今天,阶跃正式发布新一代实时语音大模型 StepAudio 2.5 Realtime!
我们希望创造更有“活人感”的 AI 聊天搭子:有温度、有灵魂、有态度。为此重点聚焦三大能力突破:
- 顶级副语言能力:实现真人级深度感知,精准听懂对话里的弦外之音与情绪流转。
- 千万人设自定义:从性格到口癖皆可定义,注入独一无二的灵魂,打造你的专属 AI。
- 对话双商领跑:在情商与智商上双重进阶,实现更深度、更懂你的交流。
目前,StepAudio 2.5 Realtime 已全量上线,欢迎体验!
阶跃星辰开放平台:
https://platform.stepfun.com/docs/zh/guides/models/stepaudio-2.5-realtime
https://platform.stepfun.com/docs/zh/guides/models/stepaudio-2.5-chat
Step Plan:
https://platform.stepfun.com/docs/zh/step-plan/integrations/audio-api
体验中心:
https://www.stepfun.com/studio/audio?tab=voice-chat
Model Card:
https://stepaudiollm.github.io/step-audio-2.5-realtime/
顶级副语言能力
StepAudio 2.5 Realtime 拥有顶级副语言能力,这使它不仅能精准捕捉对话中文字之外的微妙细节,更能以同样丰富的方式“表达”,成为一个真正鲜活、拟人的存在。
副语言是情感传递的主要载体,模型通过解读语调、语速、停顿乃至一声叹息或轻笑,所处理的已不仅是表层信息,更是对话者的情绪状态与潜在意图。
由此,它能实现真正的自然对话,大幅降低交互成本。无论是从低沉声线中听出你的疲惫、还是从急促语气里察觉你的不开心,它都能动态调整回应策略,让每次交流都精准体贴,如同与真人交谈。
StepAudio 2.5 Realtime-顶级副语言
对话双商领跑
更进一步,StepAudio 2.5 Realtime 实现对话智商与情商的双重跃升。不仅能深度理解复杂语义、极致抛梗,更能灵活调用多领域知识,提供有深度有洞见的对话体验。
既能成为提供充足情绪价值的好闺蜜:
StepAudio 2.5 Realtime-好闺蜜
更能化身专业 HR,帮你模拟面试:
StepAudio 2.5 Realtime-面试
千万人设自定义
在实时语音大模型中,人设是赋予对话“灵魂”的关键。而真正的“灵魂”,应当是千人千面、因人而异的。
为此,StepAudio 2.5 Realtime 将人设的定义权交给用户(通过 API)。从性格特质、背景经历、个人好恶,到语言习惯与对话边界,皆可精细调节,让每个声音角色都真正与众不同。
StepAudio 2.5 Realtime-官方人设
这一能力的背后,是我们基于超 10,000 个高质量原生人设,通过算法裂变生成的百万级人设特征矩阵,并融合海量真实场景对话进行训练所构建的泛化基础。这使得模型即便面对长尾、小众的话题,也能保持响应一致、表现稳定。
在深度角色扮演中,AI 常因“人设崩塌”而让沉浸感瓦解。为此,我们针对 Roleplay 场景进行了深入的 RLHF 对齐优化,在极端情境的压力测试下,模型仍能牢牢贴合预设人格,展现出高度稳定、可信的角色演绎能力。
StepAudio 2.5 Realtime-章鱼哥
此外,我们也直接提供 5 个预设人设,可供大家根据个人喜好选择体验。

StepAudio 2.5 Realtime 现已全量上线,欢迎大家体验!
更多推荐


所有评论(0)