火山语音首个数字人产品经理小灿原来是这样炼成的!
创始人
2025-07-04 05:31:26
0

近日,火山语音发布了首位超写实数字员工小灿,在同步推出的首秀TVC中,小灿凭借高效的工作能力以及温暖可人的性格引起多方关注,她的到来将会引领怎样的改变?

善听会说能想:提升工作效率的好帮手

小灿作为火山语音团队联合朝夕光年江南团队共同打造的S级超写实数字人形象,名字源于“火山”两字的结合,拼音“can”在英文中表示“可以、能够”的意思,这也意味着小灿从“出生”就是工作的最佳辅助。虽然加入数字人产品矩阵不久,但小灿同样依托团队长期积累的成熟语音交互技术,具有语音识别、自然语言处理、情感识别等多种功能,传承“善听”、“会说”、“能想”的多重能力,能够做到与用户面对面实时交互来提供更加高效服务。


亲和友好真实: 工作场景下的‘副驾驶’

尽管小灿是虚拟数字人,但火山语音团队仍然通过强大的技术能力,帮助TA构筑了从外形、动作到语言、情感交互的超写实形态。外形上,凭借团队3D超写实数字人整套形象设计、资产制作、高成本影视级cg管线视频内容的制作能力,让小灿无论在外形动作,还是面部微表情抑或是皮肤肌理、发丝材质等各方面高度逼真,深度还原了真人影像,改变了大众对数字人的一贯认知。

除却精致的外在,小灿通过火山语音团队丰富且领先的对数字人AI的驱动能力,实现了更加近似真人的口型动作表现。例如AI驱动口型方面,团队通过使用行业领先的非自回归模型的唇形生成网络,合成与输入文本或语音完全匹配的唇形,准确率高达98.55%。


“在AI驱动动作上,我们基于创新的Motion Blening技术,在动作切换时可生成过度帧,使数字人在切换各类动作时不仅可以做到毫秒级切换,还可以做到平滑效果自然无感知。”除此之外还在AI表情口型联合建模,基于语音语义的动作生成即co speech技术上,都有极具前瞻性的预研工作,并已取得阶段性成果,后续将全部应用于数字人视频创作、交互以及直播等场景。


值得提及的是,小灿还具备“一条音频秒级别音色复刻”(zero shot TTS)的能力,可以做到高保真还原真人音色、说话风格以及声学环境等特点,在核心技术架构全自研的基础上,关键指标均保持业界前沿。此外韵律模块基于自回归GPT类大模型,目前训练数据超过20万个小时,架构可扩展性很强,未来预计可支持100万小时以上数据训练;模块支持code-switch,即无论prompt为中文或者英文,都可支持直接输出中文、英文及混合内容。整体来说,小灿无疑是目前数字人研发领域艺术与技术高度融合的产物,但她不仅仅是一个超写实数字人形象,更是高效且有温度解决问题的好帮手。


相关内容

热门资讯

如何允许远程连接到MySQL数... [[277004]]【51CTO.com快译】默认情况下,MySQL服务器仅侦听来自localhos...
如何利用交换机和端口设置来管理... 在网络管理中,总是有些人让管理员头疼。下面我们就将介绍一下一个网管员利用交换机以及端口设置等来进行D...
施耐德电气数据中心整体解决方案... 近日,全球能效管理专家施耐德电气正式启动大型体验活动“能效中国行——2012卡车巡展”,作为该活动的...
Windows恶意软件20年“... 在Windows的早期年代,病毒游走于系统之间,偶尔删除文件(但被删除的文件几乎都是可恢复的),并弹...
20个非常棒的扁平设计免费资源 Apple设备的平面图标PSD免费平板UI 平板UI套件24平图标Freen平板UI套件PSD径向平...
德国电信门户网站可实时显示全球... 德国电信周三推出一个门户网站,直观地实时提供其安装在全球各地的传感器网络检测到的网络攻击状况。该网站...
为啥国人偏爱 Mybatis,... 关于 SQL 和 ORM 的争论,永远都不会终止,我也一直在思考这个问题。昨天又跟群里的小伙伴进行...
《非诚勿扰》红人闫凤娇被曝厕所... 【51CTO.com 综合消息360安全专家提醒说,“闫凤娇”、“非诚勿扰”已经被黑客盯上成为了“木...