零门槛打造具身智能:给大模型装上会说话的3D身体

你有没有设想过,与之对话的 AI 不再只是屏幕上冷冰冰的文字框,而是一个会开口说话、有表情、能用手势交流的 3D 数字人?

魔珐科技去年正式发布了全球首个面向开发者的具身智能 3D 数字人开放平台「魔珐星云」,它的核心使命非常硬核:给大模型「装上身体」。

从文字框到「真身」,AI 迈出关键一步

以往的人工智能交互大多停留在文字与语音层面。魔珐星云基于自研的 LAM(Language Action Model)大模型,能够把你输入的文本在毫秒之间,直接转换成融合了语音、表情、眼神、手势与身体动作的完整 3D 数字人表现。

这意味着它不再是单纯「会思考」的大脑,而是真正以具身形态与人类相处的智能体。

直击落地痛点,四大核心优势

高延迟、高成本、难部署,一直是数字人落地路上的「三座大山」。魔珐星云用四项能力把它们一并化解:

  • 对硬件极度友好:无需昂贵的高端 GPU,数字人可以在百元级的国产芯片上稳定运行,部署成本被压缩到极低。
  • 交互极致流畅:采用「云端传参数、本地渲染」的独特架构,端到端延迟低于 1.5 秒,驱动延迟甚至能压到 500 毫秒以内,支持实时对话与随时打断,体验如同和真人聊天。
  • 全终端适配:手机、网页、商显大屏、车载座舱,乃至人形机器人,都能完美适配,做到「让每一块屏幕都活起来」。
  • 开发极其简单:平台对外开放全套 API 与 SDK,开发者不必从零钻研 3D 渲染、动作生成等底层逻辑,只需聚焦业务创新即可快速落地。

从展厅到课堂,数字人已经「上岗」

魔珐星云并非实验室里的 Demo,它在大量真实场景中已经验证了价值:

  • 品牌零售:方太把传统 App 客服升级为品牌 IP「方拾壹」具身智能客服,实现 7×24 小时服务。
  • 展厅讲解:劲酒用 3D 超写实数字员工替换了原有的 2D 数字人,为参观者带来高自然度的产品讲解。
  • 医药培训:赛诺菲在企业微信内嵌星云 SDK,搭建了高仿真的医药销售实战陪练体系。
  • 智慧教育:四川开放大学引入 AI 数字教师,为学生提供有温度的启发式解题引导与个性化辅导。

此外,在政务导办、车载助手、文旅讲解等场景中,魔珐星云也正成为推动行业变革的关键基础设施。

三步上手:打造你的第一个 3D 数字人

无论你是个人开发者、创业团队还是大型企业,魔珐星云都向所有人敞开大门。已有开发者借助它,仅用 3 分钟就搭出了一个会说话、有表情、可随时打断的 3D 数字人助手。它的「身体」来自魔珐星云,而「大脑」可以自由接入 DeepSeek、豆包、Kimi 等任意你喜欢的 LLM。

下面几步即可完成数字人的接入。

1. 创建应用

进入应用管理,点击「开始创建」,填写任意名称后确认创建。

2. 创建完成后复制凭据

应用创建成功后,进入详情页复制所需的接入信息。

3. 获取接入配置

创建应用后,需要从控制台获取以下三个核心参数,供后续 SDK 集成使用:

字段 说明 获取位置
appId 应用的唯一标识符,用于 SDK 鉴权。 控制台「应用管理」→ 点击应用名称进入「应用详情」页面
appSecret 应用密钥,用于身份验证,请务必妥善保管,不要泄露。 同上,在应用详情页中查看
gatewayServer 数字人服务网关地址,SDK 通过此地址连接服务。 通常为平台分配的固定地址,可在控制台应用详情页查看

安全提示appSecret 属于敏感信息,建议在项目中使用环境变量或配置中心管理,避免直接硬编码在客户端代码中。

4. 配置检查

拿到上述参数后,建议先记录并核对以下几点:

  1. appIdappSecret 配对正确。
  2. gatewayServer 地址可正常访问,没有拼写错误。
  3. 在项目的配置文件中填入上一步获取的参数。

配置文件示例:

const xingyunConfig = {
  appId: '替换为自己的 appId',
  appSecret: '替换为自己的 appSecret',
  gatewayServer: '替换为自己的 gatewayServer'
}

完成接入后,可依次尝试输入以下语句进行验证:

  • 输入「你好」,等待回复后继续;
  • 输入「这里有什么好玩」「这里有什么好吃的」「我的症状是发热」中的任意一个,等待回复后继续;
  • 输入「我想去发热科室」「我想去电影院」「我想去某某商家」中的任意一个。

5. 初始化数字人 SDK

在页面中准备数字人挂载容器:

在 HTML 页面中创建一个承载数字人的 DOM 容器,建议为容器设置固定宽高,确保数字人能够正常渲染和显示。

<div id="avatar-container" style="width: 320px; height: 480px;"></div>

如果页面需要展示多个数字人实例,可以为每个容器设置不同的 id 进行区分。

初始化 SDK:

const avatar = new XmovAvatar({
  containerId: '#avatar-container',
  appId: xingyunConfig.appId,
  appSecret: xingyunConfig.appSecret,
  gatewayServer: xingyunConfig.gatewayServer
})

6. 调用数字人播报

SDK 初始化完成后,即可调用文本播报能力。

avatar.speak('你好,我是魔珐星云数字人。')

实际项目中,播报方法名称以当前 SDK 版本或项目封装为准。建议封装一层调用方法:

function speakText(text) {
  if (!avatar) {
    console.warn('SDK 未初始化')
    return
  }

  if (!text) {
    console.warn('播报文本为空')
    return
  }

  avatar.speak(text)
}

7. 接入大模型问答

如果项目需要数字人回答问题,可按以下链路接入:

用户输入问题
    ↓
请求大模型接口
    ↓
获取大模型返回文本
    ↓
调用数字人 SDK 播报文本

示例:

async function handleQuestion(question) {
  const answer = await callLLM(question)

  speakText(answer)
}

其中 callLLM 由项目自行实现,可以接入豆包、OpenAI 兼容接口或其他大模型服务。

8. 测试调用是否成功

完成配置后,建议按以下顺序测试。

① 基础播报测试

输入:
你好
判断:
- 数字人是否正常加载
- 是否能完成语音播报
- 嘴型 / 动作是否正常
- 页面是否报错

② 场景问答测试

输入:
这里有什么好玩的?
或:
我的症状是发热。
判断:
- 大模型是否返回内容
- 数字人是否能播报返回内容
- 连续多轮输入是否正常

AI 的下一个时代,是具身交互的时代。如果你想让自己的应用拥有一个「看得见、摸得着」的智能体,现在就可以动手尝试。

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?