免费开源桌面智能小助手(类Agent)开发指南
一、安装软件
文件解压缩,找到exe文件,双击运行(绿色软件免安装),软件启动后显示设置页面,可以看到需要配置名称,3D数字人应用ID、应用密钥,DeepSeek大预言模型API Key信息。
- 名称:根据个人喜好输入即可
- 3D数字人应用ID、应用密钥:见第二节内容
- DeepSeek大语言模型API Key:见第三节内容

二、3D数字人配置
注册魔珐星云账户:https://xingyun3d.com/,点击右上角登录/注册按钮,进入注册流程。

在注册页面,勾选同意按钮,选择其它登录方式,输入手机号、验证码及邀请码(XDBAC5Q6KM)注册,使用此内测邀请码可得2000分钟免费体验权,加上本身新用户注册赠送的200分钟体验时长,合计2200分钟免费时长。

登录后,进入具身驱动页面,选择个人喜欢的数字人形象,然后点击创建同款应用。

在设置页输入应用信息,点击创建并进入调试即可。

创建成功后,点击场景,选择形象背景,我们这里选择透明“背景-全身”,音色、表演等功能按照个人喜好设置即可,人物配置设置完成后,点击右上角的预览效果,查看数字人实际呈现效果。


确认人物语音播放正常,点击右上角“接入SDK”按钮,记录App ID、App Secret信息,这两段信息就是调用此数字人的钥匙🔑,做好保存,一会我们把它们复制到软件设置页面的对应位置。

三、DeepSeek账号注册
注册DeepSeek账户,点击API开放平台进行注册。

登录后,点击左侧充值页面,DeepSeek作为最具性价比的国内大语言模型,为智能助手充值10元足够你用一年了,感谢梁圣!!!

账户充值完毕后,点击左侧的API Keys按钮,点击创建API Key,输入名称比如“桌面智能小助手”,点击创建,此时弹出API key,该串字符就是外部调用DeepSeek大模型对话的钥匙🔑,此页面仅显示一次,点击复制后做好留存,一会我们把它们复制到软件设置页面的对应位置。

四、配置桌面智能小助手
双击打开软件,软件启动后显示设置页面,可以看到需要配置名称,3D数字人应用ID、应用密钥,DeepSeek大预言模型API Key信息。
- 名称:根据个人喜好输入即可
- 3D数字人应用ID、应用密钥:输入魔珐星云创建应用的ID和密钥
- DeepSeek大预言模型API Key:输入DeepSeek API Key
- 点击右下角的保存及校验按钮,稍等片刻后,确认校验无误则配置成功,此时小助手将成功渲染到桌面。

五、开发介绍
1.具备功能:
- 人物支持桌面内随意拖拽
- 点击人物身体听到“滴”提示音开启语音对话(初次对话需要几秒钟加载语音识别模型)
- 默认接入DeepSeek大模式快速响应
- 人物口型、表情、动作及情绪等和对话内容高度统一,情绪价值拉满
- 文件包含所有工程文件,支持二次开发优化
- 离线语音识别模型,高隐私性、响应快
- 配置VAD语音活动检测功能(准确识别人声开始及结束)
2.软件整体结构:
级联链路:ASR+LLM+TTS
- 采用OpenAI开源的whisper语音识别模型(ASR),识别用户说话,并转化为文字送至LLM;
- 采用DeepSeek国内最高性价比大语言模型(LLM),处理ASR转化的文字,并输出反馈至TTS;
- 采用魔珐星云3D数字人自带语音合成模型(TTS),将LLM反馈的文本合成带语气、语调的音频播放给用户。
3.二次开发方向:
- 升级ASR,当前采用的whisper体积小便携性高但是参数也小,语音识别准确率并不是最优的,不考虑软件体积情况下,可以考虑升级参数更高的ASR模型。
- 可以考虑原生Realtime Speech-to-Speech方法,取消本地离线ASR(缺点:识别准确率不高),直接调用多模态大模型,用户输入音频至大模型,大模型反馈文本至魔珐星云输出。
- 增加唤醒词检测(如“Hey 宝贝”),比点击人物体验感更好。
- 增加功能性(偏向Agent),通过语音对话让其帮忙设置定时任务,操作电脑增删文件等等…
更多推荐


所有评论(0)