基于 Rokid GPASS 打造 AI 智能眼镜饮食识别 Agent ——《食记》项目实践
摘要
随着 AI 智能眼镜逐渐进入消费级市场,越来越多的 AI Agent 开始从传统手机应用迁移到可穿戴设备。
相比手机,AI 眼镜具有第一视角拍摄、免手操作、语音交互等天然优势,非常适合视觉理解类应用。
本文以《食记》项目为例,介绍如何基于 Rokid GPASS 百宝箱平台,从零搭建一个 AI 智能眼镜饮食识别 Agent,包括整体架构设计、工作流设计、端侧插件调用、多模态模型应用、Prompt 设计、连续追问优化以及开发过程中踩过的坑,希望能够给正在开发 AI 眼镜 Agent 的开发者提供参考。
一、项目背景
随着大模型的发展,AI Agent 已经不仅局限于聊天,而开始逐渐进入真实世界。
其中,AI 智能眼镜是目前最值得关注的新入口。
相比传统手机 App,AI 眼镜具有三个天然优势:
① 第一视角
用户看到什么,AI 就能看到什么。
② 解放双手
无需拿出手机。
一句语音即可完成交互。
③ 即时反馈
边看边识别。
边识别边回答。
因此,我希望尝试开发一个真正适合 AI 眼镜使用,而不是简单把手机 App 搬过去的 Agent。
于是便有了《食记》。
二、产品定位
《食记》是一款运行在 AI 智能眼镜上的饮食识别助手。
第一版 MVP 并没有做:
❌ 健康档案
❌ 卡路里统计
❌ 日食记
❌ 周食记
❌ 月食记
因为这些都依赖数据库。
目前主要提供四项能力:
① 当前餐食识别
② 包装食品分析
③ 连续追问
④ 产品介绍
整个产品强调:
轻量
即时
自然
适合 AI 眼镜交互。
三、整体技术架构
整体采用:
端侧 + 云端
协同模式。
架构如下:
AI Glasses
↓
GPASS Workflow
↓
Intent Recognition
↓
眼镜拍照插件
↓
Qwen VL Max
↓
Qwen3.6 Plus
↓
End
说明:
端侧负责:
- 语音
- 拍照
- 展示
云端负责:
- 意图识别
- 图片理解
- Prompt
- 连续追问
- 回复生成
这种架构便于后续升级模型。
【插入整体架构图】
四、GPASS 工作流设计
整个工作流控制在十个节点以内。
工作流如下:
开始
↓
意图识别
↓
记录饮食
↓
拍照插件
↓
VL识别
↓
AI总结
↓
结束
包装食品:
开始
↓
意图识别
↓
包装食品
↓
拍照插件
↓
VL
↓
AI总结
↓
结束
帮助:
开始
↓
意图识别
↓
介绍帮助
↓
直接回复
↓
结束
继续追问:
开始
↓
意图识别
↓
继续追问
↓
Qwen3
↓
结束
【插入GPASS工作流截图】
五、各节点设计思路
Start
负责:
接收:
当前用户输入。
Intent
这是整个工作流核心。
最终设计:
记录饮食
包装食品
继续追问
介绍与帮助
退出
其他
其中:
继续追问
是后面增加的。
因为眼镜交互:
用户经常:
为什么?
那怎么办?
如果只吃一半呢?
因此:
必须单独设计。
眼镜拍照插件
采用:
GPASS 官方插件。
作用:
调用:
AI眼镜
拍照。
输出:
图片URL
拍照状态
这里只做:
采集。
不分析。
VL模型
采用:
Qwen VL Max
分别设计:
餐食 Prompt
包装 Prompt
餐食:
识别:
- 主食
- 蔬菜
- 肉类
- 水果
- 饮料
包装:
识别:
品牌
名称
营养成分
配料表
注意:
不估算重量。
不计算精准热量。
避免:
虚假精准。
AI总结
采用:
Qwen3.6 Plus
主要负责:
把视觉识别结果。
转换成:
适合 AI 眼镜阅读的回答。
Prompt 要求:
第一句话:
先给结论。
控制:
四行以内。
适量:
Emoji。
例如:
🥗 今天搭配不错
🍗 蛋白质充足
🥬 可以增加蔬菜
😊 继续保持
六、Prompt 设计经验
Prompt 并没有追求:
功能越多越好。
而是:
围绕 AI 眼镜特点。
进行了优化。
例如:
不要:
长段文字
Markdown
表格
而采用:
短句
结论先行
逐行展示
Emoji
整个回复:
控制:
70~100字。
这样:
更适合:
眼镜阅读。
七、连续追问设计
这是整个项目最大的优化。
例如:
用户:
分析完成以后。
继续问:
为什么?
适合减脂吗?
只吃一半呢?
传统流程:
重新拍照。
现在:
直接:
继续追问。
读取:
历史上下文。
继续回答。
整个体验自然很多。
八、开发过程中踩过的坑
Web无法拍照
官方插件:
只能:
真机。
意图容易误判
增加:
继续追问
以后。
效果提升明显。
回复太长
统一:
结果先行。
四行以内。
热量估算
没有重量。
放弃:
精准热量。
改成:
饮食结构分析。
体验更好。
九、目前存在的问题
当前 MVP 仍存在一些不足:
- 无数据库,无法保存历史饮食记录。
- 无法生成日食记、周食记、月食记。
- 连续追问主要依赖历史对话,上下文稳定性受平台限制。
- 意图识别仍依赖 Prompt,需要持续优化语义覆盖。
- 包装食品 OCR 在图片质量较差时识别率会下降。
这些问题并不影响 MVP 的验证,但也是后续迭代的重点。
十、后续规划
下一步准备增加:
① 数据库
生成:
日食记
周食记
月食记
② 用户画像
记录:
身高
体重
目标
③ 行为分析
长期:
早餐
蔬菜
零食
④ 分享系统
AI图片优化。
朋友圈分享。
十一、项目总结
《食记》验证了一件事情。
AI 眼镜不仅可以:
看见现实世界。
更可以:
理解现实世界。
相比手机。
AI 眼镜能够以更加自然的方式完成:
拍照
识别
理解
交互。
这也是我认为 AI Agent 在可穿戴设备上的一个重要应用方向。
结语
目前《食记》仍然只是一个 MVP。
但它已经验证了 AI 智能眼镜在饮食健康场景中的可行性。
未来随着数据库、用户画像、多模态模型和更多传感器能力加入,它有机会从一个饮食识别工具,成长为一个真正的 AI 健康生活助手。
更多推荐


所有评论(0)