摘要

随着 AI 智能眼镜逐渐进入消费级市场,越来越多的 AI Agent 开始从传统手机应用迁移到可穿戴设备。

相比手机,AI 眼镜具有第一视角拍摄、免手操作、语音交互等天然优势,非常适合视觉理解类应用。

本文以《食记》项目为例,介绍如何基于 Rokid GPASS 百宝箱平台,从零搭建一个 AI 智能眼镜饮食识别 Agent,包括整体架构设计、工作流设计、端侧插件调用、多模态模型应用、Prompt 设计、连续追问优化以及开发过程中踩过的坑,希望能够给正在开发 AI 眼镜 Agent 的开发者提供参考。


一、项目背景

随着大模型的发展,AI Agent 已经不仅局限于聊天,而开始逐渐进入真实世界。

其中,AI 智能眼镜是目前最值得关注的新入口。

相比传统手机 App,AI 眼镜具有三个天然优势:

① 第一视角

用户看到什么,AI 就能看到什么。

② 解放双手

无需拿出手机。

一句语音即可完成交互。

③ 即时反馈

边看边识别。

边识别边回答。

因此,我希望尝试开发一个真正适合 AI 眼镜使用,而不是简单把手机 App 搬过去的 Agent。

于是便有了《食记》。


二、产品定位

《食记》是一款运行在 AI 智能眼镜上的饮食识别助手。

第一版 MVP 并没有做:

❌ 健康档案

❌ 卡路里统计

❌ 日食记

❌ 周食记

❌ 月食记

因为这些都依赖数据库。

目前主要提供四项能力:

① 当前餐食识别

② 包装食品分析

③ 连续追问

④ 产品介绍

整个产品强调:

轻量

即时

自然

适合 AI 眼镜交互。


三、整体技术架构

整体采用:

端侧 + 云端

协同模式。

架构如下:


AI Glasses

↓

GPASS Workflow

↓

Intent Recognition

↓

眼镜拍照插件

↓

Qwen VL Max

↓

Qwen3.6 Plus

↓

End

说明:

端侧负责:

  • 语音
  • 拍照
  • 展示

云端负责:

  • 意图识别
  • 图片理解
  • Prompt
  • 连续追问
  • 回复生成

这种架构便于后续升级模型。

【插入整体架构图】


四、GPASS 工作流设计

整个工作流控制在十个节点以内。

工作流如下:


开始

↓

意图识别

↓

记录饮食

↓

拍照插件

↓

VL识别

↓

AI总结

↓

结束

包装食品:


开始

↓

意图识别

↓

包装食品

↓

拍照插件

↓

VL

↓

AI总结

↓

结束

帮助:


开始

↓

意图识别

↓

介绍帮助

↓

直接回复

↓

结束

继续追问:


开始

↓

意图识别

↓

继续追问

↓

Qwen3

↓

结束

【插入GPASS工作流截图】


五、各节点设计思路

Start

负责:

接收:

当前用户输入。


Intent

这是整个工作流核心。

最终设计:


记录饮食

包装食品

继续追问

介绍与帮助

退出

其他

其中:

继续追问

是后面增加的。

因为眼镜交互:

用户经常:

为什么?

那怎么办?

如果只吃一半呢?

因此:

必须单独设计。


眼镜拍照插件

采用:

GPASS 官方插件。

作用:

调用:

AI眼镜

拍照。

输出:


图片URL

拍照状态

这里只做:

采集。

不分析。


VL模型

采用:

Qwen VL Max

分别设计:

餐食 Prompt

包装 Prompt

餐食:

识别:

  • 主食
  • 蔬菜
  • 肉类
  • 水果
  • 饮料

包装:

识别:

品牌

名称

营养成分

配料表

注意:

不估算重量。

不计算精准热量。

避免:

虚假精准。


AI总结

采用:

Qwen3.6 Plus

主要负责:

把视觉识别结果。

转换成:

适合 AI 眼镜阅读的回答。

Prompt 要求:

第一句话:

先给结论。

控制:

四行以内。

适量:

Emoji。

例如:


🥗 今天搭配不错

🍗 蛋白质充足

🥬 可以增加蔬菜

😊 继续保持

六、Prompt 设计经验

Prompt 并没有追求:

功能越多越好。

而是:

围绕 AI 眼镜特点。

进行了优化。

例如:

不要:


长段文字

Markdown

表格

而采用:


短句

结论先行

逐行展示

Emoji

整个回复:

控制:

70~100字。

这样:

更适合:

眼镜阅读。


七、连续追问设计

这是整个项目最大的优化。

例如:

用户:

分析完成以后。

继续问:

为什么?

适合减脂吗?

只吃一半呢?

传统流程:

重新拍照。

现在:

直接:

继续追问。

读取:

历史上下文。

继续回答。

整个体验自然很多。


八、开发过程中踩过的坑

Web无法拍照

官方插件:

只能:

真机。


意图容易误判

增加:

继续追问

以后。

效果提升明显。


回复太长

统一:

结果先行。

四行以内。


热量估算

没有重量。

放弃:

精准热量。

改成:

饮食结构分析。

体验更好。


九、目前存在的问题

当前 MVP 仍存在一些不足:

  1. 无数据库,无法保存历史饮食记录。
  2. 无法生成日食记、周食记、月食记。
  3. 连续追问主要依赖历史对话,上下文稳定性受平台限制。
  4. 意图识别仍依赖 Prompt,需要持续优化语义覆盖。
  5. 包装食品 OCR 在图片质量较差时识别率会下降。

这些问题并不影响 MVP 的验证,但也是后续迭代的重点。


十、后续规划

下一步准备增加:

① 数据库

生成:

日食记

周食记

月食记

② 用户画像

记录:

身高

体重

目标

③ 行为分析

长期:

早餐

蔬菜

零食

④ 分享系统

AI图片优化。

朋友圈分享。


十一、项目总结

《食记》验证了一件事情。

AI 眼镜不仅可以:

看见现实世界。

更可以:

理解现实世界。

相比手机。

AI 眼镜能够以更加自然的方式完成:

拍照

识别

理解

交互。

这也是我认为 AI Agent 在可穿戴设备上的一个重要应用方向。


结语

目前《食记》仍然只是一个 MVP。

但它已经验证了 AI 智能眼镜在饮食健康场景中的可行性。

未来随着数据库、用户画像、多模态模型和更多传感器能力加入,它有机会从一个饮食识别工具,成长为一个真正的 AI 健康生活助手

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐