当 AI 的交互入口从屏幕和聊天框延伸至摄像头、麦克风与真实环境,第一视角可穿戴设备正成为多模态智能的关键落点。OpenSQZ Glass 是由上海期智研究院开源平台团队打造的本地实时多模态 AI 眼镜参考实现,面向研究者与开发者,专为第一视角感知与交互场景设计。系统采用“感知-计算分离”架构:轻量眼镜端负责图像与语音采集,本地设备完成全模态模型推理,在兼顾隐私、延迟、成本与可复现性的前提下,探索第一视角实时视觉辅助的可行路径。项目提供完整的 3D 打印眼镜文件与装配教程,软硬件双开源,降低社区的复现与使用门槛。

为什么要做 OpenSQZ Glass?
近年来 AI 眼镜赛道迅速升温。国内有字节、阿里、小米、雷鸟、乐奇等多家企业相继推出智能眼镜,国外有谷歌搭载 Gemini 的 AI 眼镜与 Meta Ray-Ban 激烈竞争。市场数据印证了这股热潮——2026 年 Q1 全球出货量同比增长 130%,2026 年全年销量预计增至 2000 万台,同期市场规模预计扩大至 56 亿美元(数据来自市场研究机构 Smart Analytics Global (SAG) 的报告),行业普遍认为 2028 年或将迎来“iPhone 时刻”。
然而,热潮之下,一个根本性问题尚未解决:当前 AI 眼镜的主流交互范式与真实世界的运作方式存在结构性错位。市面多数产品的使用方式仍然是“用户拍照、提问→等待模型输出答案”的离散闭环。但现实世界是流动的:视角在切换,场景在变化,值得被注意的事件可能在任意时刻突然发生。一张静态照片无法代表持续演变的现场,而每一次等待都在打断用户的注意力和行动节奏。这种错位源于一组环环相扣的结构性约束:
云端推理带来延迟和隐私压力。第一视角辅助中,响应延迟直接决定可用性阈值。几秒钟的等待在很多场景下已经足以让语境变化、信息失效。同时,第一视角图像天然包含很多敏感信息,如路人面孔、工作环境、家庭空间、电脑屏幕等,将这些数据默认上传云端并不是理想选择。
交互割裂偏静态。多数系统虽然接入了视觉和语音,但使用方式仍停留在“拍照→提问→等待回答”的隔离交互流程。这很难满足真实辅助场景中的持续性需求。第一视角场景不是一张静止图片,而是持续变化的环境流,用户和系统都需要在变化中保持交互。
穿戴设备受限于算力、功耗和重量约束。如果把大模型推理、散热和电池都集中在眼镜本体内,会牺牲佩戴舒适性与续航表现。产品在“算力、功耗、轻便性”之间做取舍,让智能眼镜始终处于“勉强可用”而非“真正好用”的状态。
研究社区缺少完整可复现的平台。商用 AI 眼镜价格高昂,动辄上千元,且软硬件体系封闭,模型选择、推理链路、提示词编排和评估方法都未完整开放。研究者很难在此基础上开展实验和迭代。
OpenSQZ Glass 的思路是以本地 Omni 推理、全双工交互、低成本硬件和可复现 3D 打印,构建了一套开源 AI 眼镜参考实现,让研究者和开发者用方便获得的低成本硬件、可审计的软件链路和本地优先的部署方式,构建第一视角的实时视觉辅助系统。
架构设计:感知-计算分离
OpenSQZ Glass 的核心设计原则是:眼镜只需要把感知做好,不需要跑大模型。为此,我们采用了“感知-计算分离”的系统架构。眼镜端保持轻量,只负责第一视角数据的流式采集;真正的多模态推理则在本地电脑或边缘设备上运行。数据通过本地 WiFi 传输,由本地运行的 Omni 模型统一处理视觉、语音和文本,并通过流式语音将结果反馈给用户。
OpenSQZ Glass 采用感知-计算分离的架构有如下优势:
显著降低眼镜端的负担。前端不承担重型推理,也就不需要为大算力芯片、复杂散热和大容量电池付出额外重量代价,更有利于控制功耗、发热和佩戴负担。
将系统时延和稳定性控制在本地边界内。和依赖公网链路的云端方案相比,本地推理可以获得更低、更稳定的响应延迟,更适合第一视角实时辅助场景。
保护隐私。第一视角数据无需上传远端服务器,直接在本地网络和本地设备内部完成处理,用户能够对数据流向和使用方式拥有更强控制权。
解耦架构可升级性强。眼镜端硬件相对稳定,而主机侧推理能力、模型版本和工具链可以持续演进。这种感知-计算分离的结构尤其适合研究平台,它允许系统随着模型和算法进步不断迭代,无需频繁重做硬件。
OpenSQZ Glass 通过合理分工,让眼镜负责“看和听”,让本地设备负责“理解和回答”,二者形成边看、边问、边答的交互闭环;让模型能够像真人一样处理“插话”和“被打断”的情况,支持更流畅的双向对话。
技术亮点:从图像问答走向全双工全模态交互
感知与计算分离架构解决了硬件与系统层面的矛盾——眼镜端负责持续采集,主机端负责多模态推理。但如果交互方式仍停留在“用户拍照→系统回答”的离散回合制,AI 眼镜依然难以真正融入现实世界。现实世界不会等待系统回答完再继续变化:用户可能一边走路一边提问,环境中可能突然出现新目标或风险,用户也可能在系统回答过程中随时插话、改口或切换任务。传统半双工交互模式无法适应这种节奏。
这一问题的核心在于:AI 眼镜需要的不是更强的“单次问答能力”,而是“持续在场的感知与响应能力”。面壁智能 MiniCPM-o 4.5 的出现,为这个问题提供了关键解法——它以仅 9B 参数实现了业界首个端到端全双工全模态模型,在视觉理解、文档解析、语音理解和生成等方面均达到全模态 SOTA 水准,突破了传统“输入→输出”的范式。
OpenSQZ Glass 以 MiniCPM-o 4.5 为基座构建了自身的技术亮点:将交互从“离散回合”推向持续时间轴上的并行流,将视觉、音频、文本流纳入统一时间轴进行流式处理,实现了真正的“边看、边听、主动说”,在任何情况下都随时保持对环境的持续感知,既不错过关键细节,也不会被冗余信息干扰。这一技术赋予 OpenSQZ Glass 在真实环境中不可或缺的三项能力:
持续感知:系统不是在用户提问时才“看一眼”,而是持续接收第一视角输入,理解场景变化与上下文延续。
持续响应:系统在反馈过程中不脱离当前环境,能根据新的视觉和语音信息动态调整回答内容。
可中断性:当用户临时改变意图或出现更紧急的信息时,系统能及时收住当前输出,转向新任务——这对开放环境中的辅助系统尤为关键。
全双工技术的本质,是将交互从“离散回合”转变为“感知-决策-执行”的连续流。模型在输出语音时仍在持续接收新的视觉与音频输入;用户中途插话时,系统将新输入纳入状态判断,重新决策应该继续聆听还是切换任务。OpenSQZ Glass 通过接入 MiniCPM-o 4.5,实现了“边听、边看、边说、边决策”的闭环,使 AI 眼镜从“问答工具”进化为“持续在场的协作者”。
系统实现:低成本硬件与本地多模态链路
硬件层面,OpenSQZ Glass 选择了一条务实的路线:基于现成、低成本的组件构建系统。前端采用 ESP32-S3 + OV5640 作为感知单元——我们看重的不是单点性能,而是整体可复现性:成本可控、开源生态成熟、WiFi 传输稳定、社区资料丰富,便于开发者快速搭建原型并二次改造。配合小型锂电池与 3D 打印结构件,整个前端装配成本控制在 150 元。这种设计的前提是前端只承担采集与传输任务,不参与任何大模型推理,因此硬件可以做到足够轻量,无需在算力、功耗和重量之间做取舍。
计算推理侧采用商用边缘设备(笔记本电脑/平板电脑/手机等)作为推理主机,负责本地 Omni 推理任务。这套方案提供了成熟的调试环境、灵活的模型替换能力和较低的开发门槛,同时也使得 OpenSQZ Glass 的软件架构天然具备硬件兼容性——前端的感知层与后端的推理层通过标准化数据接口通信,只要前端设备能输出稳定的第一视角图像和音频流,即可无缝接入 OpenSQZ Glass 的推理链路。
目前,我们已在 Rokid 眼镜上完成全链路适配并通过实机验证。OpenSQZ Glass 软件栈采用了跨设备兼容设计,ESP32-S3 固件层采用统一的 WiFi 传输协议封装,推理主机端的数据接收与调度逻辑与具体硬件解耦。适配新款眼镜时只需对接摄像头和麦克风的数据采集接口,核心推理链路无需改动。这意味着系统对前端硬件的依赖被降到了最低。
未来,我们将逐步适配更多商用智能眼镜产品,也欢迎各硬件厂商和我们联系,共同推进标准化接入流程。
对研究者而言,这套设计的价值很明确:不与任何特定硬件绑定,可自由选择前端设备;即便硬件迭代或更换,软件栈与实验脚本也能平滑迁移。更关键的是,全栈开源的代码与可审计日志,不仅能帮助系统“跑起来”,更能让研究者在遇到问题时快速定位根因——无论问题出在 WiFi 抖动、分辨率策略、状态切换逻辑还是音频播报卡顿,都能追溯到具体环节,而不是对着黑盒盲目猜测。
测试结果和关键发现:0.99 秒中位延迟,97.5% 请求 2 秒内完成
在真实 WiFi 环境下,我们基于面壁智能 MiniCPM-V 4.5 对 OpenSQZ Glass 进行了端到端延迟测试——从用户说完话到音频输出,涵盖采集、预处理、VLM 推理、TTS 合成全链路。选择 MiniCPM-V 4.5 作为测试基准,是因为其标准的“输入→输出”回合制交互范式能精确量化系统链路的物理时延,为工程优化提供可重复、可对比的数值依据。实测数据表明:
分辨率调优带来 2.3 倍加速。将 1280×720 图像调整为 896×504 后,VLM 推理首字节时间从 1222ms 降至 528ms,加速 2.3 倍,画质损失在实际辅助场景中几乎不可感知。中位端到端延迟由此跨过“1 秒”的门槛——993ms。
云端方案在真实网络环境下并不占优势。Qwen-VL-Max 中位延迟超 2 秒,仅有 46.7% 的对话响应时间小于 2 秒;Gemini 2.5 Flash 中位延迟高达 4.9 秒,P95 突破 11 秒,<2 秒通过率直接归零。而 OpenSQZ Glass 的 P95 仅 1.78 秒,即使在网络波动时仍保持稳定。
<1 秒与>2 秒的差距,是“实时在场”与“远程助理”的本质区别。2 秒是人类等待交互响应的心理容忍上限。视觉辅助场景中,当你在行走、识别路牌或寻找商品时,每一次等待都会打断注意力。993ms 的响应让 AI 感觉“就在身边”,而云端方案超过 2 秒的等待则让交互变成异步任务。
Wi-Fi 端到端延迟对比。所有系统均使用 ESP32 Wi-Fi 摄像头采集,并搭配本地 TTS 引擎 pyttsx3。延迟单位为毫秒。数值结果来自 ACL 2026 System Demonstrations 论文(https://aclanthology.org/2026.acl-demo.82/)
实测结果表明,OpenSQZ Glass 用 150 元的眼镜端硬件+本地消费级 GPU,实现了比云端大模型更快、更稳定、更私密的实时视觉辅助——中位延迟 0.99 秒,P95 仅 1.78 秒,97.5% 请求 2 秒内完成。
应用场景
人与人的对话中,停顿、思考、背景噪音与声音重叠是常态,AI 要真正融入这种环境,必须突破“一问一答”的机械模式。OpenSQZ Glass 的目标正是让 AI 从“被唤醒的工具”进化为“持续在场的协作者”,它在三个典型场景中展现出独特的交互能力:
主动提醒:系统通过持续感知与事件记忆,将用户指令注册为触发条件,实现从“被动响应”到“主动预警”的转变。例如,用户说“听到拍手声提醒我”,系统便在持续运行的音频流中检测该事件,一旦匹配即触发提醒。
边看边说:用户佩戴眼镜在移动中环顾四周,系统实时识别并流式描述视野中的物体、布局与变化,将动态环境转化为连贯的语音叙述,让用户“边走边看边听”地感知周围世界。
随时打断:用户可在系统回答过程中随时追问或切换话题。例如,模型正在介绍上海,用户突然追问“浦东新区在上海吗?”——系统瞬间停止当前回复、平滑收声,转入聆听状态并处理新问题。整个过程在数秒内完成,让打断成为自然的信息澄清方式。
视频内容是 OpenSQZ Glass 基于 MiniCPM-o 4.5 实现的全双工全模态交互体验
总结
OpenSQZ Glass 已打通视觉与语音的实时闭环,完成了从第一视角输入到本地多模态理解、再到流式语音反馈的完整链路,相关工作已被 ACL 2026 System Demonstration 接收。
在专用穿戴 AI 芯片尚未完全成熟之前,我们基于现有硬件,通过感知-计算分离、本地 Omni 推理和全双工交互,验证了一条值得继续探索的技术路线。需要说明的是,OpenSQZ Glass 是一个研究参考平台,而非经过安全认证的导航设备。我们会持续开源代码、硬件清单、3D 打印文件与装配教程,进一步降低社区复现与二次开发成本。
如果 AI 的交互入口注定从屏幕走向现实世界,OpenSQZ Glass 希望成为这条路径上的一个开放起点。
OpenSQZ 开源平台
OpenSQZ 开源平台是上海期智研究院全力打造的开源生态枢纽,致力于搭建一个托管协作、共享创新、持续演进的活跃社区。在这里,科研灵感可以快速孵化,产业需求可以一站落地。平台所有项目均采用 Apache / MIT 开源许可;通过完善的社区运营机制和专业技术,助力托管项目打造具有行业影响力的开源社区。配套的治理章程、技术基建和运营体系,则为每一个开源团队提供从 “0 → 1” 到 “1 → N” 的全周期助力。
OpenSQZ 开源平台的项目有:
AutoMathText-V2 数据集和相关模型
100w+下载!AutoMathText-V2:2.46万亿 token 的数学“教科书”,旨在打造下一个 SOTA 模型
AI 安全 Jailbreak Foundry
28 分钟,把一篇越狱论文变成可运行代码——这个开源工具正在改变 AI 安全研究
OpenSQZ Glass:让端侧全双工全模态模型进入第一视角的可穿戴世界
https://github.com/OpenSQZ/OpenGlass
MiniCPM‑V CookBook:一键覆盖个人、企业、研究者,全场景释放端侧推理能力
https://github.com/OpenSQZ/MiniCPM-V-CookBook
MegatronApp:为 Megatron‑LM 训练带来高可用、自适应、高效率与可观测的全链条加速
破局大模型训练黑盒,MegatronApp开源实现万亿参数「可视可控」训练
今日好文推荐
16 万 Star 的 OpenCode 彻底重写:API 全部重做、Bun 换 Node、桌面端迁移 Electron





