AI眼镜正在从“厂商预装什么功能,用户就只能用什么”,走向一个新的阶段:
开发者可以自己给眼镜增加能力。
2026年8月10日,千问开放平台正式上线,面向生态伙伴和开发者开放手机APP、PC和AI眼镜三类终端的服务接入。

8月11日,千问进一步公布AI眼镜端开放能力。
针对AI眼镜,千问目前提供两条主要开发路线:
- 技能平台:面向个人开发者和生态开发者创建Skill
- 行业定制:面向企业开放镜端、APP和云端技术底座
开发者可以通过自然语言描述需求,并调用“眼镜拍照”、语音交互等硬件插件,让AI眼镜增加新的场景能力。
官方已经展示的方向包括:
- 无障碍辅助
- 景区导游
- 做饭指导
- 运动教练
- 工业巡检
- 零售巡检
未来还将逐步开放:
- 空间3D立体显示
- 运动健康状态感知
- 智能家居控制
千问AI硬件开放平台入口:
千问AI硬件开放平台是什么?
千问AI硬件开放平台是围绕千问AI眼镜建立的官方开发者平台。
官方平台当前提供:
- 技能平台
- 开发者文档
- 开发者社区
- 行业定制能力
- 千问AI眼镜S1
- 千问AI眼镜G1相关硬件生态
平台目前仍标记为 “内测中”。
它真正想解决的问题并不是“大模型API怎么调用”,而是:
如何让开发者把大模型真正变成眼镜上的一个具体功能。
普通大模型API主要提供:
文字
↓
模型
↓
文字AI眼镜应用则需要同时协调:
用户语音
+
第一视角摄像头
+
眼镜传感器
+
眼前显示
+
手机APP
+
云端AI
↓
Skill
↓
现实场景服务因此,开发AI眼镜应用不只是写一个Prompt。
平台还需要开放硬件、交互、显示、设备通信和云端能力。
这正是千问这次AI硬件开放平台重点解决的问题。
千问开放平台和AI硬件开放平台有什么区别?
这里容易把两个名字混在一起。
千问开放平台
这是更大的生态平台。
2026年8月10日上线后,它同时覆盖:
- 千问APP
- PC
- AI眼镜
第三方企业可以把自己的智能体和服务接入千问,为用户提供从咨询、推荐到履约的完整服务。
首批合作伙伴已经覆盖物流、租房、本地生活、金融、汽车和智能家居等十多个领域,包括:
- 顺丰速运
- 天鹅到家鹅宝
- 联想乐享
- 自如
- 盈米基金且慢小顾
- 哈啰租车
- 彩云天气
- 快递100果宝
- 闪送
- 飞常准
- 美的美居
- 嘟嘟巴士
菜鸟、夸克网盘和夸克扫描王等阿里生态服务也已经接入。
千问AI硬件开放平台
则重点服务:
AI眼镜和后续智能硬件开发。
开发者能够直接使用眼镜端特有的能力,例如:
- 摄像头
- 麦克风
- 语音
- 画面显示
- 设备Sensor
- 镜端交互
这使AI服务可以真正利用“戴在脸上”的硬件优势。
核心是“技能平台+行业定制”
千问目前将AI眼镜开放体系分成两个模块。
| 模块 | 主要用户 | 主要用途 |
|---|---|---|
| 技能平台 | 开发者、创作者 | 快速创建AI眼镜Skill |
| 行业定制 | 企业客户 | 深度定制AI眼镜系统和业务流程 |
两套体系解决的问题并不完全相同。
技能平台更接近:
给现有千问AI眼镜增加一个新应用。
行业定制则更接近:
基于千问AI眼镜底层技术,为企业重新做一套行业解决方案。
Skill是什么?
可以把Skill理解成AI眼镜上的一个“技能包”。
传统APP通常是:
打开APP
↓
寻找功能
↓
点击按钮
↓
进入页面
↓
完成操作而AI眼镜Skill希望变成:
直接说出需求
↓
AI判断应该调用哪个Skill
↓
调用眼镜硬件
↓
完成任务千问AI眼镜产品负责人此前也解释过,他们希望把外部Agent能力进一步拆成原子化Skill,由千问大模型根据用户的意图、上下文和记忆进行自由编排。
这种思路意味着:
AI眼镜未来更像拥有一套技能系统,而不是安装几十个传统APP。
可以直接用自然语言创建Skill
这是此次平台非常值得关注的一点。
开发者并不一定要从完整代码项目开始。
千问AI硬件开放平台支持通过自然语言描述一个新Skill。
官方页面直接给出的示例是:
帮我创建一个门店巡检助手,识别货架缺货并实时提醒店员。
随后可以选择需要调用的插件和硬件能力,再进入创建流程。
平台提供:
- 对话创建
- 模板创建
- 空白创建
等方式。
这有点类似现在用自然语言创建Agent或Vibe Coding应用,只不过最终运行的位置变成了AI眼镜。
Skill完成后还要经过审核和灰度
AI眼镜Skill不是创建以后立刻向所有用户公开。
千问AI硬件开放平台当前流程还包括:
创建Skill
↓
测试
↓
审核
↓
灰度
↓
上架
↓
用户通过语音调用官方平台明确提到,Skill需要完成审核、灰度和上架后,才能提供给用户使用。
这非常重要。
因为AI眼镜拥有:
- 摄像头
- 麦克风
- 位置和环境信息
- 设备控制
- 持续佩戴能力
相比普通网页Agent,其隐私和权限风险明显更高。
“眼镜拍照”已经开放为插件
目前最具有AI眼镜特色的能力之一,就是:
眼镜拍照。
开发者可以让Skill主动调用第一视角摄像头获得当前环境信息,然后交给多模态模型进行理解。
传统AI的工作流程是:
用户描述自己看到了什么
↓
AI回答AI眼镜则变成:
用户看向某处
↓
眼镜拍照
↓
多模态模型理解
↓
Skill结合场景进行处理
↓
语音或画面反馈用户不需要先拿手机拍照,再上传图片。
摄像头本身就成为AI观察现实世界的入口。
官方案例:“身边有什么”
千问已经展示了一个很典型的无障碍Skill:
“身边有什么”。
开发者调用眼镜拍照能力,让视觉障碍用户佩戴眼镜后获取前方画面。
AI可以帮助识别:
- 门槛
- 台阶
- 障碍物
- 周边环境
随后通过语音向用户提供环境提示。
整体流程类似:
用户向前行走
↓
眼镜获取第一视角画面
↓
多模态模型分析
↓
识别潜在障碍
↓
语音提醒这也是AI眼镜和普通AI App最大的差异之一。
它天然位于用户视角。
不过,这种视觉识别目前不能替代专业无障碍设备或人工判断,尤其涉及交通和安全决策时仍需要保留明确的风险边界。
可以做AI导游
文旅也是非常适合AI眼镜的场景。
例如开发一个:
故宫AI导游Skill。
用户走到建筑前时,可以询问:
我现在看的是什么建筑?
眼镜获取第一视角画面,再结合:
- 视觉识别
- 景区知识库
- 用户位置
- 历史资料
生成讲解内容。
未来空间3D能力进一步开放后,还可以尝试:
看到建筑
↓
识别目标
↓
显示名称
↓
3D空间标记
↓
语音讲解
↓
提示下一处路线千问目前也把3D景点导览列为后续空间3D能力的重要应用方向。
可以做“菜谱专家”
居家场景也可以利用第一视角。
例如创建一个“菜谱专家”Skill。
用户做饭时不需要一直查看手机:
看向食材
↓
AI识别
↓
判断当前步骤
↓
告诉用户下一步怎么做开发者还可以为Skill增加:
- 菜谱知识库
- 食材识别
- 计时
- 语音提醒
- 营养信息
从而变成真正面向做饭场景的第一视角AI助手。
AI运动教练也会成为重要方向
千问还在逐步开放:
运动健康状态感知。
这将允许未来Skill结合用户当前的运动状态进行判断。
例如跑步时:
速度
+
心率等健康状态
+
当前路线
+
运动历史
↓
AI教练
↓
实时训练建议可能实现:
- 配速提醒
- 训练节奏建议
- 补水提醒
- 运动动作建议
- 路线提示
- 个性化陪练
需要注意的是,官方目前使用的是 “陆续开放” 的表述。
因此,运动健康状态感知不能写成当前已经对所有开发者完整开放。
空间3D立体显示也将开放
千问AI眼镜S1此前已经上线空间3D显示能力。
其原理之一是利用双光机和双目视差,让左右眼看到略有不同的画面,从而形成空间深度。千问AI硬件负责人此前表示,团队希望数字信息能够像现实物体一样存在于空间中,而不是简单贴在用户视野前方。
现在,千问正在计划将这部分能力逐步开放给开发者。
未来可能出现:
3D导览
景点名称、路线和内容直接出现在对应建筑附近。
运动路线
跑步方向和训练信息进入空间视野。
工业维修
设备对应位置显示:
- 参数
- 操作步骤
- 风险信息
教育
现实中的物体旁边显示:
- 3D模型
- 结构解释
- 标签
不过,目前平台仍在分阶段开放相关能力,不能把未来规划写成已经可以调用的成熟API。
技能平台更像AI眼镜的“App Store”
传统智能手机生态增长靠的是:
操作系统
+
App Store
+
开发者AI眼镜未来可能变成:
AI操作系统
+
Skill平台
+
开发者区别在于:
手机用户会主动寻找并打开App。
AI眼镜则可能通过大模型自动理解用户当前需要什么,再调用相应Skill。
千问AI硬件负责人此前直接提出:
“AI助理即OS”。
他认为,如果所有外部能力都保留成封闭Agent,大模型的自由编排空间会受到限制;如果将其变成原子化Skill,大模型就可以根据:
- 用户意图
- 环境
- 记忆
- 当前任务
动态决定调用哪些能力。
第二条路线:企业行业定制
个人开发者可能只需要创建一个Skill。
但工业、零售、物流等企业往往需要更深的能力。
例如工厂巡检眼镜可能需要:
- 摄像头长期采集
- 企业设备知识库
- 专业识别模型
- 画面提示
- 语音交互
- APP后台
- 任务系统
- 云端数据服务
因此,千问AI硬件开放平台还提供 行业定制 模块。
官方平台表示,将高自由度开放:
- 镜端
- APP
- 云端
三部分能力,并提供语音交互、影像采集和画面渲染等核心技术。
三层架构意味着什么?
可以简单理解为:
第一层:眼镜端
负责与真实世界直接交互。
包括当前已经明确展示的:
- 影像采集
- 语音交互
- 画面渲染
- Sensor相关能力
官方平台页面还明确列出镜端画面渲染能力,可支持双光机单绿显示及眼镜桌面入口展示。
第二层:APP
手机承担设备配套和部分交互层。
可能负责:
- 设备配置
- 用户账号
- 网络连接
- 内容管理
- 企业业务入口
千问AI硬件团队此前已经完成眼镜近端、APP移动端和云端能力梳理,并规划相应SDK。
第三层:云端
云端负责更重的:
- 大模型推理
- Agent
- 企业知识
- 数据服务
- 业务系统连接
这使企业不用强行把所有AI模型运行在眼镜内部。
为什么不能全部放在眼镜端?
AI眼镜最大的工程限制始终是:
- 重量
- 电池
- 散热
- 算力
- 续航
如果在几十克的眼镜中长时间运行大型多模态模型,功耗和散热都很难控制。
阿里云现有的通义多模态交互开发套件,本身就采用端云结合方案:端侧SDK连接摄像头和麦克风,同时提供VAD、回声消除、语音唤醒等端侧算法,大模型和复杂视觉理解则可以放在云端完成。
这种分工大致可以理解成:
眼镜端
负责感知和低延迟交互
↓
手机端
负责连接和设备管理
↓
云端
负责复杂AI推理企业也可以根据实际业务重新调整。
工业巡检已经成为重点案例
企业行业定制最直接的场景之一就是:
工业巡检。
工作人员戴着眼镜走到设备前。
系统可以:
- 获取当前设备画面
- 识别设备状态
- 查询企业巡检规范
- 检查项目是否完成
- 提示异常
- 记录检查结果
千问目前已经展示,工业巡检助手可以结合企业自己的检查标准和作业流程进行定制。
与手机巡检相比,眼镜最大的优势是:
工作人员可以继续使用双手。
例如维修大型机械时,不需要:
停下来
↓
掏手机
↓
拍照
↓
查看文档
↓
放下手机
↓
继续操作AI眼镜可以让说明和提醒持续出现在眼前或耳边。
零售巡检也很适合
零售行业同样可以创建专用巡检助手。
例如店员进入卖场后:
看向货架
↓
眼镜拍摄
↓
AI识别商品陈列
↓
检查缺货
↓
检查摆放规范
↓
提醒店员官方在平台创建示例中直接使用:
帮我创建一个门店巡检助手,识别货架缺货并实时提醒店员。
进一步还可以结合:
- 商品数据库
- 门店SOP
- 陈列规范
- 库存系统
- 补货任务
让眼镜从视觉识别工具变成一线工作终端。
智能家居可能成为另一个入口
千问已经明确将智能家居列为眼镜能力扩展方向。
未来用户可以直接看向设备并说:
把这个灯调暗一点。
或者:
空调调到25度。
AI结合视线、视觉识别和智能家居设备关系,判断用户指的是哪一个设备,再调用对应服务。
传统智能家居需要:
打开APP
↓
找房间
↓
找设备
↓
点击操作未来可能变成:
看向设备
↓
说出要求
↓
AI完成控制这就是AI眼镜作为现实世界智能入口的重要价值。
为什么AI眼镜特别适合Skill模式?
眼镜和手机存在三个非常明显的不同。
第一,眼镜可以解放双手
用户可以边工作、边运动、边做饭、边旅行。
第二,信息就在眼前和耳边
无需低头查看手机。
第三,眼镜拥有连续的第一视角
千问AI硬件负责人认为,只要眼镜持续佩戴,它就拥有手机难以获得的连续多模态感知条件。
因此AI可以理解:
- 用户正在看什么
- 当前处于什么环境
- 用户正在做什么
- 当前任务进行到哪一步
Skill就能围绕这些上下文工作。
未来AI硬件可能不再靠“出厂功能”竞争
过去购买智能眼镜时,用户通常比较:
- 能不能翻译
- 能不能导航
- 能不能拍照
- 能不能提词
- 能不能听音乐
这些功能基本在设备出厂时确定。
开放Skill平台以后,理论上可以变成:
今天
安装旅游Skill
明天
安装健身Skill
后天
安装做饭Skill
工作时
使用巡检Skill同一副硬件能够随着软件生态不断增加新的使用方式。
因此用户所说的“可生长智能”,可以更准确地理解成:
硬件能力保持相对稳定,但AI和Skill生态持续扩展设备能做的事情。
与手机App开发最大的区别
假设要开发一个植物识别功能。
手机App
通常需要:
打开APP
↓
点击拍照
↓
对准植物
↓
拍摄
↓
等待识别
↓
阅读结果AI眼镜Skill
则可能是:
看着植物
↓
“这是什么花?”
↓
调用眼镜拍照
↓
多模态识别
↓
耳边直接回答这种交互没有传统App页面作为中心。
核心从UI变成:
- 语音
- 视觉
- 上下文
- AI判断
因此,AI眼镜开发者需要重新思考交互设计,而不是简单把手机App缩小放进眼镜。
千问现有多模态能力可以提供哪些底层支持?
阿里云此前已经提供通义多模态交互开发套件,专门面向:
- AI/AR眼镜
- 智能耳机
- 机器人
- 学习机
- AI玩具
- 智能家居
提供实时语音和多模态交互技术。
现有能力包括:
- 全双工语音
- 用户随时打断
- 实时视觉理解
- VAD语音活动检测
- 回声消除
- 语音唤醒
- 模型和Prompt配置
- 知识库
- Agent
- 插件
- 设备指令
- 第三方Agent接入
同时支持Android、iOS、Linux和RTOS等系统。
千问AI硬件开放平台可以理解为进一步把这些AI能力,与千问自己的AI眼镜硬件和用户生态连接起来。
APP、PC、眼镜三端为什么值得关注?
千问开放平台并不是只开放眼镜。
它同时覆盖:
- APP
- PC
- AI眼镜
这意味着同一个服务未来可能在不同设备之间连续工作。
例如旅游场景:
PC
提前制定旅行计划。
手机
途中管理机票、酒店和行程。
AI眼镜
到了景区直接进行:
- 路线提醒
- 地标识别
- 实时翻译
- 景点讲解
一个Agent服务不必局限于单个硬件。
这可能比单独开发一款“眼镜App”更有价值。
第三方Agent也可以进入千问
千问开放平台支持第三方通过标准化协议将已有Agent接入千问,并提供:
- 一键授权
- 端到端调测
- 账号能力
- AI支付
- 订单接入
- 前端组件
- 多模态交互模板
例如顺丰智能体可以直接处理:
帮我给上海客户寄个文件。
而不仅是告诉用户如何寄快递。
这意味着千问整个开放平台正在形成两个层级:
服务Agent
负责完成具体服务和交易
+
眼镜Skill
负责理解现实环境和即时交互两者未来结合起来,会出现更复杂的场景。
例如“看到东西就能办事”
假设用户戴着AI眼镜看到快递盒:
把这个退掉。
未来系统可能需要:
眼镜识别快递
↓
判断商品
↓
查询订单
↓
调用电商服务
↓
调用物流Agent
↓
生成退货订单
↓
告诉用户结果这里同时涉及:
- 视觉
- Skill
- 用户账号
- Agent
- 支付与订单系统
这也是为什么AI眼镜平台的竞争,最终很可能不仅是硬件竞争,而是生态竞争。
开发者现在可以尝试哪些Skill?
基于当前已经公开的能力,可以优先尝试低风险、场景明确的方向:
AI导游
眼镜拍照
+
景点识别
+
知识库
+
语音讲解展会助手
识别展台和产品,自动介绍企业和产品资料。
博物馆讲解
识别展品并根据馆方知识库进行解说。
菜谱助手
识别食材和当前步骤,提供做饭指导。
商品导购
识别商品并提供参数、比较和选购建议。
门店巡检
识别货架缺货和陈列异常。
工业维修助手
识别设备,再显示操作步骤和注意事项。
无障碍视觉助手
描述用户眼前环境并提示障碍。
教学助手
识别教材、公式和实验器材并提供解释。
户外运动助手
未来结合运动感知能力提供训练建议。
企业可以开发自己的“专用AI眼镜”
行业定制的意义则更大。
企业不必所有员工都使用同一套消费级功能。
例如一家汽车制造商可以建立:
工厂巡检眼镜
只开放:
- 设备识别
- SOP
- 故障记录
- 零件查询
- 工单提交
医院则可能建立:
院内辅助眼镜
用于:
- 信息查询
- 流程提醒
- 物资识别
物流企业可以建立:
仓储作业眼镜
用于:
- 条码识别
- 路线提示
- 拣货检查
这类设备的价值不在于功能数量,而在于高度匹配企业流程。
当前还需要注意哪些限制?
平台仍处于内测阶段
千问AI硬件开放平台官网当前明确标注“内测中”。
因此:
- API可能变化
- SDK可能升级
- 审核规范可能调整
- 开发者权限可能分批开放
不应将其描述成已经完全成熟的应用商店。
3D和运动感知正在陆续开放
目前媒体和官方信息的口径均是“正在陆续开放”,不能写成当前所有开发者已经可以完整调用。
视觉识别不能用于绝对安全判断
无障碍辅助和工业巡检都可能涉及真实安全风险。
AI识别可能:
- 漏检
- 误检
- 错误理解场景
因此不能完全替代专业安全设备和人工判断。
摄像头涉及隐私问题
AI眼镜会获取第一视角环境。
在人脸、办公区、医院、家庭等场景中,需要考虑:
- 用户授权
- 第三方隐私
- 数据上传
- 数据存储
- 企业合规
云端AI依赖网络
复杂多模态和Agent服务通常需要云端推理。
网络环境会影响:
- 响应速度
- 稳定性
- 功耗
- 使用范围
Skill权限需要严格审核
如果Skill可以调用摄像头、企业数据和真实业务系统,恶意或错误Skill产生的风险会高于普通聊天机器人。
千问目前设置审核、灰度和上架流程,也说明平台正在针对这一问题进行管理。
总结
2026年8月10日,千问开放平台正式上线,面向开发者开放APP、PC和AI眼镜三类终端。
随后公开的AI眼镜开发体系显示,千问正在通过:
技能平台+行业定制
两条路线开放自己的AI硬件生态。
对于普通开发者,最值得关注的是Skill平台。
开发者可以通过自然语言创建Skill,并调用:
- 眼镜拍照
- 语音交互
- 视觉理解
等能力。
Skill经过审核、灰度和上架后,可以让用户通过语音直接调用。
对于企业,千问则开放:
- 镜端
- APP
- 云端
三层技术能力,包括语音交互、影像采集、画面渲染等底层模块,用于搭建更深入的行业AI眼镜解决方案。
目前已经公开的案例覆盖:
- 无障碍辅助
- 文旅导览
- 菜谱指导
- 工业巡检
- 零售巡检
空间3D立体显示、运动健康状态感知等能力也正在逐步向开发者开放。
过去AI眼镜最大的限制之一,是购买设备以后能力基本由厂商决定。
现在千问正在尝试改变这一模式:
眼镜硬件
+
大模型
+
Skill
+
开发者
+
企业服务当开发者能够直接调用摄像头、语音、显示和传感器,再把自己的专业知识和业务流程封装成Skill,AI眼镜才真正开始拥有类似智能手机应用生态的扩展能力。
只不过,这一次开发者做的可能不再是一款需要用户点击打开的APP。
而是一个用户看向现实世界、说一句话,就能够立即出现的:
眼镜“超能力”。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。