AI眼镜正在从“厂商预装什么功能,用户就只能用什么”,走向一个新的阶段:

开发者可以自己给眼镜增加能力。

2026年8月10日,千问开放平台正式上线,面向生态伙伴和开发者开放手机APP、PC和AI眼镜三类终端的服务接入。

ChatGPT Image 2026年8月11日 19_19_32.png

8月11日,千问进一步公布AI眼镜端开放能力。

针对AI眼镜,千问目前提供两条主要开发路线:

  • 技能平台:面向个人开发者和生态开发者创建Skill
  • 行业定制:面向企业开放镜端、APP和云端技术底座

开发者可以通过自然语言描述需求,并调用“眼镜拍照”、语音交互等硬件插件,让AI眼镜增加新的场景能力。

官方已经展示的方向包括:

  • 无障碍辅助
  • 景区导游
  • 做饭指导
  • 运动教练
  • 工业巡检
  • 零售巡检

未来还将逐步开放:

  • 空间3D立体显示
  • 运动健康状态感知
  • 智能家居控制

千问AI硬件开放平台入口:

https://device.qianwen.com/

千问AI硬件开放平台是什么?

千问AI硬件开放平台是围绕千问AI眼镜建立的官方开发者平台。

官方平台当前提供:

  • 技能平台
  • 开发者文档
  • 开发者社区
  • 行业定制能力
  • 千问AI眼镜S1
  • 千问AI眼镜G1相关硬件生态

平台目前仍标记为 “内测中”

它真正想解决的问题并不是“大模型API怎么调用”,而是:

如何让开发者把大模型真正变成眼镜上的一个具体功能。

普通大模型API主要提供:

文字
↓
模型
↓
文字

AI眼镜应用则需要同时协调:

用户语音
+
第一视角摄像头
+
眼镜传感器
+
眼前显示
+
手机APP
+
云端AI
↓
Skill
↓
现实场景服务

因此,开发AI眼镜应用不只是写一个Prompt。

平台还需要开放硬件、交互、显示、设备通信和云端能力。

这正是千问这次AI硬件开放平台重点解决的问题。

千问开放平台和AI硬件开放平台有什么区别?

这里容易把两个名字混在一起。

千问开放平台

这是更大的生态平台。

2026年8月10日上线后,它同时覆盖:

  • 千问APP
  • PC
  • AI眼镜

第三方企业可以把自己的智能体和服务接入千问,为用户提供从咨询、推荐到履约的完整服务。

首批合作伙伴已经覆盖物流、租房、本地生活、金融、汽车和智能家居等十多个领域,包括:

  • 顺丰速运
  • 天鹅到家鹅宝
  • 联想乐享
  • 自如
  • 盈米基金且慢小顾
  • 哈啰租车
  • 彩云天气
  • 快递100果宝
  • 闪送
  • 飞常准
  • 美的美居
  • 嘟嘟巴士

菜鸟、夸克网盘和夸克扫描王等阿里生态服务也已经接入。

千问AI硬件开放平台

则重点服务:

AI眼镜和后续智能硬件开发。

开发者能够直接使用眼镜端特有的能力,例如:

  • 摄像头
  • 麦克风
  • 语音
  • 画面显示
  • 设备Sensor
  • 镜端交互

这使AI服务可以真正利用“戴在脸上”的硬件优势。

核心是“技能平台+行业定制”

千问目前将AI眼镜开放体系分成两个模块。

模块主要用户主要用途
技能平台开发者、创作者快速创建AI眼镜Skill
行业定制企业客户深度定制AI眼镜系统和业务流程

两套体系解决的问题并不完全相同。

技能平台更接近:

给现有千问AI眼镜增加一个新应用。

行业定制则更接近:

基于千问AI眼镜底层技术,为企业重新做一套行业解决方案。

Skill是什么?

可以把Skill理解成AI眼镜上的一个“技能包”。

传统APP通常是:

打开APP
↓
寻找功能
↓
点击按钮
↓
进入页面
↓
完成操作

而AI眼镜Skill希望变成:

直接说出需求
↓
AI判断应该调用哪个Skill
↓
调用眼镜硬件
↓
完成任务

千问AI眼镜产品负责人此前也解释过,他们希望把外部Agent能力进一步拆成原子化Skill,由千问大模型根据用户的意图、上下文和记忆进行自由编排。

这种思路意味着:

AI眼镜未来更像拥有一套技能系统,而不是安装几十个传统APP。

可以直接用自然语言创建Skill

这是此次平台非常值得关注的一点。

开发者并不一定要从完整代码项目开始。

千问AI硬件开放平台支持通过自然语言描述一个新Skill。

官方页面直接给出的示例是:

帮我创建一个门店巡检助手,识别货架缺货并实时提醒店员。

随后可以选择需要调用的插件和硬件能力,再进入创建流程。

平台提供:

  • 对话创建
  • 模板创建
  • 空白创建

等方式。

这有点类似现在用自然语言创建Agent或Vibe Coding应用,只不过最终运行的位置变成了AI眼镜。

Skill完成后还要经过审核和灰度

AI眼镜Skill不是创建以后立刻向所有用户公开。

千问AI硬件开放平台当前流程还包括:

创建Skill
↓
测试
↓
审核
↓
灰度
↓
上架
↓
用户通过语音调用

官方平台明确提到,Skill需要完成审核、灰度和上架后,才能提供给用户使用。

这非常重要。

因为AI眼镜拥有:

  • 摄像头
  • 麦克风
  • 位置和环境信息
  • 设备控制
  • 持续佩戴能力

相比普通网页Agent,其隐私和权限风险明显更高。

“眼镜拍照”已经开放为插件

目前最具有AI眼镜特色的能力之一,就是:

眼镜拍照。

开发者可以让Skill主动调用第一视角摄像头获得当前环境信息,然后交给多模态模型进行理解。

传统AI的工作流程是:

用户描述自己看到了什么
↓
AI回答

AI眼镜则变成:

用户看向某处
↓
眼镜拍照
↓
多模态模型理解
↓
Skill结合场景进行处理
↓
语音或画面反馈

用户不需要先拿手机拍照,再上传图片。

摄像头本身就成为AI观察现实世界的入口。

官方案例:“身边有什么”

千问已经展示了一个很典型的无障碍Skill:

“身边有什么”。

开发者调用眼镜拍照能力,让视觉障碍用户佩戴眼镜后获取前方画面。

AI可以帮助识别:

  • 门槛
  • 台阶
  • 障碍物
  • 周边环境

随后通过语音向用户提供环境提示。

整体流程类似:

用户向前行走
↓
眼镜获取第一视角画面
↓
多模态模型分析
↓
识别潜在障碍
↓
语音提醒

这也是AI眼镜和普通AI App最大的差异之一。

它天然位于用户视角。

不过,这种视觉识别目前不能替代专业无障碍设备或人工判断,尤其涉及交通和安全决策时仍需要保留明确的风险边界。

可以做AI导游

文旅也是非常适合AI眼镜的场景。

例如开发一个:

故宫AI导游Skill。

用户走到建筑前时,可以询问:

我现在看的是什么建筑?

眼镜获取第一视角画面,再结合:

  • 视觉识别
  • 景区知识库
  • 用户位置
  • 历史资料

生成讲解内容。

未来空间3D能力进一步开放后,还可以尝试:

看到建筑
↓
识别目标
↓
显示名称
↓
3D空间标记
↓
语音讲解
↓
提示下一处路线

千问目前也把3D景点导览列为后续空间3D能力的重要应用方向。

可以做“菜谱专家”

居家场景也可以利用第一视角。

例如创建一个“菜谱专家”Skill。

用户做饭时不需要一直查看手机:

看向食材
↓
AI识别
↓
判断当前步骤
↓
告诉用户下一步怎么做

开发者还可以为Skill增加:

  • 菜谱知识库
  • 食材识别
  • 计时
  • 语音提醒
  • 营养信息

从而变成真正面向做饭场景的第一视角AI助手。

AI运动教练也会成为重要方向

千问还在逐步开放:

运动健康状态感知。

这将允许未来Skill结合用户当前的运动状态进行判断。

例如跑步时:

速度
+
心率等健康状态
+
当前路线
+
运动历史
↓
AI教练
↓
实时训练建议

可能实现:

  • 配速提醒
  • 训练节奏建议
  • 补水提醒
  • 运动动作建议
  • 路线提示
  • 个性化陪练

需要注意的是,官方目前使用的是 “陆续开放” 的表述。

因此,运动健康状态感知不能写成当前已经对所有开发者完整开放。

空间3D立体显示也将开放

千问AI眼镜S1此前已经上线空间3D显示能力。

其原理之一是利用双光机和双目视差,让左右眼看到略有不同的画面,从而形成空间深度。千问AI硬件负责人此前表示,团队希望数字信息能够像现实物体一样存在于空间中,而不是简单贴在用户视野前方。

现在,千问正在计划将这部分能力逐步开放给开发者。

未来可能出现:

3D导览

景点名称、路线和内容直接出现在对应建筑附近。

运动路线

跑步方向和训练信息进入空间视野。

工业维修

设备对应位置显示:

  • 参数
  • 操作步骤
  • 风险信息

教育

现实中的物体旁边显示:

  • 3D模型
  • 结构解释
  • 标签

不过,目前平台仍在分阶段开放相关能力,不能把未来规划写成已经可以调用的成熟API。

技能平台更像AI眼镜的“App Store”

传统智能手机生态增长靠的是:

操作系统
+
App Store
+
开发者

AI眼镜未来可能变成:

AI操作系统
+
Skill平台
+
开发者

区别在于:

手机用户会主动寻找并打开App。

AI眼镜则可能通过大模型自动理解用户当前需要什么,再调用相应Skill。

千问AI硬件负责人此前直接提出:

“AI助理即OS”。

他认为,如果所有外部能力都保留成封闭Agent,大模型的自由编排空间会受到限制;如果将其变成原子化Skill,大模型就可以根据:

  • 用户意图
  • 环境
  • 记忆
  • 当前任务

动态决定调用哪些能力。

第二条路线:企业行业定制

个人开发者可能只需要创建一个Skill。

但工业、零售、物流等企业往往需要更深的能力。

例如工厂巡检眼镜可能需要:

  • 摄像头长期采集
  • 企业设备知识库
  • 专业识别模型
  • 画面提示
  • 语音交互
  • APP后台
  • 任务系统
  • 云端数据服务

因此,千问AI硬件开放平台还提供 行业定制 模块。

官方平台表示,将高自由度开放:

  • 镜端
  • APP
  • 云端

三部分能力,并提供语音交互、影像采集和画面渲染等核心技术。

三层架构意味着什么?

可以简单理解为:

第一层:眼镜端

负责与真实世界直接交互。

包括当前已经明确展示的:

  • 影像采集
  • 语音交互
  • 画面渲染
  • Sensor相关能力

官方平台页面还明确列出镜端画面渲染能力,可支持双光机单绿显示及眼镜桌面入口展示。

第二层:APP

手机承担设备配套和部分交互层。

可能负责:

  • 设备配置
  • 用户账号
  • 网络连接
  • 内容管理
  • 企业业务入口

千问AI硬件团队此前已经完成眼镜近端、APP移动端和云端能力梳理,并规划相应SDK。

第三层:云端

云端负责更重的:

  • 大模型推理
  • Agent
  • 企业知识
  • 数据服务
  • 业务系统连接

这使企业不用强行把所有AI模型运行在眼镜内部。

为什么不能全部放在眼镜端?

AI眼镜最大的工程限制始终是:

  • 重量
  • 电池
  • 散热
  • 算力
  • 续航

如果在几十克的眼镜中长时间运行大型多模态模型,功耗和散热都很难控制。

阿里云现有的通义多模态交互开发套件,本身就采用端云结合方案:端侧SDK连接摄像头和麦克风,同时提供VAD、回声消除、语音唤醒等端侧算法,大模型和复杂视觉理解则可以放在云端完成。

这种分工大致可以理解成:

眼镜端
负责感知和低延迟交互
↓
手机端
负责连接和设备管理
↓
云端
负责复杂AI推理

企业也可以根据实际业务重新调整。

工业巡检已经成为重点案例

企业行业定制最直接的场景之一就是:

工业巡检。

工作人员戴着眼镜走到设备前。

系统可以:

  1. 获取当前设备画面
  2. 识别设备状态
  3. 查询企业巡检规范
  4. 检查项目是否完成
  5. 提示异常
  6. 记录检查结果

千问目前已经展示,工业巡检助手可以结合企业自己的检查标准和作业流程进行定制。

与手机巡检相比,眼镜最大的优势是:

工作人员可以继续使用双手。

例如维修大型机械时,不需要:

停下来
↓
掏手机
↓
拍照
↓
查看文档
↓
放下手机
↓
继续操作

AI眼镜可以让说明和提醒持续出现在眼前或耳边。

零售巡检也很适合

零售行业同样可以创建专用巡检助手。

例如店员进入卖场后:

看向货架
↓
眼镜拍摄
↓
AI识别商品陈列
↓
检查缺货
↓
检查摆放规范
↓
提醒店员

官方在平台创建示例中直接使用:

帮我创建一个门店巡检助手,识别货架缺货并实时提醒店员。

进一步还可以结合:

  • 商品数据库
  • 门店SOP
  • 陈列规范
  • 库存系统
  • 补货任务

让眼镜从视觉识别工具变成一线工作终端。

智能家居可能成为另一个入口

千问已经明确将智能家居列为眼镜能力扩展方向。

未来用户可以直接看向设备并说:

把这个灯调暗一点。

或者:

空调调到25度。

AI结合视线、视觉识别和智能家居设备关系,判断用户指的是哪一个设备,再调用对应服务。

传统智能家居需要:

打开APP
↓
找房间
↓
找设备
↓
点击操作

未来可能变成:

看向设备
↓
说出要求
↓
AI完成控制

这就是AI眼镜作为现实世界智能入口的重要价值。

为什么AI眼镜特别适合Skill模式?

眼镜和手机存在三个非常明显的不同。

第一,眼镜可以解放双手

用户可以边工作、边运动、边做饭、边旅行。

第二,信息就在眼前和耳边

无需低头查看手机。

第三,眼镜拥有连续的第一视角

千问AI硬件负责人认为,只要眼镜持续佩戴,它就拥有手机难以获得的连续多模态感知条件。

因此AI可以理解:

  • 用户正在看什么
  • 当前处于什么环境
  • 用户正在做什么
  • 当前任务进行到哪一步

Skill就能围绕这些上下文工作。

未来AI硬件可能不再靠“出厂功能”竞争

过去购买智能眼镜时,用户通常比较:

  • 能不能翻译
  • 能不能导航
  • 能不能拍照
  • 能不能提词
  • 能不能听音乐

这些功能基本在设备出厂时确定。

开放Skill平台以后,理论上可以变成:

今天
安装旅游Skill

明天
安装健身Skill

后天
安装做饭Skill

工作时
使用巡检Skill

同一副硬件能够随着软件生态不断增加新的使用方式。

因此用户所说的“可生长智能”,可以更准确地理解成:

硬件能力保持相对稳定,但AI和Skill生态持续扩展设备能做的事情。

与手机App开发最大的区别

假设要开发一个植物识别功能。

手机App

通常需要:

打开APP
↓
点击拍照
↓
对准植物
↓
拍摄
↓
等待识别
↓
阅读结果

AI眼镜Skill

则可能是:

看着植物
↓
“这是什么花?”
↓
调用眼镜拍照
↓
多模态识别
↓
耳边直接回答

这种交互没有传统App页面作为中心。

核心从UI变成:

  • 语音
  • 视觉
  • 上下文
  • AI判断

因此,AI眼镜开发者需要重新思考交互设计,而不是简单把手机App缩小放进眼镜。

千问现有多模态能力可以提供哪些底层支持?

阿里云此前已经提供通义多模态交互开发套件,专门面向:

  • AI/AR眼镜
  • 智能耳机
  • 机器人
  • 学习机
  • AI玩具
  • 智能家居

提供实时语音和多模态交互技术。

现有能力包括:

  • 全双工语音
  • 用户随时打断
  • 实时视觉理解
  • VAD语音活动检测
  • 回声消除
  • 语音唤醒
  • 模型和Prompt配置
  • 知识库
  • Agent
  • 插件
  • 设备指令
  • 第三方Agent接入

同时支持Android、iOS、Linux和RTOS等系统。

千问AI硬件开放平台可以理解为进一步把这些AI能力,与千问自己的AI眼镜硬件和用户生态连接起来。

APP、PC、眼镜三端为什么值得关注?

千问开放平台并不是只开放眼镜。

它同时覆盖:

  • APP
  • PC
  • AI眼镜

这意味着同一个服务未来可能在不同设备之间连续工作。

例如旅游场景:

PC

提前制定旅行计划。

手机

途中管理机票、酒店和行程。

AI眼镜

到了景区直接进行:

  • 路线提醒
  • 地标识别
  • 实时翻译
  • 景点讲解

一个Agent服务不必局限于单个硬件。

这可能比单独开发一款“眼镜App”更有价值。

第三方Agent也可以进入千问

千问开放平台支持第三方通过标准化协议将已有Agent接入千问,并提供:

  • 一键授权
  • 端到端调测
  • 账号能力
  • AI支付
  • 订单接入
  • 前端组件
  • 多模态交互模板

例如顺丰智能体可以直接处理:

帮我给上海客户寄个文件。

而不仅是告诉用户如何寄快递。

这意味着千问整个开放平台正在形成两个层级:

服务Agent
负责完成具体服务和交易

+

眼镜Skill
负责理解现实环境和即时交互

两者未来结合起来,会出现更复杂的场景。

例如“看到东西就能办事”

假设用户戴着AI眼镜看到快递盒:

把这个退掉。

未来系统可能需要:

眼镜识别快递
↓
判断商品
↓
查询订单
↓
调用电商服务
↓
调用物流Agent
↓
生成退货订单
↓
告诉用户结果

这里同时涉及:

  • 视觉
  • Skill
  • 用户账号
  • Agent
  • 支付与订单系统

这也是为什么AI眼镜平台的竞争,最终很可能不仅是硬件竞争,而是生态竞争。

开发者现在可以尝试哪些Skill?

基于当前已经公开的能力,可以优先尝试低风险、场景明确的方向:

AI导游

眼镜拍照
+
景点识别
+
知识库
+
语音讲解

展会助手

识别展台和产品,自动介绍企业和产品资料。

博物馆讲解

识别展品并根据馆方知识库进行解说。

菜谱助手

识别食材和当前步骤,提供做饭指导。

商品导购

识别商品并提供参数、比较和选购建议。

门店巡检

识别货架缺货和陈列异常。

工业维修助手

识别设备,再显示操作步骤和注意事项。

无障碍视觉助手

描述用户眼前环境并提示障碍。

教学助手

识别教材、公式和实验器材并提供解释。

户外运动助手

未来结合运动感知能力提供训练建议。

企业可以开发自己的“专用AI眼镜”

行业定制的意义则更大。

企业不必所有员工都使用同一套消费级功能。

例如一家汽车制造商可以建立:

工厂巡检眼镜

只开放:

  • 设备识别
  • SOP
  • 故障记录
  • 零件查询
  • 工单提交

医院则可能建立:

院内辅助眼镜

用于:

  • 信息查询
  • 流程提醒
  • 物资识别

物流企业可以建立:

仓储作业眼镜

用于:

  • 条码识别
  • 路线提示
  • 拣货检查

这类设备的价值不在于功能数量,而在于高度匹配企业流程。

当前还需要注意哪些限制?

平台仍处于内测阶段

千问AI硬件开放平台官网当前明确标注“内测中”。

因此:

  • API可能变化
  • SDK可能升级
  • 审核规范可能调整
  • 开发者权限可能分批开放

不应将其描述成已经完全成熟的应用商店。

3D和运动感知正在陆续开放

目前媒体和官方信息的口径均是“正在陆续开放”,不能写成当前所有开发者已经可以完整调用。

视觉识别不能用于绝对安全判断

无障碍辅助和工业巡检都可能涉及真实安全风险。

AI识别可能:

  • 漏检
  • 误检
  • 错误理解场景

因此不能完全替代专业安全设备和人工判断。

摄像头涉及隐私问题

AI眼镜会获取第一视角环境。

在人脸、办公区、医院、家庭等场景中,需要考虑:

  • 用户授权
  • 第三方隐私
  • 数据上传
  • 数据存储
  • 企业合规

云端AI依赖网络

复杂多模态和Agent服务通常需要云端推理。

网络环境会影响:

  • 响应速度
  • 稳定性
  • 功耗
  • 使用范围

Skill权限需要严格审核

如果Skill可以调用摄像头、企业数据和真实业务系统,恶意或错误Skill产生的风险会高于普通聊天机器人。

千问目前设置审核、灰度和上架流程,也说明平台正在针对这一问题进行管理。

总结

2026年8月10日,千问开放平台正式上线,面向开发者开放APP、PC和AI眼镜三类终端。

随后公开的AI眼镜开发体系显示,千问正在通过:

技能平台+行业定制

两条路线开放自己的AI硬件生态。

对于普通开发者,最值得关注的是Skill平台。

开发者可以通过自然语言创建Skill,并调用:

  • 眼镜拍照
  • 语音交互
  • 视觉理解

等能力。

Skill经过审核、灰度和上架后,可以让用户通过语音直接调用。

对于企业,千问则开放:

  • 镜端
  • APP
  • 云端

三层技术能力,包括语音交互、影像采集、画面渲染等底层模块,用于搭建更深入的行业AI眼镜解决方案。

目前已经公开的案例覆盖:

  • 无障碍辅助
  • 文旅导览
  • 菜谱指导
  • 工业巡检
  • 零售巡检

空间3D立体显示、运动健康状态感知等能力也正在逐步向开发者开放。

过去AI眼镜最大的限制之一,是购买设备以后能力基本由厂商决定。

现在千问正在尝试改变这一模式:

眼镜硬件
+
大模型
+
Skill
+
开发者
+
企业服务

当开发者能够直接调用摄像头、语音、显示和传感器,再把自己的专业知识和业务流程封装成Skill,AI眼镜才真正开始拥有类似智能手机应用生态的扩展能力。

只不过,这一次开发者做的可能不再是一款需要用户点击打开的APP。

而是一个用户看向现实世界、说一句话,就能够立即出现的:

眼镜“超能力”。

相关链接