2025 年 8 月 31 日,上海人工智能实验室(OpenGVLab)正式开源书生・万象 InternVL3.5,以2410 亿参数旗舰模型 + 九种尺寸矩阵的全量级布局,首次实现开源多模态大模型在推理能力、部署效率、通用性能的全面突破。其旗舰模型 InternVL3.5-241B-A28B 在多学科推理基准 MMMU 中以77.7 分刷新开源纪录,超越 GPT-5(75.7 分),标志着开源多模态 AI 正式迈入 “超越闭源” 的新纪元。

一、三大核心突破:从 “能用” 到 “好用” 的质变

1. 级联式强化学习:推理能力跃升 16 分,数学逻辑全面碾压

InternVL3.5 首创 ** 级联式强化学习(Cascade RL)** 框架,通过 “离线预热 + 在线精调” 双阶段训练,解决传统模型 “训练 - 推理分布偏移” 难题:

  • 离线预热:基于 2170 万高质量多模态样本(含 GUI 操作、3D 图纸、科学图表等),结合混合偏好优化(MPO)生成 1.2 亿伪样本,快速提升基础推理能力;
  • 在线精调:引入 GSPO 算法,利用模型自生成的 10 万 + 复杂任务样本(如数学证明、逻辑推理),动态优化输出分布。
    成果:旗舰模型在 AIME25 数学竞赛题中平均得分 75.6 分,超越 Claude-3.7-Sonnet(53.9 分);逻辑推理基准 ZebraLogic 准确率 89.3%,接近 GPT-5(91.2%)。

2. 动态视觉路由 + 解耦部署:896 分辨率推理速度提升 4 倍

针对高分辨率视觉输入的效率瓶颈,InternVL3.5 推出两大工程创新:

  • 动态视觉分辨率路由(ViR):智能识别图像关键区域(如文字、人脸)保留高分辨率,背景区域降采样,使 896px 图像的视觉 tokens 减少 62%,38B 模型单次推理延迟从 369ms 降至 91ms(A100 GPU);
  • 解耦部署框架(DvD):分离视觉编码器与语言模型,支持异步流水线处理,38B 模型吞吐量提升 4.05 倍,单张 A100 即可部署 8B 模型,8 张 A100 支持 235B 模型,覆盖边缘设备到数据中心的全场景需求。

3. 全尺寸模型矩阵:1B-241B 九种规格,首个兼容 GPT-OSS 基座

首次构建稠密 + MoE 混合架构的全尺寸模型家族,包含:

  • 轻量化系列:1B/2B/4B/8B(单 A100 部署),适合移动端与嵌入式设备;
  • 通用系列:14B/26B/38B(2-4 张 A100),平衡性能与成本;
  • 旗舰系列:78B(6 张 A100)、241B-A28B(MoE,8 张 A100),挑战复杂任务。
    独特性:全球首个支持GPT-OSS 语言基座的开源多模态模型,语言能力与多模态理解深度协同,纯文本任务(如 MMLU-Pro)得分 81.3 分,超越同类开源模型 20%。

二、标杆性能:开源模型首次超越闭源商业产品

基准测试InternVL3.5-241B-A28BGPT-5Claude-3.7-Sonnet开源第二
MMMU(多学科推理)77.7(开源第一)75.772.171.2
MMStar(多模态感知)77.980.774.570.3
ScreenSpot(GUI 定位)92.9(开源第一)94.189.285.6
SGP-Bench(矢量图理解)70.7(开源第一)72.368.563.2
VSI-Bench(空间推理)69.5(开源第一)71.065.861.1

关键突破:在 GUI 智能体、建筑图纸解析、矢量图生成等垂直场景,InternVL3.5 已达到商业模型 95% 的能力,可直接赋能自动化办公(如跨平台软件操作)、智能制造(如工程图纸审查)等领域。

三、开源生态:从科研到产业的全链路赋能

1. 开发者友好型设计

  • 统一接口:支持 HuggingFace/Transformers 标准调用,提供多图 / 视频 / 文档处理示例代码(如多图对比分析、视频关键帧问答);
  • 低门槛微调:通过 ms-swift 框架,开发者可基于 10 万 + 行业数据(如医疗影像 + 病历)快速定制模型,38B 模型微调仅需 4 张 A100;
  • 部署工具链:内置量化工具(支持 4-bit AWQ),8B 模型在 RTX 3060 上实现 200+TPS 推理,满足中小企业需求。

2. 产业落地场景

  • 教育领域:支持多学科图文解析(如数学公式 + 几何图),AIME25 解题速度比人类快 3 倍;
  • 智能办公:GUI 定位准确率 92.9%,可自动操作 PS、Excel 等专业软件,处理发票识别 + 表格提取全流程;
  • 科研辅助:支持 128k 长文档(如论文 + 图表),在生物医学图像分析中,病灶定位准确率达 91.2%;
  • 创意产业:矢量图生成支持 SVG 解析,自动生成网页图标、工业设计草图,效率提升 80%。

四、开源价值:推动 AI 技术民主化

InternVL3.5 的开源不仅是技术突破,更是一次AI 普惠运动

  • 打破技术垄断:首次让中小企业获得接近 GPT-5 的多模态能力,模型训练成本降低 70%;
  • 加速垂直创新:开源九种模型 + 完整训练数据(含 200 亿文本 + 150 亿多模态样本),推动农业(病虫害图像识别)、金融(财报图表分析)等领域快速落地;
  • 生态共建:联合清华大学、商汤科技等 12 家机构,建立多模态开源社区,已吸引 3000 + 开发者参与,贡献 200 + 行业适配方案。

立即体验 InternVL3.5

  • 代码开源:GitHub(https://github.com/OpenGVLab/InternVL),含部署指南与微调教程
  • 在线 Demo:上海 AI 实验室官网(即将开放多图对话、GUI 操作等交互功能)