阿里巴巴近日正式发布全球首个通过强化学习训练的长文本推理模型——QwenLong-L1-32B,专为复杂的长上下文推理与问答场景设计。该模型采用创新的GRPO和DAPO强化学习算法,在长文本推理准确性与效率方面实现新突破,其性能已可媲美业界先进的Claude-3.7,并在多个文档问答基准测试中领先主流大模型。


QwenLong-L1-32B核心亮点

  • 行业首创强化学习训练机制
    通过GRPO和DAPO算法,有效提升了模型对长文本推理任务的准确理解与分析能力。
  • 多项长文本基准测试优异成绩
    在7个权威长上下文文档问答基准测试中表现出色,优于同类主流大模型,更适用于复杂文档场景。
  • 全套技术解决方案发布
    同步开源高性能模型、优化的数据集、强化学习方法及完善的评价体系,协助产业深度应用长文本AI。
  • 产业化应用潜力巨大
    推动长文本推理大模型在法务、医疗、金融、科研、内容生成等各类场景落地。

 详细信息及开源入口
QwenLong-L1-32B项目(GitHub)


关注阿里巴巴及业界领先的长文本AI应用,洞悉大模型与强化学习的产业化新拐点!