随着大模型在软件工程、智能体和内容生成领域的持续发展,模型是否真正“好用”,已不再只取决于参数规模,而更体现在编程能力、推理稳定性以及与真实工作流的适配程度上。
GLM-4.7 正是在这样的背景下推出的新一代通用大语言模型,在编程智能体、UI 生成、工具调用和复杂推理等多个关键方向实现了系统性提升。

一、编程能力的持续增强

在核心编程能力方面,GLM-4.7 相较上一代模型在多个权威基准测试中表现更加稳定:

  • SWE-bench:73.8%(+5.8%)
  • SWE-bench Multilingual:66.7%(+12.9%)
  • Terminal Bench 2.0:41%(+16.5%)

这些结果显示,GLM-4.7 在多语言代码理解、修复真实工程问题以及基于终端的任务执行方面具备更强的可靠性。
同时,模型在 Claude Code、Kilo Code、Cline、Roo Code 等主流编程智能体框架中,能够更好地完成跨文件修改、调试和复杂任务规划。

这使得 GLM-4.7 更适合长期运行的编程智能体场景,而不仅是一次性的代码生成。


二、UI 与“氛围编程”体验的明显改善

在前端与视觉生成方向,GLM-4.7 在输出质量上迈出了重要一步:

  • 生成的网页结构更清晰,布局更符合现代设计规范
  • HTML / CSS 尺寸和间距更准确
  • 幻灯片和海报的排版更稳定、可直接使用

相关示例可参考:

这些改进使模型在“从想法到可视化结果”的流程中,减少了反复修改的成本。


三、工具调用与智能体任务表现

GLM-4.7 在工具使用和多步骤任务执行方面表现更加成熟:

  • -Bench 等工具调用基准中,任务完成率明显提高
  • BrowseComp 等网页浏览与信息整合任务中,表现更加稳定

这意味着模型在真实环境下调用搜索、终端、浏览器等工具时,能够更好地理解上下文并做出合理决策,适合复杂智能体应用。


四、复杂推理与数学能力提升

在高难度推理方面,GLM-4.7 在 HLE(Humanity’s Last Exam) 基准测试中取得了 42.8%(+12.4%) 的成绩。
这一提升反映出模型在数学推理、逻辑一致性和多步分析方面的整体增强,为科研、工程分析和复杂决策提供了更可靠的基础。


五、交错式思考与多轮一致性机制

GLM-4.7 延续并增强了此前引入的思考机制,使复杂任务更加可控:

  • 交错式思考:在每次响应和工具调用前进行内部推理,提高指令遵循度
  • 保留式思考:在编程智能体场景中,自动保留多轮推理结果,减少信息丢失
  • 轮级思考:支持按轮次控制推理深度,在性能、成本与准确性之间取得平衡

相关技术说明可参考官方文档:
https://docs.z.ai/guides/capabilities/thinking-mode


六、从基准到实际使用的意义

在对比 GPT-5、Claude Sonnet、Gemini Pro、DeepSeek 等模型的 17 项基准测试中,GLM-4.7 在编程、推理和智能体任务上展现出具有竞争力的综合表现。
不过,正如官方所强调的,基准测试只是参考,真正的价值仍然体现在模型是否能够自然融入开发者的日常工作流。

更多研究背景可查看:
https://www.zhipuai.cn/zh/research/143