
随着大模型在软件工程、智能体和内容生成领域的持续发展,模型是否真正“好用”,已不再只取决于参数规模,而更体现在编程能力、推理稳定性以及与真实工作流的适配程度上。
GLM-4.7 正是在这样的背景下推出的新一代通用大语言模型,在编程智能体、UI 生成、工具调用和复杂推理等多个关键方向实现了系统性提升。
一、编程能力的持续增强
在核心编程能力方面,GLM-4.7 相较上一代模型在多个权威基准测试中表现更加稳定:
- SWE-bench:73.8%(+5.8%)
- SWE-bench Multilingual:66.7%(+12.9%)
- Terminal Bench 2.0:41%(+16.5%)
这些结果显示,GLM-4.7 在多语言代码理解、修复真实工程问题以及基于终端的任务执行方面具备更强的可靠性。
同时,模型在 Claude Code、Kilo Code、Cline、Roo Code 等主流编程智能体框架中,能够更好地完成跨文件修改、调试和复杂任务规划。
这使得 GLM-4.7 更适合长期运行的编程智能体场景,而不仅是一次性的代码生成。
二、UI 与“氛围编程”体验的明显改善
在前端与视觉生成方向,GLM-4.7 在输出质量上迈出了重要一步:
- 生成的网页结构更清晰,布局更符合现代设计规范
- HTML / CSS 尺寸和间距更准确
- 幻灯片和海报的排版更稳定、可直接使用
相关示例可参考:
- 前端开发展示
https://chat.z.ai/s/23c15468-405d-4993-9110-cffa99f79acb - 前端产物展示
https://chat.z.ai/s/aa6d8ace-1aec-45a1-bf0c-bb9dc9104072 - 海报展示
https://chat.z.ai/s/83640645-5436-4069-a27b-f8094189d669 - 幻灯片制作展示
https://chat.z.ai/s/00f6153c-d5ae-4ee6-a26a-897505377e02
这些改进使模型在“从想法到可视化结果”的流程中,减少了反复修改的成本。
三、工具调用与智能体任务表现
GLM-4.7 在工具使用和多步骤任务执行方面表现更加成熟:
- 在 -Bench 等工具调用基准中,任务完成率明显提高
- 在 BrowseComp 等网页浏览与信息整合任务中,表现更加稳定
这意味着模型在真实环境下调用搜索、终端、浏览器等工具时,能够更好地理解上下文并做出合理决策,适合复杂智能体应用。
四、复杂推理与数学能力提升
在高难度推理方面,GLM-4.7 在 HLE(Humanity’s Last Exam) 基准测试中取得了 42.8%(+12.4%) 的成绩。
这一提升反映出模型在数学推理、逻辑一致性和多步分析方面的整体增强,为科研、工程分析和复杂决策提供了更可靠的基础。
五、交错式思考与多轮一致性机制
GLM-4.7 延续并增强了此前引入的思考机制,使复杂任务更加可控:
- 交错式思考:在每次响应和工具调用前进行内部推理,提高指令遵循度
- 保留式思考:在编程智能体场景中,自动保留多轮推理结果,减少信息丢失
- 轮级思考:支持按轮次控制推理深度,在性能、成本与准确性之间取得平衡
相关技术说明可参考官方文档:
https://docs.z.ai/guides/capabilities/thinking-mode
六、从基准到实际使用的意义
在对比 GPT-5、Claude Sonnet、Gemini Pro、DeepSeek 等模型的 17 项基准测试中,GLM-4.7 在编程、推理和智能体任务上展现出具有竞争力的综合表现。
不过,正如官方所强调的,基准测试只是参考,真正的价值仍然体现在模型是否能够自然融入开发者的日常工作流。
更多研究背景可查看:
https://www.zhipuai.cn/zh/research/143









评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。