GLM-5.3正式登场!开源榜单登顶,实测改造DeepSeekHarness
创始人
2026-08-15 12:30:50
0

8月14日,智谱正式推出旗舰模型GLM-5.3,7430亿参数、主打代码与智能体,并且官宣两周内完成安全评估后开源。不同于行业普遍认知里“做大基座、扩充参数才能变强”的路线,这款新模型沿用GLM-5.2原有基座,全部性能提升来自后训练优化。

基准榜单上,它站稳开源模型第一梯队,编程能力逼近海外顶尖闭源大模型;落地实测更加直观,从零搭建3D开放世界游戏、读懂七千多个文件的陌生代码仓库。意料之外的是,长时间任务训练之后,模型还涌现出不俗的网络安全能力。当预训练算力红利逐步放缓,智谱GLM-5.3的亮相,也把一条全新赛道摆在所有AI厂商面前。

一、硬核实测:两大真实工程任务,检验模型落地实力

想要看清一款编程大模型水平,单纯跑分远远不够。内测阶段,测试人员搭配智谱AI编程工具ZCode,安排了两项难度极高的实战任务。

1、基于真实地理数据,复刻外滩3D驾驶游戏

第一项任务目标清晰:依托公开地图数据,搭建上海陆家嘴至外滩区域的3D开放世界驾驶游戏,只允许调用Three.js底层能力,地图解析、游戏逻辑全部交由模型手写。测试者还悄悄埋下两道隐藏需求,考验模型长期任务的记忆稳定性:凌晨两点至四点外滩灯光减半、地图边缘设置软性边界提示。

拿到需求之后,GLM-5.3没有直接动手编码,先编写脚本拉取八万多条地理节点数据,完成前期数据核验。整套项目最终产出4900行代码,覆盖车辆物理引擎、昼夜切换、导航、存档全套功能,两处隐藏条款全部顺利落地。

调试过程更能看出模型排障思路。页面出现卡死故障时,它主动新增日志探针定位根源;相机穿透建筑的模糊问题,模型自行统计数千栋建筑法线方向差异,仅修改少量代码完成修复。甚至在无法直观预览画面的环境下,自主开发解码器,依靠像素数据验证渲染效果。

当然短板同样明显,模型工程调试思路清晰,但审美表现尚有欠缺,建筑贴图、道路画面经过多轮人工调整依旧简陋。整体来看,GLM-5.3具备独立完成完整开发任务的潜力,不过依然需要人类持续反馈,打磨最终成品。

2、裸考全新开源框架,打造可切换人格插件

第二项测试更贴近开发者日常工作场景:挑战刚刚发布、训练数据完全没有覆盖的DeepSeekHarness智能体框架。这份代码仓库包含七千四百多个文件、数十个顶层项目,相当于让模型在零资料前提下读懂一套陌生大型工程。

GLM-5.3启动多个并行子智能体分头探索,追踪程序启动链路、插件加载规则,梳理清楚整套框架运行逻辑。摸清架构后,新任务随之而来:开发一款零侵入式人格插件,实现文言文、东北话、猫语三种风格自由切换,插件关闭之后框架需要立刻恢复原始状态。

模型选定系统提示注册表作为改造入口,做到不改动原有消息链路。最终交付代码覆盖二十个文件,配套单元测试一次性通过。测试期间遇到6个用例报错,模型主动回滚改动、在纯净环境复测,精准定位问题来自运行环境,而非新增代码。

实测也暴露出产品体验痛点:超长任务运行时缺少状态反馈,容易让人误以为进程中断;面对低风险代码修改,依旧执行全套检测流程,带来不必要的token消耗。

二、不止擅长写代码,意外涌现强劲网络安全能力

深耕编程赛道之外,GLM-5.3带来一大惊喜:持续的后训练过程,催生了突出的漏洞挖掘能力。

在专业评测CyberGym白盒代码审计测试中,GLM-5.3得分84.5%,超越多款海外知名闭源模型。在漏洞利用相关测试里,相比前代GLM-5.2实现跨越式提升。考虑到强大代码能力伴随潜在风险,智谱明确表示,正式开源前会完成全面安全加固,限制模型被用于网络攻击,保留代码防御、漏洞审计的正向价值。

三、效率全面升级,不盲目消耗算力

大模型落地成本始终是开发者关心的核心。GLM-5.3引入思考档位调节机制,在性能与token消耗之间找到新平衡点。

高档位思考模式下,GLM-5.3任务准确率31.5%,高于ClaudeOpus4.8,平均仅输出5万个token,不足后者一半。搭配ZCode开展开发工作时,对话缓存命中率超过99%,能够持续降低开发者使用成本。

横向对比当前主流模型,GLM-5.3在编程、智能体基准测试上处于开源第一梯队;和国产KimiK3各有长短,整体基准表现领先DeepSeek-V4-Pro。目前模型已经接入Zcode、AutoClaw等多款工具,同时登陆多个第三方开发平台抢先体验,官方API也会很快对外开放。

四、行业新趋势:后训练成为模型迭代主战场

GLM-5.3最关键的信号,不在于又诞生一款高性能开源模型,而是验证一条全新迭代路径:不必无休止堆砌算力、扩大预训练基座,依靠持续拉长、丰富的后训练,同样可以实现能力跨越式升级。

在此之前,DeepSeek最新版本性能提升,同样大量依托后训练阶段投入。行业不难发现,单纯扩充参数规模的边际收益持续下滑。搭建全新预训练基座,需要海量数据与巨额算力投入;而后训练路线成本可控,更适合持续针对编程、智能体、安全等垂直场景定向优化。

这意味着接下来的大模型竞争逻辑正在转变。过去比拼谁能训练出更大基座;未来厂商的差距,会体现在任务环境搭建、强化学习框架、真实场景对齐能力之上。

GLM-5.3算不上一款完美模型,审美短板、长任务交互体验问题客观存在。但它向开发者展示了可行方向:能够独立承接中型完整开发项目,读懂大型复杂代码库,兼顾算力效率,同时具备漏洞审计这类延伸能力。

随着两周后的开源窗口期临近,更多独立开发者、中小企业能够近距离体验这款国产旗舰编程模型。而当后训练Scaling成为行业共识,接下来会有更多厂商跟进这条路线,国产开源大模型之间的竞争,也将进入全新阶段。

相关内容

GLM-5.3正式登场!开...
8月14日,智谱正式推出旗舰模型GLM-5.3,7430亿参数、主...
2026-08-15 12:30:50
阿里巴巴宣布:今天正式开源...
阿里巴巴宣布,今天正式开源Qwen3.8系列模型,所有开发者、科研...
2026-08-15 11:02:37
华为申请模型处理方法及装置...
国家知识产权局信息显示,华为技术有限公司申请一项名为“一种模型处理...
2026-08-15 11:01:51
戴夫·普拉默推赛博朋克风重...
2026-08-15 07:41:47 作者:狼叫兽 2026年...
2026-08-15 09:03:14
云从科技:公司实施&quo...
证券之星消息,云从科技(688327)08月14日在投资者关系平台...
2026-08-15 08:30:43
龙岗何以AI③|用AI开拓...
人民网记者 李语 深圳龙岗机器人街区汇聚人工智能6S店、机器人6...
2026-08-15 08:29:18

热门资讯

GLM-5.3正式登场!开源榜... 8月14日,智谱正式推出旗舰模型GLM-5.3,7430亿参数、主打代码与智能体,并且官宣两周内完成...
AI选秀喧嚣过后,一场没有“真... 作者| 娱乐独角兽 赤木瓶子 AI正在闯入综艺领域。 今年暑期以来,《12星练赛》《星光108》等...
山东黄河勘测设计研究院申请基于... 国家知识产权局信息显示,山东黄河勘测设计研究院有限公司申请一项名为“基于远程Linux的水文泥沙数据...
华为申请模型处理方法及装置专利... 国家知识产权局信息显示,华为技术有限公司申请一项名为“一种模型处理方法及装置”的专利,公开号CN12...
AI海报|一粒朱砂原石 解锁亿... 天眼新闻记者 尹洁 编辑 蔡茜 二审 文叶飞 三审 陈刚
阿里巴巴宣布:今天正式开源Qw... 阿里巴巴宣布,今天正式开源Qwen3.8系列模型,所有开发者、科研机构和企业均可自由下载、部署和使用...
我为群众办实事|定襄农商行神山... 近日,定襄农商行神山支行上演暖心一幕。面对一名听语双重障碍且不识字的特殊客户,工作人员灵活运用AI手...
AI硬件板块复苏 双创指数领衔... ◎记者 费天元 8月14日,A股早盘冲高回落,午后反转回升。以共封装光学(CPO)、印制电路板(PC...
戴夫·普拉默推赛博朋克风重制版... 2026-08-15 07:41:47 作者:狼叫兽 2026年8月14日,曾于1996年为微软开...
英伟达GeForce NOW原... IT之家 8 月 13 日消息,英伟达于当地时间 8 月 13 日宣布,其云游戏服务 GeForce...