8月26日晚,智谱宣布上线并开源GLM-5.3-Flash,并确认该模型正是过去一周在海外开发者社区引发热议的匿名模型Ox-Alpha,中文开发者社区将其称为“牛来”。作为GLM-5系列的首个原生多模态模型,GLM-5.3-Flash采用MIT协议开放权重,上线即登陆Hugging Face平台。
根据Artificial Analysis Intelligence Index评测结果,该模型取得57分,与Anthropic旗舰模型Claude Opus 4.8得分持平,超过上一代旗舰GLM-5.2。定价策略上,GLM-5.3-Flash完成同一任务的成本约为GLM-5.3的十分之一,约为Claude Opus 4.8的四十分之一。
8月27日港股开盘,智谱高开逾8%,盘中涨幅一度扩大至10%以上,AI概念股整体走强。
值得注意的是,该匿名模型在测试阶段海内外双平台调用量创下新高,其背后的算力来源随即成为市场关注的核心。据智谱方面披露,超过10万张国产芯片承载了测试期间全部线上流量,具体芯片供应商智谱未予置评。
智谱官方技术文档显示,团队在SGLang基础上构建专用推理引擎,结合张量并行、多级量化及混合精度缓存等技术,并采用生产级Encode-Prefill-Decode分离式架构,将编码、预填充和逐token解码拆分为独立调度的工作池。与同一硬件上的初始基线相比,端到端性能提升3倍;智谱同时披露,硬件效率及单Token成本已达到与主流英伟达GPU相当的水平。
半导体研究机构SemiAnalysis在X平台引述智谱公开技术数据并点评称:“所有流量均由国产芯片承载,硬件效率和单token成本已可与英伟达GPU相媲美。继OpenAI自研推理芯片Jalapeño之后,CUDA护城河再度受到考验。”
北京时间8月27日凌晨,英伟达发布2027财年第二季度财报,当季营收962亿美元,业绩超预期增长。英伟达CFO特别指出,第二财季运往中国大陆的Hopper架构数据中心产品收入占数据中心收入比例低于1%,且下一季度业绩指引未计入任何来自中国的数据中心计算收入。
与此同时,国产AI算力生态的适配已在全产业链铺开。海光信息在半年报中披露,DCU已完成与DeepSeek、Qwen3、混元、智谱等400余款主流大模型的适配。今年4月,DeepSeek V4发布当日,海光DCU即完成Day0适配;今年8月,MiniMax H3开源当天,包括海光DCU、摩尔线程、沐曦、壁仞科技在内的多家国产芯片厂商同步完成适配支持。
从产业趋势来看,从单点突破到全产业链协同,从实验室验证到规模化商用,国产AI算力生态正在完成一场关键跨越。
封面图片:公司官网