作者 | 蔡芳芳
盛大网络创始人陈大年最近给本地模型下了一个颇为激进的判断:三年内,本地模型的综合能力有机会追平 Claude 等顶级云端大模型,并占据 80% 的市场。
他的依据之一,是今天的大模型还有很大的效率优化空间。相比不断增加参数和算力,陈大年更看好“轻量化基础模型+精准后训练”这条路线:先获得一个能力足够好的基础模型,再通过后训练,让有限的参数发挥出更高的效率。
陈大年这次重新进入 AI 赛道创业,押注的正是这条路线。他新成立的 AI 公司上海原点星辉科学技术有限公司(下简称 StartLux),第一款模型就没有选择从头训练一个更大的基础模型,而是把重点放在本地模型和后训练上。
StartLux联合创始人兼CTO、语生科学首席科学家郭权玮曾用一个很形象的比喻描述他们对这条路线的理解:“我要用很小的数据,做一个像小孩一样聪明的模型。接下来,给它上九年制义务教育。”
StartLux-V1.0-27B-Preview,可以看作这套思路的第一次实际落地。它没有从头训练一个新的基础模型,而是选择 Qwen3.6-27B 作为基座,模型结构基本沿用原模型,主要围绕任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等 Agent 能力进行后训练。
近期,这个 27B 模型参加了中国信通院可信 AI 大模型基准测试 MCP 专项测试。测试覆盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理和 3D 设计等任务,StartLux-27B 综合排名第二,在部分专项任务上达到或超过了规模更大的参测模型。
它的技术起点并不陌生:成熟的开源基座,27B 的参数规模,模型结构基本没动,能力变化主要发生在“出生以后”。
StartLux-27B 的训练过程里还有另一层重要变化。StartLux 告诉 InfoQ,在研发过程中,大约 70% 的实验执行工作已经可以交给 AI,包括数据生成、实验调度、Eval 和初步失败分析。研究员仍然负责确定目标、做关键取舍和判断最终结果,只是亲自逐个运行实验的工作正在减少。
StartLux 在这一过程中采用了 AI 训练 AI(Auto Research)的方法,类似的自动研究方法今年开始受到更多关注。今年 3 月,Andrej Karpathy 开源了 autoresearch:让 AI Agent 在一个真实的小型语言模型训练环境中自己修改代码、运行训练、检查结果,决定保留还是回滚,再进入下一轮实验。近日,OpenAI 也公开了其迈向 Recursive Self-Improvement(RSI,递归式自我改进)的最新进展,其中一个重要方向就是让 AI 承担越来越多原本由研究员完成的研究任务。StartLux 则把这种自动实验和反馈循环引入了 27B 本地 Agent 模型的后训练。
不过,Auto Research 只是这款模型训练方式的一部分。要理解 StartLux-27B 为什么会这样训练,还得先从它的模型定位说起。
1本地模型很多,但能“干活”的还不够多
今天,能在个人电脑上运行的模型已经不少。7B、14B、30B 级开源模型不断增加,经过量化后,一台配置不错的 PC 或 Mac 就可以跑起来。市场其实不缺能下载到电脑里的模型,缺的是能真正替用户工作的本地 AI。
StartLux 给自家模型的定位更具体: 面向真实任务执行的本地 Agent 模型。其中“本地”解决在哪里运行,“Agent”解决它能不能工作。
一个模型可以在个人设备上运行,只说明它具备了本地部署条件。Agent 面对的是另一类任务:理解用户最终想完成什么,选择合适的工具,连续执行多个步骤,根据环境反馈调整行动,检查结果,最终真正把事情做完。
之所以选择 27B 这个规模也与这个定位息息相关。团队在实验中发现,模型再小一些,复杂推理和 Agent 稳定性会明显下降;继续做大,本地设备的覆盖范围又会快速缩小。现阶段,他们把 27B 看作能力与本地可部署性之间一个相对现实的平衡点。随着硬件能力提升,StartLux 也会考虑更大规模的模型。
另一个问题更加直接:Qwen3.6-27B 本身已经很强,也支持本地部署,为什么还要在它上面再训练一遍?
StartLux 并不回避这一点。团队认为,原始 Qwen 已经具备 Agent 基础,他们所做的,是把有限的模型能力更多集中到真实任务上。工具怎么选,参数怎么填,一件事情怎么拆成连续的步骤,执行到一半怎么检查状态,工具报错以后怎么恢复,以及最后怎么判断任务已经完成——这些成为后训练重点。
StartLux 希望长期积累的资产也不局限在某一版模型权重,而是围绕真实任务形成的数据、Auto Research、训练 pipeline、Eval 和失败分析体系。 相比某一版模型本身,团队更希望最终形成一套能够持续发现问题、验证改进并迭代模型的系统。以后如果出现更好的基座,可以从一个更高的起点继续训练。
这条路线有点像郭权玮所说的“九年义务教育”:底座决定模型最初有多聪明,接下来还要让它在大量真实任务中反复练习,逐渐学会怎么工作。
2Agent 最难学的,是十几步以后还知道自己在哪
StartLux 在训练过程中发现,Agent 很多棘手的问题并不发生在第一次工具调用。
“最难的其实不是第一次把工具调对,而是连续做十几步以后还知道自己在哪。”
模型调用一次浏览器、搜索一次网页或者读取一个文件,今天已经不难。任务变长以后,状态开始累积,错误也跟着累积。模型可能逐渐忘记用户最初给出的限制条件,重复已经完成的操作;工具返回错误后不知道换路线;有时任务只进行了一半,它已经判断事情完成了。
比如订一张机票。用户同时要求直飞、价格最低、不能抵达大兴机场,最后还要求关闭浏览器。每个条件单独看都很简单,Agent 却需要在搜索航班、筛选机场、比较价格、进入预订页面的整个过程中一直记住这些约束。中间漏掉任何一个,最终结果都有可能失效。
金融分析里的问题更隐蔽。模型拿到一条看起来合理的数据,很容易直接开始计算。但真实任务还需要检查日期、交易日和原始数据是否一致。如果第一步取到的数据就是错的,后面的计算做得越完整,结果反而越容易让人信以为真。
StartLux 目前观察到的典型失败,包括长链路中的状态漂移、约束丢失、工具异常后的恢复,以及最后的结果验证。这些问题和模型“知道多少知识”关系有限。一个 Agent 需要在执行过程中持续维护任务状态:已经完成了什么,还有哪些条件没有满足,工具返回的数据靠不靠谱,下一步要不要换路线,现在离最终目标还有多远。
传统问答场景不太容易暴露这些问题。到了几十个步骤串起来的真实任务里,它们会迅速决定一个 Agent 到底好不好用。StartLux-27B 的后训练,很大一部分工作就围绕这些失败展开。
3从Auto Research 到RSI
给模型补充 Agent 数据、继续做 SFT,已经是常见做法。StartLux 这次采用 Auto Research,希望把实验过程本身也放进一个持续反馈的循环里。
据团队介绍,现在的流程大致是:研究员先确定研究目标、边界和评价标准,AI 在这个范围里提出实验假设、生成或筛选数据、启动训练和 Eval、分析失败轨迹,再根据实验结果决定下一轮尝试什么。
StartLux 对 Auto Research 有一个比较明确的分界线: AI 能不能根据上一轮实验结果,自己判断下一步该研究什么。自动调超参数、生成训练数据、帮助研究员写代码,都可以提高研发效率;但只有当实验结果真正进入下一轮研究决策,整个流程形成“假设 → 实验 → 验证 → 新假设”的闭环,才算从实验自动化走向 Auto Research。
对 StartLux 来说,Auto Research 不是终点。团队正在尝试把自动化 AI 研发进一步推进到 Recursive Self-Improvement(RSI,递归式自我改进):让更强的 AI 参与创造下一代更强的 AI。
过去,AI 主要是被训练和被优化的对象;现在,它开始参与 AI 自身能力的改进过程。现阶段,研究目标、评价标准和关键取舍仍然由人掌握,但越来越多实验设计、执行、评测、失败分析和下一轮迭代正在交给 AI。当经过改进的 AI 又能进一步提升“改进 AI”的能力,这个循环才真正具备递归式自我改进的特征。
金融分析场景的一次训练经历,可以比较具体地说明这个过程。早期模型拿到一条看起来合理的数据之后,经常直接进入计算,随后在日期、交易日或原始数据一致性上出错。Auto Research 会从这些失败轨迹中归纳问题,并在后面的训练中补充“回查原始数据—确认目标条件—再计算”这一类任务和轨迹。
这里没有诞生新的模型架构,也没有由 AI 凭空提出一种新算法。AI 做的是从一批失败中找出共性,判断接下来需要补什么能力,再通过新的实验验证改进是否有效。
这也暴露出从 Auto Research 走向 RSI 更困难的一层问题:自我改进并不意味着模型的所有能力都会同步上涨。当优化目标比较集中时,一类 Agent 能力可以明显提升,但有限参数模型的能力也可能发生重新分配,部分通用能力甚至出现波动。
StartLux 在这次训练中也在持续观察这类 trade-off。对团队来说,真正困难的不是让某一个 Eval 一直上涨,而是让 Auto Research 从单一目标优化,逐步走向同时管理多个相互约束的能力目标:既提升真实 Agent 任务能力,也尽可能保持通用性和泛化能力。
如果模型只是学会钻评分规则的漏洞,或者目标任务上涨的同时整体泛化明显下降,就不能算一次真正成功的改进。研究员仍然需要调整数据、评价体系和训练目标,判断一条路线是否值得继续。
真正有价值的 RSI,不只是让 AI 在一个目标上变强,还要让它越来越擅长判断“什么才是真正的变强”,并能在尽可能保持原有通用能力的同时持续更新自己。StartLux 对 RSI 的研究不会只停留在 Auto Research,Auto Research 是目前已经落地的一种工程形态,团队同时还在通过新的模型架构、训练算法和受控的本地参数更新机制,让模型参与训练下一代模型,并逐步具备在本地持续自我更新的能力。
这件事真正困难的地方,不是让模型“会改自己”,而是如何避免持续参数更新破坏已经具备的通用能力。从这个角度看,Auto Research 只是 RSI 的一块拼图:它帮助系统发现哪里需要改、判断一次改进是否真的有效;团队正在推进的,是把数据、训练、模型结构和参数更新连接成一套可以持续自我改进的系统。
470%的实验执行交给 AI 之后
在 StartLux-27B 这次研发中,大约 70% 的实验执行已经可以交给 AI,包括数据生成、实验调度、Eval 和初步失败分析。
对研究员来说,变化首先体现在工作粒度上。过去,一个研究员往往围绕几个具体实验工作:准备数据、修改配置、启动任务、等待结果,再打开 Eval 逐项分析。现在,他们可以更多地管理一整套持续运转的实验系统。AI 把研究员从“亲自跑每一个实验”,变成了“决定下一批实验应该往哪里跑”。
人的工作重心随之往上移动。目标如何定义、评价标准怎么设、什么样的能力值得继续优化、哪些结果只是 Benchmark 上的偶然提升,都需要研究员做判断。实验执行逐渐自动化以后,一名研究员能够同时推动多少实验,也开始取决于背后的自动研究系统。
StartLux 没有透露 Research Agent 具体使用什么模型,只表示其中的模型可以比被训练的 27B 模型更强,也可能由多个模型共同工作。
团队也特意区分了这套方法和知识蒸馏。 蒸馏更像老师给答案、学生模仿;Auto Research 里,强模型更像研究员,会设计实验、出题、看结果、找失败原因,再决定下一轮怎么训练。如果只是把强模型答案拿来教 27B,那就是蒸馏,而不是 Auto Research。
如果这类方法逐渐稳定,模型团队的研发效率也会增加一个新的变量。除了有多少研究员、有多少 GPU,还要看每个研究员背后能够同时调度多少自动实验。
5跑分之外,Agent 还得学会稳定工作
StartLux-27B 这次受到关注,很大程度上来自 MCP 专项测试的成绩。在本次测试中,StartLux-V1.0-27B-Preview 综合得分为 39.25,排名第二,超过 284B 的 DeepSeek-V4-Flash-0731 和 198B 的 Step-3.7-Flash。相比基座模型 Qwen-3.6-27B,StartLux-V1.0-27B-Preview 的得分高出 5.34 百分点。
Agent Benchmark 本身比传统语言模型测试复杂。模型权重只决定其中一部分表现,Agent Harness、Prompt、工具环境、最大执行步数和推理配置,都可能影响最终任务成功率。
这次测试由中国信通院统一组织,任务、工具环境、执行约束和评分口径采用统一方案,并连续进行三轮完整测试取平均值。StartLux 表示,团队研究过公开的 MCP-Universe 任务结构,训练重点放在工具选择、多步执行、状态检查和结果验证等能力上。
相比综合排名,StartLux 内部更关注同一个 27B 基座经过 Agent 后训练后出现的能力变化。团队认为,5.34 个百分点的提升更能说明这种训练方法真的产生了增量:围绕真实任务构建训练数据和反馈闭环可以继续推动一个成熟基座的 Agent 能力进一步增强。
当然 39.25 这个分数也说明今天的 Agent 离可靠还很远,很多任务一次做成的概率还不够高。郭权玮表示,现在主要问题还是长链路里的状态漂移、约束丢失、工具异常后的恢复和最后的结果验证,下一阶段团队更关心稳定性和泛化。
在这次测试中与 1.6T 参数规模的 DeepSeek-V4-Pro 同台竞技,自然很容易引发“27B 模型和万亿参数模型比较”这种容易吸引眼球的话题讨论。但 DeepSeek-V4-Pro 使用 MoE 架构,总参数量和每个 Token 实际激活参数并不相同。对此 StartLux 坦言,科学上不能简单拿 27B 和 1.6T 直接换算能力差距,但参数规模已经不是 Agent 任务表现的唯一解释变量。
基础模型能力依然重要,但后训练、工具使用、Harness、上下文和推理效率都会直接影响最后能不能把任务做成。模型完成一次真实任务要走多少步、消耗多少 Token、中间失败多少次、最后能不能交付正确结果,和用户体验的距离都比单纯的参数数字更近。
这也是 StartLux 接下来还需要继续回答的问题。
6本地 Agent 真正的考验还在后面
StartLux-27B 目前仍然只是这条路线的第一步。
模型已经完成,团队规划中的完整本地智能解决方案还在推进。它最终会以怎样的产品形态出现,本地 Agent 能够承担多少原本依赖云端模型完成的工作,现在都还很难下结论。
现阶段 StartLux 真正想验证的核心判断:大量真实工作不需要永远调用最大的云端模型,一个足够强的本地模型,加上针对 Agent 的训练和整套系统协同,可以在个人设备上完成越来越多真正有价值的工作。
陈大年把这个判断推得更远。他预计三年内本地模型有机会追平顶级云模型,并占据 80% 的市场,这样的预测显然还需要时间验证。
对 StartLux 来说,接下来的验证也会比一次 Benchmark 难得多。
模型能不能连续工作几个小时?任务变长以后还能不能守住最初的目标和约束?工具出现异常时能不能自己恢复?放到用户自己的文件、浏览器和工作流里,成功率还能不能保持?
StartLux 给自己设定的标准是,如果一年以后,用户愿意长期把文件、研究、办公等任务交给本地 AI,它能够连续工作几个小时,任务成功率接近甚至超过同类云端方案,而且因为隐私和 Token 自由让用户用得更深,这条路线才算得到真正验证。
当下 StartLux-27B 提供的是一个值得继续跟踪的样本。随着开源基础模型越来越成熟,模型团队已经可以把更多精力放到“模型训练出来以后”:围绕真实工作不断收集失败、构造数据、执行实验,再把结果送回下一轮训练。
与此同时,做这些实验的人也在换一种工作方式。研究员依然决定模型应该往哪里走,通往那个方向的大量实验,已经开始交给 AI。
声明:本文为InfoQ 原创,不代表平台观点,也不构成投资建议,未经许可禁止转载。
会议推荐
柯南 AI 的实践仍在持续迭代。王泽锋将在 QCon 全球软件开发大会(上海站)2026 带来新演讲——《AI 时代的移动端稳定性保障——柯南 AI Agent 实践》。这次分享将重点介绍近几个月的新进展,得益于模型能力升级、产品方案迭代,柯南 AI Agent 的覆盖率和采纳率数据还在持续提升。届时,他将进一步讲解柯南 AI 如何从问题定位走向自动修复、治理闭环与知识沉淀,并结合鸿蒙原生、KMP 等新技术栈,分享 Agent 在 OOM、Freeze、Heap Snapshot 分析,以及跨语言循环引用、跨运行时死锁等复杂问题中的应用。如果你希望深入了解 Agent Workflow、Context Engineering、Agent Harness 和 Agent 友好型工程基建如何在真实业务中落地,可以关注本次分享。