新V观海外:o1模型的开源复现和智商测试
创始人
2024-09-26 10:54:08
0

经济观察报 社论 陈沛/文 自从OpenAI推出最新的高级推理模型o1,已经过去了10天左右的时间。

模型刚推出的时候,很多率先使用的用户会觉得这个预览版模型(o1-preview)的纯文本模式和类似规划代理的生成效果略感平淡,就像我在前一篇专栏中写过的情况。

也有一些研究者试图从OpenAI介绍的内容中针对自我对弈强化学习、数据合成等进行分析,以突出这个模型的特别提升之处。

在此期间,各种说法林林总总,不一而足。我则认为值得进一步分析的是随后很快出现的o1模型开源复现版,以及最新的智商测试结果。

一周内出现o1开源复现效果

美国SambaNova公司的Kaizhao Liang在o1模型发布一周内,就在HuggingFace上推出了一个类似o1模型思考过程的开源平替版——Llama3.1-Instruct-O1。

这个开源平替版用到了Llama-3.1-Instruct模型,用户可以选择405B、70B、8B三个开源模型版本,再设置思考步骤的限制(从1至100之间),然后就可以实现类似o1模型的思考过程。

实现原理非常清楚,作者给Llama-3.1-Instruct开源模型增加了额外的系统提示词,共包括八个阶段,要求模型仔细阅读问题,按照思考步骤数量设置计数器,并要求模型进行自我反思,完成全部解答阶段后进行重新组织,形成最终输出答案。

客观来看,这个方法比较讨巧,直接借用成熟的提示框架对开源模型的输出结果进行限定,以生成类似的思考效果,却不涉及上述的自我对弈强化学习过程。不过,这想必也不是开源复现版作者的本意。因为SambaNova作为AI推理加速服务商,更多是想展示它们在多步推理中的加速效果,而非高级推理能力。

测试发现o1模型智商超群

如何更加直观体现o1模型的推理能力,有人想到了进行智商测试。美国Tracking AI负责人Maxim Lott使用了门萨智商测试(Mensa Norway)对12个主流模型进行了测试,定期更新测试结果。

在最近的测试结果中,o1模型在35道题中答对了25道,智商达到121,是所有模型中唯一一个智商超过平均值(100)的模型。其它模型的智商多数普遍在80至90左右。

但是必须看到,由于这12个被测模型中既包括o1这样的纯文本模型,也包括GPT-4o、Gemini Advanced、Claude-3 Opus等多模态模型,而35道智商测试题中又有相当部分题目是复杂图形推理题,因此测试者需要把题目和选项转成非常全面的文本描述输入给纯文本模型,这个人工转换过程或多或少会让纯文本模型在测试结果上获得一定优势。

当然,就算排除掉这一点优势因素,o1模型在智商测试中所体现出来的复杂推理能力依然处于明显的领先位置。

OpenAI对o1模型的阶段定位

OpenAI的CEO Sam Altman在最近的表态中,将o1模型比喻成过去GPT系列模型的GPT-2,这似乎侧面印证了o1模型虽然表现出了显著的能力提升,但同时也存在着明显的缺点。

回顾过去,在发展GPT系列模型时,也是一直演进到GPT-3.5的阶段,才推出了ChatGPT引发了巨大关注。

展望后续的发展路线,如今o1模型已经来到了OpenAI之前提出5层通用人工智能的第2层(推理者,Reasoner),并将继续向之后第3层至第5层的智能代理(Agent)、创新者(Innovator)和组织者(Organizer)持续攀登。

相关内容

华为AI通信专利获授权:设...
【CNMO科技消息】随着人工智能技术加速向终端设备普及,如何让不同...
2026-06-22 20:32:22
刚刚,百度开源拿下全球第一...
新智元报道 【新智元导读】百度开源Unlimited OCR!3...
2026-06-22 20:30:12
微信原生 AI 助手灰度测...
6 月 20 日,微信原生 AI 助手「小微」扩大灰度测试范围。它...
2026-06-22 17:49:44
全球首个!京东全栈开源Jo...
一场火灾发生的瞬间,监控系统可以实时发出警报;独居老人在家摔倒,A...
2026-06-22 17:47:51
美图“追风”AI
4款新品和4款升级版产品,美图近日拿出的8款产品,覆盖设计师社区、...
2026-06-22 17:47:06

热门资讯

2024云栖大会|阿里云升级无... 北京商报讯(记者魏蔚)9月20日,阿里云无影AI云电脑在2024云栖大会上展出,该版本基于最新的终端...
MWC2025荣耀多款AI技术... 人民财讯3月6日电,2025世界移动通信大会(MWC 2025)上,荣耀MagicBook Pro ...
原创 2... #春日生活好物种草季#近年来,笔记本电脑市场迎来技术爆发期,尤其在手机厂商跨界入局后,轻薄本在性能、...
摩尔线程发布AI算力笔记本MT... 钛媒体App 12月20日消息,摩尔线程创始人、董事长兼CEO张建中在摩尔线程首届MUSA开发者大会...
摩尔线程AI生图摩笔马良全新升... 快科技8月7日消息,作为国产GPU的杰出代表,摩尔线程在当下火爆的AIGC浪潮中也推出了自己的软硬一...
微软 Azure AI 语音服... IT之家 8 月 23 日消息,微软Azure AI 语音服务允许开发者构建多语言生成式 AI 语音...
谷歌打磨 Gemini AI ... IT之家 8 月 31 日消息,谷歌于 8 月 27 日发布博文,宣布旗下 Gemini AI 支持...
青云QingCloud Kub... 日前,青云科技宣布开源 Thanos 的企业级发行版 Whizard,为企业带来真正高可用、可扩展、...
Macos系统上一款强大的卸载... App Cleaner mac中文版是Mac os系统上一款强大 的mac卸载工具,以帮助您完全卸载...
AMD锐龙AI 9 HX 37... 2024年6月3日,AMD正式发布全新的锐龙AI 300系列处理器。该系列处理器一经发布就引发大家的...