一款小而强大的编程助手:零一万物正式开源 Yi-Coder 系列模型
创始人
2024-09-08 10:48:37
0

在 AI 领域中,代码生成和编辑工具一直是开发者们关注的焦点。

本周,零一万物开源了 Yi-Coder 系列模型,它作为 Yi 系列模型家族中的“编程小能手”,展现了卓越的代码生成能力。这是继今年 5 月 13 日开源 Yi-1.5 系列模型之后,零一万物在开源方向上的又一重要成果。

Yi-Coder 模型 Demo 展示

01 模型简介

Yi-Coder 系列模型专为编码任务而生,提供 1.5B 和 9B 两种参数。其中,Yi-Coder- 9B 的表现优于其他 10B 参数以下的模型,如 CodeQwen1.5 7B 和 CodeGeex4 9B,甚至能够与 DeepSeek-Coder 33B 相媲美。

02 模型特点

  • 小参数,强性能:尽管 Yi-Coder 的参数量相对较小,但它在各种任务,包括代码生成、代码理解、代码调试和代码补全中的表现十分出色。10B 以下的大小也让它易于使用,方便端侧部署。
  • 128K 长序列建模:Yi-Coder 能够处理长达 128K tokens 的上下文内容,有效捕捉长期依赖关系,适用于复杂项目级代码的理解和生成。
  • 强大的代码生成能力:支持 52 种主要编程语言,Yi-Coder 在代码生成和跨文件代码补全方面表现优异。

03 模型成绩

Yi-Coder 在代码生成基准测试中名列前茅

LiveCodeBench 是一个旨在为大语言模型提供全面公平的评测平台。它实时收集来自 LeetCode、AtCoder、CodeForces 等竞赛平台的新问题,构成了一个动态而全面的基准测试库。

为确保没有数据污染(Yi-Coder 的训练数据截止时间是 2023 年底),我们选取了 2024 年 1 月到 9 月的题目进行测试。在下图榜单中,Yi-Coder-9B-Chat 的通过率达到了 23.4%,在 10B 以下参数量的模型中是唯一一个通过率超过 20% 的模型。这一成绩超过了

  • DeepSeek-Coder-33B-Instruct 的 22.3%
  • CodeGeex4-All-9B 的 17.8%
  • CodeLLama-34B-Instruct 的 13.3%
  • CodeQwen1.5-7B-Chat 的 12%

除了竞赛级别的高难度评测,我们还选取了 Zero-shot HumanEval、3-shot MBPP 和 CRUXEval-O 等业内流行基准测试,用于评估模型的基础代码生成和推理能力。

下图评测结果表明,Yi-Coder 在这三个评估任务之下都取得了优异的性能。具体来说,Yi-Coder-9B-Chat 在 HumanEval 和 MBPP 的通过率分别达到了 85.4% 和 73.8%,超过其他 Coder 模型。此外,Yi-Coder 9B 在 CRUXEval-O 的准确率在开源 Coder 模型中首次达到了 50% 以上。

代码编辑和补全能力强劲

CodeEditorBench 涵盖了四个关键领域:代码调试、代码翻译、代码优化和代码需求转换。结果表明,在开源代码大语言模型中,Yi-Coder-9B-Chat 取得了优异的成绩,在 Primary 和 Plus 两个子集中始终优于 DeepSeek-Coder-33B-Instruct 和 CodeQwen1.5-7B-Chat。

代码补全方面,Yi-Coder 也表现出色。与代码生成不同,跨文件代码补全要求模型访问并理解跨多个文件的资源库,这些文件之间存在大量的跨文件依赖关系。本次评估采用了 CrossCodeEval 基准,在两种不同的情况下进行:检索相关上下文和不检索相关上下文。

下图结果表明,Yi-Coder 在有检索和无检索的情况下都优于其他同等规模的模型。这一成功验证了在具有较长上下文长度的软件仓库级代码语料库上进行训练能够使 Yi-Coder 有效捕捉长期依赖关系,从而提高其性能。

长序列建模表现优秀

我们效仿文本领域流行的长序列评测,合成了一个 128K 长序列的“Needle in the code” 评估任务,长度双倍于 CodeQwen1.5 所构建的 64K 长序列评测。它通过在长代码库中随机插入一个简单的自定义函数,测试模型能否在代码库最后重复这个函数。该测试旨在检测模型 LLM 是否能从长文本中提取出这些关键信息,从而反映 LLM 其对长文本的理解基础能力。

下图全绿结果表示,Yi-Coder-9B 在 128K 长度范围内完美完成了这一任务。

数学推理能力毫不逊色

DeepSeek Coder 先前的研究表明,模型强大的编码能力可以增强其数学推理能力。Yi-Coder 在七个数学题数据集上评估了代码辅助(PAL: Program-aided Language Models)解题能力,在每个数据集中,模型都要通过生成 Python 代码然后执行代码得出最后的答案。这七个任务的平均准确率得分如下图所示,Yi-Coder 9B 的准确率达到 70.3%,超过了 DeepSeek-Coder 33B 的 65.8%。

04 模型使用

如果你想快速上手试试 Yi-Coder,点击阅读原文参阅 Yi-Coder README,包含具体的下载和使用步骤。

剥离几百万行代码,复制核心算法去美国?TikTok 最新回应来了

订阅费超普通人月薪!一个月1.4万人民币,谁还用得起大模型?

被黑猴子虐爆了!索尼 8 年耗资 20 亿打造的巨作,14 天速死,成业内最大笑话!

要低代码,不要低能力,低代码工具能否成为企业增效神器?

相关内容

字节AI,先慢后快?
文 | 伯虎财经(bohuFN),作者 | 楷楷 一向低调的字节...
2026-08-15 21:22:58
超级小爱2.0,小米终于把...
前两天,看到小米澎湃OS 4 Beta版开启招募,没有发布会,直接...
2026-08-15 20:51:27
游戏产业进入AI时代,广州...
8月14日,广州海珠发布“词元经济八条”。 这份广东首个词元经济专...
2026-08-15 17:27:00
国家超算互联网AI社区已汇...
中新网北京8月15日电 (记者 张素)截至目前,国家超算互联网AI...
2026-08-15 16:52:14
百度文库网盘「库库AI」A...
8月14日,在百度AI Day开放日上,百度文库网盘通用智能体Ge...
2026-08-15 16:24:41
47年厨电龙头,用AI重做...
当AI不再停留在屏幕里的对话,而是真正走进烟火升腾的厨房——一场关...
2026-08-15 15:00:26

热门资讯

莫言刷短剧拒绝“套路” 谈AI... 中新社上海8月15日电 (记者 王笈)著名作家莫言时隔6年推出的全新小说集《人呐》,用短的篇幅写出深...
如何面对无故的敌意?| 新黄河... 如何面对无故的敌意?| 新黄河AI晚读(综合编辑:郑楚翘 剪辑:郑楚翘)
字节AI,先慢后快? 文 | 伯虎财经(bohuFN),作者 | 楷楷 一向低调的字节跳动创始人张一鸣,却在近日高调发声...
超级小爱2.0,小米终于把AI... 前两天,看到小米澎湃OS 4 Beta版开启招募,没有发布会,直接上。 卢伟冰在微博上说,这次不开发...
AI女主发美瞳广告“戴着很舒服... AI短剧女主角发布美瞳广告,引发网友热议。 “方桃子”发布广告引争议 近日, AI短剧《被裁掉的女孩...
卡萨帝发布AI雪茄柜,控湿精度... 2026-08-15 18:35:37 作者:狼叫兽 在雪茄圈,有一个心照不宣的共识:买雪茄容易,养...
黄仁勋出手安抚AI算力市场 本周十分罕见的一大场景就是黄仁勋携手六位华尔街资管巨头,一起为“将AI算力打造为独立资产类别”背书,...
游戏产业进入AI时代,广州为什... 8月14日,广州海珠发布“词元经济八条”。 这份广东首个词元经济专项政策里,游戏、数字文娱被明确列入...
国家超算互联网AI社区已汇聚1... 中新网北京8月15日电 (记者 张素)截至目前,国家超算互联网AI(人工智能)社区已汇聚1700余款...
站稳4000亿港元市值,联想的... 最近一个季度,外界对联想乃至对联想服务器、PC业务的讨论,大多集中在一个问题上,它史无前例营收和净利...