OpenAI 活动第二弹:“强化微调”打造领域专家 AI 模型
创始人
2024-12-08 06:16:08
0

IT之家 12 月 7 日消息,OpenAI 启动了为期 12 天的“shipmas”新品发布周期,将推出一系列新功能、新产品以及相关演示。本次活动第二日,OpenAI 推出了强化微调(Reinforcement Fine-Tuning),帮助开发者和机器学习工程师打造针对特定复杂领域任务的专家模型。

该项目通过全新的模型定制技术,让开发者可以使用高质量任务集对模型进行微调,并利用参考答案评估模型的响应,从而提升模型在特定领域任务中的推理能力和准确性。

强化微调简介

IT之家附上官方介绍:开发人员能够使用数十到数千个高质量任务,定制 OpenAI 的模型,并使用提供的参考答案对模型的响应进行评分。官方表示这项技术强化了模型推理类似问题的方式,并提高了其在该领域特定任务上的准确性。

与标准微调不同,RFT 利用强化学习算法,可以将模型性能从高中水平提升到专家博士水平。

RFT 与监督式微调不同,它不是让模型模仿输入,而是教模型以全新的方式进行推理,通过对模型答案进行评分并强化正确的推理路线,RFT 只需少量示例即可显著提高模型性能。

RFT 支持用户利用自己的黄金数据集创建独特的模型,并将其应用于法律、金融、工程、保险等需要专业知识的领域。

强化微调面向群体

OpenAI 励研究机构、高校和企业申请,特别是那些目前由专家领导执行一系列狭窄复杂任务,并且将受益于人工智能协助的机构。

OpenAI 表示强化微调在结果具有客观“正确”答案,且大多数专家会同意的任务中表现出色,因此认为在法律、保险、医疗、金融、工程等领域会有更好的表现。

参与者可提前访问 Alpha 版强化微调 API,并在特定领域任务中进行测试,此外 OpenAI 鼓励参与者分享数据集,共同改进 OpenAI 模型。

OpenAI 预计 2025 年初公开发布强化微调功能。

OpenAI 首席执行官山姆・阿尔特曼(Sam Altman)表示:“强化微调,效果出奇地好;它是我 2024 年最大的惊喜之一。”

相关内容

开源之争,撕裂硅谷
文|熔财经 每文 7月24日,黄仁勋发出了人生第一条X(原推特)...
2026-08-03 07:40:41
以AI大模型“伏羲”为基础...
台风为何经常“跑偏”?因为大气系统自带“混沌”属性,初始条件差之毫...
2026-08-02 19:37:57
给中国AI“扣帽子”,遮不...
最近,美国对中国AI的围堵,有点歇斯底里。 当地时间7月28日,美...
2026-08-02 19:23:35
MiniMax H3发布,...
7月31日,稀宇科技(MiniMax)发布新一代多模态生成模型Mi...
2026-08-02 19:21:23
Kimi K3正式开源,全...
2026年7月27日晚,月之暗面kimi正式开源Kimi K3完整...
2026-08-02 19:17:26
把AI搬进Linux:媒体...
导语:最近有开发者基于Debian推出了Shadowfetch,一...
2026-08-02 19:14:38

热门资讯

67岁男子误信AI喷农药,15... 安徽滁州67岁农户吴大伯因轻信AI生成的除草除虫方案喷洒农药,导致150亩芝麻苗一夜之间全部枯萎,损...
外语专业“遇冷”:AI只是催化... “人们没有必要恐慌。人工智能是大语言模型,本质仍然是语言。而语言是一切学科的基础,没有语言表达,就没...
AI国际合作的中国声音 [ 人工智能不是少数国家的“特权”,而应成为造福全人类的“公共产品”;人工智能治理不是零和博弈的“角...
特斯拉将开源Model S和M... 8月3日消息,据外电报道,三年前,特斯拉在其服务网站上发布了2012款初代特斯拉Roadster的所...
开源之争,撕裂硅谷 文|熔财经 每文 7月24日,黄仁勋发出了人生第一条X(原推特)。 这位英伟达掌门人没有发布新架构...
以AI大模型“伏羲”为基础,新... 台风为何经常“跑偏”?因为大气系统自带“混沌”属性,初始条件差之毫厘,最终路径就可能谬以千里。记者2...
ChinaJoy2026|延伸... 【中国·上海,2026年7月31日】第23届中国国际数码互动娱乐展览会(ChinaJoy)在上海新国...
给中国AI“扣帽子”,遮不住美... 最近,美国对中国AI的围堵,有点歇斯底里。 当地时间7月28日,美国联邦通信委员会(FCC)宣布,将...