新V观海外:全球AI智能体正进入黄金发展期
创始人
2024-10-15 18:58:58
0次

陈沛/文 OpenAI近期接连发布了两项与AI智能体(Agent)有关的研究成果,分别是智能体的测试基准MLE-Bench和多智能体协调框架Swarm。

OpenAI的发布引发了很多关注和讨论,也将人们的视线又拉回到了能够自行分析、规划、决策、执行的智能体上。

实际上,整个AI应用领域今年在智能体赛道已经取得了很多进展,特别是模型的函数调用能力和智能体框架已经日趋成熟。

其中,模型的函数调用能力对于智能体自行分析问题并执行实际任务至关重要,能帮助智能体准确完成发送邮件、提交文档、比价下单等实际任务。

对此美国加州大学伯克利分校今年提出了BFCL测试排行榜,从多个维度评估模型的函数调用能力,包括Single Turn和Multi Turn、Non-Live和Live、AST总结和Exec总结、幻觉评估、模型成本和延迟等。

该排行榜的测试难度比较大,例如OpenAI的GPT-4系列模型、Anthropic的Claude-3.5系列模型、谷歌的Gemini-1.5系列模型的测试结果最高只有50多分。

不过,美国AI公司Writer不久前刚刚宣布其新发布的Palmyra X 004模型取得了78分的高分。Writer重点提升了新模型调用外部数据库和应用程序并采取行动的能力、获取SKU数据并与内置RAG自动集成的能力、代码生成与部署能力、结构化输出和执行能力(包括邮件、CRM、XML、日志等),从而显著增强了函数调用能力。

虽然这一初步结果还没有正式进入BFCL测试排行榜单,但是已经表明,要进一步提高函数调用能力不仅涉及模型本身,还要求对于实际应用开发和真实业务场景的理解有者更深刻的理解。

与此同时,智能体的各类自动化框架此前已经有了一些早期的实践,主要聚焦帮助模型理解环境、规划推理、执行任务的工具框架和协调流程。

例如在这次OpenAI的MLE-Bench中,为了评估智能体在机器学习工程任务上的能力,OpenAI便重点分析了由WecoAI开发的AIDE框架、在MLAgentBench项目中提出的MLAB框架以及由多家机构开发的OpenHands框架。

随着函数调用能力和智能体自动化框架逐步推进,今年来已经有各个细分领域的智能体公司竞相涌现。

投资过很多AI公司的老牌投资机构Felicis Ventures不久前专门盘点了各个垂直领域和职能方向的智能体,都已经出现了有代表性的公司。

例如客服领域的Sierra、销售领域的11x、营销领域的Jasper、招聘领域的Mercor、法务领域的Harvey、运营领域的Brevian、合规领域的Norm Ai、税务领域的taxgpt以及房产领域的reAlpha。

在实际中,相关领域和其它行业的AI智能体还有更多,正出现百花齐放的态势。在这波AI浪潮下,AI应用并不会局限于聊天机器人,而智能体可能才是更合适的产品形态和付费模式。

相关内容

热门资讯

国产大模型下调推理服务价格,南... 近日,国内某大模型企业宣布下调其flash系列模型服务价格,输入缓存命中、输入缓存未命中及输出价格最...
解码青年人AI生活《2026有... 中新网深圳9月5日电(记者索有为)《2026有意思生活方式报告》(下称《报告》)4日在全国首个有意思...
OpenAI 最强 AI 生图... 9月9日消息,OpenAI 9 月 9 日官宣发布 ChatGPT Images 2.5,图像生成延...
探索AI供应链产业化路径京东推... 2026年以来,人工智能应用范围加速拓展,持续从数字空间走向现实生活,广泛融入生产线、仓储厂房、配送...
教育部发文!AI生成内容,教师... 一篇论文,因为AI使用不当,相关高校师生被通报处理。 9月2日,安徽财经大学公布“教师与学生涉嫌学术...
AI识别出近800种可充当乳化... 英国利兹大学食品科学与营养学院和爱丁堡大学科学家携手,开发出一款 人工智能(AI)工具,能从数千万种...
搭上低空经济、AI文旅?两连板... 桂林旅游(000978)回应市场热点。 9月8日,桂林旅游再度涨停,斩获2连板。当天晚间,该公司披露...
硅谷:我们不能被硅谷“AI刹车... 【文/底线思维】 OpenAI首席科学家Jakub Pachocki最近写了一篇文章,题目叫《An ...