智能体AI或将推动企业级AI服务器架构重新设计
创始人
2026-08-09 16:58:37
0

来自微软Azure与德克萨斯大学奥斯汀分校的研究人员指出,随着企业部署智能体AI,现有以GPU为核心的基础设施在执行多步骤AI工作流时效率不足,新一代AI服务器的需求正在浮现。

研究人员基于微软Azure云平台的生产遥测数据及主流开源智能体框架的实验结果发现,AI智能体在协调模型、工具与编排软件上所花费的时间,远超传统推理系统的预设。与独立的大语言模型请求不同,智能体应用以动态工作流的形式运行,任务在CPU、GPU与外部服务之间反复流转,暴露出当前服务器架构的效率瓶颈。

研究人员在论文中写道:"我们的研究表明,智能体的执行过程本质上是碎片化且异构的。每个请求会扩展为一个由大语言模型推理、工具调用和编排决策组成的工作流,并反复跨越CPU与GPU之间的边界。"

论文指出,这种执行模式使CPU处于应用关键路径上——编排软件与工具在宿主机上运行,而模型推理则在GPU上执行。研究人员认为,传统服务器架构与此类工作负载存在明显不匹配:碎片化执行导致CPU和GPU资源闲置,宿主侧不同软件角色的资源需求各异,多智能体并发运行还会增加协调开销。

研究人员通过CORAL框架进行的受控实验显示,单个工作负载扩展为580次大语言模型调用与552次工具调用交替执行,导致任务在两个处理器之间"来回切换数百次"。研究还发现,宿主CPU利用率在较长时间内维持低位,随后在工具执行密集期急剧攀升;GPU利用率则因工作流构成不同而差异显著,部分加速器处于饱和状态,另一些则处于空闲状态。

研究人员表示,这种碎片化执行模式导致CPU和GPU平均利用率偏低,同时又可能使任一处理器成为工作流关键路径上的"瞬时瓶颈",令静态资源配置难以适应智能体工作负载。

Greyhound Research首席分析师Sanchit Vir Gogia表示,上述发现说明企业在评估智能体AI基础设施时,应采用不同于传统推理部署的标准。"智能体AI不是一个更大的聊天机器人,它是一个内嵌推理能力的分布式应用。各个组成部分并不陌生,但执行图是全新的。"他补充道:"GPU依然不可或缺,但它不再独占整个时钟周期。在超过27%的请求中,工具执行时间与推理时间相当甚至更长,平均利用率指标正在对基础设施团队产生误导。"

基于上述发现,研究人员提出了一种名为Agora的服务器架构。该架构能够动态重新分配CPU和GPU资源,将调度、编排与工具执行分离为专用宿主角色,并根据工作负载行为自适应调整资源分配。

评估结果显示,Agora将宿主CPU利用率提升约30%,在低负载下恢复了协同工作负载约95%的独立吞吐量,通过工作负载整合释放了约三分之一的GPU,将生成吞吐量提升82%,并将尾延迟降低2.5倍。

Gogia表示,这些发现意味着基础设施采购的重心应从单个处理器转向整体AI工作流的执行效率。"CPU并非重回王座,而是王座本身正在消失。竞争优势正从单个处理器转移到异构服务器、机架与运行时作为一个整体系统协同运作。"他建议企业"采购工作流,而非采购硬件盒子",并指出工作负载分析与调度优化所带来的收益,很可能超过单纯基于模型推理来规划基础设施规模。

Q&A

Q1:Agora服务器架构是什么?它解决了什么问题?

A:Agora是由微软Azure与德克萨斯大学奥斯汀分校研究人员提出的新型AI服务器架构,专为智能体AI工作负载设计。它通过动态重新分配CPU和GPU资源、将调度与工具执行分离为专用角色、以及自适应资源分配,解决了传统GPU中心架构在执行多步骤智能体工作流时CPU与GPU利用率低、出现瞬时瓶颈的问题。评估显示,Agora可将CPU利用率提升约30%、生成吞吐量提升82%、尾延迟降低2.5倍。

Q2:智能体AI工作负载为什么会导致现有服务器架构效率低下?

A:智能体AI的执行模式与传统大语言模型推理请求根本不同。每个请求会扩展为大语言模型推理、工具调用和编排决策交替进行的动态工作流,任务在CPU与GPU之间反复切换。实验显示,单个工作负载可产生580次大语言模型调用与552次工具调用交替执行。这种碎片化模式导致CPU和GPU平均利用率偏低,同时又可能在任意时刻成为关键路径上的瓶颈,使静态资源配置难以应对。

Q3:企业在部署智能体AI时应如何重新考量基础设施采购策略?

A:研究人员和分析师建议,企业应将评估重心从单个处理器性能转向整体AI工作流的执行效率。具体而言,应优先进行工作负载分析与调度优化,而非仅依据模型推理需求来规划基础设施规模。分析师Gogia指出,竞争优势正从单个处理器转移到异构服务器、机架与运行时的整体协同,企业应"采购工作流,而非采购硬件盒子"。

相关内容

智能体AI或将推动企业级A...
来自微软Azure与德克萨斯大学奥斯汀分校的研究人员指出,随着企业...
2026-08-09 16:58:37
【AI贵阳】今日,立秋
入秋暑渐消,收获正当时 北京时间8月7日19时42分 我们将迎来二...
2026-08-09 03:55:01
蚂蚁百灵Ling-3.0-...
智通财经获悉,蚂蚁百灵新一代原生混合推理模型Ling-3.0-fl...
2026-08-09 03:40:12
智联招聘AI创新产品“职悟...
近日,由南方都市报主办的“AI破局消费·体验驱动增长”2026高品...
2026-08-07 19:45:17
中国开源大模型海外救场,国...
近日,“中国开源大模型海外救场”话题持续火热引发高度关注。全球多模...
2026-08-07 19:30:11
“AI教父”辛顿警告:AI...
凤凰网科技讯 北京时间8月6日,据《商业内幕》报道,有“AI教父”...
2026-08-07 07:53:54

热门资讯

智能体AI或将推动企业级AI服... 来自微软Azure与德克萨斯大学奥斯汀分校的研究人员指出,随着企业部署智能体AI,现有以GPU为核心...
海尔大暖通:AI空调全球第一,... 装修就像拼积木,空调、热水、净水样样都得凑齐,才能拼出一个完整舒适的家。可东拼西凑,费时又费劲。海尔...
【AI贵阳】今日,立秋 入秋暑渐消,收获正当时 北京时间8月7日19时42分 我们将迎来二十四节气中的第十三个节气 ——立秋...
据The Informatio... 据The Information:法律AI初创公司Harvey正洽谈融资,估值达155亿美元。 来源...
蚂蚁百灵Ling-3.0-fl... 智通财经获悉,蚂蚁百灵新一代原生混合推理模型Ling-3.0-flash已正式开源。Ling-3.0...
8月7日华懋科技涨8.19%,... 证券之星消息,8月7日华懋科技(603306)涨8.19%,收盘报73.03元,换手率6.72%,成...
智联招聘AI创新产品“职悟空”... 近日,由南方都市报主办的“AI破局消费·体验驱动增长”2026高品质消费品牌TOP100主题活动在上...