}

快科技8月12日消息,由华为2012实验室、华为云、计算、终端等团队联合打造的开源智能体平台openJiuwen,近日联合昇腾推出了一项名为"算力亲和"的全链路协同技术。

该技术打通了Agent框架、推理引擎与底层算力之间的协同壁垒,通过让KV Cache(键值缓存)从被动管理走向主动协同,使Agent推理的首Token时延降低57%以上,推理存储占用峰值下降25%。


随着AI Agent应用日益复杂,单个任务可能持续数十分钟甚至数小时,多个Agent还需分工协作。任务越长、协作的Agent越多,推理过程中产生的KV Cache就越庞大,推理时延也越久。

然而,传统推理引擎只能看到请求和缓存,却看不懂Agent正在做什么。如果子任务已经结束,缓存可能还停留在昂贵的NPU显存里;如果会话暂时挂起时,缓存却继续占着最贵的资源位置。

这背后的核心问题是:Agent掌握任务状态,引擎掌握算力资源,两者之间缺一条传递语义的通道。openJiuwen的解法是在Agent与推理引擎之间建立一套"状态契约",即Agent Hint。


Agent在关键状态变化时发出Hint信号,告诉引擎当前会话的生命周期状态;引擎据此执行对应的缓存动作:驱逐、卸载、预取。缓存不再只有"留在显存"或"排队等淘汰"两种命运,而是随任务节奏在存储层级间主动流动。


测试结果显示,开启算力亲和后,模型请求端到端时延降低27.61%,前缀缓存命中率提升33%,池化缓存使用量峰值降低25.24%。

当前这套能力即将开源,感兴趣的开发者可以关注openJiuwen开源社区。