智能体崛起推动推理方式变革
在北京中关村国际创新中心,开源推理框架SGLang的核心开发者王书文分享了令人瞩目的数据:在智能体的请求中,平均输入为88,000个Token,而输出却只有413个,差距达到213倍。他指出,在智能体时代,计算能力主要用于维护历史上下文,而不是单纯的输出。这一观点在AICC2026人工智能计算大会上得到了进一步探讨,吸引了近3000名业内专家参与。
此次大会设立了多个专题论坛,涵盖了AI芯片、Token工厂、大模型等多个环节,聚焦于芯片、系统、软件和应用的协同发展。与会者讨论了从长上下文带来的缓存压力到多种芯片适配等问题,聚焦于智能体实施持续任务的未来发展方向。
智能体的迅猛发展正在重塑AI计算的各个层面。到2026年,智能体将从发布会的概念走入实际应用,承担规划、推理、工具调用等多个任务,系统需要支持更长的负载并具备恢复能力。在此次大会上,与会者就这一变化展开了深入讨论,包括基础设施如何应对这种持续任务的需求等。 龙8头号玩家国际
智能体的崛起将算力推向国家战略的核心。过去的单次模型调用已转变为对持续任务的支持。OpenAI和博通推出的Jalapeño芯片示范了如何在芯片设计中整合模型与应用需求,对整个产业链产生深远影响。全球范围内,技术路线的多样化和系统整合正在同步进行,行业正朝着高效率的全栈协同发展。
智能体不仅改变了AI计算的组织结构,也推动了成本下降和普及,使其成为各行各业的生产力。此次大会的核心在于理解这种组织变化和基础设施层的转变。
从单纯的“回答问题”到“持续工作”,智能体任务的推理方式也发生了显著变化。王书文的数据揭示了Agent推理的演变,过去的推理仅需解决一个问题,如今则需要在多个阶段重复调用模型,形成连续的任务链,历史上下文的输入量急剧增加。 龙8头号玩家国际
面对这种变化,推理系统需要调整优化策略。根据SemiAnalysis的报告,智能体目前已贡献了约70%的推理流量,因此必须寻求减少重复计算的策略。SGLang等开源框架正致力于提高缓存的复用率,从而提升计算的效率。通过新技术的应用,SGLang在缓存命中率及首Token延迟方面均取得了显著的改善。
从单次推理到持续任务,推理系统所面临的核心挑战已转变为减少重复计算。
张展硕逆袭夺金,打破亚运800米自由泳纪录
组织篮球球迷的互动活动,包括见面会、观赛聚会等,增加球迷参与感。...
国足对阵马尔代夫:布尼亚明与韦世豪首发,钟义浩与杨明洋参赛
组织篮球球迷的互动活动,包括见面会、观赛聚会等,增加球迷参与感。...