【导读】当AI Agent从概念验证步入真实业务场景,行业关注的焦点正从“芯片有多少算力”转向“算力能转化出多少业务价值”。8月27日,2026中国国际大数据产业博览会上,海光信息重磅发布“Agent to Token开放计算架构”,以CPU与DCU双芯协同及开放互连,为Token经济规模化提供从芯片到应用的全新算力框架。这一架构并非简单的硬件叠加,而是对AI计算分工的重新定义——CPU负责指令流与任务编排,DCU专注Token生成与并行推理,两者通过高效互连形成协同。海光信息总裁助理杜夏威与张攀勇向EEWorld分享了这一架构背后的产业洞察与技术逻辑。
海光为什么要发布这样的架构?这一架构有什么值得关注的细节?在当下发展中海光能够提供什么?海光信息总裁助理兼智能计算产品部总经理杜夏威,海光信息总裁助理兼服务器产品部总经理张攀勇向EEWorld深度分享了自己的见解。
为什么要推出“Agent to Token”架构
现在,用户买AI算力,越来越不只是看峰值性能,而是更关注一个实际问题:Token能不能稳定、高效地生产出来。在杜夏威看来,这种变化实际上意味着整个AI产业正在走向成熟。
如果说Token解决的是模型与算力如何更高效协同,那么进入Agent时代之后,问题又向上走了一层。因为Agent天然带有更强的业务属性。传统大模型更多关注生成和推理,而Agent需要调用工具、执行任务、与业务系统交互。因此,最终的业务效果已经不再由单一DCU,甚至单一AI芯片决定。
比如现在的Agent,需要执行操作、调用工具,还需要考虑Sandbox沙箱和安全机制。这些任务并不是100%由AI芯片完成,CPU同样需要参与其中。同时,在一个完整的业务流程中,AI推理也只是其中一个环节,数据存储、网络通信、业务系统调用等都会影响最终效率。
因此,海光提出“Agent to Token”,并不只是把Token作为新的算力指标,而是希望把关注点进一步从Token提升到业务层。
“Agent to Token”架构的三个阶段
对于海光此次提出的Token架构,杜夏威将其背后的产业逻辑概括为三个阶段。
第一个阶段,是算力阶段。这个阶段主要解决的是“芯片能做什么、能提供多少算力”的问题。PFLOPS、TOPS等指标是核心衡量方式,这也是海光长期积累的重要领域。
第二个阶段,是Token阶段。随着大模型快速发展,Token成为连接算法和算力的重要纽带。过去谈算力,更多是在谈芯片;谈参数量,更多是在谈模型。而Token则把模型和算力结合了起来,更直接地反映两者协同后的实际效果。
第三个阶段,则是Agent时代下的业务化阶段。当Token已经成为行业普遍接受的价值衡量方式之后,下一个问题就是:这些Token到底如何服务具体业务?业务流程如何改造?智能体如何与业务系统整合?AI如何帮助研发和生产提效?
海光此前一直推动AI计算开放架构,以CPU和DCU双芯战略为基础,同时坚持开放生态的发展思路。这些底层能力,也构成了未来继续向Token、Agent,以及更广泛AI业务场景延伸的基础。
Agent对CPU提出了哪些新需求?
随着Agent进入实际行业和应用场景,AI计算的重心正在从单纯的模型训练、推理,转向完整业务流程的执行。CPU不再只是AI系统的辅助角色,而需要承担任务理解、工具调用、任务编排、数据访问、结果处理等大量工作。
张攀勇认为,Agent时代CPU的重要性会进一步提升。过去服务器中CPU与加速卡的配比可能是1:4甚至1:8,未来在Agent场景下可能逐步向1:2乃至1:1收敛。其背后的原因在于,Agent涉及大量非纯计算任务,CPU承担的工作量明显增加。
不过,与传统服务器相比,Agent时代CPU承担的角色有所变化。过去CPU更多承担通用计算、数据预处理等任务,而在Agent系统中,CPU更像是整个业务流程的“中枢”,需要负责数据接入、沙箱运行、任务理解、决策编排、工具调用、数据库访问以及多节点并发等工作。因此,Agent对CPU的需求不一定只是追求更高的峰值算力,而是更加看重串行处理效率、低延迟、高并发、数据处理能力和带宽,同时需要与DCU、网络等资源实现高效协同。
海光也会针对这些变化持续优化CPU架构,并从系统层面重新定义CPU的定位。例如通过HSL等互连技术提升CPU与DCU以及系统内部的数据传输效率,同时提升IPC和内部数据通路效率。
安全同样是重要能力。海光希望将安全能力从芯片底层开始内嵌到整个系统中,通过隔离、权限管理、加密等机制,在保证数据安全和可信的同时,尽可能降低对系统性能的影响。
CPU与DCU不是简单叠加,而是重新分工
海光提出“Agent to Token”,核心并不是简单地把CPU和DCU放在一起,而是根据不同任务的特征重新分配计算资源。
其中,任务编排、实时决策、工具调用、数据处理和数据存取等工作,更适合CPU承担。CPU擅长通用处理、复杂逻辑和低延迟响应;而Token生成、推理等大规模并行计算任务,则更适合交给DCU。
因此,在海光的双芯架构中,CPU更多承担Agent侧的指令流,DCU负责Token侧的生成流,两者通过高效互连形成协同。
张攀勇认为,未来AI算力系统的“最优”,不再是单独追求CPU或者DCU性能最强,而是要在系统层面实现最优,通过合理的任务分工和资源配置,提高整体效率,并最终降低客户TCO。
在安全方面,海光则坚持“云边端”与“内生全栈安全”的思路,从芯片底层开始设计整体安全架构,在尽量降低对系统和应用性能影响的同时,提供更高等级的安全保障。
国产算力要降低门槛,不能只靠“被动适配”
杜夏威表示,海光希望更早进入模型研发阶段,让开发者从一开始就能够基于DCU进行原生开发,包括模型训练和推理。这样,当模型后续迭代时,能够尽可能实现“发布即可用,可用即好用”。
从这个角度来看,国产AI算力生态真正要解决的问题,不只是兼容多少模型,而是要让开发者能够更低门槛地直接在国产平台上开发。
海光目前主要从两个方向推进:
第一,是持续完善自身的软件栈。随着大模型不断迭代,新的算子、新的数据精度,以及分布式、工程化部署等能力都在快速演进。底层软件栈必须具备足够完善的支撑能力,才能让新的模型和算子更快地在DCU平台上运行起来。
第二,则是继续推动开放生态。海光希望通过进一步开放和开源,让开发者、用户以及上下游合作伙伴,能够更方便地获得基于DCU的开发工具和技术支持。尤其是大模型厂商,可以围绕自身的研发节奏,自主开展模型训练、推理和业务部署。
总结
从“算力时代”到“Token时代”再到“Agent业务化时代”,海光“Agent to Token”架构清晰映射出AI产业价值重心的迁移路径。Agent时代,CPU从辅助角色跃升为业务流程中枢,承担任务理解、决策编排与安全隔离;DCU则专注Token生成与大规模并行推理。海光以双芯协同、HSL互连和内生安全架构,为这一分工提供系统级支撑。更关键的是,海光正将国产算力的参与节点从“模型发布后的适配”前移至“模型研发阶段的原生开发”,让开发者从源头即可在国产平台上完成训练与推理。



