当前,人工智能产业正经历从训练主导向推理主导的历史性转变。随着《国务院关于深入实施“人工智能+”行动的意见》逐步落实,人工智能已成为塑造竞争新优势的核心引擎。以智能体为核心应用形态的AI技术,正推动关键生产力要素从“算力”向“智力”跃迁,成为引领产业变革的新质生产力。同时,国家网信办等三部门《智能体规范应用与创新发展实施意见》的持续落地,促使AI能力的充分释放不再依赖于单点算力的突破,转而寻求多个算力节点间的高效协同。Token(词元)作为衡量与调度AI计算能力的核心单元,正深刻变革传统的算力计量与交易模式——从“算力券”向Token交易转变,以Token计费为基础的新型商业逻辑加速演进。网络已不再是单纯的“信息管道”,而是成为连接分布式Token服务的“神经中枢”,成为决定未来人工智能业务效能的关键基础设施。
随着智能体规模应用和AI协同互联网的快速发展,日均Token调用量从2024年初的1000亿增长至2026年3月的140万亿,增长超过1000倍。这种爆发式增长对互联网基础设施提出了前所未有的挑战。
Token作为驱动AI模型运转、衡量智能服务价值的基本能源单位,已从技术术语演变为全新的价值度量和交换体系。在AI时代,Token已成为“数字燃料”和智能经济的“通用货币”,将数据、服务、资产“Token化”后,可实现开放调用和实时交易,从而推动价值流动。面对这一产业变革,互联网基础设施升级势在必行,运营商亟须实现Token运营的战略转型。
基于上述背景,本文围绕面向Token运营的互联网基础设施演进展开研究:首先梳理互联网从宽带联网、弹性云网、智能算网向原生智网演进的技术脉络,分析Token爆发式增长带来的低成本、高质量、高安全和生态化运营需求;其次提出Token Net总体架构,从算网资源、大模型服务、智能服务和Token运营四个层面阐述关键能力;最后聚焦Token分发网络(Token Delivery Network,TDN)的路由调度、缓存分发、度量计费与安全保障技术,探讨以“算网存”协同支撑Token规模化生产、分发和治理的实现路径,为智能互联网基础设施建设提供参考。
互联网基础设施演进历程与趋势
算网技术演进路线
传统互联网以连通性为核心目标,IP(Internet Protocol,互联网协议)网络采用“尽力而为”的分组交换范式,在视频、网页、社交等业务场景中实现了大规模商用部署。然而,这种设计在视频流、VoIP(Voice over Internet Protocol,基于IP的语音传输,俗称“互联网电话”)等对时延和抖动敏感的实时业务面前,逐渐暴露出能力不足。为此,“IPv6+”体系通过引入SRv6(Segment Routing over IPv6,基于IPv6转发平面的段路由)、网络切片、随流检测等技术,使网络初步具备业务感知和差异化服务能力,为后续面向AI场景的网络升级夯实了技术底座。
传统广域网“尽力而为”的设计范式难以满足智算场景对高吞吐、低时延、低抖动和高可靠性的综合要求,网络亟须从“通用连接管道”向“算力使能网络”转型,智能IP广域网(AI WAN)应运而生。它以“IPv6+”为技术底座,通过融合广域RDMA(remote direct memory access,远程直接存储器访问)无损传输、流级精准控制等关键技术,在数百千米跨域场景下将计算性能损失控制在5%以内,超过200 km拉远训练效率从25%提升至97%。
当前,算网技术发展逐步进入面向Token运营的原生智网(AI Native)新阶段。2024年,中国联通发布算力智联网AINet;2026年,进一步提出Token Net技术概念和架构体系,将Token运营作为基础设施演进的核心驱动力,推动互联网从“连接信息”向“连接智能”的范式跃迁。
Token运营的核心需求
面向Token运营的互联网基础设施需要满足以下四大核心需求。
一是低成本需求。大模型推理进入高并发、长上下文和多轮交互的阶段后,单次请求会产生大量计算和访存开销。面向Token运营,应通过预填充与解码(Prefill-Decode,PD)分离、混合请求调度、算网资源协同和KV Cache(Key-Value Cache,键值缓存)复用,减少重复计算和无效等待,提升单卡Token产出效率,并通过就近推理、热点缓存下沉和弹性调度降低单位Token成本。
二是高质量需求。Token服务质量不仅体现在最终回答是否可用,还体现在首Token响应时间(Time to First Token,TTFT)、连续输出稳定性、吞吐能力、抖动控制和服务等级协定(service level agreement,SLA)保障等全过程指标。智能体业务具有实时交互、任务链长、外部工具调用频繁等特点,一旦网络抖动、算力拥塞或缓存失效,就会影响用户体验和任务完成率。因此,应构建精细化调度机制,实现高效可靠的Token供给。
三是高安全需求。Token流转贯穿提示词、上下文、模型推理、中间缓存、工具调用和结果返回等多个环节,基础设施既要保障用户的原始数据和上下文不被越权访问,也要防范提示词注入、模型滥用、缓存泄露等风险。因此,需要构建全链路的纵深防御安全体系,以保障模型安全、数据安全和网络安全。
四是生态化需求。Token运营面向的是多模型、多算力、多网络、多智能体和多行业应用共同参与的复杂生态,单一厂商或单一资源池难以满足差异化服务等级目标(Service Level Objective,SLO)和规模化调用需求。因此,应整合异厂商、异构资源,构建开放合作的Token产业生态。
Token Net架构体系
Token Net以低成本、高安全、高质量、多生态的Token运营为目标,通过算网资源、大模型服务、智能服务、Token运营四个方面,打通算网资源、AI大模型、智能服务与用户之间的价值闭环,推动面向Token运营的新型互联网基础设施建设。中国联通Token Net技术体系如图1所示。
图1 中国联通Token Net技术体系
算网资源:夯实算网底座
图2 智算网络基础资源架构
大模型服务:面向Token运营的推理优化
大模型服务层聚焦Token运营的推理服务优化,围绕Token低成本、高质量的运营目标,基于PD分离推理架构实现高吞吐、低成本、弹性可控的新一代推理服务能力。PD分离架构将Prefill阶段和Decode阶段分离,按GPU硬件特性差异化分配资源,实现算力与访存的最优匹配,最大化Token产出效率。
在广域层面,发挥运营商在广域网络和边缘算力资源方面的优势,打造“云边端”协同的分布式推理能力。通过分割学习技术将模型按层分割,首层和尾层放在边侧,中间层在云端,实现数据不出域。依托联通算网、多接入边缘计算(Multi-Access Edge Computing,MEC)和内容分发网络(Content Delivery Network,CDN)构建推理网络,实现就近推理,提升缓存调度效率,降低推理服务时延。
智能服务:构建智能体互联网
智能服务层是Token Net中连接AI能力与产业应用的桥梁。智能体是Token的主要生产者和消费者,智能体应用和人机协同是Token赋能生产的落地形式。通过将大模型作为“大脑”并与工具、环境深度结合,推动人工智能从认知层迈向行动层。在智能体互联网中,智能服务层不仅承载单个智能体应用,还要形成服务网络。智能体互联网的关键能力可从动态组网、全场景泛在接入、智能体注册发现、多协议适配互通、可信身份认证和智能体构建与协同六个模块体现,如图3所示。
1.动态组网面向多智能体协作任务,能够按需建立临时协作网络,使不同智能体在任务执行过程中灵活实现连接、能力组合和资源调度。
2.全场景泛在接入强调智能体服务对多种入口的兼容接入,使用户能够在不同场景下以统一方式调用智能体服务。
3.智能体注册发现用于建立智能体能力目录和服务索引,通过语义化描述、能力标签和接口信息发布,调用方能够按任务需求快速发现合适的智能体服务。
4.多协议适配互通解决不同平台、智能体框架和通信协议之间的互联问题,通过统一的协议映射、消息适配和语义转换,降低跨系统协同成本。
5.可信身份认证为智能体、用户、设备和服务提供统一身份标识、认证授权和可信凭证,保障跨主体调用过程中的身份可确认、权限可控制、行为可追溯。
6.智能体构建与协同面向复杂任务,支持工具调用、流程编排、角色分工和多智能体协作,使大模型能力从单轮问答升级为可执行的业务流程。
图3 智能体服务关键能力
Token运营:可运营的Token分发网络
Token运营作为Token Net的运营体系,是面向用户运营服务的关键。TDN依托运营商算网一体化资源优势,以Token感知路由和智能分发为核心,实现Token分发、KV缓存与算网资源的协同调度,从而降低Token成本、提升服务质量,构建网络化和服务化的Token运营体系。可运营的Token分发网络如图4所示。
图4 可运营的Token分发网络
当大模型推理服务从“单点优化”迈向“系统级工程化”,KV缓存已不再是简单的性能加速器,而成为构建吞吐、时延与成本“三角平衡”的核心基础设施。KV缓存分发可以根据传输需求分为以下三类。
第一,长期保存与跨数据中心KV缓存流转。该方式适合存放价值较高、复用概率较大的长上下文缓存。系统可在网络空闲时异步复制,提前在目标资源池中形成备份或预热缓存,从而在业务迁移时减少重复的Prefill计算。
第三,实时推理中的高速复用。针对PD分离架构,Prefill阶段生成的KV缓存应尽量靠近Decode实例,在GPU显存内完成快速交接,减少因CPU回拷和跨节点搬迁带来的额外开销。对于连续多轮会话,热KV Cache优先保留在大带宽内存中,有助于保障Decode阶段的输出速度与稳定性。
通过上述三种机制的协同,TDN可以根据缓存价值、访问热度、上下文长度和服务时延要求,进行KV缓存的合理分发,从而在推理成本、响应时延和资源利用率之间取得更好的平衡。
Token分发网络关键技术
路由调度技术
以TDN广域覆盖、低时延、高可靠的网络能力为底座,构建运营商级Token路由与调度方案。通过差异化网络能力赋能Token服务,实现“算网模”一体化协同,为用户提供最佳Token接入体验。TDN支持基于多要素的Token路由,综合考虑用户请求特征、网络状态、算力状态等多维度因素,实现精准调度。
Token Hub作为核心枢纽,汇聚多家供应商的Token资源,实现算力与模型的多样化供给,支撑多场景接入需求。相比传统的Token直通访问模式,TDN通过全网Token聚合,根据用户请求、网络状态、算力状态、Token消耗量,为用户提供更好的Token供应服务(如图5所示)。
图5 基于高质量承载网络的Token服务调用
KV缓存分发技术
KV缓存是大模型推理过程中的关键中间产物,通过前缀匹配技术实现缓存复用。当用户请求与历史上下文存在匹配时,可直接命中KV缓存并跳过Prefill阶段,从而大幅降低计算量,显著降低TTFT。TDN通过广域网动态路由调度、算力与本地缓存协同,实现网络、计算、存储资源的有效置换和最佳匹配。
从现阶段智算中心内的KV缓存动态管理和高效复用,走向跨智算中心的全局调度,须构建KV缓存广域级分发调度能力,实现“网存换算”、资源协同提效,解决大模型推理性能与成本的矛盾。通过KV缓存热点感知、生命周期管理和全局流转,实现跨域资源协同。
度量计费技术
建立统一的Token度量与计费机制,为Token的生产、调度和流通奠定基础,实现Token运营的可量化、可比对、可结算。TDN支持精确区分Token不同类型,为差异化计费提供依据。通过智能计费引擎,实现Token流转的精细化管理,支持按量计费、按质计费等多种模式,满足不同业务场景的计费需求。
安全保障技术
构建智能监控体系,实现Token运营全链路的可视化、可追溯、可优化,以及覆盖Token“生成—传输—分发—计费—运维”全生命周期的安全防护。TDN以“安全可信、精细管理”为原则,支持Token流转的全链路追踪,确保Token生产、分配、消费各环节安全合规,保障模型安全、数据安全、网络安全。
总结与展望
从AINet到Token Net的演进,标志着中国联通顺应AI时代潮流,推动互联网基础设施进入了以Token为核心驱动力的新阶段。Token Net不仅是技术架构的升级,更完成了商业模式从“卖流量”到“卖Token”的体系化重构。
未来,中国联通将继续协同生态伙伴,推动Token Net在技术创新、标准体系与产业应用层面的深度融合。通过坚持守正创新,全面构建低成本、高质量、高安全、生态化的Token运营体系,致力于为全球智能经济的高质量发展注入全新动力,推动互联网真正实现从“连接信息”向“连接智能”的质变。