2026年10月8日,美国AI网络基础设施公司Upscale发布了一项名为Token Fabric的新技术方案,目标是让数据中心内不同厂商的AI芯片能够通过统一、高速的网络协同工作。
这项技术的意义,并不只是网络速度更快,而是试图改变当前AI计算系统的连接方式,让大型AI数据中心不再过度依赖某一家芯片厂商的专有互联技术。
一、为什么AI需要新的网络技术?
如今,训练和运行大型AI模型,往往需要成千上万颗GPU或其他AI加速芯片共同完成计算。
这些芯片并不是各算各的,而是需要频繁交换数据。
可以把AI数据中心想象成一座大型工厂:GPU是生产设备,网络就是连接设备的运输系统。
即使每台设备的生产能力都很强,如果运输系统经常堵塞,整个工厂的效率仍然会受到影响。
AI计算也是如此。当芯片之间的数据传输速度跟不上计算速度时,昂贵的GPU就可能陷入等待,导致整体算力利用率下降。
目前,NVIDIA拥有NVLink等高性能互联技术,但这些技术主要服务于自身的GPU生态。
与此同时,AMD以及越来越多的专用AI芯片厂商正在进入市场。如何把不同品牌、不同架构的芯片高效连接起来,正在成为AI基础设施的重要技术问题。
Upscale的Token Fabric正是面向这一需求推出的。
二、Token Fabric究竟是什么?
Token Fabric不是一颗芯片,也不是某一种新的通信协议,而是一整套AI数据中心网络解决方案。
它主要包括三个部分:
| 技术组成 | 核心产品 | 通俗理解 |
|---|---|---|
| Scale-up(纵向扩展) | SkyFabriX | 让大量AI芯片紧密连接,像一台大型计算机一样协作 |
| Scale-out(横向扩展) | NVIDIA Spectrum-X交换系统 | 把不同服务器、机架和计算集群连接起来 |
| 统一管理 | SkyOS、SkyCMD | 统一管理网络设备,监测运行状态和处理故障 |
其中最引人关注的是Upscale自行研发的SkyFabriX交换芯片。
据公司公布的信息,这款芯片的交换容量达到115.2 Tbps,也就是每秒115.2万亿比特。
需要说明的是,这个数字表示芯片总体的数据交换能力,并不是单个GPU能够达到的传输速度。
SkyFabriX还支持ESUN、UALoE等面向高速AI互联的开放技术,并规划支持UALink等持续发展的标准。
简单来说,Upscale希望通过开放标准,让不同AI芯片能够接入同一套高速网络,而不是每增加一种芯片,就需要重新建设一套互联系统。
三、技术上有什么特别之处?
Token Fabric最突出的特点,可以概括为三个方面。
第一,从封闭互联转向开放互联。
传统高性能GPU互联往往与特定厂商的硬件体系紧密绑定。
Upscale选择以开放标准和以太网技术为基础,希望让不同厂商的AI加速器使用共同的网络基础设施。
不过,网络协议兼容并不意味着不同GPU可以直接共享全部计算资源。驱动程序、内存管理和AI软件框架仍然需要相互配合。
第二,将两种网络连接方式统一起来。
过去,服务器内部的高速互联与服务器之间的网络通常采用不同技术,设计、部署和维护也相对独立。
Token Fabric通过自研SkyFabriX负责紧密连接芯片,再利用NVIDIA Spectrum-X连接更大范围的计算集群。
这样既能发挥专用高速互联的优势,也能够利用成熟的以太网生态。
第三,利用AI智能体管理网络。
Upscale推出的SkyCMD采用所谓Agent-native,即智能体原生的管理架构。
其目标是让网络管理系统自动监测设备状态、识别异常、分析问题,并辅助执行管理操作。
未来,大型数据中心的网络管理有望从大量人工配置和排障,逐步转向智能化运维。
但这种自动化能力的实际效果,还需要大规模部署验证。
四、它会挑战NVIDIA吗?
这是一个值得关注的问题。
一方面,Token Fabric希望突破专有AI互联体系的限制,与NVIDIA NVLink等技术形成一定竞争。
另一方面,它的Scale-out部分又直接采用NVIDIA Spectrum-X交换技术。
这说明Upscale并不打算全面替代NVIDIA,而是选择在部分领域自主研发,在其他领域与成熟厂商合作。
事实上,Broadcom等公司也在推进面向AI计算的开放以太网互联技术。
因此,Upscale并不是唯一参与者。它真正希望建立的竞争优势,是把交换芯片、网络设备、软件管理和开放协议组合成完整产品,减少客户自行集成的难度。
五、商业前景如何?
Token Fabric目前仍处于商业化早期阶段。
按照Upscale的计划,产品将在2027年初正式供应,目前已经开展早期客户体验和联合验证。
未来需要重点观察三个方面:
- 性能: 实际延迟、带宽和GPU利用率能否达到预期?
- 兼容性: 不同品牌的AI加速器能否真正稳定、高效地协同运行?
- 成本: 相比现有解决方案,能否降低网络建设和维护成本?
特别需要注意,Token Fabric中的“Token”更多强调AI计算的最终产出效率,并不意味着这是一项直接生成或处理大模型Token的新算法。
六、总结
Token Fabric反映了AI基础设施正在发生的一个重要变化:未来AI算力的竞争,不仅取决于芯片本身有多快,还取决于不同芯片能否高效地连接和协同工作。
随着AI系统越来越庞大,网络正在从传统的数据传输工具,逐步变成决定整体计算效率的关键基础设施。
Upscale的技术路线也表明,开放标准、异构计算和智能化网络管理,可能成为下一阶段AI数据中心的重要发展方向。
当然,Token Fabric目前更多展示的是技术架构和产品规划。它究竟能够给AI计算带来多大的效率提升,还需要等待实际产品和应用数据来证明。
主要参考资料:
- Upscale:Token Fabric 官方发布公告
- OCP:ESUN 1.0 标准发布
- Network World:Token Fabric 技术分析
- Broadcom:Tomahawk 6 量产公告