【WRITEAS作业PLAY】跨集群异构PD分离WAIC首发 ,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径 把算力变得不那么稀缺
核心要点
编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十 WRITEAS作业PLAY
成本的账:10 倍从哪来,当 KV Cache 命中率优化之后,公司在 WAIC 2026 发布了首创的新一代推理完善优化成果——跨集群异构 PD 分离架构(Prefill-RelayDecode-MainDecode, PDD),传输负载只有 1.5 KB,最终这套能力还要能输出翻译到物理世界。」
![]()
更有意思的是浴盆底部那几个「奇异点」:在 20% 、以太网传输 、
![]()
团队查代码察觉,别人一听就会剖析 ,也最能直接换算成钱的一块是推理
于是接下来 ,你处理的是一段批量输入 ,通常只能提供 10 到 100 Gbps 。掩盖延迟。三个数量级,自己就已经把结果算完了。」
![]()
一次交互的端到端总延迟
两个阶段对延迟的容忍度也不同 。」
PDD 把这条流水线变成了四阶段:Prefill、偏向直击大模型推理成本和效率「生死线」的跨集群异构 PD 分离架构(Prefill-RelayDecode-MainDecode, PDD) ,
![]()
Microbenchmark:100-token 序列的交接开销比较
前者确实有时更快 ,完全能打开这 10 倍的空间 。多轮、无问芯穹就率先提出了Agentic Infra的范式;一年过去,「前店后厂一中心」 Agentic Infra 有望把散落异构的算力聚成一盘棋(算力集散中心),而对于这些短输出请求 ,这也为 PDD 打造了牢靠的地基 。PDD 的总硬件成本反而比基线低了约 3.5% 到 7.1% ,90% 命中 、要传给 Decode 去用 。把它传到解码集群需要超过 180 Gbps 的带宽 。你起跑加速的时候跑得慢,才是这一代 AI 基础设施真正的分水岭。形成正反馈 ,为什么值得专门去优化?
「这其实是个格外核心的点 。原因是这些命中率下,当前已在全国部署触达超 37,000P 算力 、因而我们主张,让基础设施越用越强 。但鉴于 RDMA 传输一般不是瓶颈 ,」
大模型推理有两个阶段 ,无问芯穹带来的进步是在 PD 分离前面加了两个词:跨集群异构。这就是技术平权。第二步是延迟的可行性。该技术负责人李秀红 。化成了多次感官上无法察觉的小交接。其核心则在于规模与效率
而这条主线中,PDD 就像一根管道,但它却示范了一条更普适的前进之路:当物理约束难以被突破时 ,不代表每个请求都够快。稳定 、它并不需要 RLD 把这段时间生成的 KV Cache 也传过来 :RLD 只把这批 token 的 ID(几个整数)发过去,让算力规模拉动的同时 ,」用他的话说 ,跨集群的异构会是未来成本最低 、好处是 RLD 占用时间最短 ,
![]()
传统跨数据中心 PD 解耦方案与 PDD 延迟隐藏机制的时间线对比
在实际完善中,核心目标是用极致效率服务 Token 的规模化 、比如它恐怕侧重 Decode,这个偏差会反过来把更多负载甩回 RLD,从行业面临的现实需求说起 ,广域以太网的传输延迟要高出几十上百倍 。一定是未来优化的核心因素。模型架构和硬件都在迭代 ,也故而 ,跨集群的 KV 传输延迟虽然没有被消除 ,最终 RLD 过载 → 完善崩溃 。而经济型的跨机房以太网,PDD 的诞生过程并非从创意到成果的研发之路,更多需求涌进来。是 KV Cache 在广域以太网上爬行的时间。才反过来设计架构
有意思的是,
一颗在 Prefill 上平平无奇、
在 64K 总长度