无问芯穹夏立雪:数字世界与物理世界的所有AI生产力运行,都需要 Agentic Infra
点击查看原文>
“计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。”
7 月 20 日,2026 年世界人工智能大会上,无问芯穹联合创始人兼 CEO 夏立雪提出,从 Pre-training(预训练) 到 Post-training(后训练)、从 Test-time(推理时扩展) 到 Agentic scaling(智能体扩展),在四条 Scaling Law 的作用下,模型训练和推理的超级市场正在互相孕育。
当下的人工智能基础设施(AI Infra)“必须以极致的效率服务更大规模。”

基于规模与效率两大锚点,夏立雪从无问芯穹的 AI 生产力公式(AI 生产力=智能资源规模× Token 转化效率× AI 生产力转化效率)出发,首次公布无问芯穹 Agentic Infra 的“前店后厂一中心”战略布局,涵盖三大核心技术能力与产品服务体系:
“算力集散中心”:Agentic Infra 自主式基础设施平台;
“Token 工厂”:Agentic MaaS 大模型服务平台;
“AI 生产力商店”:Agentic Infra 行业解决方案。
这套 Agentic Infra 产品与服务体系立足基础设施,向下汇聚能源和芯片,向上支撑模型和应用,不仅极致提升底层资源向 AI 生产力转化的规模和效率,更有着 Agentic AI 时代最显著的 AI 原生能力——用基础设施智能体蜂群赋能资源规模扩展、提效 Token 生产,并支持 Agentic AI 的持续进化。

Agentic Infra 自主式基础设施平台,服务下一代 Agentic AI 在线进化
无问芯穹 Agentic Infra 自主式基础设施平台的核心目标,是实现智能资源规模最大化。它就像一座“算力集散中心”,把散落的、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。

夏立雪认为:“算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”
无问芯穹自成立以来一直致力于通过“多元异构、软硬协同”技术破解异质算力聚合的难题,打造了面向异构集群的大模型跨域训练系统,并集成于 Agentic Infra 自主式基础设施平台软件中,通过计算通信重叠的流水编排、自适应的通信流调度和异构算力调度机制,三位一体全栈协同优化,能够系统性地破解算力聚合的行业难题。

该系统已经受过三大类跨域算力聚合训练实践的生产级考验:
第一是超远距离聚合。无问芯穹已联合中国电信,完成了国内首例超 4000 公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升 165%,验证了超远距离跨域集群协同训练的可行性。
第二是多数据中心聚合。打通 4 个不同代际、不同型号的 GPU 集群,联合训练近百亿参数大模型,四集群协同性能提升 41%,有效盘活了不同批次的存量异构算力。
第三是混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训,整体性能提升 68%,帮助众多企业客户解决本地算力不足、云上资源却闲置的错配痛点。
目前这套跨域训练系统已在全国部署触达超 37,000P 算力、覆盖 16 种主流芯片,盘活了广域分散的异质算力,使之成为 Agentic AI 时代的最坚实底座。

当下,强化学习成为下一代 AI 进步的重要手段。但相较传统预训练,强化学习“多角色协同”的特性使其对硬件的种类需求更加复杂,规模量级也更加庞大,基于异构和超大算力规模的双重刚需,跨集群强化学习因此成为智能规模化及持续进化的新锚点,这也是无问芯穹 Agentic Infra 自主式基础设施平台重点布局与攻克的核心场景。该场景存在两大重要问题:一是跨集群之后,不同角色之间的等待时间将被拉长;二是当规模扩大到万卡级后,从显卡到服务器、网络、存储,故障将以小时级的频率存在,而重新拉起任务耗时长达数十分钟,任务难以持续稳定运行。

因此,针对跨域强化学习场景,无问芯穹把全栈协同的技术思路贯穿到底——从网络、平台到框架做一体式深度优化,打通分散的异构集群,实现全局资源一盘棋调度。
在此之上,无问芯穹进一步将优化渗透进全链路的每一个环节,尤其是在跨域通信和容错这两个层面:通过优化计算通信重叠技术,让跨域通信效率直接提升 3-4 倍,实现通信开销 100%全掩盖,训练不再因跨域通信产生额外耗时损耗;同时搭建了故障无感的训练机制,成功实现了跨域强化学习训练连续一周 0 中断稳定运行。让大规模跨域强化学习不仅可以“跑得通”,还能“跑得快、跑得稳”。

“这只是一个起点。”夏立雪表示,伴随着大规模跨集群强化学习训练技术的持续成熟突破,无问芯穹还将持续深耕并行策略、通信融合、智能算子、极致容错等核心技术,“未来,我们能够将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代 Agentic AI 的在线进化。”

Agentic MaaS 大模型服务平台,无问芯穹 Token 工厂以“效”搏大
Token 经济时代,无问芯穹早在 2023 年初就提前布局的 Agentic MaaS 大模型服务平台,目前正在迎来高速且持续的增长曲线。该平台就像一座“Token 工厂”,核心目标是用极致效率服务 Token 的规模化、高质量生产。
发布会现场,夏立雪用千卡至万卡规模下完整推理服务技术栈揭示了一座 Token 工厂内部的可优化空间,“从网关、路由,到底层推理实例,Token 工厂层层可优化、处处有增量。”

随后,夏立雪披露了无问芯穹首创的新一代推理系统优化成果——跨集群异构 PD 分离架构(Prefill-RelayDecode-MainDecode, PDD)。
智能体推理需求的特征有“三极”:上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。同时,从实测数据中能直观看到,不同芯片在 Prefill、Decode 阶段的性能差异极大。而眼下,这些散落在不同地区的存量集群几乎都是同构的,且几乎每个集群都“偏科”。
因此,该架构首先用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来,让算力强的集群做 Prefill 任务,让显存带宽高的集群做 Decode 任务。这一架构设计相当于让“偏科”的硬件只刷自己最擅长的题,可以极大提升大模型推理系统效率,是每座 Token 工厂都必备的“超级管线”。

然而,基于以太网的 KV Cache 跨集群传输,存在带宽和延迟瓶颈,这根“超级管线”既要能扛住智能体业务的巨大“流量”,也要能跟得上用户对“流速”的极致要求。
基于 Agentic MaaS 线上业务长期的大规模实践积淀,无问芯穹推理团队首先把为了 Decode 实例重复前缀存储去重而设计的 Decode Radix Cache 技术,创新性地迁移至跨集群异构 PD 分离架构之中,实现跨集群 KV Cache 传输数据量降低一个数量级, 让“流量过载”的难题迎刃而解。
其次,更大的挑战在于“流速”——智能体的响应速度,是最直观的产品体验底线。
PDD 将传统的 PD 分离链路“P-D”创新解构为“P-RLD-MD”的三级分离式推理架构,就像是为这条“超级管线”加装了一个“精密增压阀”。对于高传输延迟的请求,RelayDecode 先行输出 Token 给用户,从而让用户侧完全感受不到这一实际上长达数十秒的传输延迟;当传输完成后,输 Token 给用户的任务被无缝切换给 MainDecode 来处理,避免了 RelayDecode 被长期占用。通过这一设计,仅需极少量机器承担 RelayDecode,就能掩盖以太网 KV Cache 传输延迟。

实测显示,该架构在实现了首 Token 延迟(TTFT)降低 51.5%的同时,单 Token 成本可降低 37.5%。这不仅意味着用户端速度体验的显著提升,更意味着,每一个集群都能被充分利用起来,最大化释放全域异构算力的产业应用价值。
过去一年里,无问芯穹的 Token 工厂已通过一系列原始技术创新,推动了推理成本的 10 倍下降。夏立雪判断,随着跨集群异构 PD 分离架构的规模化落地,推理成本依然有 10 倍的下降空间。

“目前无问芯穹的 Agentic MaaS 大模型服务平台的增长飞轮已经全面转起来了!”夏立雪表示。
技术迭代驱动成本下降,业务规模加速技术创新。通过与 Kimi、智谱、Minimax、阶跃星辰等头部大模型企业的密切合作,无问芯穹在真实业务场景中持续打磨、积累了大量优化经验。截至 7 月,平台单日 Token 调用量较去年 12 月,已实现了 40 倍 的爆发增长,而海量业务经验又能反哺技术快速迭代,催动平台性能与可靠性的同步跃升,形成“业务带技术,技术提效率,效率促增长”的正向循环。

夏立雪总结:“6 月的 GTC 上,黄仁勋展示了英伟达的‘算力即收入’曲线。无问芯穹的 Token 工厂,则希望用这个‘优化即利润’的增长飞轮,向推理时代交出 Token 效率的答卷。”

无问芯穹已携手上海移动联合打造了“沪芯沪产服务沪客”的“天问”模型服务门户,也与 AI 原生新世代社区“观猹”联合打造了“中国版 OpenRouter” TokenDance(词元跳动) 平台。未来,无问芯穹将持续携手优秀的行业伙伴,以这套高效的“Token 工厂”赋能更多产业领域、服务更广泛客用户。

Agentic Infra 行业解决方案,以 AI 原生赋能百业提效
依托“算力集散中心”与“Token 工厂”,无问芯穹可以将计算资源高效转换成高质量 Token。然而相同的业务效果,基于不同的推理路径、模型规模和芯片,Token 的成本天差地别,深度影响其在真实生产环境中的商业化潜力。
为此,无问芯穹正通过 Agentic Infra 行业解决方案,携手多行业伙伴把 Token 高效转化为产业真正认可的高质量 AI 生产力,它就像一个“AI 生产力商店”,持续赋能千行百业降本提效。

现场,夏立雪带来了覆盖文娱游戏、医疗健康、法律终端、能源电力等多个垂直行业的 Agentic Infra 行业解决方案。
在文娱游戏场景,无问芯穹携手 VAST 的 Tripo 3D 大模型联合打造了 AGENTIC 3D GAME GEN 解决方案,把分散的创意输入转化为可执行、可比较、可细化的 3D 模型输出,高效释放游戏内容生产力。
在医疗健康场景,无问芯穹服务上海瑞金医院算力及模型管理,助力医疗大模型及智能应用在运营管理、临床诊疗辅助、医学教育培训等场景的探索落地。
在法律终端场景,无问芯穹打造律师事务所专属 AI 合伙人——”律盾芯人“,与“段和段律师事务所、君合律师事务所、竞天公诚律师事务所、通商律师事务所”等行业私有化 AI 终端合作伙伴,以及“法义经纬、图灵法思”等生态合作伙伴一起,共同推动法律行业的智能化安全升级。
在能源电力场景,无问芯穹也正与南网能源一起深度探索基于智能体技术的智算中心能耗智能预测与协同调度解决方案。

基础设施自己本身也是个行业,无问芯穹已经在这个行业深耕多年,既积累了丰富的实践经验与技术,也拥有足够多的应用场景与需求。因此在支撑千行百业智能升级的另一面,无问芯穹也持续将智能体的能力应用到 AI Infra 本身,打造了一套基础设施智能体蜂群。
遵循“用智能体赋能基础设施,提升计算规模和智能效率”的核心目标,无问芯穹基础设施智能体蜂群目前已包含三个子集,对应在 AI 生产力转化、智能资源规模、Token 生产效率的三方面:面向用户的平台管家智能体系统、面向集群的运维智能体系统、以及面向芯片的算子生成智能体系统。
夏立雪提到:“我们不仅用 Agent 赋能资源规模扩展、提效 Token 生产,更致力于以 Agent 能力驱动整套 AI Infra 形成自主迭代、自我优化的闭环,让基础设施越用越强。”

平台管家智能体系统是整个基础设施智能体蜂群协同场景下的全局统筹者与用户入口,它有效降低了用户驾驭复杂系统的学习成本,通过自然语言交互,就能让智能体主动帮助用户操作平台、统筹 AI 基座,轻松高效完成复杂的资源运营、管理和答疑排障等工作,能够独立解决 80%日常问题,剩下 20%深度问题再转交对应垂类 Agent。

智算集群运维智能体系统是一个能够端到端地解决实际生产场景中的运维难题的 7×24 小时全天候值守的“运维专家团”,系统以运维主智能体为核心大脑,与故障排查智能体、环境部署智能体、故障处理智能体等协作运行,不仅可以完整执行一个集群的告警自动闭环处置任务,还能够“防患于未然”地规划周期性巡检任务,提前识别潜在隐患。让智算集群的运维从“人找问题”转变为“问题找人”,和“问题自己解决”。

经过大规模生产环境验证,这套系统的价值正在逐渐凸显:可实现运维人效提升 5 倍以上,关键故障处理效率提升 6 倍,不仅为大规模 GPU 训练与推理业务提供了更加稳定、高效的基础设施保障,也让运维人力能够被真正解放出来,聚焦更有价值的技术创新。

算子,是释放 AI 硬件性能的最后一公里,同时也是拉开基础设施效率差距的关键变量。目前,大模型已经能够快速产出算子,但“能跑通”不等于“能用好” ——要在生产环境中实现性能超越成熟推理引擎、达到工业级落地标准,难度依然极大。
无问芯穹高性能算子生成智能体系统 KernelMind,以算子生成主控智能体为调度中枢,联动多类专用智能体,通过“需求分析—智能调度—内核生成—沙箱验证—评审沉淀”五步闭环工作流,可在真实编译试错与知识沉淀中持续自迭代,稳定交付可直接落地的高质量工业级算子。
在 GLM5.2 模型的实测中,对比行业基线该系统在 NVIDIA 旗舰卡中实现了端到端 7.3%的性能提升,在 AMD 旗舰卡中更是带来了 39%的整体性能跃升,GEMM、Attention、Router 等各类核心算子性能均实现全面超越。

早在 2025 年,无问芯穹就已经在业内率先提出了 Agentic Infra 的范式变革。如今,Agentic Infra 支撑智能体规模化运行与持续进化的产业价值正在被不断验证。从概念到落地,无问芯穹始终坚持以硬核技术推动 Agentic Infra 走向真实业务场景。夏立雪提到:“我们的愿景始终清晰而坚定:通过 Agentic Infra,实现'用智能进化智能,用生产力加速生产力'。”

One More Thing:迈向物理世界
演讲最后,夏立雪将视野从云端的数字世界延伸至真实的物理世界。他提出:“在物理世界中,具身智能的 Scaling Law 同样需要高效率、大规模的基础设施支持。”
现场,无问芯穹公布了在具身智能领域的全新探索——首个面向大规模具身任务的云边端一体化管理与调度平台。该平台首次把云端 GPU 集群、边缘算力节点和机器人真机设备统一接入到一个平台中,支持训练、数据采集、评测和真机执行等多种具身任务统一编排运行,有效解决了具身训练中资源分散、跨集群协同困难、任务角色复杂、真机状态不可见、启动链路长的问题。

同时,针对具身智能的训练与推理部署两大核心环节,夏立雪宣布了无问芯穹两项重磅技术升级:面向具身智能的大规模真机强化学习训练框架 RLinf V0.3 ,以及面向机器人与端侧 AI 场景的全栈的推理优化体系 Mizar-Robo。
RLinf 在 V0.1 版本中实现了在仿真环境下渲训推一体化的强化学习;在 V0.2 版本中实现了像管理 GPU 一样管理真机设备;而 V0.3 版本的升级则新增支撑具身智能大规模真机、跨域端云协同的强化学习训练,支持具身智能的持续进化。

从实验室到产业,无问芯穹也与智元、清华大学携手深度探索了真机强化学习训练的技术与实践,攻克阻碍真机强化学习训练大规模落地的核心痛点与难点。通过首创的 HotSwarm 与端云协同训练模式,RLinf V0.3 可以支持真机设备 1000+次在线上下线,训练 0 中断,并成功实现近百台真机规模专线需求降至 2Gbps 以下,大幅拉低具身智能规模化训练的成本门槛。

Mizar-Robo 则依托流水线调度、算子内核、量化压缩、计算图四层协同优化,全方位释放端侧硬件潜力,大幅提升具身模型的部署效率,让具身智能即便在低功耗硬件上,也能实现连贯流畅、低延迟、长续航的高精动作交互。
在无问芯穹与自变量机器人 WALL-OSS 系列模型的联合优化部署中,在保持 WALL-OSS 原有任务成功率的前提下,实现了 7.14 倍的推理性能提升,经 Thor 平台实测,端侧推理时延从 500ms 压缩至 70ms,降幅达 86%。不仅保障了实时交互的流畅度与稳定性,也有效延长作业续航,为机器人产品从实验室走向规模化商用落地,提供了有力的基础设施支撑。

“让智能无所不能,是 AGI,而让智能无处不在,是 AGI Infra。”夏立雪在发布会的尾声中说道。“AI 无疑是目前世界上发展变化最快的行业,但我们的初心从未改变,就是做 AGI 时代最需要的 AI Infra。”

从“算力集散中心”做大资源总盘,到“ Token 工厂”深挖效率红利,再到“AI 生产力商店”循环造血向产业输出价值,乃至向物理世界 AI 的探索与实践,无问芯穹始终锚定“规模与效率”两大支点稳步向前。

“前店后厂一中心”的 Agentic Infra 体系 ,既是无问芯穹积淀多年的战略蓝图系统性落地,也代表着无问芯穹锚定 AGI 时代的长期方向:为未来数字与物理世界的所有 AI 生产力的运行构筑基础设施。
本文来源:InfoQ