云原生基础设施正成为可信代理式 AI 的基础
点击查看原文>
云原生计算基金会(CNCF)发布的一份最新技术分析报告指出,代理式 AI 未来并非建立在全新的基础设施之上,而是建立在已经为现代分布式应用程序提供支撑的成熟的云原生生态系统之上。该文借鉴了在 Kubernetes 上构建多代理网络安全平台的经验,认为 Kubernetes、OpenTelemetry、 Dapr、 SPIFFE、 Falco、 Kafka 和 GitOps 等技术共同提供了自主 AI 系统所需的许多能力,包括编排、可观测性、工作负载身份识别、安全性、弹性及治理。
作者认为,与其将 AI 代理视为一种全新的架构范式,不如从本质上将其视为具备额外推理能力的分布式系统。随着企业从实验性的 AI 助手转向能够调用工具、与其他代理协作并做出运营决策的自主代理,他们所面临的运营挑战变得格外熟悉:保障身份安全、协调长期运行的工作流、管理状态、确保可观测性以及从故障中恢复。按照 CNCF 的说法,这正是云原生生态系统过去十年中致力解决的问题。
本文重点介绍了基于 Kubernetes 的多代理安全平台的开发。该平台旨在检测和应对运行时威胁。它将多种云原生技术整合到了一个集成架构中,其中每个组件都承担着特定的角色。
这些 AI 代理并非是要取代传统安全工具,而是基于现有的云原生基础架构而构建。从中可以看出,可以通过智能决策来扩展现有的运维平台,而非从头重写。
作者认为,随着多代理系统日益复杂,基础设施方面的问题变得愈发重要。代理可能运行数小时甚至数天,与众多外部服务进行协调,调用多种工具,并在分布式环境中与其他代理协作。Kubernetes 提供了支持这些复杂执行模式所需的弹性与编排能力,同时可以在混合云和多云部署中保持运维一致性。
该文还强调,可观测性是生产级 AI 系统的关键要求之一。与传统应用程序不同,AI 代理会做出概率性决策、调用外部工具,并动态适应不断变化的上下文。这使得对其进行监控和故障排查的难度大大增加。
OpenTelemetry 等云原生可观测技术正变得至关重要,不仅可以用于追踪服务交互,还可以用于追踪推理路径、工具调用、执行上下文以及多代理协作。可观测性不能仅停留在测量延迟或吞吐量上,而是必须进一步发展,以便可以解释代理为何做出特定的决策,以及该决策如何在更广泛的系统中进行传播。
本文贯穿始终的另一个重要主题是安全性。随着 AI 代理越来越多地访问敏感系统、API 和业务流程,加强工作负载身份验证变得至关重要。作者以 SPIFFE 和 SPIRE 等项目为例,说明云原生身份框架如何为自主工作负载提供可通过密码学验证的身份。
这里所强调的观点与业界为构建 AI 系统可信执行环境所做的广泛努力是一致的。近期的一些举措,包括 Dapr 1.18 的可验证执行功能以及 Linux 基金会发起的 Akrites 安全计划,都反映出业界日益认识到了这个问题:未来的 AI 系统不仅必须能够证明其做出了哪些决策,还必须能够证明决策者是谁、依据何种权限做出决策,以及执行这些决策的历史记录是否完整。
这篇文章反映了云原生生态系统中一个日益明显的趋势:最初为微服务开发的技术正迅速被应用于 AI 工作负载。
更深层的启示是,成功的代理式 AI 与其说依赖于日益强大的模型,不如说更依赖于严谨的系统工程。随着企业从聊天机器人迈向自主工作流,限制因素也从模型智能转向了运营可靠性。
原文链接:https://www.infoq.com/news/2026/07/cncf-trustworthy-agentic-ai/
本文来源:InfoQ