模型开放之后,AI能力为什么仍难以复用?
点击查看原文>
近年来,中国积极推动人工智能开源开放,全球 AI 开源生态也在持续发展。开放模型、开发工具和技术框架不断丰富,降低了技术应用门槛,让更多开发者能够基于已有成果开展创新。
然而,随着 AI 从模型能力展示走向企业业务、科学研究和物理世界,开源生态面临的问题也在发生变化:模型可以下载,不代表系统能够复现;代码公开,不意味着能力可以直接调用;Demo 能够运行,也不代表可以迁移到不同场景。
AI 开源的价值,正在从“开放了什么”,进一步转向“开放的能力能否被验证、复用和持续迭代”。
一、从代码开放到能力复用,AI 开源的评价标准正在变化
AI 系统的运行不仅依赖代码,还受到模型、数据、提示词和外部工具等多重因素影响。
一个 AI 项目可能同时依赖模型权重、数据处理流程、工具接口、运行环境和硬件配置。对于 Agent 系统,还涉及任务规划、状态管理、异常恢复和权限控制。这些要素相互关联,底层模型更换,可能改变 Agent 的执行行为;工具接口升级,可能使原有工作流失效;环境配置缺失,则可能导致项目无法复现。
因此,AI 技术复用不只是复制代码,还需要明确组件依赖、接口规范和运行条件。这也使开源项目的评价维度进一步扩展。
GitHub Star、下载量和 Benchmark 能够反映项目关注度、使用情况及特定测试条件下的性能,却难以完整衡量技术成果的可复用程度。文档完整性、环境可复现性、接口稳定性,以及第三方独立部署能力,正在成为重要的补充指标。
2026 年世界人工智能开源大赛(GOAI)提供了一个观察样本。大赛覆盖 91 个国家和地区,吸引超过 1.4 万名开发者参与,收到 2999 份有效初赛作品,最终 70 个项目进入总决赛。
在「新智基座 Agent Infra」和「无界应用 Boundless Agents」赛道中,多 Agent 协作、Skill 调用、状态传递和任务闭环成为重要的工程考察内容。
对企业级 Agent 而言,完成一次数据查询只是基础。更复杂的要求是让多个 Agent 协同执行任务,在数据缺失、工具调用失败或任务中断时具备恢复能力,并最终交付可检查的结果。
这类任务表明,当 AI 从单次交互走向复杂任务执行,能力能否被清晰封装、稳定调用和跨场景迁移,正在成为评价 AI 系统的重要维度。
二、从单个模型到能力组件,AI 创新形成模块化协作链
AI 开源的变化,也体现在技术系统的组织方式上。
一个完整的智能系统,可以由模型、Agent 框架、Skill、外部工具、数据处理模块和评测工具共同组成。不同团队开发的组件通过接口集成,使开发者能够在已有成果之上构建应用,而不必重复开发整套技术栈。这一趋势已体现在全球开源基础设施建设中。
2025 年 12 月,Linux Foundation 宣布成立 Agentic AI Foundation(AAIF),将 MCP、goose 和 AGENTS.md 等项目纳入开放协作体系,推动 Agent 相关协议、工具与基础设施的社区共建。其中,MCP 为 AI 应用连接外部工具和数据源提供了标准化接口,有助于降低系统集成成本。
与此同时,Open Source Initiative(OSI)发布的《Open Source AI Definition 1.0》提出,开源 AI 应保障使用、研究、修改和分享系统的自由。为实现这些自由,开放内容不仅涉及模型参数和相关代码,还包括充分的训练数据信息。
两项进展分别回应了 AI 开源的不同问题:前者关注系统之间如何连接,后者明确开放所应具备的权利和技术条件。
从实际开发看,模块化协作链正在形成。一个 AI 产品可以使用开放模型提供基础能力,借助 Agent 框架组织任务,通过 MCP Server 连接业务工具,再调用符合接口要求的 Skill 完成特定操作,并利用评测工具检验运行效果。
例如,数据治理 Skill 可以封装特定处理流程,供符合调用条件的 Agent 使用;公开评测框架可以帮助多个团队采用相同测试方法;机器人仿真环境则能够支持不同算法的开发与比较。
但组件能够连接,并不意味着能力可以直接复用。不同 Skill 可能采用不同的调用规范,工具接口需要维护兼容性,数据和模型也可能受到许可证及使用条件限制。即使源码完整公开,项目仍可能因模块高度耦合、依赖缺失或运行条件不明确而难以复用;部分组件即使能够通过稳定接口实现集成,也不意味着整个项目符合开源定义。
开放程度与复用能力相互关联,却不能混为一谈。
三、从结果展示到过程验证,AI 开源需要新的评测体系
能力可以被调用,并不代表其表现已经得到充分验证。
AI 系统具有一定的概率性,同样的任务在不同模型、输入和环境下,可能产生不同结果。尤其对于需要连续决策和工具调用的 Agent,单次任务成功难以说明系统的稳定性。行业评测正在从最终输出延伸至完整执行过程。
2026 年 1 月,Anthropic 在 Agent 评测技术文章中指出,智能体会在多轮任务中持续调用工具、改变环境状态,并根据中间结果调整行为。相比单次输出评测,Agent 评测需要关注完整执行轨迹,并通过重复测试提高结果的可靠性。
OpenAI Agents SDK 则提供工作流追踪功能,记录模型生成、工具调用、智能体交接和护栏检查等执行事件,为系统调试、运行监测和后续评测提供依据。
这意味着,判断 Agent 是否可靠,不能只看任务最终有没有完成,还需要检查工具选择、执行路径、状态变化和异常处理是否符合预期。在科研和具身智能领域,验证要求更加具体。
科研模型的预测结果,需要结合数据来源、实验条件、评价方法和科学意义进行判断。机器人算法则必须面对仿真与真实环境之间的差异,检验其在不同设备、地形和任务条件下的表现。
GOAI「前沿探索 AI for Research」和「具身未来 Embodied Future」赛道,分别呈现了这两类问题。
前沿探索赛道设置算法赛题与开放探索赛题,既关注量化指标,也重视科学问题的定义、研究方法和结果的可检验性,并允许具有研究价值的负结果。
具身未来赛道则围绕双臂协作操作和全地形巡逻设置任务,将仿真评测与真实设备测试结合,考察机器人在实际环境中的执行能力。
两类技术的评价方式不同,却有共同要求:不仅要展示结果,还要明确结果成立的条件、验证方法和适用边界。 这也意味着,值得沉淀的开源资产不只有模型和代码,还包括数据版本、评测脚本、运行轨迹、实验记录、对照方法和仿真环境。
对于科研项目,一项未能验证预期假设的实验,如果记录完整、方法可靠,同样能够帮助其他研究者识别技术边界。对于工程项目,公开测试条件和失败案例,则有助于开发者判断组件是否适用于自身场景。
从代码可获取到系统可验证,正在成为 AI 开源质量提升的重要方向。
四、从项目开放到公共技术层,AI 开源面临新的治理挑战
随着 AI 系统日益依赖多种组件协同运行,如何保障技术成果的长期可用,成为开源生态面临的重要课题。
技术成果发布之后,接口能否保持兼容、版本更新是否影响现有应用、安全漏洞能否及时修复、社区能否持续维护,都直接关系到项目的长期价值。
Linux、Kubernetes 等成熟开源项目的经验表明,技术开放只是起点,持续维护与社区协作才是开源成果长期发挥价值的重要保障。 对于 AI 开源而言,仅有单个项目的开放还不够,还需要逐步形成由开放协议、可复用组件和公共评测工具支撑的共同技术基础,并完善相应的维护与协作机制,为技术成果的持续复用创造条件。
杭州拥有数字经济产业基础、科技企业集群、开发者生态和丰富的应用场景,为 AI 开源技术的开发、验证与应用提供了良好条件。以 2026 年世界人工智能开源大赛(GOAI)为纽带,杭州进一步连接全球开发者、开源社区与产业资源,推动技术交流、成果展示和应用需求对接。如何将赛事汇聚的创新成果转化为可持续复用的技术资产,将是杭州深化 AI 开源生态建设的重要课题。
这也呼应了 GOAI 倡导的“Open. Share. Build.”理念:开放让技术得以共享,共建让创新得以延续。
五、结语
过去几年,AI 开源让更多开发者获得了模型能力。下一阶段,关键不仅在于开放更多技术成果,更在于让已有成果能够被验证、复用和持续迭代,成为后来者创新的基础。
Open 只是把门打开。一个开放生态真正成熟的标志,是让后来者能够从这里继续向前。
本文来源:InfoQ