《云上Agent基准度量模型》正式发布,腾讯云推动云上Agent安全、稳定、可信

2026-07-30 16:18:32
来源:中国日报网

7月29日,在2026可信云大会暨首届Token云服务大会上,《云上Agent基准度量模型》正式发布。腾讯旗下WorkBuddy、CloudQ、AndonQ、MigraQ等产品首批通过了基准认证。

《度量模型》由中国信息通信研究院牵头起草,云计算开源产业联盟发布为技术文件,中国通信标准化协会提出并归口。腾讯云以丰富的Agent产品经验参与模型编制,构建统一的云上Agent度量评估框架。

建立统一度量框架,引入“双重授权”,为Agent设置可控边界

《云上Agent基准度量模型》标准从功能性、安全性、可靠性、用户体验、性能效率和成本效益六个维度,对云上Agent运行表现进行度量,覆盖单智能体和多智能体任务成功率、意图识别准确率、提示词注入防御率、工具滥用率、隐私数据输出率、记忆串扰率、行为可追溯率等指标。在度量范围方面,延伸至Agent决策、工具调用、任务执行和异常处置等运行链路,推动Agent从“能完成任务”进一步走向“可稳定运行、可持续评估”。

在上述六维度度量框架中,如何为自动化操作设定可控边界,是《度量模型》重点回答的问题之一。《度量模型》中针对智能体工具调用提出建议,对于影响范围较广的自动化操作,要求在关键环节增加人工二次确认,明确智能体需要遵守被调用工具的平台规则、安全策略和数据使用政策,禁止未授权的操作及截屏录屏等敏感行为,并通过“人类批准依赖度分层”等指标,对不同任务类型所需的人工确认比例进行度量。

这一设计并非简单限制Agent自主执行,而是按照业务影响范围设置不同的人机协作边界:核心级操作强调关键环节确认、重要级操作可根据风险保留必要的人为介入、一般级操作则可在可控范围内提高自动化程度。而提高自动化程度的同时,也需要遵守政策、规则与策略,避免影响第三方工具的权益,更好地为用户提供智能体服务。《度量模型》同时通过任务中止正确率、任务中止恰当率、升级求助恰当率、行为可追溯率和行为可控率等指标,评价Agent是否能够在应当停止、求助或请求确认时作出合理决策。

由此,《度量模型》中的人工监督从原则性要求进一步转化为可分级、可度量的运行机制,有助于降低Agent因误判或越权操作带来的风险,也为金融、政务、云运维等对操作安全要求较高的场景提供更明确的建设参考。

沉淀多场景Agent安全实践,腾讯云以产品能力推动标准共建

2026年上半年,AI Agent的产品形态与应用边界快速变化。腾讯从轻量云部署OpenClaw起步,持续迭代产品矩阵:面向个人场景推出QClaw、WorkBuddy;面向云运维垂直场景上线CloudQ、AndonQ、MigraQ;面向企业客户提供ADP与ClawPro,逐步形成覆盖个人开发者、垂直行业、企业级客户的完整Agent产品体系。在产品成长的同时,Agent开发、使用、管理、运维过程中的安全性也是腾讯的核心关注。

7月8日,中国信通院发布首批互联网智能体治理系列评估结果,腾讯云WorkBuddy、QClaw、ClawPro、轻量云OpenClaw、云桌面云手机Claw五款产品通过能力评估,腾讯统一身份OneID通过可信互联握手(ATH)能力评估。围绕Agent运行安全,腾讯先后推出AI Agent安全中心、Agent安全网关等产品,从运行时防护、技能分发、身份管控到企业级管控,为Agent产品提供安全保障。

以WorkBuddy为例,系统架构层面支持多种权限模式,配备安全中心和安全沙箱,可结合操作意图识别拦截高危操作;针对第三方Skill等运行风险,构建覆盖“入口拦、运行检、兜底断”的多层防护体系,第三方Skill须通过安全检测后方可启用;数据安全方面采用全链路TLS加密和最小权限原则,并接入腾讯统一身份OneID实现身份与权限管控。

基于这些实践,腾讯云参与《度量模型》编制,为云上Agent稳定、安全运行的度量指标、评估方法和技术要求等提供了丰富建议和实践指引。

  编辑:瞿凯侠