企业 AI 安全并非单一控制措施。员工在浏览器中使用公共聊天机器人,开发人员通过 API 调用模型,智能体则将模型连接至业务工具和数据。每条路径都会形成身份、目的地、信息、权限和响应时间风险的不同组合。一个平台可能拥有很长的功能清单,却仍让重要流量不可见,或使获批工作慢到无法使用。

因此,稳健的评估应从组织的 AI 流程开始,而不是从供应商类别或营收叙事开始。目标是确定平台能否发现真实使用情况、执行精确的数据规则、约束自动化操作,并产出安全与运营团队可以信赖的证据。商业势头可能表明供应商能够持续投资,但它并不能证明这些控制措施在你的环境中有效。

在安排演示前定义决策

撰写一份简短评估说明,列明范围内的用户、应用程序、模型、智能体、数据类别和网络路径。将获批准服务与未知或个人账户分开。无论浏览器会话、模型 API、私有托管模型以及模型上下文协议(MCP)等智能体连接出现在哪里,都应纳入其中。

随后说明重要的结果。一份实用说明可能要求:可见未获批准的 AI、防止敏感内容上传、对 API 流量执行策略、限制智能体工具访问、提供有用的调查日志,以及来自主要办公室的可接受延迟。为每项结果指定负责人。否则,网络、身份、数据安全、应用安全和 AI 平台团队可能会以互不兼容的标准评判同一场演示。

不要让产品名称定义需求。例如,Netskope 描述了 AI 使用可见性、流量检查、智能体和 MCP 治理、与提示词相关的防护栏、模型测试以及数据安全管理等独立能力。这些类别可作为需求地图的有用提示,但它们的存在并不能证明覆盖范围、准确性或运营适配性。将每项承诺的能力转化为可观察的测试。

建立 AI 流量和影子使用清单

发现是第一道门槛,因为策略无法保护平台看不到的流量。要求每个供应商展示它如何在浏览器和 API 活动中识别 AI 服务、区分企业账户和个人账户、将活动关联到用户或工作负载,以及如何处理新出现的服务。检查可见性是否依赖某个特定端点代理、浏览器配置、代理路径或集成。

影子使用的规模可能很大。Netskope 在其 2026 年云与威胁报告中表示,在其观察的平均组织中,生成式 AI 用户数量增长了三倍,而提示词量从每月 3,000 条升至 18,000 条。它还报告称,47% 的生成式 AI 用户访问了个人 AI 应用。这些是供应商制作的观察结果,因此应当用于指导测试设计,而不是取代你自己的基线。

在开启广泛拦截前,先在具有代表性的试点群体中运行发现。将平台清单与身份日志、获批准应用列表和已知开发人员集成进行比较。调查无法解释的缺口和重复项。有用的清单应能回答:谁通过什么路径、使用何种账户类型使用了哪项服务,以及是否涉及敏感信息。仅统计 AI 域名数量并不够。

将数据保护测试为一连串决策

AI 数据控制应结合身份、数据分类、目的地、模型或应用上下文以及请求的操作。笼统的允许或拦截规则或许能阻止明显上传,但它无法区分获批员工总结公开材料与同一人将客户记录发送到个人账户。

创建反映实际业务信息的测试集:源代码、销售记录、客户电子表格和无害的公开文本,都是源材料支持的示例。对每个项目,测试允许和禁止的目的地、受管理和个人账户、浏览器和 API 路径,以及复制粘贴和文件上传行为。记录平台是拦截、警告、引导、脱敏,还是仅记录该事件。

衡量误报,也衡量漏报。阻断普通获批工作的规则会鼓励绕过,而只检测完全匹配字符串的规则可能会漏掉经转换的内容。Netskope 报告称,平均每个组织每月发生 223 起生成式 AI 数据策略违规事件,并表示一半观察到的组织缺乏适用于生成式 AI 应用的可执行数据保护策略。这些数字说明了可执行性为何重要,而不是任何特定产品对你的数据会有多准确。

要求提供解释决策的审计轨迹:行为主体、服务、数据类别、匹配的策略、采取的操作和时间。安全团队应能在不依赖供应商专家的情况下重建事件。这些记录的保留和访问应符合组织的调查与合规需求。

将智能体和 MCP 视为特权活动

智能体可以重复操作,并在没有人审查每笔交易的情况下访问多个系统。如果它能访问电子邮件、云存储和客户系统,一项过度权限或被攻破的指令可能会暴露比单次误用聊天机器人提示词更多的信息。因此,智能体安全必须覆盖身份、工具权限、数据检索、对外操作和日志,而不仅是发送给模型的文本。

询问平台是否能识别智能体及其负责的人或服务、枚举 MCP 服务器和工具,并对读取数据与变更系统应用不同策略。测试一个请求超出其角色的信息、调用未获批准工具或试图将受保护数据发送至外部服务的智能体。确认当模型、工具、认证方法或服务器端点变化时,控制措施是否仍然有效。

提示词注入和越狱防御是有用的层次,但不应被视为确定性的安全边界。源材料指出,有害指令可能通过文档、网页、工具响应或检索内容到达。你的架构仍应使用最小权限、交易日志、对后果重大操作的审批门槛,以及禁用被攻破集成的方法。评估平台是否支持这些层次,或能否与支持这些层次的系统干净集成。

在真实路径和工作负载下基准测试延迟

检查会改变流量路径,因此必须一起测试安全效力和用户体验。定义具有代表性的地点、服务提供商、负载大小、并发级别以及浏览器和 API 工作流。在有和没有控制路径时,测量响应开始时间、令牌传送、丢包、抖动、错误率和总任务时间。包括稳定使用期和繁忙时段。

供应商的最佳情况数字不是服务保证。Netskope 表示,其 AI Fast Path 在公司测试中将通向特定 AI 目的地的延迟最多降低了 90%。该结果可能与候选名单有关,但“最多”描述的是观察到的最佳结果。实际性能取决于地点、原始路径、应用、模型提供商、流量模式和现有网络设计。

在试点前设定验收阈值,并分别评估每个地点。有吸引力的全球平均值可能掩盖某个变得无法使用的办公室或工作负载。还要测试故障行为:当检查点、私有网络路径或模型目的地受损时会发生什么?平台应按你的风险策略要求的方式失败,并产生足够的遥测数据来诊断事件。

要求运营证据,而非精致的仪表盘

生产平台必须帮助团队在演示结束后运营控制措施。给评估人员布置现实任务:发现一项新的 AI 服务、创建数据规则、调查被拦截事件、豁免有正当理由的工作流、追踪智能体交易,以及导出证据。记录每项任务所需的时间、权限和供应商协助。

要求证明作为一个平台销售的产品之间策略行为一致。通用界面不一定意味着共享身份、策略语义、日志或执行。检查与已在使用的身份、数据、网络和事件工作流的集成。确定策略变更如何审查、部署、回滚和审计。

试点主张应通过清晰的证据级别逐步升级:演示、受控展示、概念验证、有限生产和广泛生产。早期客户兴趣或概念验证几乎无法说明它在复杂身份、敏感存储库、地理路由和业务关键工作流中的运行情况。对承载最高风险的用例,要求提供经测量的生产证据。

将供应商耐久性与控制效力分开

财务审查属于采购环节,但它回答的是不同的问题。营收增长、年度经常性收入、客户数量和产品采用情况可以表明商业规模。调整后利润率改善可能表明运营杠杆。这些指标都不能证明检测准确性、策略质量、延迟或事件响应。

该来源季度说明了这种区别。Netskope 报告营收为 2.21 亿美元,同比增长 29%,年度经常性收入为 8.99 亿美元。它表示 59% 的客户使用至少四种产品。但其 SEC 文件也显示,基于美元的净留存率为 114%,低于 118%;公司报告 GAAP 运营亏损 8,980 万美元,自由现金流为负 2,980 万美元。其调整后运营利润率有所改善,但调整后结果排除了包括股权薪酬、相关税项、收购无形资产摊销和重组费用在内的项目。

仅使用这些数字评估供应商韧性、投资能力和合同风险。应一并审查已确认营收、留存、剩余义务、现金流、已报告亏损以及非 GAAP 指标背后的定义。供应商没有隔离该影响或披露 AI 专属经常性收入时,不要推断 AI 产品导致了利润率变化。

竞争同样重要,因为相邻安全供应商可以将 AI 控制捆绑到既有的访问、数据、端点或网络关系中。Zscaler 报告 2026 财年第四季度年度经常性收入为 37.71 亿美元,并宣传了重叠的 AI 和智能体安全能力。期间和产品组合并不相同,但这种比较强化了一项采购原则:除技术结果外,还要评估转换成本、集成深度、支持和合同整合。

实用评估清单

使用此清单,将候选名单转化为可辩护的决策:

  • 在给产品评分前,绘制获批准、未获批准、个人账户、浏览器、API、私有模型、智能体和 MCP 流量。
  • 为发现、数据保护、智能体控制、延迟、调查和故障行为定义负责人及通过标准。
  • 验证发现的活动能解析为有意义的人或工作负载身份及账户类型。
  • 在获批准和禁止的目的地中测试敏感和无害数据,包括浏览器和 API 路径。
  • 衡量误报、漏报、决策清晰度以及调整策略所需的运营工作量。
  • 测试智能体身份、最小权限工具访问、读写控制、审批门槛和交易日志。
  • 对具有代表性的地点和工作负载进行基准测试;不要接受最佳情况下的延迟百分比作为基线。
  • 与将运营平台的团队一起运行调查、例外、回滚、导出和中断演练。
  • 在每张评分卡中区分演示、概念验证、有限生产和广泛生产证据。
  • 使用已报告和调整后指标,一起审查供应商财务状况和竞争地位,并将其与安全效力区分开。
  • 记录未覆盖流程、接受的剩余风险、依赖关系、退出成本以及续约所需的证据。

最强的选择并不必然是拥有最多 AI 品牌模块的平台,或增长最快的供应商。它应能以可接受的性能成本,对你的真实流量、数据、智能体和运营展示可靠控制,并在部署后持续产出该证据。

我们的编辑方法

我们会结合一手资料、产品文档与实际使用场景,帮助你更清楚地判断工具是否适合你的工作流。

参考来源

浏览工具目录