AI安全公司Goodfire推「由内而外」监控器,实时捕捉失控智能体
专注AI可解释性的旧金山创企Goodfire于10月8日发布一套新型智能体监控器,核心思路是「由内而外」(inside-out):不再花钱请第二个模型逐字审查智能体的每一步输出,而是直接读取模型运行时的内部激活状态,只有在探针标记异常时才升级处理。系统已向AI模型托管平台Baseten的客户开放。

Goodfire将这套机制类比为机场安检:名为probe的小型探测器在智能体工作的每一步读取模型内部信号,只有标记可疑时才触发更强的模型或人工复核。企业客户可自行选择监控的风险类型,包括攻击性黑客行为、化学与生物武器滥用、以及奖励黑客(reward hacking);并决定自动响应方式——记录事件、转人工复核或直接拒绝请求。联合创始人兼CTO Dan Balsam表示,在模型「动手之前」就捕捉异常,是这套方案相较事后审查的关键优势。

成本与效果是最大卖点。Goodfire称,在开源模型Kimi K3上监测约100万次交互,总费用约185美元,而用较便宜的模型全程复查需5420美元、用顶级模型则高达约20万美元;探针在测试中捕捉到93%至94%的恶意黑客会话,误报率约5.5%,同时运行多个探针仅让模型响应起始时间增加不到2%。对开源模型尤其有价值——开发者可下载并剥离其安全护栏,推理时的监控因而成为必要防线。这也呼应了近期多家公司发起的网络安全防御计划,以及围绕失控智能体的多起真实事件。
Goodfire并非新面孔,公司2024年由Eric Ho、Daniel Balsam与Tom McGrath创立,2026年2月完成1.5亿美元B轮融资,投资方包括Menlo Ventures、Lightspeed与Eric Schmidt,早前产品Ember已提供机制可解释性的研究接口。此次监控器是相关研究首次转化为可运营的AI安全产品,而非仅研究工具。随着企业把智能体从聊天机器人推向能自主订票、写代码、管理流程的系统,廉价且持续的监督正从「试点」变为「必选项」,可解释性工程也开始从学术走向生产。
读者评论 (0)
想参与讨论?请 登录 后发表评论。
还没有评论,欢迎抢沙发!