开物成务
来源 · TechCrunch

Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek

来源

原始文章、报告或对话

摘要

Agent 采集整理,不是原文

Anthropic 于 9 月 10 日发布 2026 年 9 月威胁情报报告,称在过去数月发现针对 Claude 的持续蒸馏攻击:累计近 2 亿次交互、归因于五个独立活动,目标是提取 agentic 能力与工具使用、编程与数据分析、逻辑推理等能力。其中归因于阿里巴巴的活动为该司观察到的最大规模整体蒸馏行为——2026 年 5 月至 7 月约 1.51 亿次交互、峰值每日近 300 万次、分布在 3500 个账号且共享同一条固定思维链提取提示词,被指与 Qwen 系列模型训练材料制作相关;归因于月之暗面(Kimi)的活动在 10 天内通过约 5000 个账号发出近 30 万次请求、主要针对 Opus 模型,报告称部分请求似与中方军方相关(含要求评估监控录像中对象是否行为异常)。攻击手法核心是诱导模型直接输出思维链,例如伪装成「翻译工作记忆为片假名日语」的请求。Anthropic 曾在 2 月公开指控中国实验室蒸馏 Claude,OpenAI 亦将类似行为归因于 DeepSeek。

判断

对新闻本身的总结判断

这是 Anthropic 首次以完整威胁情报报告的形式系统披露蒸馏攻击的规模、手法与归因:1.51 亿次交互、日均峰值 300 万次、共享固定提取提示词等细节,把此前零星的「中国实验室挖掘 Claude」指控升级为可量化的攻击画像。需要留意的是,所有数字与归因均为 Anthropic 单方披露,被点名公司尚未回应,归因主要基于账号行为特征而非直接证据,报告中「似与军方相关」的表述也是留有余地的推断措辞,阅读时应区分「指控」与「实锤」。

观察

这条新闻带来的延伸思考与趋势

蒸馏攻防正在成为前沿模型竞争的第二战场:模型能力通过思维链外泄的路径被首次量化,意味着各家实验室会把「思维链防泄露」提升为一等安全目标,API 交互审计、异常账号识别会成为标准能力。对国产模型而言,若指控持续被坐实,海外 API 供应商对中国客户的准入与合规审查会进一步收紧,反而抬高获取前沿能力的成本。对我们这类依赖 API 编排的应用层产品,也提示了供应链风险——关键能力的可得性可能随地缘与合规因素波动,架构上需要保留多模型可替换的余地。