昨天,Anthropic发布了迄今为止最详尽的威胁情报报告。内容涵盖了人们如何试图滥用 Claude——用于网络攻击、影响力行动、监控、生物学以及制造武器,以及其如何发现并阻止了他们。
内容劲爆,篇幅过长,加上合规考虑,小编难以完全披露。
具体可查询 https://www.anthropic.com/threat-intelligence-report-september-2026
![]()
这其中,有个编号为 GTG-15001 的“杀猪盘”案例,让人大跌眼镜,特作分享。
这家位于中国的App工作室,运营着一个由20多款约会App组成的网络,用 Claude 模拟妹子,去海外“崩老头”。”
Anthropic在2026年4月连续两周的调查中发现,这个网络中存在超过 4700个不同的AI人格,至少与 2.5万名不同用户进行过交流。
仅在这两周内,Claude就处理了大约 236万条消息。
这些AI人格并不是单独存在的。运营方把AI和真人同时放进约会App的匹配池中,用户无法知道自己匹配到的究竟是AI还是真人。
Anthropic估计,AI与真人的比例大约为 3∶1。
真人工作人员主要承担AI难以完成的互动,例如实时视频通话,以及在社交媒体上回关用户。真人工作人员与用户交流时,也会获得另一个AI模型提供的候选回复。
具体来说,当真人工作人员与用户匹配后,另一个较小的模型会生成3条候选回复,工作人员从中选择一条发送。工作人员还会因为发送消息、进行视频通话以及在社交媒体上回关用户等行为获得报酬。
与此同时,Claude负责大规模、持续地与用户聊天。
运营方通过系统提示词要求Claude始终维持设定好的AI人格,并明确要求它不要透露自己是自动化程序。对于用户提出的视频通话和照片要求,Claude会进行回避,并按照预设的聊天阶段推进交流。
后台系统还会生成虚假的点赞和访客,在没有真人可以互动时提供视频内容,同时追踪哪些用户已经开始怀疑自己是在与机器人聊天。
![]()
这套系统并不是只使用一个AI模型。
Anthropic发现,Claude主要负责AI人格与用户之间的自动化聊天;另一个模型负责为真人工作人员生成回复建议,同时进行人脸吸引力评分以及照片、声音审核;另一个图像编辑模型则负责生成AI人格使用的头像。
Anthropic还发现,这些App本身采用了多种方式规避应用商店审核。
例如,其中一个UI控制器只有在App接受应用商店审核时才会启动,平时处于休眠状态。20多款App的不同版本还使用不同的class name,以降低被识别为同一套App网络的可能性。
App内部还设置了浏览器,可以将支付流程导向第三方支付处理商,而且支付功能可以通过服务器远程配置,在审核期间隐藏。
Anthropic还发现,这个团队大量使用中国大陆的API转售商和代理基础设施,以获得和轮换AI模型的访问权限。
在调查过程中,Anthropic还抽取了一部分聊天记录进行分析。报告称,相关系统提示词能够让Claude在几乎所有被抽样的对话中维持设定的人格。
报告同时提到,在少量案例中,Claude的推理过程显示,它意识到了用户可能面临潜在伤害。
例如,有用户透露自己患有严重疾病,或者处于严重的情绪困境。但在这些情况下,Claude仍继续按照设定的人格进行交流。
Anthropic随后封禁了与这一行动有关的账户和组织,并将相关调查结果与其他AI实验室等行业合作伙伴分享,以阻断相关运营者继续使用多个AI模型。
报告还列出了与这一网络相关的一些基础设施和App信息,包括 heyhru.com、archat.us、sitin.ai 等网站,以及DORA、DONI、ROMI、LUMA、JOVIA、KIRA、GRACECHAT、HAVEN、NALO、LOVIA等约会App品牌。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.