介绍 CAIRN:面向”AI 集成型恶意软件”的前沿追踪-RadeBit瑞安全

以元数据为先的架构

CAIRN 完全基于元数据运作——无需下载或执行二进制文件。它结合了基于规则的检测、语义聚类和关系图遍历,通过认知制品来识别 AI 集成型恶意软件,这些制品包括:内嵌的提示词、服务商端点、编排逻辑、API 密钥前缀,以及规避 AI 分析的字符串。

CAIRN 通过多达 24 个获取过滤器(acquisition filters)来发现候选样本,每个过滤器针对一种不同类型的 AI 相关制品。这些过滤器不只依赖文件名或哈希,而是跨元数据进行搜索,包括提取出的字符串、沙箱行为和杀毒软件(AV)的检测标签。

  • provider-api-integration:在文件元数据中搜索 LLM 服务商端点字符串。例如:
    • api.openai.com
    • api.anthropic.com
    • api.deepseek.com
    • Generativelanguage.googleapis.com 只要某文件的二进制内容、URL 提取或沙箱行为中出现上述任一域名,它就会成为候选样本。
  • python-ai-scripts:针对匹配 AI 框架导入模式的 Python 文件。例如:
    • langchain
    • litellm
    • openai 这会把那些在代码层面(而不仅是网络层面)与 AI 生态交互的脚本纳入进来。
  • ai-analysis-evasion:搜索明确写给 AI 分析系统的文本字符串——就是攻击者想告诉某个 LLM 沙箱"这里没什么可看的"时会内嵌的那类注释。
  • local-llm-runtime:搜索表明本地模型推理的字符串(ollama、llama.cpp、vllm、gguf、safetensors)。这会暴露那些可能在端点本地做推理、而非调用托管 API 的文件。
  • agentic-tooling:查找与进攻性能力术语共同出现的工具调用语法(tool_call、tool_calls、function_call)。

获取过滤器的结果会存入一个 SQLite 语料库(corpus),导入时自动运行 YARA,并采用三层本体(ontology):

  • 第 1 层(T1)原始 AI 制品(例如 API 端点、工具调用语法)——确立"存在 AI 相关制品"这一事实。
  • 第 2 层(T2)行为上下文(例如 AI 分析规避、已知 C2 方法)——通过识别那些暗示 AI 被投入实战使用的制品组合,补充行为上下文。
  • 第 3 层(T3)运营家族(已命名的、启用 AI 的恶意软件家族)——使用已确认的运营指纹进行家族归因。

使用 CAIRN 的分析方法

CAIRN 配有详尽的 CLI,既适合分析师使用,也适合作为由 agent 驱动的工作流。随附发布的技能(skills)在使用 agent 时支持一套标准化的报告结构。

CAIRN 使用四种不同的分析策略,各自适用于调查的不同阶段。实践中,一次狩猎会话会综合运用其中几种:用"面扩展"发现未知项,用"枢轴(pivoting)"梳理相关关系,再用"语料分析"从已收集的内容中找出结构。

1. 用获取过滤器扩展样本语料库

用获取过滤器发现此前未见的样本。这类狩猎会产生候选样本,并把它们引入 CAIRN 数据库。

介绍 CAIRN:面向”AI 集成型恶意软件”的前沿追踪-RadeBit瑞安全

2. 基于关系的枢轴(pivoting)

一旦识别出一个感兴趣的样本,CAIRN 会沿元数据关系图向外扩展,识别相关的恶意软件、共享的基础设施,以及与同一攻击活动相关的其他制品。

这些关系能帮助分析师回答诸如以下问题:

  • 这个恶意软件家族是否还有其他变种?
  • 这个恶意软件与其他样本共享了哪些基础设施(例如域名、IP、证书、C2 服务器)?
  • 哪些加载器、伴随载荷或相邻恶意软件属于同一攻击活动?

顺着这些连接,分析师可以超越单个样本,开始重建其背后更宏观的运营生态。

3. 基于 YARA 的分诊与分类

CAIRN 的 YARA 规则作用于从样本元数据派生出的扫描文本(scan text),采用三层结构(T1 制品、T2 行为、T3 已确认家族)。为下一种方法(语义发现)中的嵌入流水线提供输入的,正是同一份文本文档,它同时也用于 YARA 匹配。

传统 YARA 规则是在逆向工程(RE)之后编写的。它们锚定于逆向工程揭示出的制品,尤其是那些最精确地为某家族"指纹化"的底层实现细节。那是你能写出的最佳分类器,但前提是你手里有这个二进制文件。而一条 CAIRN 规则必须在 VirusTotal 已作为元数据暴露出来的信息上触发:可打印字符串、导入名、资源与版本信息字段,以及证书身份——因此,用于区分的判别特征必须能从反汇编一路"存活"到文件表面。逆向工程的发现告诉你是什么让这个家族独一无二;而元数据规则,则是把那个发现投影到"无需下载即可观察"的那部分子集之上。

第 3 层规则用于赋予逻辑,以识别已知的运营家族。它会产出一条 YARA 规则,用于对某一族样本做已确认的归因。

介绍 CAIRN:面向”AI 集成型恶意软件”的前沿追踪-RadeBit瑞安全

这正是 T3 规则中始终存在的张力:来自底层逆向工程的最锐利信号,恰恰是你无法用来狩猎的信号。因此,这门手艺的要领是:先用逆向工程把家族钉死,再追问哪一个"字符串或元数据可访问"的特征会与那套机制相伴出现;用这些特征来构建规则,把深层实现细节当作规则所**代理(proxy)**的对象,而不是规则实际匹配的对象。

任何规则变更之后,cairn rescan 会离线地把全部三层重新应用到整个语料库,无需任何 API 调用或重新下载。这意味着,针对某个已确认家族的新 T3 规则会立即浮现出此前已获取的、匹配的样本,从而把更早的命中追溯归因到这个新家族。

4. 语义发现

YARA 只能找到你已经知道要搜索的东西。而嵌入模型(embedding models)即使在样本之间没有明显字符串重叠时,也能识别出语义上相似的样本。因此,CAIRN 把语义聚类当作 YARA 的补充发现机制,而非替代。

对每个样本,CAIRN 会从以下来源汇编出一份扫描文本文档:

  • 所有 AV 引擎的检测标签字符串
  • VirusTotal 的 PE 静态分析引擎提取出的 URL 与域名对象
  • 内容搜索的十六进制转储片段(VirusTotal 对某文件偏移处匹配内容的预览)
  • ExifTool 提取的 PE 资源字符串(CompanyName、FileDescription、OriginalFilename)
  • VirusTotal 沙箱执行得到的行为字符串模式(内存扫描出的域名、联系过的 URL、命中的 sigma 规则)

介绍 CAIRN:面向”AI 集成型恶意软件”的前沿追踪-RadeBit瑞安全

这种方法会产出候选家族,并揭示离群点和新颖聚类。该视图通过 CAIRN explorer 中的 UMAP 开关暴露出来,它使用 HDBSCAN 与 UMAP 对现有全部语料做一次无监督处理。聚类的共同归属只是一个弱相似性信号,而非强归因信号。它产生的是线索,而非结论。每一个有趣的聚类,仍需逐样本检查,以确认其 AI 关联是真实的,而不是一个"假邻居"。

发现摘要

Talos 用 CAIRN 进行的初步狩猎,聚焦于自 2025 年 7 月以来的活跃恶意软件开发——那时首批 AI 集成型样本在野被报告(LAMEHUG,CERT-UA)。纵观我们收集的样本与关系,可以做出几点有趣的初步观察:

  • 存在一条"自主性升级"的弧线,而且变化很快。 从"LLM 作为可选特性"到"完全自主、多模型共识编排、无需人工操作员"的演进,在一个日历年之内就填满了。
  • AI 特有的攻击手法正在被传授和扩散。 一种 AI 分析规避技术——内嵌写给 LLM 沙箱的自然语言压制文本——被追溯到一位具名的红队讲师,并在其首次于野外被确认使用后的 12 个月内,出现在彼此独立的攻击者样本中。这表明该技术流传范围之广,已足以触及与原课程或原恶意软件样本毫无关联的攻击者,并已从解释型脚本跨越到了编译型恶意软件。
  • 照例来一句"天下没有免费的午餐""没有银弹"的声明。 没有真正 AI 集成的 T1/T2 命中很常见。例如,PyInstaller 打包会把开发者的整个虚拟环境作为 YARA 可见的字符串暴露出来,而不管应用实际导入了什么;Tauri 框架的应用和某些 Go 语言的 PE 结构,仅凭结构相似性就会累积检测特征。做 AI 制品狩猎的分析师,应当预料到正是这些模式会带来更高的噪声。
  • 我们或许正处在一个观察 AI 转型的短暂窗口期。 AI 集成正在所有软件中变得司空见惯。随着这种集成加深,我们的过滤器将需要从强调 AI 字符串的"存在",转向强调其集成的"目的"。当前方法强调用 T2 YARA 来锐化行为分类,而非仅凭 AI 指标的存在。所有发现的最终裁定,仍需通过逆向工程来验证。

结论

现在还很难判断,AI 集成型恶意软件最终会作为一个实验性时代收场,还是会为现代攻击行动开启新的范式。对手正越来越多地把 LLM 纳入其运营工具,研究者也需要能够扩展到超越人工逆向工程的方法论与框架,才能跟上这些变化。以元数据为先的狩猎,为传统逆向工程提供了一种可扩展的补充;通过将 CAIRN 开源,Talos 希望借助社区驱动的改进来不断完善过滤器、规则和报告。

CAIRN 是一项研究性工作,而非纯粹的活跃威胁信号。然而,对安全社区而言,研究这一图景及其演进所获得的洞见,构成了一个宝贵的信号,可以为检测、情报和运营策略提供参考。