
大家读完觉得有帮助记得关注和点赞摘要网络威胁情报CTI的及时分发对于组织快速有效地进行事件响应至关重要。当有效的CTI在正确的时间传递给正确的行业时相同的攻击通常可以被遏制或缓解。然而当今快速扩张的CTI格局使分析师不堪重负他们必须筛选海量且异构的源。现有的平台如恶意软件信息共享平台MISP提供了行业标签功能例如能源、金融、政府但在实践中这些标签基本上未被映射——98%的事件未被分类。这种缺乏自动化和及时的行业映射严重限制了共享情报的运营价值使尤其是关键信息基础设施行业的组织面临风险。为填补这一空白我们将面向行业的CTI分发公式化为一个多标签分类问题。利用对CTI结构和特定行业威胁模式的深厚领域知识我们从一个威胁情报平台TIP构建了一个包含872个行业标记CTI事件的新颖数据集。然后我们应用BERT一个基于Transformer的模型来自动化将CTI事件映射到行业的过程。使用结构化威胁信息表达STIX格式以实现跨平台互操作性我们的方法在自定义数据集上实现了0.89的宏平均F1分数和0.055的汉明损失即94.5%的单个行业标签分配是正确的。这些结果不仅证明了行业感知、自动化CTI分发的可行性而且突显了如何将专家领域知识嵌入机器学习设计以填补威胁情报流水线中的关键空白从而实现更快和上下文相关的防御行动。关键词网络威胁情报自然语言处理Transformer网络安全1 引言网络安全格局在规模和复杂性上都在迅速升级国家和全球报告都强调了令人担忧的趋势[1, 2, 3, 4]。印度尼西亚国家网络与密码局BSSN的2024年安全监控报告记录了超过3.3亿次网络异常超过240万次与Lazarus、Wicked Panda和APT 40等组织相关的高级持续性威胁APT活动以及单年内超过50万次勒索软件事件[5]。这些数字不仅说明了恶意活动的广度也说明了其日益增长的复杂性。类似的激增在全球范围内也很明显ENISA的2023年威胁态势报告记录了从2022年到2023年网络安全事件翻倍[6]而IBM的2024年数据泄露成本报告报告了迄今为止最高的平均泄露成本[7]。这些统计数据共同强调了组织通过及时的、行业感知的措施来加强其网络安全态势的迫切需求这些措施能够快速检测、响应和缓解威胁。为应对不断升级的网络威胁网络威胁情报CTI已成为现代防御战略的基石。CTI是指对潜在或正在进行的威胁信息进行系统性收集、分析和分发[8]。其最终目标是使组织能够在可能的情况下预防攻击并在预防失败时实现及时有效的事件响应。图1网络威胁情报生命周期图描述一个循环流程图显示六个阶段方向 - 收集 - 处理 - 分析 - 分发 - 反馈 - 回到方向。CTI的实施通常遵循诸如图1所示的威胁情报生命周期等框架。该周期由六个相互依赖的阶段组成。(1)方向。在第一阶段组织定义其情报目标和需求这些目标和需求塑造所有后续的CTI活动。(2)收集。然后从各种内部和外部来源收集原始数据如CTI源、网络日志、应用日志和开源情报OSINT。(3)处理。收集的数据随后被清理、规范化和丰富以将其转换为适合分析的结构化格式。(4)分析。在此阶段检查处理后的数据以识别指示潜在威胁的趋势、模式或异常将原始信息转化为可操作的洞察。(5)分发。这些洞察被分发给相关利益相关者确保正确的人在正确的时间收到正确的信息。(6)反馈。最后利益相关者提供关于情报准确性、有用性和及时性的输入这些输入用于完善和改进整个周期。虽然CTI生命周期的所有阶段都很重要但分发阶段尤其关键。不及时交付且未针对正确行业或利益相关者进行上下文化的情报很快就会失去其运营价值。对于关键基础设施运营商——如能源、金融和医疗保健行业——最紧迫的挑战之一是及时了解哪些攻击专门针对其行业[9]。与通用的CTI共享不同有效的分发确保可操作的情报在正确的时间到达正确的实体从而能够采取迅速且有针对性的防御措施。这使得及时、行业感知的分发成为将CTI从原始数据转化为有意义和实用防御的核心。CTI共享大致是在组织和社区之间交换威胁信息以增强集体网络安全。相比之下CTI分发是有针对性和可操作的专注于在正确的时间将正确的情报传递给正确的利益相关者。这种精确性至关重要因为组织——尤其是关键行业的组织——只有在其面临的攻击被及时识别时才能迅速响应。然而威胁数据的快速增长使得及时分发成为一个主要挑战。因此有效的分发解决方案对于确保有效的CTI到达其预期接收者、实现更快地缓解相同攻击和加强整体安全态势至关重要[10]。图2网络威胁信息分发图描述显示威胁情报源威胁源、内部日志、共享社区流入信息共享与分析中心ISAC然后分发到各行业金融、能源、政府、医疗等的流程图。为解决CTI分发挑战许多行业依赖信息共享与分析中心ISAC——可信的非营利社区促进公共和私人利益相关者之间的网络威胁信息交换ENISA报告ISAC合作模式。ISAC通过会议、工作组和联合研究促进合作分发各种情报如入侵指标IoC、TTP、告警、报告和配置规则如图2所示。虽然这些努力利用各种来源例如威胁源、内部日志和共享社区但上下文化和路由情报所需的手动分析仍然是资源密集型的。这通常导致告警疲劳即海量数据使分析师不堪重负并损害了及时有效的决策[11]。克服这一瓶颈对于实现CTI的运营价值至关重要。几个威胁情报平台如AlienVault开放威胁交换OTX、OpenCTI和MISP提供了自动化功能以简化CTI的收集、分析和共享。然而一个关键限制仍然存在大多数CTI数据——特别是来自开放来源的——缺乏行业特定标签而这对精确分发至关重要。没有它组织被迫筛选大量不相关的情报而不是专注于直接影响其行业的威胁。由于CTI事件通常同时与多个行业相关这一挑战最好被公式化为一个多标签分类问题[12]。例如单个威胁报告可能同时适用于金融和医疗保健行业。解决此问题需要能够进行准确多标签标记的高级机器学习模型从而实现有针对性的分发将可操作的情报传递给正确的行业而不会用噪音淹没它们使这样的解决方案能够释放CTI分发的全部运营价值据我们所知这是一个未解决的开放挑战。在本文中我们解决了上述挑战主要贡献如下DisCTI框架。我们设计了DisCTI一个用于自动化特定行业CTI分发的框架利用多标签分类。新颖数据集。我们通过从威胁情报平台收集和处理872个真实世界事件构建了第一个行业标记的CTI数据集使对行业感知分发的系统研究成为可能。比较评估。我们设计并评估了三种多标签分类方法——并行二元分类器、序列二元分类器和基于Transformer的BERT模型——并识别出最适合行业标记任务的方法。实证验证。我们的实验表明BERT模型优于基线实现了0.89的宏平均F1分数和0.055的汉明损失为自动化、特定行业的CTI分发建立了强有力的基准。通过证明自动化行业标记的可行性我们的工作提高了CTI分发的运营价值并在关键基础设施环境中支持更快、更有针对性的防御响应。本文的其余部分结构如下。第2节回顾网络威胁情报中的初步概念和相关工作。第3节概述我们用于数据收集和构建行业标记数据集的方法论。第4节介绍我们的自动化标记模型包括二元分类器方法和基于BERT的分类器。第5节报告并比较实验结果。第6节总结关键发现并突出未来研究方向。2 初步与相关工作在本节中我们回顾关于CTI标准、平台和分发方法的现有研究。我们首先描述诸如STIX等结构化格式如何实现互操作性然后讨论威胁情报平台如何聚合和分析情报。最后我们突出分发挑战特别是缺乏特定行业自动化并将我们的工作定位为解决此差距的多标签学习方法。2.1 使用STIX的威胁情报数据STIX是一种用于传递网络威胁情报的标准化语言和序列化格式[13]。它促进了跨组织边界的CTI共享和分发增强了态势感知并提高了响应能力[14]。STIX包含一系列称为STIX数据对象SDO的数据元素如指标、可观察对象、威胁行为者、攻击模式和活动使得能够详细表示网络威胁。这种结构化方法允许对威胁信息进行一致性描述使其更容易自动化并集成到威胁情报平台中。例如一个STIX报告可能描述一个威胁行为者对象如已知的黑客组织该组织被观察到使用特定的攻击模式对象如鱼叉式网络钓鱼。此攻击可能链接到一个指标对象恶意URL并针对一个身份对象金融行业的公司。这些对象通过STIX关系对象SRO连接创建一个全面且机器可读的威胁图。采用STIX作为威胁情报共享标准已得到网络威胁情报整合中心CTIIC和欧盟网络安全局ENISA等组织的广泛支持。研究表明使用STIX进行威胁信息共享提高了威胁检测和响应过程的准确性和效率[15]。2.2 威胁情报平台TIP旨在聚合、分析和共享来自多个来源的威胁情报数据为安全团队提供可操作的洞察。TIP作为威胁数据的集中存储库整合各种数据源包括安全日志、威胁源和开源情报。像AlienVault OTX[16]、ThreatConnect[17]和IBM X-Force Exchange[18]等TIP能够聚合来自不同来源的大量威胁数据。这种聚合至关重要因为它能够收集跨越各种领域和地理位置的全面威胁信息[19]。这些平台支持集成结构化威胁情报格式如STIX和TAXII可信的指标信息自动交换确保威胁数据不仅被收集而且以标准化方式共享和消费[20]。这种集成促进了不同实体和系统之间的自动化和简化数据交换过程[21]。TIP的核心功能之一是其分析和关联威胁数据以识别模式、趋势和异常的能力。这涉及高级分析包括机器学习算法以检测潜在威胁并提供上下文洞察。TIP的另一个功能与CTI可视化相关。像OpenCTI这样的平台提供复杂的可视化工具使安全团队能够映射威胁行为者活动、攻击向量以及不同威胁实体之间的关系。这有助于创建全面的威胁景观视图促进更好的决策。然而一个显著的挑战仍然存在这些平台并未固有地解决。虽然TIP擅长聚合和可视化威胁数据但它们通常缺乏内置的、自动化的、特定行业标记和分发的复杂机制。威胁的上下文化——确定它是否与“金融”、“健康”或“能源”行业相关——仍然是一个主要由安全分析师手动进行的劳动密集型过程。这迫使团队筛选大量聚合数据以找到相关的内容直接导致信息疲劳和延迟响应的问题。正是这一具体差距——缺乏大规模自动化的、细粒度的、基于行业的标记——我们的工作旨在解决。2.3 威胁情报分发CTI数据量的增加对需要处理和分析大量CTI源的安全分析师构成了重大挑战。有针对性的CTI分发解决方案对于简化此过程是必要的使组织能够专注于最相关的信息[22]。利用自动化TIP对于记录和标记安全事件或事件至关重要这确保了上下文相关性。尽管有其能力TIP仍面临与它们提供的情报的上下文相关性相关的挑战。TIP的有效性在很大程度上取决于威胁数据的准确标记和分类而这往往未被充分利用。例如在CIRCL MISP私营部门平台MISPPriv中只有约2%的安全事件根据组织行业被标记突显了改进上下文标记的需求。这种上下文标记的缺乏严重削弱了CTI分发的效力[10]。根据我们对CIRCL MISPPriv等平台的分析大部分特定行业的标记仍然由安全分析师手动执行。这种手动过程是劳动密集型的且由于人为错误和分析师不同水平的专业知识而容易产生不一致。使用机器学习和自然语言处理NLP技术的自动化标记可以提高标记过程的准确性和一致性。CTI分发的有效性关键取决于其行业分类的粒度和清晰度。虽然像CIRCL MISPPriv我们的数据源这样的平台采用了包含如“政府”和“金融”等类别的行业分类法但这些类别的基本原理并不总是被严格定义导致显著的 overlap 和模糊性。例如针对大银行的威胁可能被合理地标记为“金融”、“ICT”或甚至“国家安全”取决于分析师的解释。这种源于定义不清的分类法的手动标记不一致性是破坏CTI分发可靠性的一个主要挑战。我们的数据驱动方法旨在通过学习威胁事件与行业之间的实际关系来缓解此问题从而创建一个更一致和经验基础的标记模型。2.4 问题公式化我们解决的核心挑战是网络威胁情报CTI的自动化行业感知分发。在实践中威胁情报事件很少被标记它们影响的行业例如能源、金融、医疗保健。这种缺乏行业注释显著限制了CTI的运营价值组织不得不手动过滤大量通用情报以找到与其相关的内容。对于关键信息基础设施运营商尤其如此及时的行业映射对于针对特定行业攻击实现快速防御行动至关重要。此问题本质上是一个多标签分类任务。与单标签分类每个实例恰好属于一个类别不同CTI事件可以同时涉及多个行业。例如一个钓鱼活动可能同时针对医疗保健和金融机构或者一个APT恶意软件家族可能被观察到同时针对政府和能源行业。现成的数据集是不充分的因为它们要么完全缺乏行业标签要么提供不完整和不一致的标记。因此需要一个专门构建的数据集——一个能准确反映行业相关性并为机器学习构建结构的数据集。形式上令一个CTI事件被表示为文本描述 x ∈ 。目标是学习一个函数其中 K 是行业部门的总数每个输出向量 y f(x) 由二元条目 y_k ∈ {0,1} 组成y_k1 表示事件 x 与行业 k 相关。任务的多标签性质意味着 ∑_{k1}^K y_k ≥ 1。因此我们的公式化集中于从真实世界的威胁情报平台TIP构建一个行业标记的CTI数据集 {(x_i, y_i)}_{i1}^N其中每个 x_i 是一个CTI源条目y_i 是一个行业标签向量N 是数据集中的CTI事件数量。此数据集能够对自动化标记的机器学习模型进行系统评估并为选择最有效的运营部署方法奠定基础。3 数据收集与构建为了使用机器学习自动化CTI的特定行业标记我们必须首先解决一个根本挑战缺乏适合此任务的公开可用标记数据集。现有的CTI源通常是原始和非结构化的缺乏监督模型训练所需的一致、特定行业的标签。因此我们解决的第一个问题是数据构建问题。在本节中我们详述我们创建新颖的、行业标记的CTI数据集的方法论。我们概述了可靠CTI收集的要求描述了我们如何使用MISPPriv¹平台并解释了将原始源导出、解析和处理为包含872个标记事件的机器学习就绪数据集的过程。因此本节概述了将原始CTI源转换为结构化、机器学习就绪数据集的逐步方法论。3.1 CTI数据收集的一般要求威胁情报数据从各种CTI源收集。在CTI社区中可能有数十个或更多的源可用。因此我们定义了有效收集CTI数据的几个关键要求效率。数据收集应该是一个流线化的过程以便能够无显著延迟地处理大量数据。源可靠性。CTI数据的来源必须是可信和值得信赖的以确保收集的情报准确且有用。数据多样性。应使用广泛的CTI源以捕获威胁景观的全面视图。这包括不同类型的威胁、指标和威胁行为者信息。3.2 TIP的选择为满足先前的要求我们选择了私营部门恶意软件信息共享平台。由包括卢森堡计算机事件响应中心CIRCL在内的开发团队开发和维护MISPPriv旨在促进威胁情报的收集和共享。MISPPriv满足CTI数据收集的一般要求效率MISPPriv允许自动化收集威胁情报源确保及时更新和最少的手动干预。可靠性MISPPriv聚合来自可信来源的数据包括国家和国际私营组织和CERT计算机应急响应团队。多样性该平台收集广泛的威胁情报包括入侵指标IoC、威胁行为者信息和其他相关数据。此外该平台从各个行业收集CTI数据。这一特性可以支持后续的CTI标记模型训练过程。该平台使用STIX 2.1格式从CTI源收集威胁情报、入侵指标IoC和任何类型的威胁行为者信息。STIX 2.1格式使用称为STIX域对象SDO的特定格式表示IoC。SDO有许多类别通常描述网络事件的战术、技术和程序TTP如攻击模式、恶意软件、工具和漏洞。至少有12个默认的SDO类别可用于描述IoC。不同的TIP开发自己的自定义SDO用于其各自TIP框架内的特定功能是常见做法。例如Sector SDO默认不可用。另一方面Sector SDO对于为网络事件提供上下文很重要使CTI分发更加准确。因此MISP创建了misp-galaxy:sector SDO来解决此问题。此自定义SDO确保CTI数据被标记相关的行业信息促进更有效的分发。图3显示了默认SDO与修改后SDO的一个示例。图3STIX 2.1包的高级表示。一个报告对象链接到一个指标对象并通过自定义行业标签x-industry:finance进行丰富以提供上下文。图描述显示STIX包结构的示意图包含一个Report对象、一个Indicator对象和一个自定义的Sector标签。3.3 使用MISPPriv的数据收集与处理数据收集和处理遵循以下具体步骤导出CTI源。数据收集过程始于使用STIX 2.1格式从MISPPriv导出已标记行业的CTI源。解析数据。使用自定义脚本解析导出的数据以提取与行业分类过程相关的属性和特定SDO。这些SDO包括报告、身份、指标、工具、威胁行为者、恶意软件、攻击模式和入侵集。组合SDO。在解析阶段所有相关的SDO被组合成一个称为IoC的属性。分析与过滤。从截至2024年12月MISPPriv TIP内收集的大约300,000个源中我们构建了一个包含872个多样化源的标记数据集每个源根据其特定关键行业进行标记。这些行业标记的源对于准确的多标签分类任务至关重要。解析后处理数据以提取相关属性并将各种SDO组合成一个统一的IoC属性。此过程确保CTI数据被结构化并准备好进行进一步分析和分发。表1显示了一个CTI源/事件的样本数据。通过遵循这些步骤MISPPriv平台有效地收集和构建CTI数据满足高效、可靠和多样化威胁情报收集的一般要求。表1数据收集输出报告名称发布者发布日期IoC行业OSINT: Chinese APT10dcso.de2021-10-04CnC; Redleaves benign DLL sideloading host; Compromised code-signing certificate, issued to Hacking TeamGovernment4 DisCTI设计本节介绍DisCTI的架构我们提出的用于自动化特定行业CTI分发的框架。我们描述了问题公式化、行业分类和分类模型的设计包括二元分类器集合和基于BERT的多标签分类器。以下是我们方法论方法的详细描述从数据预处理步骤到用于自动化标记过程的机器学习模型的具体架构。4.1 概述DisCTI的目的是为特定的关键信息基础设施行业分发有针对性的CTI。例如美国已定义了多达16个关键基础设施行业并在总统政策指令21PPD-21中进一步描述。另一方面日本将15个行业定义为CII关键信息基础设施包括ICT、金融、机场和医疗服务[23]。印度尼西亚政府在关于重要信息基础设施保护法的2022年第82号总统条例中定义了CII行业。有8个行业包括政府、国防、交通、金融、健康、能源、ICT和农业[24]。在本工作中CTI分发基于前面提到的8个行业加上3个额外行业工业、教育和媒体。工业和教育的加入是因为大量CTI信息与这些行业相关。媒体的加入是基于运营理由在BSSN内部负责ICT行业的理事会也负责媒体和交通行业因此针对媒体的情报必须通过相同的分发路径进行路由。这产生了本文其余部分使用的11个目标行业。同时模型输出是基于CII行业的分类CTI形式如图4所示。以表1所示特定格式呈现的数据集用于训练模型。总体而言DisCTI需要作为一个多标签分类或标记问题来解决。对于每个CTI样本数据该CTI所属的行业可能不止一个。图4DisCTI系统设计的高层概述。图描述显示输入CTI事件 - 预处理 - 特征提取 - 多标签分类器BERT或二元分类器 - 输出行业标签多个的流程图。为解决此标记挑战我们提出了将问题公式化为多标签分类任务的解决方案。我们从此方法中使用两种方法。第一种解决方案采用一种称为问题转换方法的技术该技术利用一组对应于每个行业的二元分类器。第二种方法是使用一个立即执行多标签分类的单一模型。无论采用哪种方法我们的流水线都涉及以下步骤数据预处理这涉及规范化空白并将输入文本拆分为句子为BERT处理插入特殊标记[25]。标记化自然语言处理NLP中的数据准备过程将输入文本分解为更小的单元称为标记。在二元分类器中标记通过将文本拆分为单词或子单词产生。对于BERT文本将被转换为输入ID、注意力掩码和令牌类型ID[26]。为PyTorch格式化数据在训练和评估期间将标记化数据格式化为PyTorch张量作为模型输入[27]。这些步骤对于为所使用的模型准备原始CTI数据至关重要确保模型能够有效地从数据中学习和分类。4.2 二元分类器集合二元分类器集合可以并行/独立地和顺序/依赖地组织。4.2.1 并行二元分类器。这种组织将每个标签视为一个独立的二元分类问题为每个标签训练一个单独的分类器[28]。虽然实现更简单但并行二元分类器模型不考虑标签依赖关系这在某些情况下可能是一个限制。4.2.2 序列二元分类器。该模型使用一个二元分类器链每个分类器负责预测单个标签先前分类器的预测被用作后续分类器的额外特征[29]。序列二元分类器模型可以捕获标签依赖关系从而提高多标签分类性能。4.3 基于BERT的多标签分类器我们的另一种方法采用BERT来自Transformer的双向编码器表示一个预训练的基于Transformer的模型以其在自然语言处理任务中的卓越表现而闻名[25]。Transformer是谷歌开发的基于多头注意力机制的深度学习架构。通过使用BERT我们旨在自动化标记过程并提高CTI源的相关性和实用性。然而重要的是要注意虽然BERT提供了优越的性能但它也可能产生计算成本这可以作为未来工作的基线。在我们的实验中在T4 GPU15GB VRAM上训练模型25个轮次大约需要125分钟每轮5分钟。这突显了虽然有效但基于BERT的模型的内存使用和运行时间由于大量参数和多头注意力机制而显著高于更简单的模型。因此当扩展到更大的数据集或实时应用时必须根据可用的硬件资源评估此方法的效率。4.4 实现数据预处理像表1所示的原始数据集的表示需要进一步处理以适合NLP模型训练。数据预处理包括两个阶段标签编码和IoC数据清洗。4.4.1 标签编码。标签编码阶段是为多标签分类问题准备数据的基本步骤特别是在利用BERT模型时。编码将基于唯一标签识别的结果进行。在我们定义了基于关键行业的唯一标签集后编码过程将文本或分类标签转换为可由模型处理的数值。这种转换至关重要因为模型需要特征和标签的数值输入。在此阶段至少有两个主要思想识别唯一标签。数据集中存在多个唯一标签。这些标签对应于需要标记的不同CII行业。二元编码。鉴于本问题的多标签性质每个数据点可以与多个标签关联。因此我们使用二元编码方法其中每个唯一标签表示为一个二元向量。在此向量中每个位置对应一个特定标签如果标签存在则值为1如果不存在则为0。例如如果在一个样本假设中只有三个标签如“交通”、“医疗”和“金融”那么与“交通”行业相关的数据点将被编码为[1, 0, 0]。在标签编码阶段之后我们通过将“报告名称”、“发布者”和“IoC”列连接到一个“事件信息”列中来转换表1的结构。同时由于“发布日期”列不需要按相关行业分类CTI它被丢弃。4.4.2 IoC数据清洗。下一阶段是清洗IoC数据中的不必要标记和标点符号。目的是确保输入模型的数据是高质量的且无噪声。这一步是必要的因为原始CTI数据通常包含各种形式的噪声和不一致性如特殊字符、冗余空白、URL和其他非信息性元素。文本清洗过程涉及几个步骤空白规范化。移除特殊字符和非单词字符。小写。此阶段将所有字母转换为小写。这对于CTI理解中与大小写无关的部分至关重要。词形还原。我们定义了一个将词形还原器应用于句子中每个单词的函数。此步骤标准化了输入数据使其更统一并减少了词汇量。清洗后数据集以75:25的比例分割为训练集和测试集。这意味着从872条威胁情报记录中我们得到大约654个CTI事件用于训练218个用于验证。4.5 训练并行二元分类器和序列二元分类器并行二元分类器和序列二元分类器是多标签分类的两种方法。在并行二元分类器中为每个标签独立训练单独的二元分类器而在序列二元分类器中分类器在链中链接每个分类器将先前分类器的预测视为额外特征。两种方法都需要将文本数据以数值形式向量化以进行有效训练和预测。TF-IDF向量化器通过考虑术语在文档中的频率及其在所有文档中的逆频率将文本数据转换为数值特征[30]。我们在这方面运行了两个步骤如算法1所示初始化TF-IDF向量化器。此TF-IDF向量化器的初始化从scikit-learn库获得。拟合和转换数据。然后将TF-IDF向量化器拟合到清洗和词形还原后的文本数据。文本数据被转换为TF-IDF向量产生文本的数值表示。拟合阶段基于训练数据集完成转换阶段对训练和验证数据集都完成。算法1 TF-IDF向量化4.5.1 并行二元分类器训练阶段在使用TF-IDF向量化器向量化文本数据之后下一步是训练模型。在并行二元分类器方法中每个标签被视为独立的二元分类问题。为每个标签训练单独的分类器这使得此方法直接且可扩展。算法2 并行二元分类器训练对于每个标签使用一个高斯朴素贝叶斯分类器。选择高斯朴素贝叶斯是因为其简单性和在处理高维数据方面的有效性。在预处理期间获得的TF-IDF向量被用作输入特征。来自skmultilearn.problem的BinaryRelevance分类器用于拟合多个高斯朴素贝叶斯分类器每个标签一个[31]。在预测阶段每个分类器独立预测其对应标签的存在与否。我们按算法2所述实现所有这些阶段。4.5.2 序列二元分类器训练阶段在序列二元分类器方法中分类器在链中链接其中每个分类器将先前分类器的预测视为额外特征。这种方法捕获标签依赖关系可以提高整体性能。选择随机森林分类器是因为其鲁棒性和处理大型特征集的能力。ClassifierChain包装器用于链接分类器。与并行二元分类器相同TF-IDF向量被用作输入特征。ClassifierChain用随机森林分类器拟合链顺序由标签序列决定。最后为进行预测链中的分类器顺序进行预测每个分类器考虑其前驱的预测如算法3所示。算法3 序列二元分类器训练4.6 训练BERT模型在为BERT模型准备数据时标记化和嵌入过程是将原始文本转换为适合模型训练的数值数据的关键步骤。本节详细描述这些过程。4.6.1 标记化BERT使用WordPiece标记化器它将单词分解为子词单元。这种方法在处理大多数CTI中常见的词汇表外单词和捕获CTI数据中的细微含义方面特别有效。算法4 BERT标记化与嵌入初始化。来自Hugging Face的transformers库的BertTokenizer使用预训练的BERT模型初始化。此标记化器预配置了BERT特定的词汇和规则。标记化。将标记化器应用于文本数据将每个文档转换为一系列标记。特殊标记[CLS]和[SEP]被添加到每个序列的开头和结尾以分别表示输入的开始和结束。还添加了[PAD]特殊标记以满足BERT-base模型的长度要求即512个标记。算法4解释了此标记化的实现阶段。4.6.2 嵌入嵌入过程涉及将标记化文本转换为捕获标记语义信息的固定大小稠密向量。BERT使用其预训练的Transformer架构生成这些嵌入。创建注意力掩码。创建注意力掩码以区分实际标记和填充标记。张量转换。将输入ID和注意力掩码转换为PyTorch张量这是transformers库中BERT模型所需的输入格式。嵌入生成。在训练期间BERT通过其层处理先前的张量为每个标记生成上下文化的嵌入。此阶段将在训练阶段稍后描述。标记化和嵌入过程集成到BERT模型训练流水线中。生成的嵌入被输入到BERT模型为CTI分发的特定任务进行微调。算法4显示了标记化和嵌入的整体过程。4.6.3 BERT训练阶段本节概述了训练BERT模型的重要步骤包括模型配置、训练参数配置和实际训练过程。模型配置如图5所示。图5我们基于BERT的多标签分类器的架构。图描述显示输入 - BERT模型 - 全连接层 - 多标签输出sigmoid激活的架构图。模型初始化。BERT模型使用来自transformers库的预训练版本初始化。通过将输出标签数设置为与数据集中的类别数匹配调整模型配置以处理多标签分类。优化器和学习率。选择AdamW优化器是因为其处理大规模数据集的能力及其对Transformer模型的适用性[32]。采用线性学习率调度器以在训练期间逐步调整学习率改善收敛性并防止过拟合。模型训练准备。数据集被划分为训练集和验证集。创建DataLoader以在训练和评估期间进行高效批处理[33]。训练循环。训练循环在指定的轮次数25轮上迭代。在每个轮次期间模型处理大小为6的数据批次计算损失并更新模型参数。使用的损失函数是二元交叉熵BCE适用于多标签分类。验证。在每个轮次之后在验证集上评估模型的性能以监控其进展并在必要时调整超参数。验证循环类似于训练循环但排除了反向传播步骤。4.7 评估指标使用标准多标签分类指标评估模型的性能。这些指标提供了对模型在多个标签上表现如何的全面理解。4.7.1 汉明损失汉明损失衡量被错误预测的标签的比例[34]。它定义为汉明损失 (1/(n L)) ∑{i1}^{n} ∑{j1}^{L} I(ŷ_{ij} ≠ y_{ij})其中n是样本数L是标签数ŷ_{ij}是预测标签y_{ij}是真实标签。I是指示函数用于评估特定条件是否为真。在本文中我们使用标签级准确率来表示1 - 汉明损失即跨所有样本和标签正确预测的单个行业标签分配的比例。这与精确匹配准确率也称为子集准确率不同后者仅在样本的所有L个行业标签同时被正确预测时才将该样本计为正确因此在任何多标签任务中都要低得多。我们报告标签级变体因为它反映了分发的运营成本结构其中每个行业路由决策是独立执行的我们在每次使用时明确说明该指标以避免歧义。4.7.2 精确率精确率衡量在所有阳性预测中真阳性预测的比例[35]。它定义为精确率 真阳性 / (真阳性 假阳性)4.7.3 召回率召回率衡量在数据集中所有实际阳性中真阳性预测的比例[35]。它定义为召回率 真阳性 / (真阳性 假阴性)4.7.4 F1分数F1分数是精确率和召回率的调和平均数提供了一个平衡精确率和召回率的单一指标[35]。它定义为F1分数 2 × (精确率 × 召回率) / (精确率 召回率)5 实验5.1 概述与研究问题实验旨在回答以下研究问题RQRQ 1. 如何自动化CTI数据的特定行业标记以提高分发信息的关联性我们探索了基于规则和机器学习方法包括基于BERT的多标签分类器以自动化网络威胁情报CTI数据的特定行业标记提高信息关联性和及时性。BERT模型在标记特定行业威胁方面展示了可观的准确性性能使用精确率、召回率和F1分数等指标进行评估。RQ 2. 哪种机器学习模型提供最佳性能为确定自动化CTI数据特定行业标记的最佳机器学习模型我们首先探索了二元分类器。虽然它们在单标签分类中表现尚可但在处理CTI数据的多行业性质时遇到困难。多标签二元分类器略有改善结果但仍然有限。相比之下基于BERT的多标签分类器提供了优越的性能有效地同时处理多个行业标签并实现了更好的精确率、召回率和F1分数。因此虽然二元分类器可以处理简化的情况但像BERT这样的多标签模型对此复杂任务更有效。5.2 实验结果使用高斯朴素贝叶斯的并行二元分类器训练模型后下一个关键步骤是评估其性能。并行二元分类器模型独立处理每个标签利用高斯朴素贝叶斯分类器。结果表明虽然这种方法简单且可扩展但它不捕获标签依赖关系这可能限制其性能。表2使用高斯朴素贝叶斯的并行二元分类器模型的评估指标标签精确率召回率F1分数支持Agriculture0.8891.0000.9418Defense0.5230.7190.60532Education0.7330.8050.76741Energy0.7300.8850.80061Finance0.6670.7740.71662Government0.7930.8230.80779Health0.7680.8430.80451ICT0.8110.8270.81963Industrial0.7180.8840.79269Media0.6881.0000.81511Transport0.8750.8600.86757微平均0.7400.8370.786534宏平均0.7450.8560.794534加权平均0.7470.8370.788534样本平均0.6400.7120.647534基于表2的结果表明使用高斯朴素贝叶斯的并行二元分类器模型在大多数类别中表现相当好。每个行业的精确率、召回率和F1分数提供了模型在识别真阳性并最小化假阳性和假阴性方面有效性的洞察。精确率该模型在农业0.889行业实现了高精确率表明假阳性率较低。然而在国防0.523等行业精确率较低表明在准确预测真阳性实例方面有改进空间。召回率召回率分数表明模型识别所有相关实例的能力。农业1.000等行业实现了完美的召回率而其他如国防0.719显示了较低的召回率表明有遗漏实例。F1分数F1分数提供了模型准确性的平衡度量。农业行业具有最高的F1分数0.941反映了强大的精确率和召回率。国防的F1分数最低0.605表明需要更好的精确率和召回率平衡。并行二元分类器模型的整体准确率为0.9158表明大约91.58%的标签被正确预测。汉明损失为0.0842反映了错误标签占总标签的比例表明相对较低的误差率。5.3 实验结果使用随机森林分类器的序列二元分类器我们展示了使用随机森林分类器的序列二元分类器方法的结果和分析。该模型考虑了标签间的相互依赖关系可能在与更简单的方法如并行二元分类器相比时提高多标签分类任务的性能。表3显示了每个行业的详细评估指标包括微、宏、加权和样本平均值。这些结果提供了模型在不同行业的表现以及考虑所有实例和标签时整体性能的洞察。表3使用随机森林分类器的序列二元分类器模型的评估指标标签精确率召回率F1分数支持Agriculture1.0000.8750.9338Defense1.0000.6250.76932Education0.9390.7560.83841Energy0.8500.8360.84361Finance0.8940.6770.77162Government0.8890.7090.78979Health0.9330.8240.87551ICT0.9530.7880.86363Industrial0.9250.7100.80369Media1.0000.7270.84211Transport0.9640.9300.94657微平均0.9220.7650.836534宏平均0.9410.7690.843534加权平均0.9230.7650.834534样本平均0.6140.6020.599534使用随机森林分类器的序列二元分类器模型在多个指标上显示了鲁棒的性能精确率该模型在大多数类别中实现了高精确率在农业和国防中达到完美精确率分数1.000表明这些行业中假阳性率低。召回率召回率分数各不相同能源0.836和交通0.930等行业表现良好而国防召回率较低0.625。这种差异表明模型在不同行业中识别所有相关实例的有效性不同。F1分数F1分数平衡了精确率和召回率提供了模型准确性的总体度量。交通行业达到了最高的F1分数0.946反映了平衡的精确率和召回率。相反国防行业的F1分数较低0.769表明需要在平衡精确率和召回率方面进行改进。模型的标签级准确率为0.9324即汉明损失为0.0676略优于并行二元分类器模型。比较序列二元分类器结果与并行二元分类器方法揭示了一致的权衡序列模型在几乎所有行业中获得了显著更高的精确率但以召回率降低为代价。例如农业行业在使用序列二元分类器模型时达到了完美的精确率分数而并行二元分类器模型的精确率略低为0.889。政府行业也出现了相同的模式精确率从0.793并行提高到0.889序列而召回率从0.823下降到0.709。这种权衡在聚合层面也可见宏平均精确率从0.745上升到0.941而宏平均召回率从0.856下降到0.769。国防行业最明显地说明了这种成本召回率从0.719并行下降到0.625序列表明在召回率在操作上比精确率更重要的情况下——这在威胁分发中通常是如此因为遗漏一个行业通常比多标一个行业的代价更高——并行二元分类器方法可能更可取。总体而言序列二元分类器模型以其高精确率和平衡的召回率为CTI分发背景下的多标签分类提供了一种更全面和可靠的方法。图6并行二元分类器、序列二元分类器和BERT模型的评估指标比较分析。指标包括精确率、召回率、F1分数、准确率和汉明损失。BERT模型在大多数指标上始终优于其他方法。图描述条形图比较三种模型在五个指标上的表现。BERT在F1、准确率方面最高汉明损失最低。5.4 实验结果BERT模型BERT模型利用基于Transformer的架构在相同的多标签分类任务上进行评估。表4显示了每个行业的详细评估指标提供了模型在不同标签上的性能全面概述。表4BERT模型的评估指标。平均值是在列出的10个行业上计算的媒体行业不包含在此评估中见本小节末尾的说明。标签精确率召回率F1分数支持Agriculture1.0001.0001.00010Defense1.0000.6800.81037Education0.8300.8100.82042Energy0.8700.9300.90059Finance0.8700.8300.85065Government0.9100.8400.88088Health1.0000.9400.97053ICT0.9500.8500.89065Industrial0.8500.7700.81071Transport0.9600.9500.95056微平均0.9100.8500.880546宏平均0.9200.8600.890546加权平均0.9100.8500.880546样本平均0.7500.7400.740546BERT模型在几个指标上展示了强大的性能证明了使用基于Transformer的架构进行多标签分类任务的潜在优势精确率该模型在农业、国防和健康行业实现了完美的精确率1.000表明这些类别中没有假阳性。在ICT0.950和交通0.960中也观察到高精确率分数表明BERT模型在正确识别真阳性方面是有效的。召回率召回率分数各不相同农业1.000和交通0.950等行业表现良好而国防召回率较低0.680表明有一些遗漏实例。F1分数F1分数提供了模型准确性的平衡度量。农业行业达到了完美的F1分数1.000表明强大的精确率和召回率。相反国防和工业行业的F1分数较低0.810表明需要在平衡精确率和召回率方面进行改进。BERT模型的整体汉明损失为0.055反映了错误标签占总标签的比例表明相对较低的误差率。等价地94.5%的单个行业标签分配是正确的。我们报告的是这个标签级数字而不是精确匹配准确率后者在多标签设置中是一个严格得多的标准因为它要求一个样本的每个行业标签同时被正确预测。BERT评估的范围。表4中的BERT结果涵盖了第2节定义的11个行业中的10个媒体行业在数据集中标签支持最小11个实例见表2未被包含在内。因此表4中的平均值与表2和表3中在所有11个行业上计算的平均值不可直接比较。我们明确标记这一点而不是静默地忽略该行业并指出作为正在进行的工作的一部分正在对所有三个模型在相同的11行业分割上进行同类重新评估预计三种方法的定性排名不会改变因为媒体贡献了大约2%的标签实例。5.5 比较分析在本节中我们展示了三种模型之间的比较分析结果。我们比较了三种用于有针对性的CTI分发的模型的性能使用高斯朴素贝叶斯的并行二元分类器、使用随机森林的序列二元分类器和BERT。我们基于关键指标如精确率、召回率、F1分数、准确率和汉明损失评估这些模型如图6所示。每个模型在评估指标的不同方面都展现出优势和劣势序列二元分类器模型在精确率方面表现出色使其适用于最小化假阳性至关重要的场景。并行二元分类器模型在召回率方面领先使其在识别所有相关实例方面有效。BERT模型展示了平衡的性能实现了最高的F1分数和准确率以及最低的汉明损失使其成为CTI分发中多标签分类的稳健选择。BERT模型的基于Transformer的架构在多标签分类中提供了鲁棒的性能特别是在实现高精确率和低汉明损失方面。尽管整体F1分数略低于序列二元分类器模型但BERT模型减少假阳性并在各行业保持平衡性能的能力使其成为有针对性的CTI分发的有力候选。未来的工作可能集中于微调BERT模型和探索结合不同模型优势的混合方法以进一步提高性能。6 讨论虽然我们的实证评估证明了使用基于Transformer的架构进行特定行业CTI分发的可行性但出现了几个更广泛的含义和开放挑战。本节从操作、方法论和实际角度讨论我们的发现。6.1 对CTI分发的操作意义所提出的DisCTI框架直接解决了网络威胁情报共享中最紧迫的操作瓶颈之一——缺乏及时、行业感知的分发。通过自动化将CTI事件标记到特定行业DisCTI减少了分析师的手动分诊工作和告警疲劳。在实践中这意味着国家机构、ISAC和关键基础设施运营商可以快速识别针对其领域的威胁而无需筛选大量不相关的数据。此外强大的宏平均F1分数0.89和低汉明损失0.055表明自动化不一定以牺牲精确率为代价这是情报工作流程中的一个常见担忧。6.2 迈向实时和可扩展部署在生产TIP环境中部署像BERT这样的Transformer模型引入了计算和延迟约束。对于大规模、实时的CTI分发轻量级替代方案如DistilBERT或量化Transformer变体可以在性能和效率之间提供更好的权衡。此外将DisCTI集成到现有标准如STIX/TAXII中将实现跨组织边界的无缝互操作性支持不同利益相关者之间的自动化、可信情报交换。6.3 模型可解释性与分析师信任除了其强大的定量性能外基于BERT的模型为增强威胁情报工作流程中的人机协作提供了宝贵的机会。其注意力机制固有地捕获CTI指标、行业和威胁行为者之间的上下文关系——这些洞察可以通过可视化和可解释AIXAI技术呈现。通过集成可解释性工具如注意力热图和特征归因方法DisCTI可以为每次行业分类提供透明的推理。这种透明度不仅增强了信任和问责制而且支持联合决策分析师可以验证、完善或覆盖模型输出。最终DisCTI为更共生的情报工作流程奠定了基础将机器效率与人类专业知识相结合。6.4 数据集优势与未来扩展从MISPPriv平台创建行业标记的CTI数据集代表了朝着在该领域启用监督学习迈出的重要一步。尽管其初始规模较小872个标记事件但该数据集展示了多样性和真实性捕获了关键行业间威胁数据的异质性。其构建为未来CTI分类模型的基准测试建立了可复现的基础。展望未来扩展此数据集以包括额外的国际威胁源和行业分类法将进一步提升其代表性和鲁棒性。这种增长不仅将加强模型的泛化能力而且有助于为更广泛的CTI社区构建一个开放的研究基准。7 结论本研究提出并验证了DisCTI一个基于深度学习的用于自动化特定行业网络威胁情报分发的框架。通过使用多标签分类方法的广泛实验基于BERT的模型实现了最高的整体性能宏平均F1分数为0.89汉明损失为0.055。这些结果强调了将CTI分发从一个 largely 手动的、反应性过程转变为一个自动化的、行业感知能力的可行性。除了技术性能我们的发现突显了将领域专业知识嵌入AI架构中可以为国家网络防御产生运营效率和战略影响。然而与数据可用性、模型可解释性和实时可扩展性相关的挑战仍然开放。解决这些挑战对于将DisCTI从研究原型过渡到赋能政府、行业和ISAC更快响应新兴威胁的运营系统至关重要。未来的工作将扩展数据集的多样性探索可解释AI机制并在实时TIP环境中评估部署以进一步增强网络威胁情报分发中的信任、透明度和韧性。