加密 KYT 风险评分工具到底有多准?

一个分值的成色,取决于它背后的证据

KYT合规风险评分
2026年8月15日阅读约 1 分钟

每一笔被拦下的入金、每一笔被挂起的出金背后,都坐着一个数字:KYT 风险评分。就是这一个数字,决定了一笔入金放不放行、一笔出金挂不挂起、一份可疑交易报告报不报。而买方与检查官问的是同一个问题:这个分值有多准,团队能不能解释清它为什么落在那个位置。本文拆解加密交易风险评分工具究竟在度量什么、准确度与可解释性之间的取舍、监管为什么要求分值能读得懂,以及评估一个工具时该看什么。这些分值背后的筛查工作流见 Phalcon Compliance。本页属于 KYT 资源中心

KYT 风险评分度量的是什么

KYT 风险评分是附着在一个地址或一笔交易上的非法资金敞口的汇总。它由两类输入构成:与已知非法交易对手的直接敞口,以及经由多跳资金路径传递过来的间接敞口。

直接敞口是较简单的那一类。当一个地址与被制裁实体、暗网市场、混币器,或者被执法查封标记过的地址发生过交易,这条连接就是一次带标签的直接命中。间接敞口才是各家评分引擎分道扬镳的地方。资金是一跳一跳走的,而分层(layering)的存在本就是为了稀释可追踪的敞口。忽略多跳路径的引擎会低估风险,而把每一跳都当作同等高风险的引擎会高估风险。

处理得好的引擎会把多跳污染量化。Phalcon Compliance 报告敞口金额(Exposure Value,即经由已追踪路径抵达该地址的非法资金绝对值)与敞口占比(Exposure Percentage,即该金额占总流入的比例)。两者合起来回答检查官会问的两个问题:有多少非法资金经过这个地址,以及它的活动里有多大比例涉及非法资金。前者驱动冻结决策,后者驱动降险(de-risking)决策。

在敞口之上,分值还汇总风险指标。它呈现 17 个风险指标类别,覆盖被制裁实体、暗网市场、混币服务、诈骗与欺诈项目、被盗资金、恐怖融资、儿童安全、欺诈、赌博,以及其他非法与高风险活动。每个指标都是一个有标签、可归因的信号;分值是这些指标与敞口数字的加权组合,而不是一个不透明的模型输出。

完整的地址风险详情,展示分值拆解与敞口数字

用检出能力换解释能力

准确度这个问题不是单一维度的。它有两种,而且两种朝相反方向拉。

第一种是检出准确度:引擎抓新出现、此前从未见过的洗钱模式抓得有多好。黑箱机器学习模型在这一项上有优势。一个在图模式上训练过的模型,能标出一段它从未见过带标签的拆分或分层序列,因为这段序列在统计上看起来像已知的坏行为。对新兴的作案手法,行为模型能抓到只靠标签的引擎会漏掉的东西。

第二种是可解释性:团队能不能书面地、并且在检查场合下,说清一个分值为什么是这个值。标签驱动的白箱引擎在这一项上取胜。一个由具名风险指标与量化敞口金额构成的分值,在构造上就是可解释的。合规官可以指出是哪个指标、哪个交易对手、多少金额,并把这些写进可疑交易报告。而由模型内部权重驱动的分值没法这样拆开,分值与解释之间的那道口子,就是检查发现(examination findings)诞生的地方。

这个取舍不是买一个更贵的工具就能解决的。白箱引擎的新鲜度上限就是它标签的新鲜度:如果本月有一个新的混币器上线、标签还没传播开,那么对已经与它交易过的那些地址,引擎就会低估风险。行为模型能更早抓到这个模式,但很难以监管接受的方式解释这次抓取。现实的立场是:最强的评分层把两者结合起来——用标签驱动的指标换可解释性,用行为检出覆盖新兴模式。

监管为什么要求可解释的分值

FATF 的风险为本方法要求 VASP 理解自己正在承担的风险,而 FinCEN 的反洗钱体系规则(31 CFR 1022.210)要求这套体系本身有书面记录、可供检查——这正是为什么每一个决策的推理过程都必须能被重建出来。监管不会孤立地给一个风险评分打分,他们打分的是:团队能不能为这个分值所驱动的那个决策辩护。一个触发了冻结的高分值必须说得出理由;一个放行了某笔后来被证实为非法的交易的低分值,同样必须说得出理由。一个合规团队解释不清的分值,会被读成体系缺陷——不管底层引擎实际上有多准。

这在运营实践中是看得见的。使用加密筛查工具的合规从业者,把「向监管解释风险评分」这项要求描述为一种活生生的运营压力,而不是一种理论偏好。历次检查周期中反复出现的主题,就是需要向检查官解释评分决策;而检查发现往往被归因为那些拆不开的分值。

监管框架支持这一点。面向虚拟资产服务提供商的 FATF 风险为本方法,期望的是持续监控与一套可审计的方法论,而不只是一个结果。检查官会把一套可审计的评分方法论读作「体系确实在运转」的证据;而会把一个他们审不了的黑箱分值,读作「一道纸面上存在、但无法核验的控制措施」——这比一道更简单但可核验的控制措施更糟。有准确度而没有可解释性,过不了检查这一关;有可解释性而没有准确度,过不了检出这一关。

风险指标与交易对手图谱,展示是哪些信号驱动了这个分值

白箱评分:17 个风险指标类别与敞口量化

白箱评分引擎会把自己的输入摊出来。Phalcon Compliance 就建立在这个原则上:它返回的每一个风险评分,都可追溯到一组具名的 17 个风险指标类别,以及量化的敞口金额与敞口占比。读到这个分值的合规官,能看见是哪些指标触发的、是哪些交易对手触发了它们,以及有多少非法资金流经了这个地址。

这 17 个风险指标类别覆盖的正是检查官期望看到的那些面:被制裁实体与地址、暗网市场、混币服务、诈骗与欺诈项目、被盗资金、恐怖融资、儿童性剥削内容、赌博,以及其他高风险与非法行为。每个指标都有标签、可归因。分值是这些具名信号的聚合,而每一个信号都可以被查看、被质疑,并被写进一个处置结论或一份监管申报。

敞口金额与敞口占比坐在这些指标之上,作为量化层。它们回答的是二元标记回答不了的多跳污染问题。一个敞口占比小但敞口金额大的地址,是一个交易量很大、非法污染有限的地址;一个敞口占比大但敞口金额小的地址,是一个被非法流入主导的小地址。同时报告这两个数字的白箱分值,让团队能挑对应对方式、冻对该冻的那笔钱。

实际结果是:这个分值在构造上就是可审计的。团队不需要事后重建推理过程——推理是跟着分值一起来的。

行为检出加敞口:抓住新的分层手法,同时保持可解释

只靠标签的白箱引擎,弱点在标签延迟。新的作案手法出现的速度快于标签传播的速度,而精心设计的分层手法,本就是为了把可追踪的敞口稀释到标签驱动分值不会触发的阈值之下。一个只依赖历史标签的评分层,会一直漏掉新模式,直到标签追上来——而到那时资金往往已经走了。

对策是在指标与敞口评分之上再叠一层行为风险引擎。平台内置的行为风险引擎,检测的是与分层、拆分以及各类资金流转手法相关的模式——这些模式可能还没有被打上任何标签。它看的是资金怎么动的,而不只是资金从哪来的,于是它能标出「看起来像洗钱」的活动,即便其中没有任何单个交易对手出现在制裁或非法名单上。

这个组合之所以要紧,是因为它在扩展检出范围的同时保住了可解释性。行为信号不替代指标与敞口评分,它是加上去的一层。当行为引擎标出一个地址时,这个标记本身就是一个风险指标,有自己的标签和自己的审计轨迹。合规官看到的仍然是一个具名、可归因的信号,而不是一个原始的模型输出。

这就是「准确度 vs 可解释性」这个取舍的现实解法:一个把带标签的指标与量化敞口,同一层行为检出配在一起的白箱引擎,既能抓住新兴的分层模式,又不必放弃检查所要求的可解释性。

为你的团队评估一个评分工具

当合规团队评估一个加密交易风险评分工具时,「准确度」这个问题必须被拆成检查场合下真正要紧的那三件事。在其中一件上强、另外两件上弱的工具,会恰恰在最要紧的那个节点上失手。

第一,这个分值能不能被解释。工具必须在分值旁边返回具名、可归因的风险指标,以及团队可以读进处置结论或申报材料的量化敞口数字。找厂商要一份分值拆解样例,看看指标与敞口数字是否可见、是否带标签、是否可追溯到交易对手。没有这份拆解的分值,是团队日后必须在手里没有证据的情况下去辩护的分值。

第二,这个分值能不能被审计。工具必须保留筛查历史、筛查当时的分值,以及驱动它的那些指标与敞口数字。检查官问的是这笔交易被放行那一天的分值是多少,而不是地址被重新打标之后今天的分值。不冻结历史记录的工具,回答不了这个问题。

第三,这个分值站不站得住。工具必须支撑团队的阈值逻辑、告警分派与可疑交易报告工作流。分值只有接进体系里才有用——风险区间要能映射到放行、挂起、拦截三种决策,审计轨迹要把分值与实际采取的动作连起来。一个准确度很高但接不进去的分值,是一个看板上的数字,不是一道控制措施。

老实说,「准确度」这个问题问的其实是:这个工具给团队的分值,能不能据以行动、能不能解释、能不能辩护——按这个顺序。它落实的是白箱原则:17 个风险指标类别、敞口金额与敞口占比,以及一个在不牺牲可解释性的前提下扩展检出范围的行为风险引擎。了解 Phalcon Compliance,看看这个评分层是怎么把你的检查记录所依赖的那些指标与敞口数字呈现出来的。

告警详情,展示附着在每一笔被标记交易上的评分证据

常见问题

构建实时、自动、可审计的 KYT 合规能力

从读懂监管义务到落地技术架构,系统性地提升虚拟资产交易的风险监控能力。