风控领域的知识图谱在构建和应用方式上与通用的知识图谱有很大的不同,本次介绍的内容主要包括三个方面:
1. 风控领域知识图谱
2. 风控知识图谱的应用
3. 风控领域知识图谱的发展与展望
分享嘉宾|徐德华 翼支付 总监
编辑整理|程思琪 北京师范大学
文字校队|李瑶
出品社区|DataFun
01
风控领域知识图谱
1. 什么是风控?

风控,即风险控制,它和我们的业务场景密切相关。翼支付当前主要的三个业务场景是支付场景、电商场景和信贷场景。在这三个领域我们会面对不同的风险。
支付场景中最需关注的问题一是洗钱风险,不法分子可能通过我们的支付平台完成套现、赌博、资金转移等系列洗钱操作;二是实现对个人账户的保护,比如支付账户的盗用、银行卡盗刷等一系列的反赌反诈工作。
电商场景中最经常的一些问题包括“羊毛党”套利(平台活商家进行营销活动时,羊毛党通过刷单或者号召型套利等方式,恶意侵占营销资源并获利),以及虚假商户、虚假交易等现象,使得公司或用户都蒙受一定的损失。
信贷场景中最常碰见的是中介欺诈,比如骗贷或撸网贷的中介村,以及一些明显具有信贷违规和欺诈的个人申请,都是现在业务场景会面临的风险。
2. 职业黑产的现状

315晚会上曝光了黑产给水军刷好评的情况,这只是黑产整个工作体系中的一部分。当今黑产的技术非常全面,分工也非常明确,在上游它会有专门提供号卡资源的猫池/卡池、云手机、设备农场这一系列所谓黑产生产力工具的提供方;他还会有提供接发注册短信验证码的平台,专门提供一键部署、一键控制多个账户这种操作脚本的团队,以及整条黑产产业链不同角色的细致分工。根据我们的对抗经验来看,黑产不但非常勤奋,而且非常专业,有时6点开始的活动,黑产可能在前一天或者凌晨的两三点就开始准备了。同时黑产提供的一些作弊工具和脚本,不但有完整的版本管理和维护,还支持一系列升级和调优,提供完整的“售后服务”。从研究报告来看的话,黑产整个产业的规模已超过千亿,从业人员也超过了160余万,据公开报告估计,黑产造成的损失将近千亿,还出现了集团化、区域化、产业链分工明确的特点。
3. 翼支付的风控体系

为了对抗黑产,我们有一套完整的风控体系,图谱是其中的一部分。底层收集存储多模态的数据,包括用户的行为、用户注册的图像资料、填写的文本资料、用户的操作交易数据以及一些三方运营商、行业名单等一系列的数据。有了底层的数据,构建独立的风控角色引擎,包括风控的AI引擎和分析处置预警模块,在此基础上使用一整套完整的管理系统,管理指标模型和规则知识库,从而实现贯穿事前、事中、事后用户全生命周期的风险管理。
具体到 AI 技术,主要涉及以下几方面。第一,在用户进件的时候应用视觉反诈的CV技术,基于身份证和营业执照等信息,完成对人脸攻击的识别,以及证照合成、篡改等场景的检测。第二,电商场景中很多时候是没有样本标签的,这时候就需要使用无监督的方法识别。第三,在各类已知风险的精准识别和用户信用评估的场景中,需要使用有监督的学习。另外,随着监管要求越发完善,我们会基于联邦学习技术,实现不同公司之间的合作。此外最重要的就是知识图谱。
4. 翼支付图谱建设情况

翼支付从三个维度完成知识图谱建设,面向支付业务的,目前存量的点边数据达百亿级。面向金融业务差不多是 10 亿级的这种体量。第三部分通讯反诈的工作,因为涉及到通讯数据,它的体量就非常惊人,短时周期的存量在百亿级
5. 翼支付图谱与通用知识图谱的主要区别

在翼支付风控知识图谱构建的时候,和所谓行业通用的知识图谱的不同主要体现在三个方面。
① 构建范式
金融机构有两个明显的特点,一个是强schema,另一个是自上而下的建设。图谱的整个 schema 定义是先由业务同学按照使用需求和实际业务场景预先定义,比如说支付图谱构建前已经明确定义涉及到的主体和需要维护的关系,定义好之后再开始进行图谱的构建,所以它是自上而下的体系,较少涉及通用知识图谱构建过程中需要在海量数据里面做实体抽取、实体对齐、关系推理等的工作。
② 数据体量
金融图谱无论是存量的体量还是日增的体量是非常惊人的,同时它对数据时效性的要求也非常高。金融场景留给风控的决策时间基本是在毫秒级,短的话几十毫秒,长的话在100 毫秒左右,在这个时间段中需要完成整个风控的决策链路,而不仅仅是知识图谱的推理,所以对时效性有非常高的要求。
③ 数据质量
因为金融机构是受强监管的,不像通用图谱需要面向全互联网去爬取数据,所以数据质量会高很多,基本不太会有异常数据缺失这样的问题,在构建图谱的时候也不存在类似于实体对齐或者实体多元化的问题。这就是我们在构建风控领域图谱和通用图谱之间一些明显的不同。
02
风控知识图谱的应用

云篆知识图谱的使用对象主要有两类,业务人员和算法人员。翼支付的知识图谱已经走过了几代的历程,第一代是基于商业版的neo4j,但当数据体量到了一个级别时,明显地遇到了一些瓶颈,其商业版本的架构也不能很好地满足实际高并发和分布式的需求。所以在设计2.0版本时,着力解决了1.0版本的问题,构建了翼支付的云篆知识图谱。

对于业务人员来说最重要的一个部分的几个功能,第一是可视化的探索,以直观的方式来展示账户、设备、授信等完整的使用过程。
1. 翼支付图谱的应用架构

首先,在数据层面,图谱收集自有的数据和能拿到的第三方数据,包括运营商和一些公开数据,作为底层数据基础。在整个图谱构建平台中可以实现任务调度、指标管理、知识建模等一套能力。构建平台有效发挥作用的前提是存储系统。翼支付的存储系统有两大特点,一是分布式,二是可以存储多模态的数据,多模态模型的融合会对风控的工作有很明显的提升。
在管理平台和底层的存储平台之上,平台支持定制化和优化性能的应用工具,如针对节点分析、路径分析和离线长周期的分析任务的工具。此外平台还支持图算法库。
图算法可能有分两大类,一类是传统的偏图论的算法,如Louvain、WCC、标签传播等算法;第二类就是偏图深度学习的算法,比如说GCN,GAT,Graph Sage 等,平台提供完整的算法库,服务于洗钱、欺诈的审核,以及企业关系的挖掘等场景。
面向业务同学的一个很重要的功能是可视化探索,可以直接在平台中输入想查询的实体,如手机号、设备名称、商户名称等,从而准确地定位到该实体,并且通过点选层层拓展的方式,挖掘出来与该节点关联的整套关联关系。从实际使用经验来看,可视化的呈现方式可以让业务专家和非技术同学第一时间直观地明白待分析问题的整体分布情况,并且能够很清晰地看到整个问题的全局,从而显著提升分析的效率。
2. 翼支付图谱的核心功能
① 大数据体量下的可视化
能把可视化做好,尤其是在大数据体量下能把可视化做好,也需要很多tricks。比如说如何处理大节点的问题,当拓展的时候,多层多节点存在不可控的因素时怎么来做优化。可视化探索包括在线探索和离线任务两类,当关注点在长周期的任务上时可以采用离线的方式。
② 多模态数据融合
传统的图数据库重点关注图数据的存储。但当前的场景中除了图数据,还有很重要的一部分是多模态数据,如在业务申请中提交的图像信息,在面临中介申请攻击的情况中,提交的图像信息与图谱上其他节点,如操作设备的IP、Wifi名等,存在一定的关联性,此外申请时不同申请人背景图像有时可以明显辨认出在同一场景下。通过多模数据融合的方式,我们可以把图像的信息和图谱融合在一起,当业务人员使用时,它会非常迅速地判断出来这是一个可能的中介团伙,从而避免跨系统、跨层级使用的壁垒。
③ 质量监控
对于管理图谱的角色来说,了解当前图谱整体的体量与运行状况非常重要,平台提供了非常清晰和直观的质量监控功能。如前所述,因为图谱分析时有很多长周期的任务,不能实时交互得到结果,任务调度功能提供一套完整的后台调度的能力,可以对任务做优先级排序,查看历史任务的执行情况与完成情况,并且还可以把单次跑批的结果写回图谱或导入到其他系统,方便对接下游机器学习模型任务。
④ 可视化拖拉拽探查
在实际使用中发现,技术的同学一般会通过写cypher方式完成查询任务,但要求每一个业务同事熟练掌握cypher并不现实,平台提供了拖拉转点选的功能,帮助业务同事实现图谱的复杂查询的能力。用户可以定义想查的模式,如账户登录了某些设备,并且这个账户同时和另一些账户之间存在交易行为,也可以限定账户注册时间等。这些复杂的查询条件,可以通过拖拉拽的模式匹配的方式实现一些较为复杂的查询,业务人员在处理和分析问题的时候就不会完全地受限于技术,也不用完全靠自己在图上逐层点击进行可视化探索,从而提升效率。此类任务结合平台的调度功能,可以实现结果的实时或离线反馈。
⑤ 数据角色权限管控
对金融机构来说,权限的管控非常重要,不同的部门可以查看使用的数据权限不同,需要对数据权限做隔离;不同角色可以查看的图谱、同一图谱对不同用户所展示的节点和关系范围都可以进行精细化配置。另外,不同用户可以使用的功能,如是否可以对图谱做编辑,是否可以对schema 做修改,也能通过权限管控的方式来实现安全的隔离,从而满足业务要求。
3. 翼支付图谱的图算法体系

图谱算法常见有三类方法。

第一类为SUBGRAPH基于子图的挖掘,无论是通过Louvain、WCC 或者其他办法,从图上找这种可疑诈骗团伙,尤其是在这种大规模攻击的这种场景下,比如说洗钱、套利,可以基于单点的挖掘实现对簇的挖掘。
第二类是MetaPath,基于模式匹配的方式,业务人员积累的业务经验可以帮助识别某些异常的结构,比如用户经过三路转账到商户中提现,这样一种单链路的模式也存在业务隐患的。这种长链路的匹配使用传统 SQL 数据库的方式不能支持三度及以上的join。图谱实现长链路挖掘就具有明显的优势。

第三种方法是GNN,通过图神经网络的方法,将图谱结构数据和属性数据相结合,从而提升模型效果,基于子图挖掘的方法有一个典型的场景——团伙欺诈,如信贷欺诈的黑中介以及羊毛党。

第一个案例图中可以看到通过分析紫色节点和几个红色节点可以关联出一个非常大的团伙。如果是用传统方法的话,对于单节点的一度统计,可以通过SQL实现。但是这样难以用全局的视角认知整个风险场景,难以估计整体风险规模。通过GNN的方法,在某一些洗钱类犯罪中可以达到99%以上的认定率,并且上报量也有一个明显的提升。
第二个是中介欺诈的案例,在个人金融业务中,中介会帮个人信用状况较差的用户做包装,使其可以通过授信申请,中介会把用户的申请的借款用砍头息的方式抽成牟利。这个案例中,结合多模态的数据,可以非常更直观地发现节点都是来自于同一个地方的中介团伙,从而完成团伙挖掘。在实际走访时还有这样的场景,当营业员给用户办业务时,不告诉用户办理业务附赠高价值赠品,只给用户小额返现,营业员私自留下赠品后拿去变现。对用户来说,此类行为已经构成欺诈。这类行为衍生出更复杂的模式,如营业员a帮用户办整个订单业务,另一个营业员b负责给用户转账兑现承诺的优惠金额。这两个营业员在设备上存在交集,而且在代理商的从属关系上存在关联关系,抽象此类场景成图的模式,可以通过cypher或模式匹配的方式表征出来,从而有效利用业务专家的经验,识别准确性大大提高。通过配置实时监控,可以实现中介欺诈行为的拦截。
第三个案例利用了GNN的方法。GNN的优点是同时融合图的结构信息和节点的属性信息。图上的细节部分放大看,可以发现整个资金链路是长链路的回转,并且在整个资金流转的时候,逐层会有10%资金损耗,这就是某类洗钱犯罪的一个比较典型的方式。因此在设计方案的时候,第一,预先定义了大量可疑的基本拓扑结构,如长链式、交叉环状,以及资金集中转入转出的基本的结构模式,作为图谱节点拓扑信息的一部分;第二,补充了一些用户的属性信息,如洗钱的案例中资金折损是一个非常明显的特征行为,所以图谱中将资金折损信息也做成了一个属性;第三块,融合了用户的行为模式,经过分析,洗钱用户在其团伙内具有明确的相似性,并且与正常用户的行为模式有很大差别,图谱也实现了这部分信息的表征,最后图谱中的节点信息和整个图的结构信息相结合,实现了中介诈骗团伙场景的挖掘。
03
未来展望

近年来图神经网络的计算框架有很大的发展,基于DDL 或者pyG等框架可以实现大规模知识图谱的搭建。翼支付当前的版本体量在千万级左右,支持分模式的图深度学习模型的训练。在ChatGPT广受关注的背景下,和大家聊一下对图谱的未来展望。
1. 数据层面
早期大家最关注数据的存储,强调如何设计更高效的分布式存储从而实现查询性能的提升。通过这些年的努力,目前主流的技术方案已满足业内的需求。当前我们更关注随着GPT等大模型的兴起,知识图谱本身是否会被重构。目前图谱的构建方式更偏重于经验或者规则,但随着GPT等模型的验证使用,我们会发现GPT本身找到了某一种方式,把大量图的知识存储在了自己的网络结构中,在某种意义上它也是实现了知识的存储。怎么把这类大语言模型实现知识存储的方式同目前知识图谱已有的技术架构进行结合,以提升图谱的构建效率和使用中的灵活性,那可能是未来需要重点关注的内容。
2. 系统实时性要求
其次在实际金融场景的应用中,留给风控分析的时间非常短,所以风控领域对数据实时入图、实时响应的效率要求非常高,这也是未来优化和探索的重点方向。
3. 应用场景
目前市场上虽然有一些比较成熟的分布式训练框架产品了,但是在效率上还存在需要优化和提升的地方;另外,针对多元异构数据的融合,目前图谱训练还是基于拓扑结构数据和特征集市类的数据,未来如何将图像数据,甚至音频视频等多模态的数据融合进知识图谱,实现多元异构数据的融合训练将是未来探索的方向。此外出于数据安全等原因,跨机构的联邦联控的时候,目前的联邦无法实现流转的拓扑关系信息,这也是翼支付和监管机构正在探索的基于图联邦识别中介、诈骗的工作。
此外因为金融行业是受强监管的机构,因此对整个模型体系的安全、隐私、公平也会有一定要求,如何在模型设计的时候兼顾好这些问题也是未来在图谱上会做思考的一些方向。
04




