AI如何改变对性影像受害者的支援
- 5月20日
- 讀畢需時 5 分鐘
PAPS目前由两名工程师利用AI开发支援性影像受害者的系统。

影像一旦在互联网上扩散,要找出它极为困难。社交媒体、论坛、海外网站、视频网站……影像散布之处多种多样,仅靠人力持续搜寻存在极限。
自2019年起,PAPS在三菱财团资助下持续开展利用机器学习的受害对策研发。自2022年度起,也正式投入AI支援系统的开发。过去一年AI技术突飞猛进,为此前只能依赖人力的工作开辟了新的可能。
ProtectionAI——找出受害影像的系统
目前开发中的"ProtectionAI",是用于搜寻受害者的性影像是否在互联网和社交媒体上扩散的系统。
AI基于受害者本人提供的影像读取面部特征,并转换为"512个数字的序列",专业术语称为"特征向量"。无法从特征向量还原出面部照片,因此可以以顾及隐私的形式登记。

然后与从互联网收集的影像进行比对,判断"可能是同一人的影像"。比对使用"余弦相似度",这是计算两组数据相似程度的方法。
目前ProtectionAI以约1亿张规模的影像数据为对象进行学习和分析。
我们在运用公开AI技术的同时,组合多种方法进行验证。另一方面,出于防止滥用和安全考虑,详细的模型构成和运用方式不予公开。
Paprika——去互联网上搜寻的系统
要找到受害影像,就必须去互联网的各个角落搜寻。为此,PAPS正在开发自己的爬虫系统"Paprika"。爬虫是自动巡回网站、收集所需信息的程序。"Paprika"这个名字是在PAPS的"PAP"后面加上"rika"造出的词。

受害影像会扩散到社交媒体、海外网站、匿名论坛、视频网站等各种地方,而且每个网站影像的存放和查找方式都不同。因此普通爬虫难以应对。
以前我们也研究过读取网页内部结构"DOM"进行自动操作的方法。DOM是指网页中按钮、输入框、图片、链接等的结构。但实际网站复杂多样、构造各异,常常行不通。
因此现在我们运用Vision AI,即"看着屏幕理解内容的AI"。就像人看着浏览器界面判断"这里有输入框""按这个按钮就行"一样,AI边看界面边思考操作方法。
Paprika还引入了让AI在安全的实验环境中自动编写并测试获取影像代码的机制。这个安全的实验环境称为"沙箱",是一个即使失败也不会影响外部系统的隔离空间。
AI开发中"化整为零"很重要
AI开发不仅在于使用高性能AI,整个系统如何构建同样重要。
PAPS重视"微型API化":不把AI功能捆成一个庞大系统,而是按功能拆小使用。
API就像从外部调用某个功能的入口。例如读取影像的功能、提取面部特征的功能、搜索相似影像的功能、操作删除请求表单的功能等,都各自拆分成小模块。
大型AI系统,尤其是使用GPU的处理,启动可能耗时。GPU是高速执行AI计算的装置。通过拆分,让需要的功能在需要时才运行,既提高效率,出问题时也容易找到原因。
以开发自研AI模型为目标
ProtectionAI基于受害者本人提供的影像读取面部特征,并与互联网上的影像进行比对。
目前面部识别的核心使用高性能面部识别AI模型。它精度高,在寻找受害影像方面发挥着重要作用,但我们的目标是将来开发并运用PAPS自研的面部识别AI模型。
原因在于,性影像受害支援要处理受害者面部这一极其敏感的信息。使用什么数据、如何训练、如何比对、谁能访问——必须能够按照支援一线的要求严格管理。
拥有自研模型,就能更细致地纳入专为受害者支援优化的精度改进、安全设计和防滥用机制。

另一方面,开发自研面部识别AI模型需要强大的计算能力,因此GPU等计算资源不可或缺。GPU是高速执行AI计算的装置。
PAPS目前配备了2台搭载AMD EPYC的数据中心级服务器、3台PC服务器、3台NAS和7块GPU。AMD EPYC是面向大规模处理的服务器用高性能CPU,NAS是可供多台服务器使用的大容量存储设备。
此外,我们在SSD价格暴涨前确保了32TB的SSD,正在构建处理大数据的环境。
与热和噪音的搏斗
AI开发中,除了计算能力,"热"和"噪音"也是重大课题。
GPU在进行AI计算时会产生大量热量。长时间高负荷运行会导致温度过高、性能下降、设备寿命缩短。因此将GPU温度保持在60度左右很重要。

PAPS给GPU加装散热片,并使用多台循环扇和风扇防止热量积聚。散热片是散发设备热量的金属部件。去年夏天非常严酷,今年夏天之前必须考虑更彻底的散热对策。
另外,服务器和GPU在办公室内运行,冷却风扇的噪音也是问题。因此我们大量使用12厘米大型风扇,即使低转速也能确保足够风量。
AI开发不只是算法,也是与热、噪音、电力、摆放空间这些相当朴实的问题的搏斗。
"搜寻技术"的可怕之处
另一方面,人脸搜寻技术也有重大课题。开发之初,我们没有想到它能以如此高的精度找到人脸。实际运用中,有时它以超出预想的精度找到影像,在惊叹于大数据和AI力量的同时,我们也感到了恐惧。它甚至找到了近10年前受害、如今网络搜索已无法找到的当事人的影像。
能够搜寻受害者的影像,反过来说,也意味着某人过去是否遭受过性影像伤害,可能在几秒钟内就被查出来。
为帮助受害者而生的技术,也可能被用来监视他人、揭人旧事、实施歧视和骚扰。正因如此,PAPS重视构建"无法被滥用的机制"。
此外还有一个难题:要搜寻受害影像,支援方就必须查看受害者的面部。"希望被找到"与"不想被看到"的心情同时存在。性影像受害支援中存在这样的两难。PAPS在开发中同时思考社会所需的支援与每个人的隐私保护。
AI技术的进步,正在扩大将过去耗费大量人力时间的工作部分自动化的可能。但在性影像受害支援中,AI不是魔法道具。精度、成本、热与噪音、安全,以及如何守护受害者的隐私与尊严,都是课题。
PAPS开发AI,不是因为想使用新技术。目的是让受害者能够尽早、安全地找回自己的生活。
另一方面,面部识别AI技术一旦使用不当,就有被滥用于监视和骚扰的危险。正因如此,PAPS重视"谁、为了什么、可以使用到什么程度"的规则。
为防止滥用,API规格和详细搜索方法等信息也不应公开。我们在珍视透明度的同时,为守护受害者安全,谨慎区分可公开与应保密的信息。
隐私保护是最重要的原则。同时,找到违背本人意愿扩散的影像并连接到删除请求,具有很高的公益性。以本人同意为前提、在必要最小范围内、严格管理地使用技术,这一点至关重要。
PAPS将继续直面AI的便利与危险,为守护受害者的尊严而开发。



