Scout: Leveraging Large Language Models for Rapid Digital Evidence Discovery 文章主要内容和创新点主要内容本文提出了一个名为Scout的数字取证框架,旨在解决当前数字取证中因数据量激增(如存储设备容量扩大、设备类型多样化)导致的调查效率低、假阳性多、处理延迟等问题。Scout利用大型语言模型(LLMs)和多模态模型,对 seized 的数字证据(包括磁盘镜像、网络数据包、内存转储、文本、音频、图像、视频、办公文档等)进行初步处理和优先级排序,快速识别出与调查相关的潜在证据,为取证人员提供分析顺序建议,辅助其高效开展后续手动验证工作。创新点提出Scout原型框架,通过基础模型(LLMs、多模态模型等)优先处理证据,帮助取证人员更快定位关键信息。不干扰调查过程或证据完整性,避免证据污染风险。部署灵活,可在完全离线的本地环境、 premises 环境或云端部署,支持多地点访问。支持多种证据类型(文本、图像、视频、网络数据包等),并可通过插件扩展处理能力。允许取证人员选择不同模型或同一模型的多次运行结果,以挖掘不同维度的信息。翻译部分摘要近年来,技术的进步以及技术在日常活动中的普及,使得数字证据在越来越多的法律调查中出现的可能性大幅增加。消费级硬件的性能不断提升,内存和存储容量扩大,处理器能力增强。取证调查人员在调查过程中常常需要筛选数十亿字节的数据,这一过程十分繁琐。内存取证、磁盘分析等都有先进工具支持,这些工具通过提供字符串搜索、图像文件分