互联网诈骗检测数据集:用于检测诈骗、网络钓鱼和欺诈信息的多语言自然语言处理数据集 互联网诈骗检测数据集是一个多语言 NLP 数据集包含 24,000 条消息记录和 37 个特征列覆盖 7 种语言、26 个类别、30 种诈骗模式和多个通信平台WhatsApp、电子邮件、短信、Telegram、社交媒体。作为合成数据集v1使用占位符信息生成不含真实个人信息通过 35 项质量验证实现诈骗与良性消息平衡分类无重复和缺失值适用于诈骗检测研究和网络安全教育。数据集简介数据集概述数据集采用 37 列多维特征结构涵盖身份与文本诈骗 ID、消息文本、主题、分类标签类别、标签、诈骗模式、上下文信息平台、语言、国家/地区、日期、诈骗分析特征策略、情绪、紧迫性、风险评分、检测特征链接、电话、电子邮件、一次性密码、付款请求以及机器学习支持特征字数统计、字符数统计、数据集划分。30 种诈骗模式和 26 个类别提供细粒度的诈骗类型标注风险评分和检测难度级别为模型训练提供额外监督信号多语言和跨平台覆盖确保数据集的全球适用性和场景多样性。该数据集支持诈骗检测模型训练、网络钓鱼识别、欺诈模式分析、多语言 NLP 分类、跨平台威胁检测以及安全意识教育等应用。研究人员可以开发文本分类器识别诈骗消息、构建风险评分模型量化威胁程度、训练多语言模型处理国际诈骗活动或设计特征工程方法提取诈骗信号紧迫性语言、操纵技巧、敏感信息请求。数据集的合成性质和隐私保护设计使其适合公开研究和教学使用第二版计划扩展数据规模、增强多样性和引入更高级的诈骗模式为开发鲁棒的反诈骗系统和提升网络安全防护能力提供持续的数据支持。数据集来源该数据集为合成 NLP 数据集v1包含 24,000 条消息记录和 37 个特征列覆盖 7 种语言、26 个类别、30 种诈骗模式和多个通信平台WhatsApp、电子邮件、短信、Telegram、社交媒体使用占位符信息生成以保护隐私通过 35 项质量检查专为诈骗检测研究和机器学习实验而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-62文件大小822K原创声明本数据集为整理作品