互联网诈骗检测数据集是一个多语言 NLP 数据集,包含 24,000 条消息记录和 37 个特征列,覆盖 7 种语言、26 个类别、30 种诈骗模式和多个通信平台(WhatsApp、电子邮件、短信、Telegram、社交媒体)。作为合成数据集(v1),使用占位符信息生成,不含真实个人信息,通过 35 项质量验证,实现诈骗与良性消息平衡分类,无重复和缺失值,适用于诈骗检测研究和网络安全教育。
数据集简介
数据集概述
数据集采用 37 列多维特征结构,涵盖身份与文本(诈骗 ID、消息文本、主题)、分类标签(类别、标签、诈骗模式)、上下文信息(平台、语言、国家/地区、日期)、诈骗分析特征(策略、情绪、紧迫性、风险评分)、检测特征(链接、电话、电子邮件、一次性密码、付款请求)以及机器学习支持特征(字数统计、字符数统计、数据集划分)。30 种诈骗模式和 26 个类别提供细粒度的诈骗类型标注,风险评分和检测难度级别为模型训练提供额外监督信号,多语言和跨平台覆盖确保数据集的全球适用性和场景多样性。
该数据集支持诈骗检测模型训练、网络钓鱼识别、欺诈模式分析、多语言 NLP 分类、跨平台威胁检测以及安全意识教育等应用。研究人员可以开发文本分类器识别诈骗消息、构建风险评分模型量化威胁程度、训练多语言模型处理国际诈骗活动,或设计特征工程方法提取诈骗信号(紧迫性语言、操纵技巧、敏感信息请求)。数据集的合成性质和隐私保护设计使其适合公开研究和教学使用,第二版计划扩展数据规模、增强多样性和引入更高级的诈骗模式,为开发鲁棒的反诈骗系统和提升网络安全防护能力提供持续的数据支持。
数据集来源
该数据集为合成 NLP 数据集(v1),包含 24,000 条消息记录和 37 个特征列,覆盖 7 种语言、26 个类别、30 种诈骗模式和多个通信平台(WhatsApp、电子邮件、短信、Telegram、社交媒体),使用占位符信息生成以保护隐私,通过 35 项质量检查,专为诈骗检测研究和机器学习实验而构建。由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-62
文件大小:822K
原创声明:本数据集为整理作品