Backtranslation and paraphrasing in the LLM era? Comparing data augmentation methods for emotion ... 📅 发布时间:2026/8/26 18:04:39 👁 浏览次数: 文章主要内容总结本文聚焦自然语言处理(NLP)中的数据增强方法,旨在探究在大语言模型(LLM)时代,传统的数据增强方法(如回译、释义)能否借助新一代模型达到与纯生成式方法(如零样本/少样本生成)相当的效果。研究以情感分类任务为背景,采用GoEmotions数据集(存在类别不平衡问题,重点关注5个样本量最少的情感类别),对比了四种数据增强方法:过采样(基线方法,通过复制样本解决类别不平衡);基于LLM的释义(使用GPT-3.5和GPT-4,设计不同提示词策略);零样本/少样本生成(使用GPT模型生成新样本);回译(使用DeepL、GPT系列模型、MarianMT等工具,通过多语言翻译生成样本)。通过评估生成数据的质量(词汇多样性、语义保真度)和对分类性能的影响(基于LaBSE和DistilBERT模型微调后的F1分数),研究发现:回译和释义方法的效果可与甚至优于零样本/少样本生成;其中,使用DeepL的回译方法在分类性能上表现最佳,而GPT模型的释义方法在词汇多样性上更具优势。创新点系统对比传统与生成式方法:首次在LLM框架下,系统比较了传统数据增强方法(回译、释义)与新兴生成式方法(零样本/少样本生成)在情感分类任务中的效果,填补了相关研究空白。多维度评估体系:不仅关注分类性能提升,还从词汇多样性(词数比、Jaccard差异度等)和语义保真度(余弦相似度、BERTScore等)多角度评估生成数据质量