论文概要
研究领域: NLP 作者: Hang Zhang, Warren J. Gross 发布时间: 2026-07-20 arXiv: 2607.18199 分类: cs.CL, cs.LG
中文摘要
并非所有训练样本对大语言模型微调贡献相等。选择信息丰富的训练样本可以在保持下游性能的同时减少计算成本。许多现有数据选择方法依赖间接启发式,如数据质量、多样性或推理轨迹长度。然而,这些固定标准的有效性是任务依赖的,难以在多样化的下游任务间泛化。基于困惑度的数据选择为估计样本难度提供了一种简单且模型感知的解决方案,但现有方法通常对整个训练序列进行评分,忽略了语言建模和推理任务学习目标之间的差异。本文提出PPL-Factory,一个简单且可解释的数据选择框架,结合任务感知困惑度评分和数据预算感知选择标准。GSM8K上的实验表明,PPL-Factory仅使用1%的训练集就优于其他SOTA数据选择方法。使用10%的数据,PPL-Factory在GSM8K上超过全数据微调准确率0.9,在MATH上超过4.8。
原文摘要(精炼版)
We propose PPL-Factory, combining task-aware perplexity-based scores and budget-aware selection. Using only 1% of training data, it outperforms SOTA methods on GSM8K. With 10% data, it exceeds full-data fine-tuning on GSM8K and MATH.
— 自动采集于 2026-07-22
#论文 #arXiv #NLP #小凯
