标签： AI

如何让大型语言模型(LLMs)充分利用长文本信息?——微软提出的FILM方法

大家好,相信不少人已经体验过ChatGPT等大型语言模型(LLMs)强大的对话和写作能力。但你可能不知道,目前的LLMs在处理长文本(如长篇小说、学术论文等)时,还面临着一个棘手的问题,那就是”迷失在中间”(Lost-in-the-Middle)。

什么是”迷失在中间”?简单来说,就是模型在阅读一篇很长的文章时,往往能很好地理解文章开头和结尾的内容,但对中间段落的重要信息却视而不见。这就像我们看一部电影,只记住了精彩的开场和结局,但对中间情节毫无印象。

微软的研究人员推测,造成这个问题的原因,可能是目前用于训练LLMs的长文本数据存在偏差——它们没有明确告诉模型:文章的每个部分都可能包含关键信息,要认真对待!这就导致模型养成了”重两头、轻中间”的坏习惯。

为了纠正这个偏差,研究人员提出了一种名为”信息密集型训练”(Information-Intensive Training,简称IN2)的新方法。它的核心思想是:人工合成一批长文本问答数据,其中的问题都需要模型在长文本的不同部分准确定位信息,并将它们联系起来进行推理。通过在这样的数据集上反复训练,模型就能学会关注长文本的每个细节。

研究人员以Mistral-7B模型为基础,应用IN2训练方法,得到了一个名为FILM-7B的新模型。为了全面测试它的长文本理解能力,他们还精心设计了多个探测任务,覆盖不同的文本类型(如文档、代码、表格数据等)和信息检索模式(如串联、跳跃、双向等)。

在这些探测任务上,FILM-7B展现了出色的表现,证明它能够灵活地在长达32,000词的超长文本中准确定位关键信息。更令人兴奋的是,在现实世界的长文本应用中,如长篇问答(NarrativeQA)任务,FILM-7B的F1分数也从23.5大幅提高到26.9,而在需要推理的常识问答(CSQA)等短文本任务上,性能并未下降反而小幅提升(59.3%->59.2%),可见IN2方法的有效性。

此外,研究人员还将FILM-7B与其他知名的开源长文本模型(如ChatGLM、LongChat等)和商业模型(如GPT-3.5/4)进行了比较,结果显示FILM-7B在大多数长文本任务上都实现了最佳表现,充分证明了IN2训练的潜力。

当然,FILM-7B还有进一步改进的空间。例如,研究人员分析发现,在训练过程中合理使用”滑动窗口”和”位置编码”等技巧,有望进一步提高模型性能。未来,他们还计划在更大规模、更多样化的真实数据上应用IN2方法,以进一步提升FILM系列模型的长文本理解能力。

总之,这项研究为LLMs在长文本处理上的瓶颈问题提供了一种简单有效的解决思路,相信通过更多研究者的努力,LLMs必将在各类长文本应用场景中发挥更大的价值。感兴趣的读者可以访问论文 [项目网站](https://github.com/microsoft/FILM) 了解技术细节并动手实践。

以上就是我对这篇论文的通俗解读,不知你觉得如何?欢迎在评论区交流你的想法!

2024 年 4 月 26 日
破解AI模型速度瓶颈：一种全新的「分组查询注意力」方法

你是否曾经对人工智能模型的运算速度感到不耐烦，同时又希望它能保持高质量的预测结果？这可能听起来像是一个无法两全的问题，但科研人员们并没有停下探索的脚步。今天，我们要介绍的这篇研究报告，就给出了一个行之有效的解决方案。这篇研究名为 “GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints”，由来自Google Research的团队所撰写。他们提出了一种称为「分组查询注意力（Grouped-query attention, GQA）」的新方法，旨在解决Transformer模型中的一个关键问题，即如何在保持预测质量的同时，提高模型的运算速度。

首先，让我们理解一下这个问题的背景。在Transformer模型中，一个关键的计算过程就是自回归解码器推理。这个过程需要大量的内存带宽来加载解码器权重和所有注意力键值，这就大大限制了模型的运算速度。为了解决这个问题，研究者们提出了多查询注意力（Multi-query attention, MQA）方法，它只使用一个键值对来大幅度提高解码器推理的速度。然而，MQA方法可能会导致预测质量下降，而且也不太适合用于训练单独的模型以提高推理速度。

在这样的背景下，Google Research的团队提出了两个重要的贡献。首先，他们发现，可以使用少量的原始训练计算来将具有多头注意力（Multi-head attention, MHA）的语言模型检查点进行升级训练，使其能够使用MQA，这是一种非常成本有效的方法，可以同时获得高速的MQA和高质量的MHA检查点。其次，他们提出了分组查询注意力（GQA）的概念，这是一种在多头注意力和多查询注意力之间的插值方法，它为每组查询头部共享一个键和值头部。

GQA的工作原理是将查询头部分成若干组，每组共享一个键头和值头。具有G组的GQA被称为GQA-G。GQA-1（具有一个组，因此具有一个键和值头）等同于MQA，而具有等于头部数量的组的GQA-H等同于MHA。通过使用中间数量的组，GQA可以产生一个质量比MQA高，但速度比MHA快的插值模型。此外，对于大型模型，GQA的优势更加明显，因此，我们期待GQA能在大型模型中提供一个特别好的权衡方案。

在实验部分，研究者们使用了基于T5.1.1架构的所有模型，并对T5 Large和XXL的多头注意力版本，以及使用多查询和分组查询注意力的升级版T5 XXL进行了主要实验。实验结果表明，使用GQA的T5-XXL模型在各种不同的数据集上，包括CNN/Daily Mail, arXiv, PubMed, MediaSum, 和 MultiNews等新闻摘要数据集，以及WMT英德翻译数据集和TriviaQA问答数据集上，都保持了与多头注意力模型相近的质量，同时又具有与多查询注意力模型相近的速度。

在AI领域，我们一直在寻找提高效率和质量的方法，而GQA的出现无疑为我们提供了一个新的可能。它不仅提高了模型的运算速度，而且还成功地保持了预测的质量。这使得GQA成为了提高AI模型性能的一种有力工具，我们有理由期待，这种方法将在未来的AI应用中发挥更大的作用。

总的来说，这项研究的重要性在于，它不仅提供了一种提高AI模型速度的有效方法，而且这种方法还能保持模型的预测质量。这使得我们可以在实际应用中实现更快、更准确的AI模型，从而在各种场景中提供更好的服务。

这就是今天的分享，希望你们能从中获取到有用的信息。我们将继续关注更多的人工智能研究，并与大家分享。感谢你们的倾听，我们下次见！

2023 年 11 月 21 日

标签： AI

如何让大型语言模型(LLMs)充分利用长文本信息?——微软提出的FILM方法

破解AI模型速度瓶颈：一种全新的「分组查询注意力」方法