重大突破!AI数据获取成本 “大跳水”,微调或将成历史?

发布时间2025年2月28日

在人工智能和机器学习的世界里,数据被视为其前进的关键燃料,而监督数据更是 “高品质燃料”,能让模型的性能表现更出色。

然而,获取这些监督数据的成本堪比天价。以图像识别领域为例,训练一个能精准识别图像的 AI 模型,可能需要成千上万张标注好的图片,从简单的日常物品到复杂的场景元素,这些标注工作往往得靠人工一点点完成。

就模型微调来说,这不仅仅是一个资源密集型的过程,还常常伴随着误差和不一致的问题。高昂的人工监督成本,使得许多小型企业和研究团队望而却步。

不过,最近有篇论文给出了答案,有望改变这一局面。研究人员通过一种创新的方法,成功降低了数据获取的成本,并且能够不再依赖昂贵的微调和监督,为未来的 AI 模型优化带来了新的思路!


01 无需微调,数据获取成本大降?

这次的研究,主要围绕大型语言模型(LLM)的转向方法展开。转向方法的目的是让 LLM 在推理时,能给出符合我们期望的结果,比如生成更真实、更有用的内容。

但是,以往的转向方法高度依赖监督数据,打个比方,就像老师一直盯着才能学好一样,获取这些监督数据的成本极高,还会耽误研究的进展。另一个难题在于,传统的无监督方法(如稀疏自编码器)存在缺陷,容易混淆多个概念,无法精准地针对特定概念进行调整。

这样的传统方法就像是大海捞针,要在海量的数据里筛选出有用的信息,再花费大量精力对模型进行微调,让模型适应这些数据。

而在这项新研究中,研究人员并没有走传统的大规模数据收集和复杂微调的老路,他们采用了全新的“秘密武器”,提出了一种名为稀疏移位自动编码器(SSAE)的新模型

来源:https://www.aminer.cn/pub/67b54d3aae8580e7ffc83ca2?fr=ISVS


简单来说,假设有两个文本样本,就像两篇主题相似但表述略有差异的文章,SSAE就会找出它们在 LLM 中的嵌入差异,并将两个样本之间的差异,送到一个潜在空间里。

这个潜在空间的特别之处在于,它采用“稀疏”表示,简言之就是尽可能用最少的概念,来体现样本间的差别,之后再通过线性解码函数,把这些差别重新构建出来。


02 如何让SSAE正常运转?

为了训练这个模型,研究人员还要解决一个有条件限制的问题,即找到合适的 “编码器” 和 “解码器”,使模型能够从数据中准确学习。

在这个过程中,他们基于一些合理的假设,例如假设数据是按一定规则产生的,还假设语言模型对概念的处理是线性的(就像按顺序处理事情一样)。

通过这些假设和操作,就能证明在合适的情况下,这个模型能够识别特定的概念,还能成功提取出所需要的转向向量。

接着,研究人员在人造的数据和真实的语言数据上,进行了大量实验,来验证 SSAE 的性能。

研究人员创造了不同的半合成数据集,有的只变语言,有的同时变性别和语言等。

举个例子,在LANG (1, 1) 数据集中,文本对只有语言不一样,比如 “door” 和 “porte”都是门,区别在于一个是英语,一个是法语;在GENDER (1, 1) 数据集中,只有文本对的性别概念有变化,例如“grandfather” 和 “grandmother”,分别指的是爷爷和奶奶。

由二元对比组成的部分数据集

来源:https://www.aminer.cn/pub/67b54d3aae8580e7ffc83ca2?fr=ISVS


最后,研究人员采用平均相关系数(MCC),来评估模型识别概念的能力,MCC数值越高,说明模型识别的能力越强;研究人员还用余弦相似度来评估转向的准确性,也就是看看模型调整后的结果和人们期望的结果之间的相似程度。

结果令人惊喜,SSAE 的 MCC 值表现优异,在处理像包含 135 个概念的 CAT (135,3) 这种复杂数据集时,优势显著。

复杂数据集CAT

解码器的MCC值均接近于1


当把嵌入变得更复杂(例如增加纠缠度)后,其他对比的模型(如仿射自动编码器 aff)性能会大幅下降,但SSAE 仍然保持良好的表现,说明它的鲁棒性很强。

进一步增加缠结后,SSAE仍然具有鲁棒性


03 重要突破:AI数据获取的新时代?

这项研究取得了重要的突破意义。研究人员展示了如何通过无监督学习和创新的 SSAE 模型,在没有昂贵的监督和微调的情况下,准确地引导大型语言模型的行为。

就数据获取成本来说,SSAE模型能减少对于监督数据的依赖。它使用的多概念变化成对样本,来源广泛而且获取成本低,例如社交媒体上每天产生的海量帖子及其回复,都可以成为数据来源。而这一成本的大幅降低,意味着未来或许可以利用有限的资源,训练出更强大的模型,极大地提升研发效率。

而在概念识别方面,SSAE能提高概念识别的精确性。例如,在处理包含多种语言和情感的文本数据时,传统方法容易混淆多个概念,导致转向操作不准确,而 SSAE能够精确识别概念变化,确保转向向量精准作用于目标概念。

值得一提的是,SSAE模型还具有更强的适应能力。当面对复杂数据的时候,传统方法容易出现偏差,但 SSAE能保持比较稳定的效果,适应复杂的数据变化。

未来这一技术还需要不断地验证和优化,以提高SSAE的安全性和可靠性。但对目前的AI行业而言,这一成果已是一场及时雨。从提高AI模型的准确性和可解释性,到更高效地使用有限的数据资源,SSAE已经为我们提供了一个新的方向。