当你把“什么是迁移学习?AI 如何跨领域复用知识”与实际决策联系起来理解,而不是把它当作又一个 AI 流行词时,这个概念会更容易使用。本篇 AI Tools Radar 指南聚焦其运作原理、重要取舍,以及在采用工具或工作流前值得提出的问题。
迁移学习是一种机器学习方法:它将已在大型数据集上训练的模型,使用少得多的数据适应到一个新的、但相关的任务。该技术复用模型此前学到的模式,而不是从随机权重重新开始。
这一方法如今很重要,因为从头训练大模型已变得昂贵。研究人员和工程师正在寻找复用既有工作的方式,迁移学习提供了一条直接路径。MIT Technology Review 的研究显示,在许多领域适应预训练模型可同时减少计算时间和标注数据需求。
迁移学习先在一个任务上训练模型、存储学得参数,再将这些参数作为第二个任务的起点。源任务通常拥有丰富数据,目标任务的数据往往少得多。
迁移学习与标准训练有三个核心区别。第一,源任务和目标任务共享某种结构,如视觉特征或语言模式。第二,模型保留大部分早期参数,而非重置。第三,由于模型已有有用表征,目标领域所需标注示例更少。
该过程遵循四个主要阶段,每一阶段都建立在前一阶段基础上,将知识从源领域移到目标领域。
阶段 1:源任务预训练。 大型模型在 ImageNet 等广泛视觉数据集或语言文本语料上训练,目标是学习出现在大量示例中的通用特征。这一阶段消耗最多计算。
阶段 2:特征提取。 预训练后,模型拥有能检测边缘、纹理或词语关系的层。这些层会固定或仅轻微更新。提取出的特征充当目标任务的输入。
阶段 3:微调。 较小的头部或少数顶层会在目标数据集上更新。学习率保持较低,以免破坏有用的源知识。相比从头训练,这一过程通常在少得多的轮次中收敛。
阶段 4:评估与调整。 适应后的模型会在保留的目标数据上运行。若表现落后,工程师可能解冻更多层或添加领域专用数据。2019 年《Nature Machine Intelligence》的一篇论文显示,仔细选择层可在任务差异过大时防止负迁移。
计算机视觉团队从 ImageNet 权重出发,使用迁移学习标注医学图像。预训练模型已能识别形状和纹理,因此医学数据集只需数百个示例,而非数万个。
自然语言处理团队会在法律或金融文本上微调 BERT。模型从原始训练中携带通用语言理解,再用适量额外数据学习领域词汇。
语音识别系统将已在英语播客上训练的模型适应到新口音或语言。早先学得的声学特征会减少新场景所需的转写音频小时数。
机器人研究人员会在不同机器人机体之间迁移视觉导航技能。感知层保持相似,而控制层适应新硬件。
关于迁移学习 AI 详解的常见问题。
问:迁移学习等同于微调吗?
答:迁移学习描述复用预训练模型的整体策略;微调是该策略中的一个具体步骤,即模型在目标任务上接收更新。
问:迁移学习总能改善结果吗?
答:不能。当源任务与目标任务差异很大时,性能可能下降。这种负迁移会在自然照片上学得的视觉特征损害显微图像准确性时出现。
问:目标任务仍需要多少数据?
答:数量因情况而异,但多数报告案例用的标注数据比从头训练少 10 到 100 倍。确切数值取决于任务相似度和模型规模。
问:迁移学习能用于小模型吗?
答:可以。在 ImageNet 或相似数据集上预训练的小模型仍可提供有用特征。增益虽小于大模型,但该方法在边缘设备上仍然实用。
问:新领域随时间漂移时会怎样?
答:模型可能遭遇灾难性遗忘。定期重放旧示例或逐步解冻层,有助于在吸收新模式时维持早先表现。
实际检验标准是:这种方法能否改善某项可重复的工作,同时不掩盖其来源、成本或失效模式。先从一项有代表性的任务开始;在错误影响重大的地方保留人工检查点;并随着模型和产品变化重新评估结果。
我们会结合一手资料、产品文档与实际使用场景,帮助你更清楚地判断工具是否适合你的工作流。