大数跨境

自主移动机器人(AMR)如何重塑仓库运营与物流

自主移动机器人(AMR)如何重塑仓库运营与物流 贸易趋势
2024-11-14
11
导读:自主移动机器人(AMR)是一种能够自主导航的机器人,它们利用传感器、摄像头和机载智能在环境中移动,无需人工直接控制。与传统自动导引车(AGV)不同,AMR 能够适应周围环境,实时做出导航决策以避开障碍

自主移动机器人(AMR)是一种能够自主导航的机器人,它们利用传感器、摄像头和机载智能在环境中移动,无需人工直接控制。与传统自动导引车(AGV)不同,AMR 能够适应周围环境,实时做出导航决策以避开障碍物并优化路线。AMR 具有高度灵活性,可快速重新编程以执行不同任务,使其成为仓库和配送中心等动态环境的理想选择。

受电子商务和制造业日益增长的需求以及 AMR 技术进步的双重驱动,预计未来十年仓库和物流运营中 AMR 的采用率将呈指数级增长。具体而言,AMR 在以下四个主要用例中被证明具有成本效益:

  1. 拣选与分拣:高效地在仓库中检索和分拣物品
  2. 越库作业:直接将货物从收货区转移到发货区
  3. 库存管理:跟踪库存水平和位置
  4. 物料搬运:在生产流水线或存储区域之间移动物料。

对于仓库和物流经理而言,目标是利用 AMR 根据机器人的特定训练,精确且高效地处理重复性任务。例如,经过训练的自主叉车可以根据企业资源计划(ERP)系统的提示执行指定操作。当卡车到达仓库堆场时,ERP 系统会触发 AMR 开始卸货。随后,AMR 移动到堆场,利用先进的传感器和摄像头确定最有效的托盘卸载方法,并将托盘放置在收货区以便进一步处理。

现在,考虑一个场景:同一台 AMR 需要重新训练以执行越库作业任务。在这种情况下,如果有待处理的 outgoing 交付涉及这些 incoming 物品,机器人会将货物直接从收货区移动到发货区。

理解大型语言模型

为了更好地理解 AMR 是如何训练的,首先探索大型语言模型(LLM)的基础知识可能更有帮助。LLM 是一种生成式人工智能(Gen AI),能够创建原创的基于文本的内容。其核心是由称为神经网络的复杂节点网络驱动的,其中节点之间的连接由权重表示,这些权重可以取一系列值,不仅限于 0 到 1 之间。这些网络处理海量数据,将文本分解为称为标记的较小单元,每个单元都被分配一个唯一的数字表示。然后,这些标记被组织成多维向量,使模型能够识别和解释单词及概念之间的关系。

无需深入技术细节,重要的是要认识到 LLM 主要是根据给定提示生成内容的工具。通过在广泛且多样化的数据集上进行训练,可以实现响应的一致性,而高性能计算资源——通常是图形处理单元(GPU)甚至是更专门的处理器如张量处理单元(TPU)——则为训练和操作提供所需的计算能力。

LLM 擅长解释自然语言提示,使其能够响应人类编写的指令并以类似人类推理的方式完成任务,尽管这完全基于学习到的模式。引导 LLM 响应的文本输入称为提示,用于处理此提示的可用内存空间称为上下文窗口。上下文窗口的大小因模型而异,以标记(而非单词)为单位测量,通常范围从数百到数千个,使模型能够处理复杂的指令和上下文。

LLM 是一个庞大且层次复杂的主题,但出于我们的目的,我们将探讨解决方案架构师如何利用大型语言模型来增强仓库中的 AMR 运营,重点关注训练 AMR 在仓库内执行不同任务的示例。在这种情况下,模型被训练以识别 ERP 系统中的开放交付,并动态指导 AMR 从收货区拾取物料托盘,并将其运输到发货区。这允许高效地装载 outgoing 卡车,确保及时向客户交付。

在接下来的讨论中,我们将仅专注于模型的适配和对齐,包括主要使用带有软提示的参数高效微调(PEFT)对模型进行微调,因为这是应用最广泛的方法之一,但不包括评估模型学习成果的方面。我们还假设应用程序集成已经到位,因为探讨其细节会增加我们讨论的范围。

图 1:典型的生成式 AI 项目生命周期。

生成式 AI 项目生命周期

如图 1 所示,生成式 AI 项目生命周期涉及四个关键阶段。在我们的示例中,我们专注于重新训练模型以适应新功能,特别是在适配、对齐和评估阶段。在此阶段,通过提示工程和带有软提示的参数高效微调(PEFT)来完善模型,后者更新有限数量的参数以有效地调整模型。这种方法对于已经训练并与 API 集成的模型特别有价值;PEFT 能够快速微调以纳入新功能,同时保留模型之前的训练成果。通过人类反馈,模型在相关性、准确性和伦理考量方面得到对齐,并对其性能进行严格评估。

图 2:LLM 训练五个阶段所涉及的时间和精力概述。

LLM 训练时间表

如图 2 所示,LLM 训练涉及的五个阶段中,第一阶段是最长的,通常需要数周到数月。完成该阶段后,接下来的四个阶段进展相对较快。对于我们的示例,我们将在下面查看前三个阶段,并更多地讨论 PEFT 微调方法。

  • 预训练
    预训练大型语言模型是一项艰巨的任务。由于复杂的架构设计、所需的海量数据以及涉及的专业知识,这一阶段是模型开发中最复杂的。然而,当今的大多数开发工作都始于预训练的基础模型,从而允许您跳过这一初始阶段。在使用基础模型时,您通常会通过提示工程来评估模型的性能——这是一个需要较少专业技术且不涉及重新训练模型的过程。
  • 提示工程
    提供给模型的输入文本称为提示,生成文本的过程称为推理,模型的响应称为补全。模型用于处理此输入的内存称为上下文窗口。在此示例中,模型在响应卸货任务方面表现良好,但在实际场景中,您可能需要它根据特定条件调整其行为以执行诸如越库托盘等任务。

为了第一次尝试就实现预期结果,您可能需要优化提示的语言或结构。这种迭代过程称为提示工程,涉及尝试不同的提示格式,直到模型按预期行为。虽然提示工程是一个复杂的领域,但提高模型响应的强大策略是在提示中嵌入目标任务的示例,帮助引导模型朝向期望的输出。

  • 提示微调和多任务微调

多任务微调通过在一个包含多个任务示例的多样化数据集上训练模型,超越了传统的单任务微调。该数据集包括各种任务的输入 - 输出对,例如摘要、情感分析、代码翻译和实体识别。通过对这种混合数据进行训练,模型能够同时执行多项任务,从而缓解灾难性遗忘的问题——即模型在针对新任务进行训练时会丢失之前学到的信息。经过多个训练轮次后,模型的权重会根据跨示例计算出的损失进行更新,最终得到一个能够在多项任务中同时表现出色的指令微调模型。

这一方法的显著例子是 FLAN(Fine-tuned Language Net,微调语言网络)系列模型。FLAN 是一组应用于不同模型的多任务微调指令集合,其中微调过程作为训练的最后一个阶段。在原始的 FLAN 论文中,作者将微调比作预训练“主菜”之后的“甜点”——这是一个恰当的比喻,强调了微调作为提升模型跨任务适应能力的最终优化步骤。

  • 参数高效微调(PEFT)

对于拥有数十亿参数的庞大模型而言,灾难性遗忘的风险显著,因此参数高效微调(PEFT)成为一种理想方法。PEFT 技术最大限度地减少了对所有参数重新训练的需求,从而在针对特定任务进行微调的同时保留先前学到的知识。

在本例中,我们将采用 PEFT 方法来微调模型。PEFT 中还包括一些附加方法,旨在完全不改变权重的情况下提升模型性能。这包括提示微调(prompt tuning),它听起来与提示工程(prompt engineering)相似,但两者截然不同。

在提示工程中,你通过调整提示的语言来获得所需的补全结果。这可能只是尝试不同的单词或短语,也可能更复杂,例如为一次或几次少样本推理(Few-shot Inference)提供示例。其目标是帮助模型理解你所要求执行的任务性质,并生成更好的补全结果。然而,提示工程存在一些局限性,因为它可能需要大量手动工作来编写和尝试不同的提示。此外,你还受限于上下文窗口的长度,最终可能仍无法达到任务所需的性能。

在提示微调中,你在提示中添加额外的可训练标记,并将其最优值交由监督学习过程来确定。这组可训练标记称为软提示(soft prompt),它会前置到表示输入文本的嵌入向量之前。

图 3:使用软提示的提示高效微调。

软提示向量的长度与语言标记的嵌入向量相同;包含 20 到 100 个虚拟标记通常足以获得良好的性能。

代表自然语言的标记在某种意义上是“硬”的,因为每个标记都对应嵌入向量空间中的固定位置。然而,软提示并非固定的、离散的天然语言词汇。相反,你可以将它们视为可以在连续多维嵌入空间中取任意值的虚拟标记。通过监督学习,模型会学习这些虚拟标记的值,以最大化给定任务的性能。

在全量微调中,训练数据集由输入提示和输出补全或标签组成。在监督学习过程中,大语言模型(LLM)的权重会被更新。

与提示微调不同,大语言模型(LLM)的权重被冻结,底层模型不会得到更新。相反,软提示的嵌入向量会随着时间推移而更新,以优化模型对提示的补全效果。

提示微调是一种参数高效策略,涉及训练少量额外参数,使其比全量微调的资源消耗显著降低,后者可能涉及修改数百万至数十亿个参数。与低秩自适应(LoRA)一样,提示微调属于参数高效微调(PEFT)方法的范畴。然而,PEFT 能提供更强的灵活性,因为它允许添加针对特定任务定制的新参数,而不是像 LoRA 那样对现有固定集进行重参数化。在 PEFT 中,你可以为每个任务创建独立的软提示,从而在推理时无需修改底层模型即可在不同任务间高效切换。

你也可以为一项任务训练一组软提示,为另一项任务训练另一组软提示。要在推理时使用它们,只需在输入提示前加上已学习的标记;要切换到另一个任务,只需更改软提示即可。由于软提示非常小,占用磁盘空间极少,这种微调方式极其高效且灵活。

在上述示例中,请注意,同一个大语言模型(LLM)被用于所有任务,因为在推理时你只需更换软提示。

图 4:PEFT 与其他微调方法的性能对比。

提示微调的效果如何?在描述提示微调的原始论文《Exploring the Method》中,Brian Lester 及其在 Google 的合作者将提示微调与多种其他方法进行了比较,涵盖了不同规模的模型。在图 4 中,X 轴显示模型大小,Y 轴显示 SuperGLUE 得分。(通用语言理解评估 [GLUE] 指的是 across 一系列自然语言理解 [NLU] 任务的语言模型性能评估;SuperGLUE 包括对更复杂的推理和生成任务的评估,以及针对与人类性能竞争的模型的基准测试。)红线显示通过针对单个任务进行全量微调创建的模型的得分,橙色线显示使用多任务微调创建的模型的得分。绿线显示提示微调的性能,蓝线显示仅使用提示工程的得分。

我们可以看到,对于较小规模的大语言模型,提示微调的表现不如全量微调。然而,随着模型规模的增加,提示微调的性能也随之提升——当模型参数量达到约 100 亿时,提示微调的效果可以与全量微调相媲美,并且相比仅使用提示工程,能带来显著的性能提升。

将重新训练的模型集成到 AMR 叉车中的最后步骤

在使用参数高效微调(PEFT)对模型进行微调后,我们几乎准备好将其与自主移动机器人(AMR)集成,通过应用程序编程接口(API)连接来简化交叉 docking 流程。此集成使模型能够指示 AMR 高效地将托盘从收货区直接移至发货区,以满足实时物流需求。通过利用微调模型的专业理解能力,AMR 能够以更准确的精度和响应速度执行交叉 docking,动态适应多变的需求,并优化仓库的工作流效率。

将微调后的模型与 AMR 集成带来了显著的运营优势。首先,模型的精确指令确保托盘能够快速且准确地转移,减少了人工搬运,并将交叉 docking 过程中的潜在错误降至最低。这种 streamlined 的工作流程加速了订单履行,并通过减少机器人和人工操作员的空闲时间改善了资源分配。

通过动态适应波动的需求,该系统增强了仓库的灵活性,使其能够更灵敏地应对高峰时段和紧急订单。此外,模型与 AMR 之间的实时集成促进了更好的库存管理,确保货物在仓库内高效流动,避免不必要的存储或延迟。

最终,这种先进的自动化降低了劳动力成本,优化了地面空间的使用,并提高了整体生产力,使企业在以速度和精度满足客户需求方面获得竞争优势。

【声明】内容源于网络
0
0
贸易趋势
带你看全球贸易趋势
内容 13063
粉丝 0
贸易趋势 带你看全球贸易趋势
总阅读9.0k
粉丝0
内容13.1k