根据高盛的最新报告,生成式人工智能(GenAI)虽然在聊天机器人和co-pilots (副驾驶)应用方面取得了显著进展,但由于缺乏“killer app”,因此其大众化普及仍然受到限制。
分析师认为,GenAI需要具备能够自主执行任务的应用程序,来推动进一步的发展。而Large Action Models(LAM)作为一种新型AI架构,或许能够满足这一需求。
LLM VS LAM差异对比
LAM概念在2023年底被提出,然后在人工智能(AI)领域迅速成为了一个热门话题。
LAM是大型语言模型(LLM)的自然延伸,后者通过预测输入中的下一个单词或标记来生成文本。LAM则在此基础上进行了扩展,将LLM提升为能够自主执行任务的“代理人”。作为软件单元,LAM不仅能响应用户的查询,还能协助实现具体目标。这种结合了LLM的语言处理能力和LAM的自主任务执行与决策能力,代表了AI功能的重大进步。
3Pillar公司首席创新官Pankaj Chawla指出,LLM擅长生成文本和回答问题,但无法执行后续操作,而LAM正好填补了这一空白,能够模拟各种应用程序和人类行为,并通过执行操作完成复杂任务。神经符号编程的发展则进一步提升了LAM的能力,使其无需短暂演示即可执行这些复杂操作。
以下是LLM和LAM的差异对比:

LAM的实际应用场景
Large Action Models(LAM)正逐渐成为人工智能(AI)领域的一个关键力量。通过与物联网(IoT)设备等外部系统的紧密集成,LAM不仅能够执行物理操作、控制设备、检索数据或操纵信息,还能智能地与人交流、适应环境变化,并与其他LAM协同工作。这些能力使LAM成为AI领域的重要工具。
LAM的核心优势在于它们能够理解复杂的人类目标,并将其转化为可执行的步骤,实现实时响应。它们还能够通过现有的程序化路径(如API)执行任务,甚至与应用程序的用户界面直接交互,这与机器人流程自动化(RPA)相似。例如,当用户请求查找航班和酒店时,LAM不仅能够提供建议,还能直接执行预订操作。
Pankaj Chawla强调,LAM超越了传统co-pilots工具的范畴,它们能够在无人干预的情况下自动执行任务,并随着操作的重复而变得更加高效。
不同公司对LAM的称呼可能不同,例如Gartner将其称为神经符号人工智能(neurosymbolic AI)。亚马逊及其AWS子公司正在开发的半自主代理,能够自动处理基础编码任务,这些代理已经为亚马逊节省了大量的Java代码维护时间,展示了LAM在实际应用中的潜力。
随着技术的不断进步,LAM预计将在医疗保健、金融、汽车等多个领域发挥重要作用,比如以下场景中:
1.虚拟助理与客户支持:LAM有望成为开发高级虚拟助理的核心框架,这些助理能够理解并回应客户咨询,同时能够代表客户执行相关任务。
2.流程自动化执行:LAM能够为组织自动处理那些重复且耗时的工作,如数据录入、文件处理或库存管理。通过语音输入,可以迅速完成相似文档的填写工作。这不仅能够显著节约时间和成本,随着识别技术的不断进步,还能提高数据处理的准确性,减少错误。
3.零售与客户服务助理:LAM通过分析客户的购物历史、偏好和行为模式,能够提供个性化的商品推荐。在超市购物时,根据客户的过往购买记录,LAM可能会推荐相关产品、促销活动或食谱建议。此外,通过分析客户的反馈和情绪,LAM能够识别服务改进的领域,并实时解决客户问题,从而帮助零售商提升顾客的整体购物体验,增加销售收入。

现有的LAM实例
LAM(大型动作模型)正在被集成到实际产品中,Rabbit r1设备是此类应用的一个示例。这款设备体积紧凑,大约是iPhone大小的一半,配备了触摸屏和能够360度旋转的摄像头,方便用户拍摄照片和视频。
Rabbit r1还设有滚轮,便于用户操作,同时配备了远场麦克风和一键通话按钮,方便用户与设备内置的助手进行交互。
Rabbit公司开发的Rabbit OS操作系统,通过自然语言界面和专用硬件,为用户提供了定制化的体验。该系统的一个关键特点是其私有LAM,它能够识别用户的操作并在不同技术界面上进行相应的响应,为用户提供了一种新的交互方式,无需依赖传统的应用程序。这种设计为用户提供了更加直观和便捷的操作体验。
当然,LAM技术的应用不仅限于Rabbit。Salesforce也在其企业计算套件中采用LAM架构,以增强自动化能力。利用企业内部数据,Salesforce的LAM能够自动执行活动发起和输出追踪等任务,显著提升了自动化管理的效率。
麦肯锡的报告强调,LAM和智能代理将成为人工智能未来发展的前沿。这些智能代理能够理解复杂的人类目标,并将其转化为可执行的行动步骤,实现从理论到实践的跨越。它们被誉为“超高效的虚拟同事”,在贷款审批、代码文档维护、在线营销活动创建等多个领域展现出巨大的潜力。
对LAM的认知误区
但是Trinetx机器学习工程师Dmytro Ivanov强调,在探讨Large Action Models(LAM)时,我们要首先明确,目前相关讨论往往聚焦于它们未来可能对全球各行各业产生的变革,而非它们目前所取得或正在实现的具体成果。
他指出,行业尚未看到明确的性能跟踪指标、完善的市场监测体系,以及广泛认可的LAM应用实例。
虽然这种信息的匮乏可能源于LAM作为一种新兴技术尚未得到广泛应用,但这并不意味着我们可以忽视这一点。决策者在考虑引入LAM时,应该保持谨慎,透过那些充满期待的展望,专注于那些经过验证的事实。
以下是一些需要企业高管们注意的关于LAM的常见误解:
1. 企业已经在广泛应用Large Action Models
LAM的概念最初由Rabbit AI公司提出,以推广其搭载定制操作系统的设备,该设备支持一个可训练的AI助手,使用LAM来执行用户的请求。目前,该产品仍处于预售阶段,这意味着实际应用案例和用户反馈相对有限。这种情况削弱了关于LAM已经在多个行业广泛应用的说法。
2. Large Action Models能够执行关键任务
理论上,LAM能够处理复杂且关键的任务,但理论并不等同于实践。即使是LAM执行简单任务的能力也仍在研究之中。因此,区分期望与现实至关重要。
需要记住的是,人工智能不仅仅是软件或应用程序,它同样依赖于硬件的支持。例如,OpenAI依赖于拥有超过285,000个CPU核心的超级计算机来处理数据并提供快速响应。随着时间的推移,这些系统需要升级以适应不断增长的AI模型规模。这种规模的硬件需求对于支持LAM执行复杂决策至关重要。
只有像亚马逊或Meta这样的行业巨头,才有能力投资并维护这样的系统。但对于大多数企业来说,这在可预见的未来并不是一个现实的选项。
——Dmytro Ivanov,Trinetix机器学习工程师
尽管Large Action Models有潜力改变行业,但鉴于其首个应用案例尚未得到验证,现在讨论其对行业的影响还为时尚早。这项技术需要通过实践测试和用户反馈来证明自己的价值和竞争优势。
人工智能已经是一个强大的变革力量,对全球产生了深远影响。因此,我们应关注其实际能力,而不是那些尚未得到证实的主张。
LAM面临的挑战与前景
尽管LAM的应用前景看似广阔,但在实际应用层面目前仍面临一些技术挑战。由于LLMs的概率性,它们有时会偏离预定的任务流程。因此,开发人员需要通过确定性编程和经典技术来保持系统的稳定性。
例如,3Pillar正在开发一个能够与用户互动的LAM应用程序,但由于LLM有时会偏离主题,团队必须结合知识图和确定性编程,以确保输出准确。
LAM的潜力不仅限于后台应用程序。随着大型软件公司ERP套件的集成,LAM可以访问大量跨行业的数据,为进一步发展奠定基础。PC预计,未来将会出现更多的基于LAM的框架,允许公司通过配置和点击,轻松集成和执行复杂操作。
未来五年内的突破
Pankaj Chawla相信,随着技术的成熟,LAM将在未来两到五年内从概念发展为实际应用。特别是在金融、医疗、自动驾驶等行业,LAM将成为推动自动化和智能化的核心力量。Rabbit r1等现有产品已经展示了LAM的潜力,而随着技术的不断发展,我们有机会在未来看到越来越多的现实世界应用。
正如麦肯锡报告所指出的,LAM不仅是GenAI的下一个前沿,更是推动整个行业迈向自主化决策和行动的关键。这一技术的应用有望彻底改变多个行业,并为人工智能的未来发展奠定基础。
本文整理,编译自以下参考资料:
1.《The Rise of Large Action Models, LAMs: How AI Can Understand and Execute Human Intentions?》作者:Rosemary J Thomas, PhD, is a Senior Technical Researcher at the Version 1 AI Labs.
2.The Road from Chatbots and Co-Pilots to LAMs and AI Agents
3.tinetx:《What Are Large Action Models and How Do They Work?》
(特别福利放送:如您是AI营销相关从业者,对本活动有兴趣,欢迎在评论下方留言,我们有少量免费门票送出!数量有限,先到先得!)