A Generalist Agent
Gato 是 DeepMind 在其 2022 年 5 月研究文章《A Generalist Agent》中介绍的通用智能体。一个具有共享权重的变换器策略处理聊天、图像描述、Atari 游戏和真实机器人手臂堆积积木等任务,均来自同一模型。文章将其描述为一种多模态、多任务、多体现策略,根据上下文选择输出文本、关节扭矩、按钮按压或其他标记。
该领域的大多数工具为每个任务领域训练独立模型。而 Gato 则将每种模态和环境序列化为扁平标记序列,并通过类似大型语言模型的变换器处理。这意味着一个预训练检查点可以在对话、视觉和控制之间切换,无需更换架构。
训练过程中,来自模拟和真实环境的数据与自然语言和图像数据集混合,损失被掩码处理,使 Gato 仅预测动作和文本目标。部署时,先对提示进行标记化,每个新观察结果追加到序列中,模型在 1024 标记的上下文窗口内一次采样一个动作向量。博客中包含按领域分组的任务图表,显示预训练模型达到专家分数阈值。
该文面向 AI 和机器人研究人员多于普通软件用户。您可以在 deepmind.google 阅读和引用该研究;这里审查的页面没有公开注册流程、API 层级或下载按钮。
一个具有相同权重的transformer可以玩Atari游戏、为图像生成字幕、聊天,并用真实机器人手臂堆积积木
部署时保持1024标记的上下文窗口,覆盖先前的观察和动作
在2022年5月deepmind.google发布的A Generalist Agent文章中宣布
根据活动环境输出文本、关节扭矩、按钮按压或其他标记
训练时将多模态数据序列化为扁平标记批次,像大型语言模型一样处理
损失掩码在训练期间将预测限制为动作和文本目标
一个共享的变换器处理文本、视觉和控制,无需为每个任务单独模型。
DeepMind的文章详细记录了训练、部署和跨领域性能图表。
展示了如何用令牌化的多模态序列驱动语言和机器人动作。
不作为面向终端用户的公共应用、API或可下载产品提供。
2022年5月的研究公告,没有在deepmind.google上的消费者部署路径。
跨领域的广度意味着性能因任务而异,而不是在所有地方都匹配专业工具。
什么是 A Generalist Agent?
A Generalist Agent 是 Google DeepMind 于 2022 年 5 月发布的关于 Gato 的研究文章,介绍了一种多模态代理,使用一个共享的 transformer 策略来处理聊天、图像描述、Atari 游戏和机器人手臂控制。该页面记录了 Gato 如何将提示、观察和动作标记化为单一序列。
谁开发了 Gato?
A Generalist Agent 由 Google DeepMind 的研究人员开发,并于 2022 年 5 月在 deepmind.google 上发布。该博客文章将 Gato 描述为一个多模态、多任务、多体现的通用策略,基于代理经验以及语言和图像数据集进行训练。
我可以作为公开应用使用 Gato 吗?
不能。A Generalist Agent 是 deepmind.google 上的研究公告,而非提供注册或 API 的托管产品。该页面解释了 Gato 的训练和部署流程,但不提供消费者下载或交互式演示。
Gato 能处理哪些任务?
A Generalist Agent 通过一个模型覆盖聊天、图像描述、Atari 游戏玩法和真实机器人手臂堆叠积木。DeepMind 文章展示了 Gato 使用相同的预训练权重,根据上下文在文本、视觉和控制输出之间切换。
Gato 如何选择输出?
A Generalist Agent 将提示和每个新观察标记化为一个序列,然后自回归地一次采样一个动作向量。DeepMind 文章指出,Gato 可以根据环境规范输出文本、关节扭矩、按钮按压或其他标记。
A Generalist Agent 可以免费阅读吗?
可以。deepmind.google 上的 A Generalist Agent 研究文章免费阅读,无需付款或账户。这是开放的研究文档,而非付费软件计划。

