背景技术:
1、本说明书涉及使用机器学习模型来处理数据。
2、机器学习模型接收输入并基于所接收的输入生成输出,例如预测的输出。一些机器学习模型是参数模型,并且基于所接收的输入和模型的参数值来生成输出。
3、一些机器学习模型是深度模型,其采用多层模型来为接收到的输入生成输出。例如,深度神经网络是深度机器学习模型,其包括输出层和一个或多个隐藏层,每个隐藏层将非线性变换应用于接收到的输入以生成输出。
技术实现思路
1、本说明书一般地描述了在一个或多个位置中的一个或多个计算机上实现为计算机程序的系统,其控制与环境交互以在环境中执行任务的代理。
2、在每个时间步骤,系统接收输入观察并从动作集合中选择动作以供代理执行。例如,该动作集合可以包括固定数量的动作,或者可以是连续的动作空间。
3、通常,系统使用基本策略神经网络来控制代理,该基本策略神经网络接收包括观察的基本策略输入,并处理基本策略输入以生成定义响应于观察而要执行的动作的基本策略输出。
4、本说明书描述了用于使用元策略(policy)训练基本策略神经网络的技术,该元策略定义了在生成用于训练基本策略神经网络的训练数据时要使用的探索计策(strategy)。策略被描述为元策略,因为它定义了应用于由基本策略神经网络定义的基本(动作选择)策略的策略,即探索计策。
5、更具体地,本说明书描述了通过使用(i)基本策略神经网络和(ii)由元策略设置的探索计策控制代理来生成用于训练基本策略神经网络的训练数据,该探索计策根据一个或多个参数(稍后称为探索计策参数)的集合将由基本策略神经网络生成的基本策略输出映射到由代理执行以与环境交互的动作。例如,基本策略可以由探索计策修改以定义用于选择由代理执行的动作的新行为策略。在一些实施方式中,探索计策随机地确定是使用基本策略输出来选择要由代理执行的动作还是不同地选择动作(根据探索策略)。训练数据可以包括元组,每个元组指定表征环境的状态的观察、响应于观察而执行的动作、以及响应于动作被执行(并且可选地包括下一观察)而接收的奖励。生成训练数据可以涉及针对多个(环境)时间步骤中的每个获得这样的元组。
6、也就是说,在生成训练数据时,系统使用探索计策而不是直接使用基本策略神经网络来控制代理。通过使用元策略集探索计策,由代理执行的动作将至少在一些时间步骤处与根据由基本策略神经网络生成的输出的“最佳”动作不同。可以使用训练数据、使用任何强化学习技术(例如,在线或离线、同策略(on-policy)或异策略(off-policy))来训练基本策略神经网络。仅作为一些示例,可以使用q学习技术或者直接或间接策略优化技术。
7、使用训练数据训练基本策略神经网络可以包括反向传播强化学习目标函数的梯度,以例如使用诸如adam的梯度下降优化算法或另一优化算法,来更新基本策略神经网络的可学习基本策略神经网络参数,例如权重。
8、通常,在多个(计策更新)时间点中的每个处,该技术确定是否满足(计策更新)标准以更新探索计策。如果是,则可以更新探索计策。在实现中,这涉及生成元策略输入;这包括例如,基于由代理接收的一个或多个奖励,表征基本策略神经网络在该时间点控制代理的性能的数据。
9、根据元策略处理元策略输入以生成元策略输出,该元策略输出指定定义探索计策的一个或多个探索计策参数的集合中的每个的相应值。例如,探索计策参数可以定义由代理执行的动作的随机性程度,例如,用于选择由代理执行的动作的新行为策略的随机性。然后可以使用基本策略神经网络并根据由元策略输出指定的(更新的)探索计策参数的相应值定义的探索计策来控制代理。作为示例,根据元策略处理元策略输入以生成元策略输出可以涉及使用学习的线性变换,例如,使用线性神经网络层,或使用(元策略)神经网络,来处理元策略输入。
10、可以实现本说明书中描述的主题的特定实施例,以便实现以下优点中的一个或多个。
11、使用元策略训练基本策略神经网络可以在训练过程期间提高观察-动作对的采样效率,例如,减少在训练过程期间需要访问多少观察-动作对以便达到一定水平的代理性能。以有效的方式访问观察-动作对允许基本策略学习以有利的性能更快地收敛,并且对于训练代理在具有要从中采样的大的观察-动作空间的许多现实生活的复杂任务中有利地执行是至关重要的。
12、另外,该元策略训练技术可以用于以比其他方法更频繁的节奏来更新探索计策。这种更新灵活性实现了数据驱动的探索过程,该过程可以促进基本策略神经网络的更快训练。
13、此外,该技术可以消除执行探索超参数搜索的需要,即,搜索以找到用于生成训练数据的探索相关参数的最佳值,以便在给定任务上实现有利的代理性能。这是有益的,因为这样的搜索通常是时间和资源密集的,并且在不依赖于模拟环境的一些实现中,甚至是不切实际的。
14、此外,所描述的技术跨单任务域和多任务域推广。也就是说,元策略可以在用于一个特定任务的基本策略神经网络的训练期间学习,然后用于训练用于控制不同代理执行不同任务或执行多个不同任务的另一基本策略神经网络。
15、所描述的技术也是通用的,并且可以在一个或多个环境中由一个或多个代理生成训练数据的场景中使用。
16、在附图和下面的描述中阐述了本说明书中描述的主题的一个或多个实施例的细节。根据说明书、附图和权利要求,主题的其他特征、方面和优点将变得明确。
1.一种由一个或多个计算机执行并且用于训练基本策略神经网络的方法,所述基本策略神经网络被配置为接收包括环境的状态的观察的基本策略输入,并且处理所述策略输入以生成定义要由代理响应于所述观察而执行的动作的基本策略输出,所述方法包括:
2.根据权利要求1所述的方法,其中,所述探索计策是ε贪婪探索计策,所述ε贪婪探索计策选择具有概率1-ε的、使用由所述基本策略神经网络生成的策略输出选择的动作和具有概率ε的随机动作作为要由所述代理执行的动作,并且其中,定义所述探索计策的参数包括指定ε的值的一个或多个参数。
3.根据任一前述权利要求所述的方法,其中,所述探索计策将softmax应用于由所述基本策略神经网络生成的所述策略输出,并且其中,定义所述探索计策的参数包括指定所述softmax的温度参数τ的一个或多个参数。
4.根据任一前述权利要求所述的方法,其中,所述探索计策将噪声应用于由所述基本策略神经网络生成的所述策略输出,并且其中,定义所述探索计策的所述参数包括指定如何生成所述噪声的一个或多个参数。
5.根据任一前述权利要求所述的方法,其中,在每n个环境时间步骤满足所述标准,其中,n是大于或等于1的整数。
6.根据权利要求1-4中的任一所述的方法,其中,在每个任务片段完成之后满足所述标准。
7.根据任一前述权利要求所述的方法,其中,所述操作还包括:
8.根据任一前述权利要求所述的方法,其中,表征所述基本策略神经网络在所述时间点控制所述代理的性能的所述数据包括:表征在使用所述基本策略神经网络控制所述代理时接收的相应奖励的数据。
9.根据任一前述权利要求所述的方法,其中,所述元策略输入还包括表征差异的数据,所述差异是(i)所述基本策略神经网络在所述时间点控制所述代理的性能与(ii)所述基本策略神经网络在满足所述标准的最近时间点控制所述代理的性能中的差异。
10.根据任一前述权利要求所述的方法,其中,所述元策略输入还包括识别满足所述标准的时间点的数据。
11.根据任一前述权利要求所述的方法,其中,所述训练数据包括元组,所述元组每个至少指定(i)表征所述环境的状态的观察、(ii)响应于所述观察而执行的动作、以及(iii)响应于所述动作被执行而接收的奖励。
12.根据权利要求11所述的方法,还包括:
13.根据任一前述权利要求所述的方法,还包括,在生成所述训练数据时:
14.根据权利要求13所述的方法,特别是当从属于权利要求12时,其中,确定满足用于更新所述元策略的标准包括:
15.根据权利要求13或14中的任一项所述的方法,其中,所述元策略先前已经基于在由所述基本策略神经网络控制时所述环境中的不同代理的交互而被更新。
16.根据权利要求13-15中的任一项所述的方法,其中,所述元策略先前已经基于在由所述基本策略神经网络控制时不同环境中的所述代理的交互而被更新。
17.根据权利要求13-16中的任一项所述的方法,其中,所述元策略先前已经基于在由不同的基本策略神经网络控制时不同环境中的不同代理的交互而被更新。
18.根据权利要求13-17中的任一所述的方法,其中,所述元奖励是差异,所述差异是(i)在满足用于更新所述元策略的所述标准的时间所述基本策略神经网络控制所述代理的性能与(ii)在满足用于更新所述元策略的所述标准的在先时间所述基本策略神经网络控制所述代理的性能之间的差异。
19.根据权利要求18所述的方法,其中,基于响应于由所述代理执行的动作而接收的奖励来测量所述性能。
20.根据权利要求1-19中的任一项所述的方法,其中,已经基于元奖励通过强化学习来学习所述元策略。
21.根据权利要求20所述的方法,其中,所述元奖励包括:在由一个或多个不同的基本策略神经网络控制时从一个或多个环境中的一个或多个代理的性能计算的元奖励。
22.一种由一个或多个计算机执行并且用于训练基本策略神经网络的方法,所述基本策略神经网络被配置为接收包括环境的状态的观察的基本策略输入,并且处理所述策略输入以生成定义要由代理响应于所述观察而执行的动作的基本策略输出,所述方法包括:
23.根据任一前述权利要求所述的方法,其中,所述代理是机械代理,并且所述环境是现实世界环境。
24.根据权利要求23所述的方法,其中,所述代理是机器人。
25.根据任一前述权利要求所述的方法,其中,所述环境是包括多件电子设备的服务设施的现实世界环境,并且所述代理是被配置为控制所述服务设施的操作的电子代理。
26.根据任一前述权利要求所述的方法,其中,所述环境是用于制造产品的现实世界制造环境,并且所述代理包括电子代理,所述电子代理被配置为控制操作以制造所述产品的制造单元或机器。
27.根据任一前述权利要求所述的方法,其中,所述环境是模拟环境,并且所述代理是模拟代理。
28.根据权利要求27所述的方法,还包括:
29.根据权利要求27所述的方法,还包括:
30.一种系统,包括:
31.存储指令的一个或多个非暂时性计算机存储介质,所述指令在由一个或多个计算机执行时使所述一个或多个计算机执行根据权利要求1-29中的任一项所述的相应方法的操作。
