强化学习(RL)的经典理论主要集中在单个任务设置上,在该设备设置中,代理商学会通过反复试验的经验来解决任务,仅从该任务中访问数据。但是,许多最近的经验工作表明,利用跨多个相关任务训练的联合代表的实践好处。在这项工作中,我们从理论上分析了这样的设置,将与任务相关性的概念形式化为共享的状态行动表示,该表示在所有任务中都接受线性动态。我们介绍了用于Multitask MatrixRl的共享matrixrl算法。在$ p $ dimension $ d $共享联合$ r \ ll d $低维表示的情况下,我们向$ o o提高了对$ p $任务的遗憾(phd \ sqrt { nh})$ to $ o(((HD \ sqrt {rp} + hp \ sqrt {rd})\ sqrt {nh})$ bo $ n $ n $ n $ episodes of horizon $ h $。这些收益与上下文匪徒和RL中其他线性模型中观察到的收益一致。与以前研究过其他函数近似模型中多任务RL的工作相反,我们表明,在具有双线性优化的Oracle和有限状态作用空间的存在下,多任务矩阵的计算有效算法通过减少到Quadratic编程。我们还开发了一种简单的技术,可以从某些情节线性问题的遗憾上限中刮除$ \ sqrt {h} $ factor。
translated by 谷歌翻译