Tianshou（天授）基于 PyTorch 的强化学习平台

联合创作 · 2023-09-26 05:32

Tianshou（天授）是纯基于 PyTorch 的强化学习平台，与现有的主要基于 TensorFlow 的强化学习库不同，Tianshou 没有繁杂的嵌套类、不友好的 API 和速度较慢的代码，其提供了用于构建深度强化学习代理的快速框架和 pythonic API。

支持的接口算法包括：

Policy Gradient (PG)
Deep Q-Network (DQN)
Double DQN (DDQN) with n-step returns
Advantage Actor-Critic (A2C)
Deep Deterministic Policy Gradient (DDPG)
Proximal Policy Optimization (PPO)
Twin Delayed DDPG (TD3)
Soft Actor-Critic (SAC)

Tianshou 还支持所有算法并行，所有算法都重新格式化为基于重放缓冲（replay-buffer）模式。

特性：

快速：使用 laptop（i7-8750H + GTX1060）测试为例，CartPole-v0 任务中，Tianshou 仅需要 3 秒钟即可根据 vanilla 策略梯度来训练代理：python3 test/discrete/test_pg.py --seed 0 --render 0.03

性能对比：

可重复性：具有单元测试，并且单元测试覆盖针对所有已实现算法的完整代理培训过程。单元测试确保了平台的可重复性
模块化：所有算法分解为 4 部分：
- __init__：初始化
- process_fn：从重放缓冲区预处理数据（所有算法都重构为基于重放缓冲的算法）
- __call__：根据给定的观察值计算操作
- learn：从给定的批处理数据中学习
优雅灵活：整体代码不到 1500 行，大多数已实现的算法少于 100 行 Python 代码。可以根据需要提供许多灵活的 API。

浏览 9

点赞

收藏

分享

举报

评论

图片

表情

基于强化学习的自动化剪枝模型

Dopamine基于 Tensorflow 的强化学习框架

Dopamine 是由 Google AI 实验室推出的一个基于 Tensorflow 的强化学习（

Dopamine基于 Tensorflow 的强化学习框架

Dopamine是由GoogleAI实验室推出的一个基于Tensorflow的强化学习（RL）框架，旨在为新手和资深RL研究人员提供灵活性、稳定性和可重复性。该框架受大脑中的奖励动机行为启发，反映了神

基于自适应策略转移的深度强化学习

小白学视觉

综述：基于深度强化学习的自动驾驶算法

新机器视觉

GraphLearn-for-PyTorch基于 PyTorch 的图学习库

GraphLearn-for-PyTorch(GLT)是一个基于PyTorch的图学习库，目的是使分布式GNN训练和推理变得简单和高效。GLT利用GPU加速图采样，并利用UVA来减少顶点和边特征的转换

基于视觉模型强化学习的通用机器人

小白学视觉

Facebook Horizon应用强化学习平台

Facebook Horizon应用强化学习平台

Facebook Horizon应用强化学习平台

Horizon是一个开源的端到端的应用强化学习平台，在Facebook内部被大量使用。Horizon采用Python构建，使用PyTorch进行建模和训练，使用Caffe2提供模型服务。该平台包含主流

基于pytorch的densenet

pytorch玩转深度学习

点赞

收藏

分享

举报