如题,每个环境中的action_space都随训练更新,但env_wrapper中的解决方式是只使用第一个环境的第一个时间步的action_space,完全不进行任何更新
如题,每个环境中的action_space都随训练更新,但env_wrapper中的解决方式是只使用第一个环境的第一个时间步的action_space,完全不进行任何更新