I ran python ac_solver/agents/ppo.py --exp-name demo --wandb-log to train the PPO, but it doesn’t seem to be solving any of the problems. Did I do something wrong?
wandb: Run history:
wandb: charts/episode ▁▁▂▂▂▂▃▃▃▄▄▄▅▅▅▅▆▆▆▇▇▇▇██
wandb: charts/global_step ▁▁▂▂▂▂▃▃▃▄▄▄▅▅▅▅▆▆▆▇▇▇▇██
wandb: charts/highest_solved ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb: charts/learning_rate ██▇▇▇▇▆▆▆▅▅▅▅▄▄▄▃▃▃▂▂▂▂▁▁
wandb: charts/normalized_lengths_mean ▁▄▅▆▆▇▇▇▇▇▇▇▇▇▇▇▇████████
wandb: charts/normalized_returns_mean █▅▄▃▃▂▂▂▂▂▂▂▂▂▂▂▂▁▁▁▁▁▁▁▁
wandb: charts/solved ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb: charts/unsolved ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb: debug/advantages_mean ▅█▄▅▁▃▃▄▃▃▃▃▃▄▃▄▂▄▄▅▄▄▄▄▃
wandb: debug/advantages_std █▅▄▃▂▂▂▂▂▂▂▂▂▁▁▁▁▁▁▁▁▁▁▁▁
wandb: losses/approx_kl █▄▂▂▂▂▂▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb: losses/clipfrac ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb: losses/entropy_loss █▇▇▆▅▅▄▄▄▃▃▃▃▂▂▂▂▁▂▂▁▂▂▂▂
wandb: losses/explained_variance ▇█▇██▄▄▄▅▃▂▃▄▄▄▅▃▄▁▄▂▄▂▄▄
wandb: losses/policy_loss ▁▇▁▇▅▅▆▆▇▆█▅▅▇▆▆▆▇▆▇▆▆▆▆▆
wandb: losses/value_loss █▄▃▂▂▂▂▂▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
I ran
python ac_solver/agents/ppo.py --exp-name demo --wandb-logto train the PPO, but it doesn’t seem to be solving any of the problems. Did I do something wrong?