Skip to content

Train the PPO #4

Description

@WeihangGuo

I ran python ac_solver/agents/ppo.py --exp-name demo --wandb-log to train the PPO, but it doesn’t seem to be solving any of the problems. Did I do something wrong?

wandb: Run history:
wandb:                 charts/episode ▁▁▂▂▂▂▃▃▃▄▄▄▅▅▅▅▆▆▆▇▇▇▇██
wandb:             charts/global_step ▁▁▂▂▂▂▃▃▃▄▄▄▅▅▅▅▆▆▆▇▇▇▇██
wandb:          charts/highest_solved ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb:           charts/learning_rate ██▇▇▇▇▆▆▆▅▅▅▅▄▄▄▃▃▃▂▂▂▂▁▁
wandb: charts/normalized_lengths_mean ▁▄▅▆▆▇▇▇▇▇▇▇▇▇▇▇▇████████
wandb: charts/normalized_returns_mean █▅▄▃▃▂▂▂▂▂▂▂▂▂▂▂▂▁▁▁▁▁▁▁▁
wandb:                  charts/solved ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb:                charts/unsolved ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb:          debug/advantages_mean ▅█▄▅▁▃▃▄▃▃▃▃▃▄▃▄▂▄▄▅▄▄▄▄▃
wandb:           debug/advantages_std █▅▄▃▂▂▂▂▂▂▂▂▂▁▁▁▁▁▁▁▁▁▁▁▁
wandb:               losses/approx_kl █▄▂▂▂▂▂▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb:                losses/clipfrac ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
wandb:            losses/entropy_loss █▇▇▆▅▅▄▄▄▃▃▃▃▂▂▂▂▁▂▂▁▂▂▂▂
wandb:      losses/explained_variance ▇█▇██▄▄▄▅▃▂▃▄▄▄▅▃▄▁▄▂▄▂▄▄
wandb:             losses/policy_loss ▁▇▁▇▅▅▆▆▇▆█▅▅▇▆▆▆▇▆▇▆▆▆▆▆
wandb:              losses/value_loss █▄▃▂▂▂▂▂▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions