
**episode length is too small when train**
(hover) root@robot:~/rl/HOVER# ${ISAACLAB_PATH:?}/isaaclab.sh -p scripts/rsl_rl/train_teacher_policy.py --device cuda:0 --num_envs 2048 --headless --reference_motion_path third_party/human2humanoid/data/h1/amass_part.pkl --teacher_policy.project_name hover
here amass_part.pkl from ACCD dataset
################################################################################
Learning iteration 156025/10000000
Computation: 46045 steps/s (collection: 0.975s, learning 0.092s)
Value function loss: 736518.8656
Surrogate loss: -0.0096
Mean action noise std: 8.40
Mean reward: 4006.23
Mean cost: 0.00
Mean episode length: 42.41
Average_episode_length_for_reward_curriculum: 63.223576
Penalty_scale: 0.001403
Teleop_body_pos_upperbody_sigma: 0.030000
Mean episode Episode_Reward/reward_track_joint_positions: 2.2082
Mean episode Episode_Reward/reward_track_joint_velocities: 0.0048
Mean episode Episode_Reward/reward_track_body_velocities: 2.7732
Mean episode Episode_Reward/reward_track_body_angular_velocities: 1.1955
Mean episode Episode_Reward/reward_track_body_position_extended: 3.5211
Mean episode Episode_Reward/reward_track_body_position_vr_key_points: 2.0993
Mean episode Episode_Reward/penalize_torques: 531.4338
Mean episode Episode_Reward/penalize_by_torque_limits: 0.4039
Mean episode Episode_Reward/penalize_joint_accelerations: 7427.6616
Mean episode Episode_Reward/penalize_joint_velocities: 1.8734
Mean episode Episode_Reward/penalize_lower_body_action_changes: 6.6088
Mean episode Episode_Reward/penalize_upper_body_action_changes: 24.9249
Mean episode Episode_Reward/penalize_by_joint_pos_limits: 0.0000
Mean episode Episode_Reward/penalize_by_joint_velocity_limits: 0.0034
Mean episode Episode_Reward/penalize_early_termination: 0.0001
Mean episode Episode_Reward/penalize_feet_contact_forces: 1.0436
Mean episode Episode_Reward/penalize_stumble: 0.0000
Mean episode Episode_Reward/penalize_slippage: 0.0018
Mean episode Episode_Reward/penalize_feet_orientation: 0.0026
Mean episode Episode_Reward/penalize_feet_air_time: -0.0001
Mean episode Episode_Reward/penalize_both_feet_in_air: 0.0017
Mean episode Episode_Reward/penalize_orientation: 0.0001
Mean episode Episode_Reward/penalize_max_feet_height_before_contact: 0.0001
Mean episode Episode_Termination/base_contact: 36.7500
Mean episode Episode_Termination/time_out: 0.2500
Total timesteps: 7668989952
Iteration time: 1.07s
Total time: 166496.91s
(hover) root@robot:~/rl/HOVER# ${ISAACLAB_PATH:?}/isaaclab.sh -p scripts/rsl_rl/train_teacher_policy.py --device cuda:0 --num_envs 2048 --headless --reference_motion_path third_party/human2humanoid/data/h1/amass_part.pkl --teacher_policy.project_name hover
here amass_part.pkl from ACCD dataset
################################################################################
Learning iteration 156025/10000000
Average_episode_length_for_reward_curriculum: 63.223576
Penalty_scale: 0.001403
Teleop_body_pos_upperbody_sigma: 0.030000
Mean episode Episode_Reward/reward_track_joint_positions: 2.2082
Mean episode Episode_Reward/reward_track_joint_velocities: 0.0048
Mean episode Episode_Reward/reward_track_body_velocities: 2.7732
Mean episode Episode_Reward/reward_track_body_angular_velocities: 1.1955
Mean episode Episode_Reward/reward_track_body_position_extended: 3.5211
Mean episode Episode_Reward/reward_track_body_position_vr_key_points: 2.0993
Mean episode Episode_Reward/penalize_torques: 531.4338
Mean episode Episode_Reward/penalize_by_torque_limits: 0.4039
Mean episode Episode_Reward/penalize_joint_accelerations: 7427.6616
Mean episode Episode_Reward/penalize_joint_velocities: 1.8734
Mean episode Episode_Reward/penalize_lower_body_action_changes: 6.6088
Mean episode Episode_Reward/penalize_upper_body_action_changes: 24.9249
Mean episode Episode_Reward/penalize_by_joint_pos_limits: 0.0000
Mean episode Episode_Reward/penalize_by_joint_velocity_limits: 0.0034
Mean episode Episode_Reward/penalize_early_termination: 0.0001
Mean episode Episode_Reward/penalize_feet_contact_forces: 1.0436
Mean episode Episode_Reward/penalize_stumble: 0.0000
Mean episode Episode_Reward/penalize_slippage: 0.0018
Mean episode Episode_Reward/penalize_feet_orientation: 0.0026
Mean episode Episode_Reward/penalize_feet_air_time: -0.0001
Mean episode Episode_Reward/penalize_both_feet_in_air: 0.0017
Mean episode Episode_Reward/penalize_orientation: 0.0001
Mean episode Episode_Reward/penalize_max_feet_height_before_contact: 0.0001
Mean episode Episode_Termination/base_contact: 36.7500
Mean episode Episode_Termination/time_out: 0.2500