From d4ddf070861a0f257e116c04438ac1d2271e4f5b Mon Sep 17 00:00:00 2001 From: ZidongLiu Date: Sun, 25 Aug 2024 14:09:24 -0500 Subject: [PATCH 01/29] rerun all experiments --- run_experiments.sh | 62 ++++++++++++++++++++++++++++++++++++++++++++++ 1 file changed, 62 insertions(+) create mode 100644 run_experiments.sh diff --git a/run_experiments.sh b/run_experiments.sh new file mode 100644 index 0000000..2c31cd2 --- /dev/null +++ b/run_experiments.sh @@ -0,0 +1,62 @@ +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=multirc-0001 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0002 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0003 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0004 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=multirc-0005 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0006 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0007 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0008 + +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=rte-0001 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0002 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0003 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0004 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=rte-0005 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0006 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0007 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0008 + +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=boolq-0001 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0002 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0003 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0004 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=boolq-0005 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0006 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0007 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0008 + +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wsc-0001 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0002 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0003 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0004 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wsc-0005 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0006 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0007 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0008 + +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wic-0001 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0002 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0003 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0004 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wic-0005 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0006 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0007 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0008 + +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=cb-0001 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0002 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0003 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0004 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=cb-0005 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0006 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0007 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0008 + +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=sst2-0001 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0002 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0003 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0004 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=sst2-0005 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0006 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0007 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0008 From 2667d0c22950cfc29fab895989199f3f0135dbe3 Mon Sep 17 00:00:00 2001 From: ZidongLiu Date: Sun, 25 Aug 2024 14:17:57 -0500 Subject: [PATCH 02/29] update tensorboard name --- run_experiments.sh | 112 ++++++++++++++++++++++----------------------- 1 file changed, 56 insertions(+), 56 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 2c31cd2..3cc7c50 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,62 +1,62 @@ -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=multirc-0001 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0002 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0003 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0004 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=multirc-0005 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0006 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0007 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=multirc-0008 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0001 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0002 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0003 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0004 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0007 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0008 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=rte-0001 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0002 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0003 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0004 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=rte-0005 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0006 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0007 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=rte-0008 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0001 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0002 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0003 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0004 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0007 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0008 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=boolq-0001 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0002 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0003 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0004 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=boolq-0005 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0006 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0007 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=boolq-0008 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0001 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0002 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0003 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0004 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0007 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0008 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wsc-0001 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0002 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0003 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0004 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wsc-0005 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0006 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0007 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wsc-0008 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0001 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0002 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0003 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0004 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0007 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0008 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wic-0001 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0002 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0003 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0004 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=wic-0005 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0006 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0007 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=wic-0008 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0001 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0002 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0003 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0004 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0007 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0008 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=cb-0001 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0002 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0003 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0004 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=cb-0005 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0006 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0007 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=cb-0008 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0001 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0002 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0003 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0004 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0007 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0008 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=sst2-0001 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0002 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0003 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0004 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=sst2-0005 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0006 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0007 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=sst2-0008 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0001 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0002 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0003 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0004 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0007 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0008 From d0e8520b1bcfd676599b46d88cf44168eef89252 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Wed, 28 Aug 2024 22:39:12 -0400 Subject: [PATCH 03/29] Update run_experiments.sh --- run_experiments.sh | 101 +++++++++++++++++---------------------------- 1 file changed, 39 insertions(+), 62 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 3cc7c50..7b615ce 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,62 +1,39 @@ -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0001 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0002 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0003 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0004 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0007 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0008 - -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0001 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0002 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0003 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0004 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0007 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0008 - -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0001 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0002 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0003 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0004 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0007 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0008 - -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0001 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0002 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0003 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0004 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0007 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0008 - -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0001 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0002 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0003 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0004 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0007 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0008 - -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0001 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0002 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0003 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0004 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0007 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0008 - -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0001 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0002 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0003 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0004 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.0000001 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=1 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0007 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float16 --seed=365 --iterations=5000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0008 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0004 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0001 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0002 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0003 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0004 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 +python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0001 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0002 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0003 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0004 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0001 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0002 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0003 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0004 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 +python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0001 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0002 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0003 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0004 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0001 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0002 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0003 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0004 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0001 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0002 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0003 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0004 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 From 6739c0e6a5d13d3600d515c4c32feb3fafaf037c Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sun, 1 Sep 2024 21:33:39 -0400 Subject: [PATCH 04/29] Update run_experiments.sh --- run_experiments.sh | 51 +++++++++++++++------------------------------- 1 file changed, 16 insertions(+), 35 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 7b615ce..3c2a3dc 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,39 +1,20 @@ -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0004 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0001 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0002 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0003 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-cb-0004 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 + python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0001 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0002 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0003 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wic-0004 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0001 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0002 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0003 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0004 + +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 +python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 + python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0001 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0002 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0003 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0004 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0001 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0002 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0003 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-rte-0004 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0001 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0002 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0003 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=64 --test-batch-size=64 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0004 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 + +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 + +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 +python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 + +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 From 594aeb46156485a8050e4fa367076b2ee498656b Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Thu, 5 Sep 2024 11:27:58 -0400 Subject: [PATCH 05/29] Update run_experiments.sh --- run_experiments.sh | 31 +++++++++++-------------------- 1 file changed, 11 insertions(+), 20 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 3c2a3dc..8e4b38a 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,20 +1,11 @@ -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python cezo_fl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 - -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 -python cezo_fl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 - -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 -python cezo_fl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 - -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 -python cezo_fl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 - -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python cezo_fl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 - -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 -python cezo_fl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 - -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python cezo_fl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 +python decomfl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 +python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 +python decomfl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 +python decomfl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python decomfl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 +python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 +python decomfl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 From 4b61293313fe84d02f9408f1b26458b8377b5dba Mon Sep 17 00:00:00 2001 From: ZidongLiu Date: Thu, 5 Sep 2024 11:51:00 -0500 Subject: [PATCH 06/29] add requirements.txt back for run_experiment --- requirements.txt | 9 +++++++++ 1 file changed, 9 insertions(+) create mode 100644 requirements.txt diff --git a/requirements.txt b/requirements.txt new file mode 100644 index 0000000..015e631 --- /dev/null +++ b/requirements.txt @@ -0,0 +1,9 @@ +numpy==1.23.5 +tqdm==4.66.1 +tensorboardx==2.6.2 +transformers==4.41.1 +accelerate==0.30.1 +datasets==2.19.1 +--extra-index-url https://download.pytorch.org/whl/cu121 +torch==2.3.0+cu121 +torchvision==0.18.0+cu121 \ No newline at end of file From b4a4d5ff8071065e3cf242d6bc39eb66d80771bf Mon Sep 17 00:00:00 2001 From: RogerRogerUSC <118097091+RogerRogerUSC@users.noreply.github.com> Date: Fri, 6 Sep 2024 20:49:56 -0400 Subject: [PATCH 07/29] Update run_experiments.sh --- run_experiments.sh | 25 ++++++++++++++----------- 1 file changed, 14 insertions(+), 11 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 8e4b38a..4c167ae 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,11 +1,14 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 -python decomfl_main.py --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 -python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 -python decomfl_main.py --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 -python decomfl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python decomfl_main.py --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 -python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 -python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 -python decomfl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py —no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py —no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py —no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 +python decomfl_main.py —no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 +python decomfl_main.py —no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python decomfl_main.py —no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python decomfl_main.py —no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 +python decomfl_main.py —no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 +python decomfl_main.py —no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 +python decomfl_main.py —no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 +python decomfl_main.py —no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 +python decomfl_main.py —no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 +python decomfl_main.py —no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python decomfl_main.py —no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 \ No newline at end of file From cff6e17fdbdec143b36f1b74ead22d8226aded5f Mon Sep 17 00:00:00 2001 From: RogerRogerUSC <118097091+RogerRogerUSC@users.noreply.github.com> Date: Fri, 6 Sep 2024 20:53:15 -0400 Subject: [PATCH 08/29] Update run_experiments.sh --- run_experiments.sh | 28 ++++++++++++++-------------- 1 file changed, 14 insertions(+), 14 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 4c167ae..6a3cfc3 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,14 +1,14 @@ -python decomfl_main.py —no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py —no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 -python decomfl_main.py —no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 -python decomfl_main.py —no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 -python decomfl_main.py —no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python decomfl_main.py —no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 -python decomfl_main.py —no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 -python decomfl_main.py —no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 -python decomfl_main.py —no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 -python decomfl_main.py —no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 -python decomfl_main.py —no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 -python decomfl_main.py —no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 -python decomfl_main.py —no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python decomfl_main.py —no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 \ No newline at end of file +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py --no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 +python decomfl_main.py --no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python decomfl_main.py --no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 +python decomfl_main.py --no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 +python decomfl_main.py --no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 +python decomfl_main.py --no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 +python decomfl_main.py --no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 +python decomfl_main.py --no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 +python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 \ No newline at end of file From 78cd1f1f2ea53921e7760a498a888e2694883c5a Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Tue, 10 Sep 2024 11:30:12 -0400 Subject: [PATCH 09/29] Update run_experiments.sh --- run_experiments.sh | 24 ++++++++++-------------- 1 file changed, 10 insertions(+), 14 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 6a3cfc3..e2ada3e 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,14 +1,10 @@ -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 -python decomfl_main.py --no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0005 -python decomfl_main.py --no-optim --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-rte-0006 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 -python decomfl_main.py --no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0005 -python decomfl_main.py --no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 -python decomfl_main.py --no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0005 -python decomfl_main.py --no-optim --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wic-0006 -python decomfl_main.py --no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 -python decomfl_main.py --no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0006 -python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 \ No newline at end of file +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=32 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0004 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python decomfl_main.py --no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 +python decomfl_main.py --no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=42 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 +python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=32 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0004 +python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 +python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 From 4612b32df99e0a3cc9b6506aad51cabf54b68422 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Wed, 11 Sep 2024 17:41:21 -0400 Subject: [PATCH 10/29] Update run_experiments.sh --- run_experiments.sh | 14 ++++---------- 1 file changed, 4 insertions(+), 10 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index e2ada3e..3f0b037 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,10 +1,4 @@ -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=32 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0004 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 -python decomfl_main.py --no-optim --dataset=wsc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-wsc-0006 -python decomfl_main.py --no-optim --dataset=cb --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=42 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-cb-0005 -python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=32 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=1 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-central --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0004 -python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0005 -python decomfl_main.py --no-optim --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-sst2-0006 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 +python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 From 5bb2c31af4ce7993560d64ec3661b4fba25aa642 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sun, 15 Sep 2024 14:28:15 -0400 Subject: [PATCH 11/29] Update run_experiments.sh --- run_experiments.sh | 8 ++++---- 1 file changed, 4 insertions(+), 4 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 3f0b037..28b37fc 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,4 +1,4 @@ -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0005 -python decomfl_main.py --no-optim --dataset=boolq --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-boolq-0006 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=66 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=66 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=88 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 +python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=88 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 From 0e1fba0b1be20419ff89ebb6f0df6774a829ee2f Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Wed, 23 Apr 2025 22:00:52 -0400 Subject: [PATCH 12/29] Update run_experiments.sh --- run_experiments.sh | 16 ++++++++++++---- 1 file changed, 12 insertions(+), 4 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 28b37fc..b5bddd6 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,4 +1,12 @@ -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=66 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=66 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=88 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0005 -python decomfl_main.py --no-optim --dataset=multirc --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=88 --iterations=2000 --train-batch-size=16 --test-batch-size=16 --no-iid --dirichlet-alpha=1 --num-clients=8 --num-sample-clients=2 --local-update-steps=1 --num-pert=10 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=FedDisco-multirc-0006 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=64 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0001 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002 +python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=64 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0001 +python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0002 +python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=64 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0001 +python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0002 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0003 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0004 +python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0003 +python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0004 +python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0003 +python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0004 From 1c769fe9b891751df2b7fe8040a44551d15e122f Mon Sep 17 00:00:00 2001 From: ZidongLiu Date: Thu, 24 Apr 2025 19:34:23 -0500 Subject: [PATCH 13/29] delete requirements.txt --- requirements.txt | 9 --------- 1 file changed, 9 deletions(-) delete mode 100644 requirements.txt diff --git a/requirements.txt b/requirements.txt deleted file mode 100644 index 015e631..0000000 --- a/requirements.txt +++ /dev/null @@ -1,9 +0,0 @@ -numpy==1.23.5 -tqdm==4.66.1 -tensorboardx==2.6.2 -transformers==4.41.1 -accelerate==0.30.1 -datasets==2.19.1 ---extra-index-url https://download.pytorch.org/whl/cu121 -torch==2.3.0+cu121 -torchvision==0.18.0+cu121 \ No newline at end of file From 3da4a2f2e31a37e0af22e88fcdb6a001edbee27d Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Thu, 1 May 2025 10:27:44 -0400 Subject: [PATCH 14/29] Update run_experiments.sh --- run_experiments.sh | 30 ++++++++++++++++++------------ 1 file changed, 18 insertions(+), 12 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index b5bddd6..313a182 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,12 +1,18 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=64 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0001 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002 -python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=64 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0001 -python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0002 -python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=64 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0001 -python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=64 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0002 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0003 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0004 -python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0003 -python decomfl_main.py --dataset=wic --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-wic-0004 -python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=3 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0003 -python decomfl_main.py --dataset=rte --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=1500 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-rte-0004 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0001 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0003 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0004 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0006 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0001 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0003 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0004 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0005 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0006 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0001 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0002 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0003 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0004 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0005 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0006 From d8b5b85f198cb09727aec8ca04adf256e0cd6079 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Thu, 1 May 2025 10:31:09 -0400 Subject: [PATCH 15/29] Update run_experiments.sh --- run_experiments.sh | 12 ++++++------ 1 file changed, 6 insertions(+), 6 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 313a182..09056ec 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,9 +1,9 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0001 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0003 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0004 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0006 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0001 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0003 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0004 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0006 python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0001 python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0003 From c1fa81b3fb82b403ab85061ba4a58bbaa4346ad8 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Thu, 1 May 2025 10:31:29 -0400 Subject: [PATCH 16/29] Update run_experiments.sh --- run_experiments.sh | 12 ++++++------ 1 file changed, 6 insertions(+), 6 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 09056ec..374f129 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -4,12 +4,12 @@ python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 - python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0004 python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0006 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0001 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0003 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0004 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0005 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0006 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0001 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0003 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0004 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0005 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0006 python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0001 python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0002 python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0003 From 30ace90ed96e9df59fd91577797f640a9e5f4574 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sun, 4 May 2025 10:34:28 -0400 Subject: [PATCH 17/29] Update run_experiments.sh --- run_experiments.sh | 28 ++++++++++------------------ 1 file changed, 10 insertions(+), 18 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 374f129..bd7caed 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,18 +1,10 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0001 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0003 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0004 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0006 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0001 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0003 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0004 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0005 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0006 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0001 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0002 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0003 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0004 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0005 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=phi-1 --model-dtype=float32 --seed=365 --iterations=200 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0006 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0007 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0008 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0009 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0010 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0011 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0012 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0013 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0014 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0014 From 1922c70a93a0e3b34a4b382a34d992978b662dbd Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sun, 4 May 2025 10:37:16 -0400 Subject: [PATCH 18/29] Update run_experiments.sh --- run_experiments.sh | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/run_experiments.sh b/run_experiments.sh index bd7caed..df1af3f 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -7,4 +7,4 @@ python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350 python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0012 python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0013 python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0014 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0014 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0015 From 1526f63077c4d2371f20b11fea919f0ebcb2dbea Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Tue, 6 May 2025 00:26:14 -0400 Subject: [PATCH 19/29] Update run_experiments.sh --- run_experiments.sh | 24 ++++++++++++++---------- 1 file changed, 14 insertions(+), 10 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index df1af3f..3050a17 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,10 +1,14 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000002 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-0005 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0007 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0008 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0009 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0010 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-350m --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0011 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0012 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0013 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.0005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0014 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0015 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0005 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 + +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002-v-0.95-lr-1e-5 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.90 --log-to-tensorboard=Hessian-sst2-0002-v-0.90-lr-1e-5 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000008 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002-v-0.95-lr-8e-6 + +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0002 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0005 + +python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-drop-0002-v-0.95-lr-1e-5 +python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.90 --log-to-tensorboard=Hessian-drop-0002-v-0.90-lr-1e-5 +python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-drop-0002-v-0.95-lr-5e-5 +python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-drop-0005 From ad45db724b07983161f67cc30959f2392a38075b Mon Sep 17 00:00:00 2001 From: RogerRogerUSC <118097091+RogerRogerUSC@users.noreply.github.com> Date: Mon, 12 May 2025 12:26:04 -0400 Subject: [PATCH 20/29] Replace fixed variables with args. --- llm_fo_fine_tune_main.py | 6 ++---- 1 file changed, 2 insertions(+), 4 deletions(-) diff --git a/llm_fo_fine_tune_main.py b/llm_fo_fine_tune_main.py index 8219622..830cfdc 100644 --- a/llm_fo_fine_tune_main.py +++ b/llm_fo_fine_tune_main.py @@ -80,15 +80,13 @@ def inf_loader(dl): torch.cuda.empty_cache() print(f"Start, Accuracy: {acc.avg:.4f}") - num_epochs = 20 train_loader = train_loaders[0] model.train() total_loss = 0.0 inf_train_loader = inf_loader(train_loader) - eval_iterations = 200 train_losses = [] eval_accs = [] - for i in tqdm(range(10000)): + for i in tqdm(range(args.iterations)): batch_input_dict, batch_output_tensor = next(inf_train_loader) batch_input_dict = batch_input_dict.to("cuda") batch_output_tensor = batch_output_tensor.to("cuda") @@ -114,7 +112,7 @@ def inf_loader(dl): # Print average loss for the epoch average_loss = total_loss / len(train_loader) - if (i + 1) % eval_iterations == 0: + if (i + 1) % args.eval_iterations == 0: acc = Metric("accuracy") model.eval() with torch.no_grad(): From cc03dec003e1d1486245120375faf99d8036a4f5 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Tue, 13 May 2025 12:27:34 -0400 Subject: [PATCH 21/29] Update run_experiments.sh --- run_experiments.sh | 15 ++++----------- 1 file changed, 4 insertions(+), 11 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index 3050a17..df61bfb 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,14 +1,7 @@ -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qqp-0005 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-qqp-0002 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-125m -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002-v-0.95-lr-1e-5 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.90 --log-to-tensorboard=Hessian-sst2-0002-v-0.90-lr-1e-5 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000008 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-0002-v-0.95-lr-8e-6 +python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-125m -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-0002 -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-0005 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-2.7b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-2.7b -python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-drop-0002-v-0.95-lr-1e-5 -python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.90 --log-to-tensorboard=Hessian-drop-0002-v-0.90-lr-1e-5 -python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-drop-0002-v-0.95-lr-5e-5 -python decomfl_main.py --dataset=drop --eval-iterations=20 --large-model=opt-1.3b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-drop-0005 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-2.7b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-2.7b From b3e4308a4da4c973cda179292aaadda49e25bd29 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Thu, 15 May 2025 00:42:02 -0400 Subject: [PATCH 22/29] Update run_experiments.sh --- run_experiments.sh | 13 ++++++------- 1 file changed, 6 insertions(+), 7 deletions(-) diff --git a/run_experiments.sh b/run_experiments.sh index df61bfb..c8897a9 100644 --- a/run_experiments.sh +++ b/run_experiments.sh @@ -1,7 +1,6 @@ -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-squad-125m - -python decomfl_main.py --dataset=squad --eval-iterations=20 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=8 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-squad-125m - -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-2.7b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=Hessian-sst2-2.7b - -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-2.7b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-sst2-2.7b +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qwen-sst2 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qwen-qqp +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qwen-squad +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-qwen-sst2 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-qwen-qqp +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-qwen-squad From 680d3d7d0654265edd5fd1fa10c6c40257bea9ef Mon Sep 17 00:00:00 2001 From: RogerRogerUSC <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sun, 18 May 2025 10:29:57 -0400 Subject: [PATCH 23/29] Fix a tiny error. --- llm_fo_fine_tune_main.py | 6 ++++-- 1 file changed, 4 insertions(+), 2 deletions(-) diff --git a/llm_fo_fine_tune_main.py b/llm_fo_fine_tune_main.py index 830cfdc..ea00b84 100644 --- a/llm_fo_fine_tune_main.py +++ b/llm_fo_fine_tune_main.py @@ -82,11 +82,13 @@ def inf_loader(dl): train_loader = train_loaders[0] model.train() + eval_iterations = 20 + iterations = 1000 total_loss = 0.0 inf_train_loader = inf_loader(train_loader) train_losses = [] eval_accs = [] - for i in tqdm(range(args.iterations)): + for i in tqdm(range(iterations)): batch_input_dict, batch_output_tensor = next(inf_train_loader) batch_input_dict = batch_input_dict.to("cuda") batch_output_tensor = batch_output_tensor.to("cuda") @@ -112,7 +114,7 @@ def inf_loader(dl): # Print average loss for the epoch average_loss = total_loss / len(train_loader) - if (i + 1) % args.eval_iterations == 0: + if (i + 1) % eval_iterations == 0: acc = Metric("accuracy") model.eval() with torch.no_grad(): From 7bc9e851ad1b5ff0407cf6ca3505d610706bb531 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Fri, 25 Jul 2025 11:30:59 -0700 Subject: [PATCH 24/29] Update and rename run_experiments.sh to run_exp_h200.sh --- run_exp_h200.sh | 6 ++++++ run_experiments.sh | 6 ------ 2 files changed, 6 insertions(+), 6 deletions(-) create mode 100644 run_exp_h200.sh delete mode 100644 run_experiments.sh diff --git a/run_exp_h200.sh b/run_exp_h200.sh new file mode 100644 index 0000000..9c70320 --- /dev/null +++ b/run_exp_h200.sh @@ -0,0 +1,6 @@ +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-sst2 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-qqp +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-squad +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-sst2 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-qqp +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-squad diff --git a/run_experiments.sh b/run_experiments.sh deleted file mode 100644 index c8897a9..0000000 --- a/run_experiments.sh +++ /dev/null @@ -1,6 +0,0 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qwen-sst2 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qwen-qqp -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=2000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-qwen-squad -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-qwen-sst2 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-qwen-qqp -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=deepseek-qwen-1.5b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-qwen-squad From 6ca9b88115f2f14a81e2add523a3433f7b05dd6b Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Fri, 25 Jul 2025 11:32:27 -0700 Subject: [PATCH 25/29] Update run_exp_h200.sh --- run_exp_h200.sh | 4 ++-- 1 file changed, 2 insertions(+), 2 deletions(-) diff --git a/run_exp_h200.sh b/run_exp_h200.sh index 9c70320..b7f22e5 100644 --- a/run_exp_h200.sh +++ b/run_exp_h200.sh @@ -1,6 +1,6 @@ python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-sst2 python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-qqp -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-squad +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-squad python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-sst2 python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-qqp -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-squad +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-squad From 4b53c8fed3da42b0c33ab596f8153d16b3d505cd Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Fri, 25 Jul 2025 11:39:06 -0700 Subject: [PATCH 26/29] Create run_exp_h100.sh --- run_exp_h100.sh | 6 ++++++ 1 file changed, 6 insertions(+) create mode 100644 run_exp_h100.sh diff --git a/run_exp_h100.sh b/run_exp_h100.sh new file mode 100644 index 0000000..9bef138 --- /dev/null +++ b/run_exp_h100.sh @@ -0,0 +1,6 @@ +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-qqp-64 +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-squad-64 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64 +python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-qqp-64 +python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-squad-64 From e2b98ee25bbecdb3753d1388d24693109d0200f3 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Fri, 25 Jul 2025 23:56:42 -0700 Subject: [PATCH 27/29] Update run_exp_h100.sh --- run_exp_h100.sh | 26 ++++++++++++++++++++------ 1 file changed, 20 insertions(+), 6 deletions(-) diff --git a/run_exp_h100.sh b/run_exp_h100.sh index 9bef138..9fd6062 100644 --- a/run_exp_h100.sh +++ b/run_exp_h100.sh @@ -1,6 +1,20 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-qqp-64 -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-squad-64 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-qqp-64 -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-squad-64 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64_1 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64_1 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=4 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64_4 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=4 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64_4 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=16 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64_16 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=16 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64_16 + +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=24 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-24_8 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=24 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-24_8 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=36 --num-sample-clients=12 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-36_12 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=36 --num-sample-clients=12 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-36_12 + +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=5 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-lu-5 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=5 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-lu-5 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=10 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-lu-10 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=10 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-lu-10 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=20 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-lu-20 +python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=20 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-lu-20 + + From 80535e3458e567261a044936268d992409687388 Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sat, 15 Nov 2025 19:19:16 -0500 Subject: [PATCH 28/29] Update and rename run_exp_h100.sh to run_experiments.sh --- run_exp_h100.sh | 20 -------------------- run_experiments.sh | 2 ++ 2 files changed, 2 insertions(+), 20 deletions(-) delete mode 100644 run_exp_h100.sh create mode 100644 run_experiments.sh diff --git a/run_exp_h100.sh b/run_exp_h100.sh deleted file mode 100644 index 9fd6062..0000000 --- a/run_exp_h100.sh +++ /dev/null @@ -1,20 +0,0 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64_1 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64_1 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=4 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64_4 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=4 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64_4 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=16 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-64_16 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=16 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-64_16 - -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=24 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-24_8 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=24 --num-sample-clients=8 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-24_8 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=36 --num-sample-clients=12 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-36_12 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=36 --num-sample-clients=12 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-36_12 - -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=5 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-lu-5 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=5 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-lu-5 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=10 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-lu-10 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=10 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-lu-10 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=20 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt125m-sst2-lu-20 -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-125m --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=64 --num-sample-clients=8 --local-update-steps=20 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt125m-sst2-lu-20 - - diff --git a/run_experiments.sh b/run_experiments.sh new file mode 100644 index 0000000..56be1c6 --- /dev/null +++ b/run_experiments.sh @@ -0,0 +1,2 @@ +uv run decomfl_main.py --large-model=smollm3-3b --dataset=sst2 --iterations=3000 --train-batch-size=32 --test-batch-size=32 --eval-iterations=25 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=1e-6 --mu=1e-3 --grad-estimate-method=rge-forward --no-optim --log-to-tensorboard=decomfl-sst2-smollm3-3b +uv run decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=smollm3-3b --model-dtype=float32 --seed=365 --iterations=3000 --train-batch-size=32 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=6 --num-sample-clients=2 --local-update-steps=1 --num-pert=5 --lr=0.00001 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --no-optim --log-to-tensorboard=Hessian-sst2-smollm3-3b From ecf186f91b8fe8243f35b440d8ad869524554a3f Mon Sep 17 00:00:00 2001 From: Zhe Li <118097091+RogerRogerUSC@users.noreply.github.com> Date: Sat, 15 Nov 2025 19:19:45 -0500 Subject: [PATCH 29/29] Delete run_exp_h200.sh --- run_exp_h200.sh | 6 ------ 1 file changed, 6 deletions(-) delete mode 100644 run_exp_h200.sh diff --git a/run_exp_h200.sh b/run_exp_h200.sh deleted file mode 100644 index b7f22e5..0000000 --- a/run_exp_h200.sh +++ /dev/null @@ -1,6 +0,0 @@ -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-sst2 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-qqp -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.000005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --log-to-tensorboard=decomfl-opt6-7-squad -python decomfl_main.py --dataset=sst2 --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-sst2 -python decomfl_main.py --dataset=qqp --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=16 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-qqp -python decomfl_main.py --dataset=squad --eval-iterations=25 --large-model=opt-6.7b --model-dtype=float32 --seed=365 --iterations=1000 --train-batch-size=8 --test-batch-size=32 --no-iid --dirichlet-alpha=1 --num-clients=1 --num-sample-clients=1 --local-update-steps=1 --num-pert=5 --lr=0.00005 --momentum=0 --grad-estimate-method=rge-forward --mu=0.001 --estimator-type=adam_forward --k_update_strategy=last_local_update --hessian-smooth=0.95 --log-to-tensorboard=hessian-opt6-7-squad