From 2e9827a65fcd7676bb72dfd716377493667e36f8 Mon Sep 17 00:00:00 2001 From: Deval Shah Date: Tue, 1 Sep 2026 22:14:13 -0500 Subject: [PATCH 1/3] Fix CPU-GPU linking when ac2g start events are missing. hipDrvLaunchKernelEx launches omit the ac2g start flow, so the linker now falls back to an unambiguous correlation-id match. Co-authored-by: Cursor --- TraceLens/Trace2Tree/trace_to_tree.py | 27 +++++++++++++-------------- 1 file changed, 13 insertions(+), 14 deletions(-) diff --git a/TraceLens/Trace2Tree/trace_to_tree.py b/TraceLens/Trace2Tree/trace_to_tree.py index 0089dbb2a..94e4b045c 100644 --- a/TraceLens/Trace2Tree/trace_to_tree.py +++ b/TraceLens/Trace2Tree/trace_to_tree.py @@ -1199,26 +1199,25 @@ def _find_corresponding_output_event(self, input_event): # 1. Get the linking id from the input event # 2. Find the corresponding start and end ac2g events for the linking id # 3. Find the output event using the pid, tid, and linking id of the end ac2g event + # 4. Some runtimes (e.g. hipDrvLaunchKernelEx) emit only the finish half of the + # ac2g flow, so fall back to an unambiguous correlation-id match link_id = input_event.get(TraceEventUtils.TraceKeys.Args, {}).get( self.linking_key ) ac2g_start_event = self.ac2g_event_map["start"].get(link_id) ac2g_end_event = self.ac2g_event_map["end"].get(link_id) - if not ac2g_start_event: - return None - - if not ac2g_end_event: - # print(f"Warning: start ac2g event found for {self.linking_key}={link_id} but no corresponding end ac2g event found.") - # print(f"Input event name: {input_event[TraceEventUtils.TraceKeys.Name]}") - # print(('-'*64)) - return None - - pid = ac2g_end_event.get(TraceEventUtils.TraceKeys.PID) - tid = ac2g_end_event.get(TraceEventUtils.TraceKeys.TID) - link_id = ac2g_end_event.get("id") - - output_event = self.pid_tid_event_map.get((pid, tid, link_id)) + output_event = None + if ac2g_start_event and ac2g_end_event: + pid = ac2g_end_event.get(TraceEventUtils.TraceKeys.PID) + tid = ac2g_end_event.get(TraceEventUtils.TraceKeys.TID) + end_link_id = ac2g_end_event.get("id") + output_event = self.pid_tid_event_map.get((pid, tid, end_link_id)) + + if output_event is None: + gpu_events = self.linking_id_to_gpu_events.get(link_id, []) + if len(gpu_events) == 1: + output_event = gpu_events[0] return output_event def get_nn_module_children(self, nn_module_event: Dict[str, Any]): From 25c3960ec6186d06460febd7a6d12dc0afb418bc Mon Sep 17 00:00:00 2001 From: Deval Shah Date: Wed, 2 Sep 2026 14:23:55 -0500 Subject: [PATCH 2/3] addressed comment, fixed unit test --- TraceLens/Trace2Tree/trace_to_tree.py | 10 +++---- tests/test_trace2tree.py | 39 +++++++++++++++++++++++++++ 2 files changed, 43 insertions(+), 6 deletions(-) diff --git a/TraceLens/Trace2Tree/trace_to_tree.py b/TraceLens/Trace2Tree/trace_to_tree.py index 94e4b045c..164e93e10 100644 --- a/TraceLens/Trace2Tree/trace_to_tree.py +++ b/TraceLens/Trace2Tree/trace_to_tree.py @@ -1207,18 +1207,16 @@ def _find_corresponding_output_event(self, input_event): ac2g_start_event = self.ac2g_event_map["start"].get(link_id) ac2g_end_event = self.ac2g_event_map["end"].get(link_id) - output_event = None if ac2g_start_event and ac2g_end_event: pid = ac2g_end_event.get(TraceEventUtils.TraceKeys.PID) tid = ac2g_end_event.get(TraceEventUtils.TraceKeys.TID) end_link_id = ac2g_end_event.get("id") - output_event = self.pid_tid_event_map.get((pid, tid, end_link_id)) - - if output_event is None: + return self.pid_tid_event_map.get((pid, tid, end_link_id)) + else: gpu_events = self.linking_id_to_gpu_events.get(link_id, []) if len(gpu_events) == 1: - output_event = gpu_events[0] - return output_event + return gpu_events[0] + return None def get_nn_module_children(self, nn_module_event: Dict[str, Any]): """ diff --git a/tests/test_trace2tree.py b/tests/test_trace2tree.py index 3562413ca..0a3887ca7 100644 --- a/tests/test_trace2tree.py +++ b/tests/test_trace2tree.py @@ -634,6 +634,45 @@ def test_label_non_gpu_paths(self): assert "non_gpu_path" not in gpu_op_evt assert cpu_only.get("non_gpu_path") is True + def test_links_kernel_when_ac2g_start_is_missing(self): + def _launch_events(corr, kernel_names): + events = [ + _mk_event("cpu_op", "aten::mm", ts=0, dur=100, pid=1, tid=1, args={}), + _mk_event( + "cuda_runtime", + "hipDrvLaunchKernelEx", + ts=5, + dur=5, + pid=1, + tid=1, + args={"correlation": corr}, + ), + ] + for idx, name in enumerate(kernel_names): + events.append( + _mk_event( + "kernel", + name, + ts=20 + idx * 20, + dur=10, + pid=0, + tid=7, + args={"correlation": corr, "stream": 7}, + ) + ) + events.append(_mk_ac2g(corr, pid=0, tid=7, ts=20, phase="f")) + return events + + unique = _build_tree(_launch_events(26391, ["Cijk_Alik_Bljk"])) + mm = next(e for e in unique.events if e["name"] == "aten::mm") + gpu_events = unique.get_gpu_events(mm) + assert len(gpu_events) == 1 + assert gpu_events[0]["name"] == "Cijk_Alik_Bljk" + + ambiguous = _build_tree(_launch_events(42, ["kernel_a", "kernel_b"])) + mm = next(e for e in ambiguous.events if e["name"] == "aten::mm") + assert ambiguous.get_gpu_events(mm) == [] + def test_linking_key_uses_correlation_when_present(self): events = [ _mk_event("cpu_op", "aten::add", ts=0, dur=10, pid=1, tid=1, args={}), From 048770b756995830c93ce1f0bee0af009bded858 Mon Sep 17 00:00:00 2001 From: Deval Shah Date: Tue, 15 Sep 2026 11:32:32 -0500 Subject: [PATCH 3/3] Link unique memset events and refresh perf-report references. hipMemsetAsync often emits only the ac2g finish event, so the correlation-id fallback now also recovers those device memsets. The golden CSVs are regenerated to include that newly attributed GPU time. Co-authored-by: Cursor --- TraceLens/Trace2Tree/trace_to_tree.py | 5 +- tests/test_trace2tree.py | 41 +- .../perf_csvs/gpu_timeline.csv | 6 +- .../perf_csvs/ops_summary.csv | 280 +++---- .../perf_csvs/ops_summary_by_category.csv | 88 +-- .../perf_csvs/ops_unique_args.csv | 686 +++++++++--------- .../perf_csvs/unified_perf_summary.csv | 630 ++++++++-------- .../perf_csvs/BinaryElementwise.csv | 96 +-- .../perf_csvs/Normalization_fwd.csv | 24 +- .../perf_csvs/UnaryElementwise.csv | 78 +- .../xdit_sd_3.5/perf_csvs/gpu_timeline.csv | 6 +- .../xdit_sd_3.5/perf_csvs/ops_summary.csv | 200 ++--- .../perf_csvs/ops_summary_by_category.csv | 76 +- .../xdit_sd_3.5/perf_csvs/ops_unique_args.csv | 428 +++++------ .../perf_csvs/unified_perf_summary.csv | 396 +++++----- .../BinaryElementwise.csv | 34 +- .../CONV_bwd.csv | 10 +- .../CONV_fwd.csv | 12 +- .../Normalization.csv | 46 +- .../UnaryElementwise.csv | 20 +- .../gpu_timeline.csv | 14 +- .../ops_summary.csv | 50 +- .../ops_summary_by_category.csv | 24 +- .../ops_unique_args.csv | 260 +++---- .../unified_perf_summary.csv | 258 +++---- .../BinaryElementwise.csv | 12 +- .../Normalization.csv | 44 +- .../Reduce_fwd.csv | 2 +- .../gpu_timeline.csv | 6 +- .../ops_summary.csv | 36 +- .../ops_summary_by_category.csv | 8 +- .../ops_unique_args.csv | 64 +- .../unified_perf_summary.csv | 62 +- 33 files changed, 2016 insertions(+), 1986 deletions(-) diff --git a/TraceLens/Trace2Tree/trace_to_tree.py b/TraceLens/Trace2Tree/trace_to_tree.py index 5f4141c54..4e66830dc 100644 --- a/TraceLens/Trace2Tree/trace_to_tree.py +++ b/TraceLens/Trace2Tree/trace_to_tree.py @@ -1194,8 +1194,9 @@ def _find_corresponding_output_event(self, input_event): # 1. Get the linking id from the input event # 2. Find the corresponding start and end ac2g events for the linking id # 3. Find the output event using the pid, tid, and linking id of the end ac2g event - # 4. Some runtimes (e.g. hipDrvLaunchKernelEx) emit only the finish half of the - # ac2g flow, so fall back to an unambiguous correlation-id match + # 4. Some runtimes (e.g. hipDrvLaunchKernelEx, hipMemsetAsync) emit only + # the finish half of the ac2g flow, so fall back to an unambiguous + # correlation-id match. link_id = input_event.get(TraceEventUtils.TraceKeys.Args, {}).get( self.linking_key ) diff --git a/tests/test_trace2tree.py b/tests/test_trace2tree.py index 0a3887ca7..0db72bebd 100644 --- a/tests/test_trace2tree.py +++ b/tests/test_trace2tree.py @@ -635,12 +635,12 @@ def test_label_non_gpu_paths(self): assert cpu_only.get("non_gpu_path") is True def test_links_kernel_when_ac2g_start_is_missing(self): - def _launch_events(corr, kernel_names): + def _launch_events(corr, gpu_events, launcher="hipDrvLaunchKernelEx"): events = [ _mk_event("cpu_op", "aten::mm", ts=0, dur=100, pid=1, tid=1, args={}), _mk_event( "cuda_runtime", - "hipDrvLaunchKernelEx", + launcher, ts=5, dur=5, pid=1, @@ -648,10 +648,10 @@ def _launch_events(corr, kernel_names): args={"correlation": corr}, ), ] - for idx, name in enumerate(kernel_names): + for idx, (cat, name) in enumerate(gpu_events): events.append( _mk_event( - "kernel", + cat, name, ts=20 + idx * 20, dur=10, @@ -663,16 +663,45 @@ def _launch_events(corr, kernel_names): events.append(_mk_ac2g(corr, pid=0, tid=7, ts=20, phase="f")) return events - unique = _build_tree(_launch_events(26391, ["Cijk_Alik_Bljk"])) + # A single unambiguous kernel is recovered from the correlation id. + unique = _build_tree(_launch_events(26391, [("kernel", "Cijk_Alik_Bljk")])) mm = next(e for e in unique.events if e["name"] == "aten::mm") gpu_events = unique.get_gpu_events(mm) assert len(gpu_events) == 1 assert gpu_events[0]["name"] == "Cijk_Alik_Bljk" - ambiguous = _build_tree(_launch_events(42, ["kernel_a", "kernel_b"])) + # Several kernels share the correlation id, so the match is ambiguous. + ambiguous = _build_tree( + _launch_events(42, [("kernel", "kernel_a"), ("kernel", "kernel_b")]) + ) mm = next(e for e in ambiguous.events if e["name"] == "aten::mm") assert ambiguous.get_gpu_events(mm) == [] + # Unique memsets with only the ac2g finish event are linked too. + # Real traces also contain kernel launches, which is how linking_key + # is set to "correlation"; a memset-only trace would fall back to + # "External id" and never take this path. + memset_events = _launch_events( + 43, [("gpu_memset", "Memset (Device)")], launcher="hipMemsetAsync" + ) + memset_events.insert( + 1, + _mk_event( + "cuda_runtime", + "hipLaunchKernel", + ts=1, + dur=1, + pid=1, + tid=1, + args={"correlation": 1}, + ), + ) + memset = _build_tree(memset_events) + mm = next(e for e in memset.events if e["name"] == "aten::mm") + gpu_events = memset.get_gpu_events(mm) + assert len(gpu_events) == 1 + assert gpu_events[0]["name"] == "Memset (Device)" + def test_linking_key_uses_correlation_when_present(self): events = [ _mk_event("cpu_op", "aten::add", ts=0, dur=10, pid=1, tid=1, args={}), diff --git a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/gpu_timeline.csv b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/gpu_timeline.csv index 07101f93e..7b621c7a6 100644 --- a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/gpu_timeline.csv +++ b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/gpu_timeline.csv @@ -1,9 +1,9 @@ type,time ms,percent -computation_time,2102.9709057617188,87.4578204938859 +computation_time,2102.980433105469,87.45821671464064 exposed_comm_time,0.0,0.0 exposed_memcpy_time,6.673357421875,0.27752989539457523 -busy_time,2109.644263183594,87.73535038928048 -idle_time,294.9101767578125,12.264649610719514 +busy_time,2109.653790527344,87.73574661003522 +idle_time,294.9006494140625,12.264253389964779 total_time,2404.554439941406,100.0 total_comm_time,0.0,0.0 total_memcpy_time,6.673357421875,0.27752989539457523 diff --git a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary.csv b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary.csv index 55022fa8a..245565426 100644 --- a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary.csv +++ b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary.csv @@ -1,141 +1,141 @@ name,parent_module,total_direct_kernel_time_sum,total_subtree_kernel_time_sum,total_subtree_kernel_time_count,total_direct_kernel_time_ms,Count,Categories,call_stack_first,Percentage (%),Cumulative Percentage (%) -aten::mm,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,675918.7666015625,675918.7666015625,1844,675.9187666015625,1844,['GEMM'],"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",32.039458621916054,32.039458621916054 -aten::miopen_convolution,nn.Module: Conv3d,612165.4331054688,641825.3598632812,396,612.1654331054688,396,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: Conv3d_0']",29.017464868395393,61.05692349031145 -aiter::fmha_v3_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,321487.89501953125,321487.89501953125,240,321.48789501953127,240,['SDPA_fwd'],"['aiter::fmha_v3_fwd', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",15.238958612902277,76.29588210321373 -aten::replication_pad3d,nn.Module: HunyuanVideoCausalConv3d,110904.69482421875,110904.69482421875,385,110.90469482421875,385,['elementwise'],"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']",5.25703169725924,81.55291380047296 -aten::addmm,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,65346.24853515625,65346.24853515625,344,65.34624853515625,344,['GEMM'],"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",3.0975000687822907,84.65041386925526 -aten::add_,nn.Module: Conv3d,29659.9267578125,29659.9267578125,396,29.6599267578125,396,['elementwise'],"['aten::add_', 'nn.Module: Conv3d_0']",1.4059204197923474,86.05633428904761 -aiter::_groupnorm_run,nn.Module: GroupNorm,28427.94873046875,28427.94873046875,330,28.42794873046875,330,['NORM_fwd'],"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",1.3475230043327207,87.40385729338033 -triton_poi_fused_addmm_cat_gelu_slice_view_25,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,26829.435546875,26829.435546875,160,26.829435546875,160,['triton'],"['triton_poi_fused_addmm_cat_gelu_slice_view_25', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",1.2717513294910165,88.67560862287134 -aten::silu,nn.Module: SiLU,20577.1474609375,20577.1474609375,319,20.5771474609375,319,['elementwise'],"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.9753844651281915,89.65099308799952 -aten::upsample_nearest3d,nn.Module: HunyuanVideoUpsampleCausal3D,20028.1728515625,20028.1728515625,33,20.0281728515625,33,['elementwise'],"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.9493623302938718,90.60035541829339 -triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,17534.57275390625,17534.57275390625,320,17.53457275390625,320,['triton'],"['triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.8311623318677911,91.43151775016118 -triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,16951.78662109375,16951.78662109375,160,16.95178662109375,160,['triton'],"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.8035374853473224,92.2350552355085 -aten::_efficient_attention_forward,nn.Module: Attention,15922.49267578125,15922.49267578125,11,15.92249267578125,11,['SDPA_fwd'],"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.7547475679783492,92.98980280348685 -aten::mm,nn.Module: Linear,15569.16064453125,15569.16064453125,257,15.56916064453125,257,['GEMM'],"['aten::mm', 'nn.Module: Linear_0', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.7379991544789721,93.72780195796582 -triton_poi_fused_addmm_gelu_view_12,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,15036.4638671875,15036.4638671875,80,15.0364638671875,80,['triton'],"['triton_poi_fused_addmm_gelu_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.712748610775998,94.44055056874183 -triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,12884.18994140625,12884.18994140625,160,12.88418994140625,160,['triton'],"['triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.6107279319674955,95.05127850070932 -triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,11937.31396484375,11937.31396484375,480,11.93731396484375,480,['triton'],"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.5658447371663017,95.61712323787562 -triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,11810.2421875,11810.2421875,152,11.8102421875,152,['triton'],"['triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.5598213640135065,96.17694460188912 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,9094.6015625,9094.6015625,156,9.0946015625,156,['triton'],"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.4310963459552777,96.6080409478444 -triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,8616.4873046875,8616.4873046875,80,8.6164873046875,80,['triton'],"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.40843308708949516,97.01647403493389 -aten::add,nn.Module: HunyuanVideoResnetBlockCausal3D,7791.0283203125,7791.0283203125,154,7.7910283203125,154,['elementwise'],"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.3693052210192198,97.38577925595311 -aten::copy_,NA,6902.01416015625,6902.01416015625,61,6.90201416015625,61,['elementwise'],['aten::copy_'],0.3271647541376219,97.71294401009074 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,5610.1484375,5610.1484375,76,5.6101484375,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.26592858137351316,97.97887259146425 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,5503.7001953125,5503.7001953125,76,5.5037001953125,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.26088279152499344,98.23975538298924 -triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4916.93310546875,4916.93310546875,320,4.91693310546875,320,['triton'],"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.23306924228700807,98.47282462527625 -triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4547.35693359375,4547.35693359375,156,4.54735693359375,156,['triton'],"['triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.2155508346742554,98.6883754599505 -aten::cat,nn.Module: HunyuanVideoUpsampleCausal3D,3906.1015625,3906.1015625,33,3.9061015625,33,['elementwise'],"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.18515446762035664,98.87352992757086 -triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,2377.56787109375,2377.56787109375,80,2.37756787109375,80,['triton'],"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.11269991482809223,98.98622984239896 -aten::_efficient_attention_forward,nn.Module: LlamaAttention,1437.6220703125,1437.6220703125,32,1.4376220703125,32,['SDPA_fwd'],"['aten::_efficient_attention_forward', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.0681452196797522,99.0543750620787 -aten::cat,nn.Module: LlamaAttention,927.484375,927.484375,128,0.927484375,128,['other'],"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.04396400680616563,99.09833906888487 -aten::mul,nn.Module: LlamaRMSNorm,874.0419921875,874.0419921875,130,0.8740419921875,130,['elementwise'],"['aten::mul', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.041430765982883345,99.13976983486775 -triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,836.4521484375,836.4521484375,160,0.8364521484375,160,['triton'],"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.03964895683222493,99.17941879169997 -aten::copy_,nn.Module: HunyuanVideoUpsampleCausal3D,792.10546875,792.10546875,66,0.79210546875,66,['elementwise'],"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.03754686457044197,99.21696565627042 -aten::copy_,nn.Module: LlamaAttention,768.60546875,768.60546875,96,0.76860546875,96,['elementwise'],"['aten::copy_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.03643293296383686,99.25339858923425 -aten::addmm,nn.Module: Linear,723.5498046875,723.5498046875,83,0.7235498046875,83,['GEMM'],"['aten::addmm', 'nn.Module: Linear_224', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.03429723388912192,99.28769582312337 -aten::mul,nn.Module: LlamaAttention,684.77734375,684.77734375,128,0.68477734375,128,['elementwise'],"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.03245936709320092,99.32015519021657 -aten::copy_,nn.Module: LlamaRMSNorm,647.44091796875,647.44091796875,130,0.64744091796875,130,['elementwise'],"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.030689570295098775,99.35084476051166 -aten::add,nn.Module: LlamaAttention,560.7275390625,560.7275390625,64,0.5607275390625,64,['elementwise'],"['aten::add', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.02657923950874995,99.37742400002041 -aten::pow,nn.Module: LlamaRMSNorm,557.67919921875,557.67919921875,65,0.55767919921875,65,['elementwise'],"['aten::pow', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.026434744100255193,99.40385874412067 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,543.81103515625,543.81103515625,76,0.54381103515625,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.025777374471540125,99.42963611859221 -aten::mean,nn.Module: LlamaRMSNorm,542.81884765625,542.81884765625,65,0.54281884765625,65,['reduce'],"['aten::mean', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.025730343449585722,99.4553664620418 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,537.51416015625,537.51416015625,4,0.53751416015625,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.025478894127483036,99.48084535616928 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,532.4853515625,532.4853515625,76,0.5324853515625,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.025240521836583228,99.50608587800586 -aten::mul,NA,518.00244140625,518.00244140625,87,0.51800244140625,87,['elementwise'],['aten::mul'],0.024554012416214327,99.53063989042208 -aten::upsample_nearest2d,nn.Module: HunyuanVideoUpsampleCausal3D,473.470703125,692.31982421875,33,0.473470703125,33,['elementwise'],"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.022443148128190867,99.55308303855027 -triton_poi_fused_addmm_gelu_view_14,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,451.66650390625,451.66650390625,80,0.45166650390625,80,['triton'],"['triton_poi_fused_addmm_gelu_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.021409599759404475,99.57449263830968 -aten::silu,nn.Module: SiLUActivation,388.82275390625,388.82275390625,32,0.38882275390625,32,['elementwise'],"['aten::silu', 'nn.Module: SiLUActivation_0', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.018430721486953825,99.59292335979663 -aten::mul,nn.Module: LlamaMLP,372.24169921875,372.24169921875,32,0.37224169921875,32,['elementwise'],"['aten::mul', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.017644757193879177,99.6105681169905 -aten::where,nn.Module: HunyuanVideoMidBlock3D,366.29150390625,366.29150390625,11,0.36629150390625,11,['elementwise'],"['aten::where', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.017362709933280568,99.62793082692379 -aten::add,NA,347.02685546875,347.02685546875,45,0.34702685546875,45,['elementwise'],['aten::add'],0.01644953968712452,99.64438036661092 -aten::_efficient_attention_forward,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,335.970703125,335.970703125,8,0.335970703125,8,['SDPA_fwd'],"['aten::_efficient_attention_forward', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.015925463195926887,99.66030582980684 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,327.12158203125,327.12158203125,4,0.32712158203125,4,['triton'],"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.015506002954352244,99.6758118327612 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,315.14404296875,315.14404296875,4,0.31514404296875,4,['triton'],"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.014938251493455809,99.69075008425466 -aten::copy_,nn.Module: HunyuanVideoMidBlock3D,309.75732421875,309.75732421875,22,0.30975732421875,22,['elementwise'],"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.01468291377977422,99.70543299803444 -aten::neg,nn.Module: LlamaAttention,307.955078125,307.955078125,64,0.307955078125,64,['elementwise'],"['aten::neg', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.014597484890978103,99.72003048292542 -aten::le,nn.Module: HunyuanVideoMidBlock3D,302.0390625,302.0390625,11,0.3020390625,11,['elementwise'],"['aten::le', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.01431705779353737,99.73434754071896 -aten::add,nn.Module: LlamaDecoderLayer,285.482421875,285.482421875,64,0.285482421875,64,['elementwise'],"['aten::add', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.013532250759861208,99.74787979147882 -aten::copy_,nn.Module: HunyuanVideoResnetBlockCausal3D,281.36572265625,281.36572265625,11,0.28136572265625,11,['elementwise'],"['aten::copy_', 'nn.Module: HunyuanVideoResnetBlockCausal3D_1', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.013337113680088773,99.76121690515892 -aten::add_,nn.Module: Linear,269.80712890625,269.80712890625,33,0.26980712890625,33,['elementwise'],"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.012789220790470332,99.77400612594938 -triton_poi_fused_silu_24,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,268.82763671875,268.82763671875,52,0.26882763671875,52,['triton'],"['triton_poi_fused_silu_24', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.01274279154340314,99.78674891749279 -aten::copy_,nn.Module: Attention,238.384765625,238.384765625,11,0.238384765625,11,['elementwise'],"['aten::copy_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.011299758509057036,99.79804867600184 -aten::rsqrt,nn.Module: LlamaRMSNorm,233.96875,233.96875,65,0.23396875,65,['elementwise'],"['aten::rsqrt', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.011090433429059186,99.8091391094309 -triton_poi_fused_silu_0,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,212.83447265625,212.83447265625,40,0.21283447265625,40,['triton'],"['triton_poi_fused_silu_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.010088640258167204,99.81922774968906 -aten::miopen_convolution,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,211.86767578125,211.86767578125,4,0.21186767578125,4,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.010042812785987221,99.82927056247505 -aten::fill_,nn.Module: LlamaAttention,211.5693359375,211.5693359375,96,0.2115693359375,96,['elementwise'],"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.010028671076137743,99.83929923355119 -aten::add,nn.Module: LlamaRMSNorm,205.08642578125,205.08642578125,65,0.20508642578125,65,['elementwise'],"['aten::add', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.009721372415464204,99.84902060596666 -triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,196.96923828125,196.96923828125,4,0.19696923828125,4,['triton'],"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00933660681065612,99.8583572127773 -aten::add,nn.Module: Attention,172.1650390625,172.1650390625,11,0.1721650390625,11,['elementwise'],"['aten::add', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.00816085440698397,99.86651806718429 -aten::_flash_attention_forward,nn.Module: CLIPAttention,165.67431640625,205.99951171875,12,0.16567431640625,12,['other'],"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.007853185423302914,99.87437125260759 -aten::where,nn.Module: LlamaAttention,156.39697265625,156.39697265625,32,0.15639697265625,32,['elementwise'],"['aten::where', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.007413426851878852,99.88178467945947 -triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,154.3037109375,154.3037109375,4,0.1543037109375,4,['triton'],"['triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.007314203431052802,99.88909888289052 -aten::mul,nn.Module: QuickGELUActivation,139.7861328125,139.7861328125,24,0.1397861328125,24,['elementwise'],"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0066260507023380546,99.89572493359286 -triton_red_fused_native_layer_norm_1,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,128.54736328125,128.54736328125,4,0.12854736328125,4,['triton'],"['triton_red_fused_native_layer_norm_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00609331791083976,99.9018182515037 -aten::add,nn.Module: CLIPEncoderLayer,126.96728515625,126.96728515625,24,0.12696728515625,24,['elementwise'],"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.006018420082569852,99.90783667158627 -triton_poi_fused_convolution_13,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,125.2998046875,125.2998046875,4,0.1252998046875,4,['triton'],"['triton_poi_fused_convolution_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.005939379265653368,99.91377605085192 -aten::native_layer_norm,nn.Module: LayerNorm,117.9951171875,117.9951171875,25,0.1179951171875,25,['NORM_fwd'],"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.005593127253626845,99.91936917810555 -triton_poi_fused_cat_slice_20,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,112.0830078125,112.0830078125,4,0.1120830078125,4,['triton'],"['triton_poi_fused_cat_slice_20', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.005312885317689869,99.92468206342325 -aten::fill_,nn.Module: Attention,107.1865234375,107.1865234375,11,0.1071865234375,11,['elementwise'],"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.005080785372729844,99.92976284879597 -aten::fill_,nn.Module: HunyuanVideoMidBlock3D,91.07275390625,91.07275390625,22,0.09107275390625,22,['elementwise'],"['aten::fill_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.00431697102454219,99.93407981982051 -aten::sigmoid,nn.Module: QuickGELUActivation,80.671875,80.671875,12,0.080671875,12,['elementwise'],"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0038239553755998784,99.9379037751961 -triton_poi_fused_addmm_silu_view_10,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,79.67041015625,79.67041015625,8,0.07967041015625,8,['triton'],"['triton_poi_fused_addmm_silu_view_10', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0037764845950740487,99.94168025979118 -triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,77.07080078125,77.07080078125,4,0.07707080078125,4,['triton'],"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0036532596143234335,99.94533351940551 -triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,76.90966796875,76.90966796875,4,0.07690966796875,4,['triton'],"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0036456217022934364,99.9489791411078 -aten::cat,NA,70.73388671875,70.73388671875,2,0.07073388671875,2,"['elementwise', 'other']",['aten::cat'],0.0033528813648528296,99.95233202247265 -aten::div,nn.Module: Attention,68.24951171875,68.24951171875,11,0.06824951171875,11,['elementwise'],"['aten::div', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.0032351186484630605,99.95556714112111 -aten::nonzero,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,59.82763671875,59.82763671875,4,0.05982763671875,4,['other'],"['aten::nonzero', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.002835910446361891,99.95840305156747 -aten::copy_,nn.Module: Conv3d,58.79736328125,58.79736328125,11,0.05879736328125,11,['elementwise'],"['aten::copy_', 'nn.Module: Conv3d_0']",0.002787074099745851,99.96119012566722 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,55.95654296875,55.95654296875,8,0.05595654296875,8,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0026524153961382095,99.96384254106336 -triton_poi_fused_addmm_silu_4,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,49.41650390625,49.41650390625,20,0.04941650390625,20,['triton'],"['triton_poi_fused_addmm_silu_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.002342408748472216,99.96618494981183 -aten::arange,nn.Module: HunyuanVideoMidBlock3D,48.9013671875,48.9013671875,11,0.0489013671875,11,['other'],"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.002317990575164196,99.968502940387 -triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,45.7841796875,45.7841796875,4,0.0457841796875,4,['triton'],"['triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0021702316951657113,99.97067317208216 -triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,45.1826171875,45.1826171875,4,0.0451826171875,4,['triton'],"['triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0021417168235870567,99.97281488890575 -aten::fill_,nn.Module: CLIPAttention,40.3251953125,40.3251953125,12,0.0403251953125,12,['elementwise'],"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0019114684936646057,99.9747263573994 -triton_poi_fused_silu_18,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,39.85205078125,39.85205078125,8,0.03985205078125,8,['triton'],"['triton_poi_fused_silu_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0018890408065219788,99.97661539820592 -aten::clamp,NA,27.64111328125,27.64111328125,1,0.02764111328125,1,['elementwise'],['aten::clamp'],0.0013102259457760355,99.9779256241517 -triton_per_fused_native_layer_norm_2,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,26.35498046875,26.35498046875,4,0.02635498046875,4,['triton'],"['triton_per_fused_native_layer_norm_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.001249261520663879,99.97917488567236 -triton_red_fused_addmm_native_layer_norm_view_0,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,22.990234375,22.990234375,4,0.022990234375,4,['triton'],"['triton_red_fused_addmm_native_layer_norm_view_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010897680303647629,99.98026465370273 -triton_poi_fused__to_copy_cat_slice_3,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,22.34130859375,22.34130859375,12,0.02234130859375,12,['triton'],"['triton_poi_fused__to_copy_cat_slice_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010590080755530484,99.98132366177829 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,21.74853515625,21.74853515625,4,0.02174853515625,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010309098173578476,99.98235457159565 -triton_red_fused__to_copy_mul_sum_unsqueeze_5,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,21.748046875,21.748046875,4,0.021748046875,4,['triton'],"['triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010308866721698779,99.98338545826782 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,19.25830078125,19.25830078125,9,0.01925830078125,9,['triton'],"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0009128693587124419,99.98429832762653 -triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,18.662109375,18.662109375,4,0.018662109375,4,['triton'],"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008846090842014534,99.98518293671073 -triton_poi_fused_addmm_clone_permute_view_31,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,18.3828125,18.3828125,4,0.0183828125,4,['triton'],"['triton_poi_fused_addmm_clone_permute_view_31', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008713700366827922,99.9860543067474 -triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,17.3427734375,17.3427734375,4,0.0173427734375,4,['triton'],"['triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008220707863073579,99.98687637753372 -triton_per_fused__to_copy_div_mul_sum_unsqueeze_7,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,17.341796875,17.341796875,4,0.017341796875,4,['triton'],"['triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008220244959314186,99.98769840202965 -aten::copy_,nn.Module: LlamaRotaryEmbedding,14.93994140625,14.93994140625,3,0.01493994140625,3,['elementwise'],"['aten::copy_', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0007081733163085262,99.98840657534596 -aten::nonzero,NA,14.5361328125,14.5361328125,1,0.0145361328125,1,['other'],['aten::nonzero'],0.0006890322458575947,99.98909560759182 -aten::index,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,13.53515625,73.36279296875,4,0.01353515625,4,['other'],"['aten::index', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0006415846105197354,99.98973719220234 -aten::gather,nn.Module: Embedding,13.056640625,13.056640625,3,0.013056640625,3,['other'],"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: LlamaModel_0']",0.0006189023263094418,99.99035609452865 -aten::cos,nn.Module: LlamaRotaryEmbedding,12.09716796875,12.09716796875,1,0.01209716796875,1,['elementwise'],"['aten::cos', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0005734220319490059,99.9909295165606 -triton_poi_fused_add_addmm_silu_8,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,11.69384765625,11.69384765625,4,0.01169384765625,4,['triton'],"['triton_poi_fused_add_addmm_silu_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0005543041066860443,99.99148382066728 -aten::copy_,nn.Module: LlamaModel,11.09375,11.09375,2,0.01109375,2,['elementwise'],"['aten::copy_', 'nn.Module: LlamaModel_0']",0.0005258586706712983,99.99200967933795 -triton_poi_fused_add_addmm_17,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,10.57275390625,10.57275390625,3,0.01057275390625,3,['triton'],"['triton_poi_fused_add_addmm_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0005011627551076418,99.99251084209307 -aten::arange,nn.Module: LlamaModel,9.6884765625,9.6884765625,5,0.0096884765625,5,['other'],"['aten::arange', 'nn.Module: LlamaModel_0']",0.00045924681969453785,99.99297008891276 -aten::bitwise_and,nn.Module: LlamaModel,9.2509765625,9.2509765625,2,0.0092509765625,2,['elementwise'],"['aten::bitwise_and', 'nn.Module: LlamaModel_0']",0.000438508731273698,99.99340859764403 -aten::sin,nn.Module: LlamaRotaryEmbedding,9.212890625,9.212890625,1,0.009212890625,1,['elementwise'],"['aten::sin', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0004367034066120623,99.99384530105064 -triton_per_fused__to_copy_any_sum_unsqueeze_6,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,9.169921875,9.169921875,4,0.009169921875,4,['triton'],"['triton_per_fused__to_copy_any_sum_unsqueeze_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0004346666300707299,99.99427996768071 -aten::mul,nn.Module: LlamaRotaryEmbedding,8.65087890625,8.65087890625,2,0.00865087890625,2,['elementwise'],"['aten::mul', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.00041006329525895206,99.99469003097597 -aten::sub,NA,8.0478515625,8.0478515625,4,0.0080478515625,4,['elementwise'],['aten::sub'],0.0003814789881163882,99.99507150996409 -aten::cat,nn.Module: LlamaRotaryEmbedding,7.490234375,7.490234375,1,0.007490234375,1,['other'],"['aten::cat', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.00035504718345500514,99.99542655714755 -aten::normal_,NA,7.25,7.25,1,0.00725,1,['elementwise'],['aten::normal_'],0.0003436597509739189,99.99577021689852 -aten::all,nn.Module: LlamaModel,6.96923828125,6.96923828125,1,0.00696923828125,1,['reduce'],"['aten::all', 'nn.Module: LlamaModel_0']",0.00033035126789134864,99.99610056816641 -aten::add,nn.Module: LlamaModel,6.80712890625,6.80712890625,3,0.00680712890625,3,['elementwise'],"['aten::add', 'nn.Module: LlamaModel_0']",0.00032266706548541245,99.9964232352319 -aten::bmm,nn.Module: LlamaRotaryEmbedding,6.76904296875,6.76904296875,1,0.00676904296875,1,['GEMM'],"['aten::bmm', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.00032086174082377676,99.99674409697272 -aten::le,nn.Module: LlamaModel,6.52783203125,6.52783203125,1,0.00652783203125,1,['elementwise'],"['aten::le', 'nn.Module: LlamaModel_0']",0.0003094280179667512,99.99705352499069 -aten::add,nn.Module: CLIPTextEmbeddings,5.9677734375,5.9677734375,1,0.0059677734375,1,['elementwise'],"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0002828804873655197,99.99733640547805 -aten::argmax,nn.Module: CLIPTextTransformer,5.72802734375,5.72802734375,1,0.00572802734375,1,['reduce'],"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0002715162000724032,99.99760792167812 -aten::copy_,nn.Module: CLIPTextTransformer,5.3271484375,5.3271484375,1,0.0053271484375,1,['elementwise'],"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.00025251400074928986,99.99786043567887 -aten::index,nn.Module: LlamaModel,5.287109375,8.73095703125,1,0.005287109375,1,['elementwise'],"['aten::index', 'nn.Module: LlamaModel_0']",0.00025061609533577546,99.9981110517742 -aten::_local_scalar_dense,NA,5.2470703125,5.2470703125,1,0.0052470703125,1,['other'],['aten::_local_scalar_dense'],0.0002487181899222611,99.99835976996413 -aten::index,nn.Module: CLIPTextTransformer,5.20703125,5.20703125,1,0.00520703125,1,['elementwise'],"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0002468202845087467,99.99860659024863 -aten::div,NA,4.68603515625,4.68603515625,1,0.00468603515625,1,['elementwise'],['aten::div'],0.00022212436894509022,99.99882871461757 -triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4.64599609375,4.64599609375,2,0.00464599609375,2,['triton'],"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00022022646353157588,99.9990489410811 -aten::fill_,nn.Module: LlamaModel,3.76513671875,3.76513671875,1,0.00376513671875,1,['elementwise'],"['aten::fill_', 'nn.Module: LlamaModel_0']",0.00017847254443425974,99.99922741362553 -aten::_local_scalar_dense,nn.Module: LlamaModel,3.52392578125,3.52392578125,1,0.00352392578125,1,['other'],"['aten::_local_scalar_dense', 'nn.Module: LlamaModel_0']",0.00016703882157723414,99.9993944524471 -aten::eq,NA,3.00390625,3.00390625,1,0.00300390625,1,['elementwise'],['aten::eq'],0.00014238919638951704,99.99953684164349 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,3.0029296875,3.0029296875,1,0.0030029296875,1,['triton'],"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0001423429060135777,99.9996791845495 -triton_poi_fused_add_addmm_18,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,2.72314453125,2.72314453125,1,0.00272314453125,1,['triton'],"['triton_poi_fused_add_addmm_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0001290807133069468,99.99980826526281 -aten::fill_,NA,2.203125,2.203125,1,0.002203125,1,['elementwise'],['aten::fill_'],0.00010443108811922965,99.99991269635093 -aten::arange,nn.Module: CLIPTextTransformer,1.841796875,1.841796875,1,0.001841796875,1,['other'],"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",8.730364902166097e-05,99.99999999999996 +aten::mm,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,675918.7666015625,675918.7666015625,1844,675.9187666015625,1844,['GEMM'],"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",32.03931392952039,32.03931392952039 +aten::miopen_convolution,nn.Module: Conv3d,612165.4331054688,641825.3598632812,396,612.1654331054688,396,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: Conv3d_0']",29.01733382353108,61.056647753051465 +aiter::fmha_v3_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,321487.89501953125,321487.89501953125,240,321.48789501953127,240,['SDPA_fwd'],"['aiter::fmha_v3_fwd', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",15.238889792718544,76.29553754577 +aten::replication_pad3d,nn.Module: HunyuanVideoCausalConv3d,110904.69482421875,110904.69482421875,385,110.90469482421875,385,['elementwise'],"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']",5.257007956143033,81.55254550191303 +aten::addmm,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,65346.24853515625,65346.24853515625,344,65.34624853515625,344,['GEMM'],"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",3.0974860802592388,84.65003158217228 +aten::add_,nn.Module: Conv3d,29659.9267578125,29659.9267578125,396,29.6599267578125,396,['elementwise'],"['aten::add_', 'nn.Module: Conv3d_0']",1.4059140705591704,86.05594565273145 +aiter::_groupnorm_run,nn.Module: GroupNorm,28427.94873046875,28427.94873046875,330,28.42794873046875,330,['NORM_fwd'],"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",1.347516918826283,87.40346257155774 +triton_poi_fused_addmm_cat_gelu_slice_view_25,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,26829.435546875,26829.435546875,160,26.829435546875,160,['triton'],"['triton_poi_fused_addmm_cat_gelu_slice_view_25', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",1.2717455861746667,88.6752081577324 +aten::silu,nn.Module: SiLU,20577.1474609375,20577.1474609375,319,20.5771474609375,319,['elementwise'],"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.9753800602249559,89.65058821795735 +aten::upsample_nearest3d,nn.Module: HunyuanVideoUpsampleCausal3D,20028.1728515625,20028.1728515625,33,20.0281728515625,33,['elementwise'],"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.9493580429083844,90.59994626086574 +triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,17534.57275390625,17534.57275390625,320,17.53457275390625,320,['triton'],"['triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.8311585782816147,91.43110483914735 +triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,16951.78662109375,16951.78662109375,160,16.95178662109375,160,['triton'],"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.8035338565168504,92.2346386956642 +aten::_efficient_attention_forward,nn.Module: Attention,15922.49267578125,15922.49267578125,11,15.92249267578125,11,['SDPA_fwd'],"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.7547441594864949,92.9893828551507 +aten::mm,nn.Module: Linear,15569.16064453125,15569.16064453125,257,15.56916064453125,257,['GEMM'],"['aten::mm', 'nn.Module: Linear_0', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.7379958216241035,93.72737867677479 +triton_poi_fused_addmm_gelu_view_12,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,15036.4638671875,15036.4638671875,80,15.0364638671875,80,['triton'],"['triton_poi_fused_addmm_gelu_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.712745391954319,94.4401240687291 +triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,12884.18994140625,12884.18994140625,160,12.88418994140625,160,['triton'],"['triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.6107251738782089,95.05084924260731 +triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,11937.31396484375,11937.31396484375,480,11.93731396484375,480,['triton'],"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.5658421817726055,95.61669142437992 +triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,11810.2421875,11810.2421875,152,11.8102421875,152,['triton'],"['triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.559818835821777,96.1765102602017 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,9094.6015625,9094.6015625,156,9.0946015625,156,['triton'],"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.4310943990945709,96.60760465929627 +triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,8616.4873046875,8616.4873046875,80,8.6164873046875,80,['triton'],"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.408431242577622,97.01603590187389 +aten::add,nn.Module: HunyuanVideoResnetBlockCausal3D,7791.0283203125,7791.0283203125,154,7.7910283203125,154,['elementwise'],"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.3693035532114771,97.38533945508537 +aten::copy_,NA,6902.01416015625,6902.01416015625,61,6.90201416015625,61,['elementwise'],['aten::copy_'],0.327163276639122,97.7125027317245 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,5610.1484375,5610.1484375,76,5.6101484375,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.2659273804217753,97.97843011214627 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,5503.7001953125,5503.7001953125,76,5.5037001953125,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.26088161336038906,98.23931172550665 +triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4916.93310546875,4916.93310546875,320,4.91693310546875,320,['triton'],"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.2330681897303023,98.47237991523696 +triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4547.35693359375,4547.35693359375,156,4.54735693359375,156,['triton'],"['triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.21554986123188158,98.68792977646883 +aten::cat,nn.Module: HunyuanVideoUpsampleCausal3D,3906.1015625,3906.1015625,33,3.9061015625,33,['elementwise'],"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.1851536314500641,98.8730834079189 +triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,2377.56787109375,2377.56787109375,80,2.37756787109375,80,['triton'],"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.11269940586753643,98.98578281378643 +aten::_efficient_attention_forward,nn.Module: LlamaAttention,1437.6220703125,1437.6220703125,32,1.4376220703125,32,['SDPA_fwd'],"['aten::_efficient_attention_forward', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.0681449119312598,99.05392772571768 +aten::cat,nn.Module: LlamaAttention,927.484375,927.484375,128,0.927484375,128,['other'],"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.04396380826169137,99.09789153397938 +aten::mul,nn.Module: LlamaRMSNorm,874.0419921875,874.0419921875,130,0.8740419921875,130,['elementwise'],"['aten::mul', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.04143057887869862,99.13932211285808 +triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,836.4521484375,836.4521484375,160,0.8364521484375,160,['triton'],"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.03964877777481271,99.1789708906329 +aten::copy_,nn.Module: HunyuanVideoUpsampleCausal3D,792.10546875,792.10546875,66,0.79210546875,66,['elementwise'],"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.03754669500622279,99.21651758563912 +aten::copy_,nn.Module: LlamaAttention,768.60546875,768.60546875,96,0.76860546875,96,['elementwise'],"['aten::copy_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.03643276843020932,99.25295035406933 +aten::addmm,nn.Module: Linear,723.5498046875,723.5498046875,83,0.7235498046875,83,['GEMM'],"['aten::addmm', 'nn.Module: Linear_224', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.03429707900045808,99.28724743306978 +aten::mul,nn.Module: LlamaAttention,684.77734375,684.77734375,128,0.68477734375,128,['elementwise'],"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.03245922050446976,99.31970665357424 +aten::copy_,nn.Module: LlamaRMSNorm,647.44091796875,647.44091796875,130,0.64744091796875,130,['elementwise'],"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.03068943169889151,99.35039608527313 +aten::add,nn.Module: LlamaAttention,560.7275390625,560.7275390625,64,0.5607275390625,64,['elementwise'],"['aten::add', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.02657911947507882,99.3769752047482 +aten::pow,nn.Module: LlamaRMSNorm,557.67919921875,557.67919921875,65,0.55767919921875,65,['elementwise'],"['aten::pow', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.02643462471913525,99.40340982946734 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,543.81103515625,543.81103515625,76,0.54381103515625,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.025777258059146577,99.42918708752649 +aten::mean,nn.Module: LlamaRMSNorm,542.81884765625,542.81884765625,65,0.54281884765625,65,['reduce'],"['aten::mean', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.025730227249587505,99.45491731477607 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,537.51416015625,537.51416015625,4,0.53751416015625,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.025478779063047224,99.48039609383912 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,532.4853515625,532.4853515625,76,0.5324853515625,76,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.02524040784865305,99.50563650168777 +aten::mul,NA,518.00244140625,518.00244140625,87,0.51800244140625,87,['elementwise'],['aten::mul'],0.024553901528607848,99.53019040321638 +aten::upsample_nearest2d,nn.Module: HunyuanVideoUpsampleCausal3D,473.470703125,692.31982421875,33,0.473470703125,33,['elementwise'],"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.022443046773392487,99.55263344998977 +triton_poi_fused_addmm_gelu_view_14,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,451.66650390625,451.66650390625,80,0.45166650390625,80,['triton'],"['triton_poi_fused_addmm_gelu_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.021409503072181514,99.57404295306195 +aten::silu,nn.Module: SiLUActivation,388.82275390625,388.82275390625,32,0.38882275390625,32,['elementwise'],"['aten::silu', 'nn.Module: SiLUActivation_0', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.018430638252549737,99.5924735913145 +aten::mul,nn.Module: LlamaMLP,372.24169921875,372.24169921875,32,0.37224169921875,32,['elementwise'],"['aten::mul', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.01764467750894382,99.61011826882344 +aten::where,nn.Module: HunyuanVideoMidBlock3D,366.29150390625,366.29150390625,11,0.36629150390625,11,['elementwise'],"['aten::where', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.017362631522090007,99.62748090034553 +aten::add,NA,347.02685546875,347.02685546875,45,0.34702685546875,45,['elementwise'],['aten::add'],0.01644946539987351,99.6439303657454 +aten::_efficient_attention_forward,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,335.970703125,335.970703125,8,0.335970703125,8,['SDPA_fwd'],"['aten::_efficient_attention_forward', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.01592539127544131,99.65985575702085 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,327.12158203125,327.12158203125,4,0.32712158203125,4,['triton'],"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.015505932928177923,99.67536168994903 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,315.14404296875,315.14404296875,4,0.31514404296875,4,['triton'],"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.01493818403128608,99.69029987398031 +aten::copy_,nn.Module: HunyuanVideoMidBlock3D,309.75732421875,309.75732421875,22,0.30975732421875,22,['elementwise'],"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.014682847470727144,99.70498272145103 +aten::neg,nn.Module: LlamaAttention,307.955078125,307.955078125,64,0.307955078125,64,['elementwise'],"['aten::neg', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.014597418967733755,99.71958014041877 +aten::le,nn.Module: HunyuanVideoMidBlock3D,302.0390625,302.0390625,11,0.3020390625,11,['elementwise'],"['aten::le', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.014316993136721055,99.73389713355549 +aten::add,nn.Module: LlamaDecoderLayer,285.482421875,285.482421875,64,0.285482421875,64,['elementwise'],"['aten::add', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.01353218964728736,99.74742932320278 +aten::copy_,nn.Module: HunyuanVideoResnetBlockCausal3D,281.36572265625,281.36572265625,11,0.28136572265625,11,['elementwise'],"['aten::copy_', 'nn.Module: HunyuanVideoResnetBlockCausal3D_1', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.013337053448767377,99.76076637665155 +aten::add_,nn.Module: Linear,269.80712890625,269.80712890625,33,0.26980712890625,33,['elementwise'],"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.012789163033470859,99.77355553968502 +triton_poi_fused_silu_24,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,268.82763671875,268.82763671875,52,0.26882763671875,52,['triton'],"['triton_poi_fused_silu_24', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.012742733996081333,99.7862982736811 +aten::copy_,nn.Module: Attention,238.384765625,238.384765625,11,0.238384765625,11,['elementwise'],"['aten::copy_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.011299707478571524,99.79759798115967 +aten::rsqrt,nn.Module: LlamaRMSNorm,233.96875,233.96875,65,0.23396875,65,['elementwise'],"['aten::rsqrt', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.011090383343900109,99.80868836450357 +triton_poi_fused_silu_0,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,212.83447265625,212.83447265625,40,0.21283447265625,40,['triton'],"['triton_poi_fused_silu_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.010088594697174892,99.81877695920075 +aten::miopen_convolution,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,211.86767578125,211.86767578125,4,0.21186767578125,4,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.010042767431954923,99.8288197266327 +aten::fill_,nn.Module: LlamaAttention,211.5693359375,211.5693359375,96,0.2115693359375,96,['elementwise'],"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.010028625785970377,99.83884835241867 +aten::add,nn.Module: LlamaRMSNorm,205.08642578125,205.08642578125,65,0.20508642578125,65,['elementwise'],"['aten::add', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.009721328513078695,99.84856968093175 +triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,196.96923828125,196.96923828125,4,0.19696923828125,4,['triton'],"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.009336564645898509,99.85790624557764 +aten::add,nn.Module: Attention,172.1650390625,172.1650390625,11,0.1721650390625,11,['elementwise'],"['aten::add', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.008160817552004965,99.86606706312965 +aten::_flash_attention_forward,nn.Module: CLIPAttention,165.67431640625,205.99951171875,12,0.16567431640625,12,['other'],"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.007853149957778171,99.87392021308743 +aten::where,nn.Module: LlamaAttention,156.39697265625,156.39697265625,32,0.15639697265625,32,['elementwise'],"['aten::where', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.007413393372334023,99.88133360645976 +triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,154.3037109375,154.3037109375,4,0.1543037109375,4,['triton'],"['triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.007314170399607757,99.88864777685937 +aten::mul,nn.Module: QuickGELUActivation,139.7861328125,139.7861328125,24,0.1397861328125,24,['elementwise'],"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.006626020778637994,99.89527379763801 +triton_red_fused_native_layer_norm_1,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,128.54736328125,128.54736328125,4,0.12854736328125,4,['triton'],"['triton_red_fused_native_layer_norm_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.006093290392997575,99.90136708803101 +aten::add,nn.Module: CLIPEncoderLayer,126.96728515625,126.96728515625,24,0.12696728515625,24,['elementwise'],"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.006018392902971403,99.90738548093398 +triton_poi_fused_convolution_13,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,125.2998046875,125.2998046875,4,0.1252998046875,4,['triton'],"['triton_poi_fused_convolution_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0059393524430086785,99.91332483337699 +aten::native_layer_norm,nn.Module: LayerNorm,117.9951171875,117.9951171875,25,0.1179951171875,25,['NORM_fwd'],"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.005593101994680022,99.91891793537167 +triton_poi_fused_cat_slice_20,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,112.0830078125,112.0830078125,4,0.1120830078125,4,['triton'],"['triton_poi_fused_cat_slice_20', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.005312861324334877,99.92423079669601 +aten::fill_,nn.Module: Attention,107.1865234375,107.1865234375,11,0.1071865234375,11,['elementwise'],"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.005080762427554144,99.92931155912356 +aten::fill_,nn.Module: HunyuanVideoMidBlock3D,91.07275390625,91.07275390625,22,0.09107275390625,22,['elementwise'],"['aten::fill_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.0043169515288045465,99.93362851065237 +aten::sigmoid,nn.Module: QuickGELUActivation,80.671875,80.671875,12,0.080671875,12,['elementwise'],"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.003823938106354766,99.93745244875872 +triton_poi_fused_addmm_silu_view_10,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,79.67041015625,79.67041015625,8,0.07967041015625,8,['triton'],"['triton_poi_fused_addmm_silu_view_10', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0037764675402102424,99.94122891629893 +triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,77.07080078125,77.07080078125,4,0.07707080078125,4,['triton'],"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.003653243115952103,99.94488215941487 +triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,76.90966796875,76.90966796875,4,0.07690966796875,4,['triton'],"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.003645605238415441,99.94852776465329 +aten::cat,NA,70.73388671875,70.73388671875,2,0.07073388671875,2,"['elementwise', 'other']",['aten::cat'],0.0033528662230103046,99.9518806308763 +aten::div,nn.Module: Attention,68.24951171875,68.24951171875,11,0.06824951171875,11,['elementwise'],"['aten::div', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.00323510403844505,99.95511573491474 +aten::nonzero,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,67.43310546875,67.43310546875,4,0.06743310546875,4,['other'],"['aten::nonzero', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0031964054589259656,99.95831214037366 +aten::copy_,nn.Module: Conv3d,58.79736328125,58.79736328125,11,0.05879736328125,11,['elementwise'],"['aten::copy_', 'nn.Module: Conv3d_0']",0.0027870615131277954,99.9610992018868 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,55.95654296875,55.95654296875,8,0.05595654296875,8,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.002652403417648108,99.96375160530444 +triton_poi_fused_addmm_silu_4,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,49.41650390625,49.41650390625,20,0.04941650390625,20,['triton'],"['triton_poi_fused_addmm_silu_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.002342398169993427,99.96609400347442 +aten::arange,nn.Module: HunyuanVideoMidBlock3D,48.9013671875,48.9013671875,11,0.0489013671875,11,['other'],"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.002317980106959555,99.96841198358139 +triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,45.7841796875,45.7841796875,4,0.0457841796875,4,['triton'],"['triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0021702218942503205,99.97058220547564 +triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,45.1826171875,45.1826171875,4,0.0451826171875,4,['triton'],"['triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0021417071514467844,99.97272391262709 +aten::fill_,nn.Module: CLIPAttention,40.3251953125,40.3251953125,12,0.0403251953125,12,['elementwise'],"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0019114598613416056,99.97463537248844 +triton_poi_fused_silu_18,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,39.85205078125,39.85205078125,8,0.03985205078125,8,['triton'],"['triton_poi_fused_silu_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0018890322754839541,99.97652440476392 +aten::clamp,NA,27.64111328125,27.64111328125,1,0.02764111328125,1,['elementwise'],['aten::clamp'],0.0013102200287056758,99.97783462479262 +triton_per_fused_native_layer_norm_2,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,26.35498046875,26.35498046875,4,0.02635498046875,4,['triton'],"['triton_per_fused_native_layer_norm_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00124925587891305,99.97908388067154 +triton_red_fused_addmm_native_layer_norm_view_0,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,22.990234375,22.990234375,4,0.022990234375,4,['triton'],"['triton_red_fused_addmm_native_layer_norm_view_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010897631088974905,99.98017364378043 +triton_poi_fused__to_copy_cat_slice_3,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,22.34130859375,22.34130859375,12,0.02234130859375,12,['triton'],"['triton_poi_fused__to_copy_cat_slice_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010590032929998444,99.98123264707343 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,21.74853515625,21.74853515625,4,0.02174853515625,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010309051616983079,99.98226355223512 +triton_red_fused__to_copy_mul_sum_unsqueeze_5,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,21.748046875,21.748046875,4,0.021748046875,4,['triton'],"['triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0010308820166148632,99.98329443425175 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,19.25830078125,19.25830078125,9,0.01925830078125,9,['triton'],"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0009128652361317204,99.98420729948788 +triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,18.662109375,18.662109375,4,0.018662109375,4,['triton'],"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008846050892460727,99.98509190457712 +triton_poi_fused_addmm_clone_permute_view_31,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,18.3828125,18.3828125,4,0.0183828125,4,['triton'],"['triton_poi_fused_addmm_clone_permute_view_31', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008713661015158595,99.98596327067864 +triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,17.3427734375,17.3427734375,4,0.0173427734375,4,['triton'],"['triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0008220670737792259,99.98678533775242 +triton_per_fused__to_copy_div_mul_sum_unsqueeze_7,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,17.341796875,17.341796875,4,0.017341796875,4,['triton'],"['triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.000822020783612337,99.98760735853604 +aten::nonzero,NA,16.4580078125,16.4580078125,1,0.0164580078125,1,['other'],['aten::nonzero'],0.0007801281825779207,99.98838748671862 +aten::copy_,nn.Module: LlamaRotaryEmbedding,14.93994140625,14.93994140625,3,0.01493994140625,3,['elementwise'],"['aten::copy_', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0007081701181491912,99.98909565683677 +aten::index,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,13.53515625,80.96826171875,4,0.01353515625,4,['other'],"['aten::index', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0006415817130795693,99.98973723854985 +aten::gather,nn.Module: Embedding,13.056640625,13.056640625,3,0.013056640625,3,['other'],"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: LlamaModel_0']",0.0006188995313040289,99.99035613808115 +aten::cos,nn.Module: LlamaRotaryEmbedding,12.09716796875,12.09716796875,1,0.01209716796875,1,['elementwise'],"['aten::cos', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.000573419442335726,99.99092955752349 +triton_poi_fused_add_addmm_silu_8,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,11.69384765625,11.69384765625,4,0.01169384765625,4,['triton'],"['triton_poi_fused_add_addmm_silu_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0005543016034106279,99.9914838591269 +aten::copy_,nn.Module: LlamaModel,11.09375,11.09375,2,0.01109375,2,['elementwise'],"['aten::copy_', 'nn.Module: LlamaModel_0']",0.0005258562958574246,99.99200971542275 +triton_poi_fused_add_addmm_17,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,10.57275390625,10.57275390625,3,0.01057275390625,3,['triton'],"['triton_poi_fused_add_addmm_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.000501160491822219,99.99251087591458 +aten::arange,nn.Module: LlamaModel,9.6884765625,9.6884765625,5,0.0096884765625,5,['other'],"['aten::arange', 'nn.Module: LlamaModel_0']",0.0004592447457043583,99.99297012066027 +aten::bitwise_and,nn.Module: LlamaModel,9.2509765625,9.2509765625,2,0.0092509765625,2,['elementwise'],"['aten::bitwise_and', 'nn.Module: LlamaModel_0']",0.00043850675093815006,99.99340862741121 +aten::sin,nn.Module: LlamaRotaryEmbedding,9.212890625,9.212890625,1,0.009212890625,1,['elementwise'],"['aten::sin', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0004367014344294846,99.99384532884564 +triton_per_fused__to_copy_any_sum_unsqueeze_6,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,9.169921875,9.169921875,4,0.009169921875,4,['triton'],"['triton_per_fused__to_copy_any_sum_unsqueeze_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.0004346646670863748,99.99427999351272 +aten::mul,nn.Module: LlamaRotaryEmbedding,8.65087890625,8.65087890625,2,0.00865087890625,2,['elementwise'],"['aten::mul', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.00041006144338494684,99.99469005495611 +aten::sub,NA,8.0478515625,8.0478515625,4,0.0080478515625,4,['elementwise'],['aten::sub'],0.0003814772653310772,99.99507153222144 +aten::cat,nn.Module: LlamaRotaryEmbedding,7.490234375,7.490234375,1,0.007490234375,1,['other'],"['aten::cat', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0003550455800375394,99.99542657780148 +aten::normal_,NA,7.25,7.25,1,0.00725,1,['elementwise'],['aten::normal_'],0.0003436581989828804,99.99577023600047 +aten::all,nn.Module: LlamaModel,6.96923828125,6.96923828125,1,0.00696923828125,1,['reduce'],"['aten::all', 'nn.Module: LlamaModel_0']",0.00033034977600233375,99.99610058577647 +aten::add,nn.Module: LlamaModel,6.80712890625,6.80712890625,3,0.00680712890625,3,['elementwise'],"['aten::add', 'nn.Module: LlamaModel_0']",0.0003226656082987834,99.99642325138477 +aten::bmm,nn.Module: LlamaRotaryEmbedding,6.76904296875,6.76904296875,1,0.00676904296875,1,['GEMM'],"['aten::bmm', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.0003208602917901179,99.99674411167656 +aten::le,nn.Module: LlamaModel,6.52783203125,6.52783203125,1,0.00652783203125,1,['elementwise'],"['aten::le', 'nn.Module: LlamaModel_0']",0.00030942662056857,99.99705353829714 +aten::add,nn.Module: CLIPTextEmbeddings,5.9677734375,5.9677734375,1,0.0059677734375,1,['elementwise'],"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.00028287920985781004,99.997336417507 +aten::argmax,nn.Module: CLIPTextTransformer,5.72802734375,5.72802734375,1,0.00572802734375,1,['reduce'],"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0002715149738865955,99.99760793248089 +aten::copy_,nn.Module: CLIPTextTransformer,5.3271484375,5.3271484375,1,0.0053271484375,1,['elementwise'],"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0002525128603787193,99.99786044534127 +aten::index,nn.Module: LlamaModel,5.287109375,8.73095703125,1,0.005287109375,1,['elementwise'],"['aten::index', 'nn.Module: LlamaModel_0']",0.0002506149635362762,99.99811106030481 +aten::_local_scalar_dense,NA,5.2470703125,5.2470703125,1,0.0052470703125,1,['other'],['aten::_local_scalar_dense'],0.00024871706669383304,99.9983597773715 +aten::index,nn.Module: CLIPTextTransformer,5.20703125,5.20703125,1,0.00520703125,1,['elementwise'],"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.00024681916985138985,99.99860659654135 +aten::div,NA,4.68603515625,4.68603515625,1,0.00468603515625,1,['elementwise'],['aten::div'],0.00022212336581618416,99.99882871990717 +triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4.64599609375,4.64599609375,2,0.00464599609375,2,['triton'],"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00022022546897374103,99.99904894537615 +aten::fill_,nn.Module: LlamaModel,3.76513671875,3.76513671875,1,0.00376513671875,1,['elementwise'],"['aten::fill_', 'nn.Module: LlamaModel_0']",0.0001784717384399913,99.99922741711458 +aten::_local_scalar_dense,nn.Module: LlamaModel,3.52392578125,3.52392578125,1,0.00352392578125,1,['other'],"['aten::_local_scalar_dense', 'nn.Module: LlamaModel_0']",0.0001670380672184434,99.9993944551818 +aten::eq,NA,3.00390625,3.00390625,1,0.00300390625,1,['elementwise'],['aten::eq'],0.00014238855335012662,99.99953684373516 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,3.0029296875,3.0029296875,1,0.0030029296875,1,['triton'],"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00014234226318323776,99.99967918599835 +triton_poi_fused_add_addmm_18,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,2.72314453125,2.72314453125,1,0.00272314453125,1,['triton'],"['triton_poi_fused_add_addmm_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.00012908013036958,99.99980826612871 +aten::fill_,NA,2.203125,2.203125,1,0.002203125,1,['elementwise'],['aten::fill_'],0.00010443061650126321,99.99991269674521 +aten::arange,nn.Module: CLIPTextTransformer,1.841796875,1.841796875,1,0.001841796875,1,['other'],"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",8.730325475238581e-05,99.99999999999997 diff --git a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary_by_category.csv b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary_by_category.csv index 2c1f77926..d93a508e5 100644 --- a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary_by_category.csv +++ b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_summary_by_category.csv @@ -1,45 +1,45 @@ op category,parent_module,Count,call_stack_first,total_direct_kernel_time_ms,Percentage (%),Cumulative Percentage (%) -GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,2188,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",741.2650151367187,35.13695869069835,35.13695869069835 -CONV_fwd,nn.Module: Conv3d,396,"['aten::miopen_convolution', 'nn.Module: Conv3d_0']",612.1654331054688,29.017464868395397,64.15442355909374 -SDPA_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,248,"['aten::_efficient_attention_forward', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",321.82386572265625,15.254884076098204,79.40930763519195 -triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,3100,"['triton_red_fused_addmm_native_layer_norm_view_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",159.1116826171875,7.5421077552088125,86.95141539040077 -elementwise,nn.Module: HunyuanVideoCausalConv3d,385,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']",110.90469482421875,5.257031697259241,92.20844708766 -elementwise,nn.Module: Conv3d,407,"['aten::copy_', 'nn.Module: Conv3d_0']",29.71872412109375,1.4087074938920934,93.6171545815521 -NORM_fwd,nn.Module: GroupNorm,330,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",28.42794873046875,1.3475230043327209,94.96467758588481 -elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,165,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",25.1998505859375,1.1945068106128618,96.15918439649768 -elementwise,nn.Module: SiLU,319,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",20.5771474609375,0.9753844651281919,97.13456886162587 -GEMM,nn.Module: Linear,340,"['aten::mm', 'nn.Module: Linear_0', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",16.29271044921875,0.7722963883680942,97.90686524999396 -SDPA_fwd,nn.Module: Attention,11,"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",15.92249267578125,0.7547475679783494,98.66161281797231 -elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,165,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",8.07239404296875,0.3826423346993086,99.04425515267162 -elementwise,NA,203,['aten::copy_'],7.887646484375,0.3738850519435338,99.41814020461516 -elementwise,nn.Module: LlamaAttention,480,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",2.69003173828125,0.12751112238478246,99.54565132699994 -elementwise,nn.Module: LlamaRMSNorm,455,"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",2.51821728515625,0.11936688622276072,99.66501821322271 -SDPA_fwd,nn.Module: LlamaAttention,32,"['aten::_efficient_attention_forward', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",1.4376220703125,0.06814521967975222,99.73316343290246 -elementwise,nn.Module: HunyuanVideoMidBlock3D,66,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",1.06916064453125,0.05067965253113436,99.78384308543359 -other,nn.Module: LlamaAttention,128,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.927484375,0.04396400680616564,99.82780709223975 -elementwise,nn.Module: Attention,44,"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.58598583984375,0.027776516937233913,99.85558360917699 -reduce,nn.Module: LlamaRMSNorm,65,"['aten::mean', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.54281884765625,0.02573034344958573,99.88131395262657 -elementwise,nn.Module: SiLUActivation,32,"['aten::silu', 'nn.Module: SiLUActivation_0', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.38882275390625,0.01843072148695383,99.89974467411352 -elementwise,nn.Module: LlamaMLP,32,"['aten::mul', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.37224169921875,0.017644757193879184,99.9173894313074 -elementwise,nn.Module: LlamaDecoderLayer,64,"['aten::add', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.285482421875,0.01353225075986121,99.93092168206726 -elementwise,nn.Module: Linear,33,"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.26980712890625,0.012789220790470335,99.94371090285773 -elementwise,nn.Module: QuickGELUActivation,36,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.2204580078125,0.010450006077937935,99.95416090893566 -CONV_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4,"['aten::miopen_convolution', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.21186767578125,0.010042812785987225,99.96420372172165 -other,nn.Module: CLIPAttention,12,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.16567431640625,0.007853185423302914,99.97205690714495 -elementwise,nn.Module: CLIPEncoderLayer,24,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.12696728515625,0.006018420082569853,99.97807532722751 -NORM_fwd,nn.Module: LayerNorm,25,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.1179951171875,0.005593127253626847,99.98366845448115 -other,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,8,"['aten::index', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.07336279296875,0.0034774950568816276,99.98714594953803 -other,nn.Module: HunyuanVideoMidBlock3D,11,"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.0489013671875,0.002317990575164196,99.9894639401132 -elementwise,nn.Module: LlamaRotaryEmbedding,7,"['aten::copy_', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.04490087890625,0.002128362050128547,99.99159230216333 -elementwise,nn.Module: LlamaModel,10,"['aten::add', 'nn.Module: LlamaModel_0']",0.04273193359375,0.0020255511251671956,99.9936178532885 -elementwise,nn.Module: CLIPAttention,12,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0403251953125,0.0019114684936646063,99.99552932178216 -other,NA,3,['aten::cat'],0.02274609375,0.0010781954363799195,99.99660751721854 -other,nn.Module: LlamaModel,6,"['aten::arange', 'nn.Module: LlamaModel_0']",0.01321240234375,0.0006262856412717722,99.99723380285981 -other,nn.Module: Embedding,3,"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: LlamaModel_0']",0.013056640625,0.0006189023263094419,99.99785270518612 -elementwise,nn.Module: CLIPTextTransformer,2,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0105341796875,0.0004993342852580366,99.99835203947137 -other,nn.Module: LlamaRotaryEmbedding,1,"['aten::cat', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.007490234375,0.0003550471834550052,99.99870708665483 -reduce,nn.Module: LlamaModel,1,"['aten::all', 'nn.Module: LlamaModel_0']",0.00696923828125,0.0003303512678913487,99.99903743792272 -GEMM,nn.Module: LlamaRotaryEmbedding,1,"['aten::bmm', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.00676904296875,0.00032086174082377687,99.99935829966354 -elementwise,nn.Module: CLIPTextEmbeddings,1,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0059677734375,0.0002828804873655198,99.9996411801509 -reduce,nn.Module: CLIPTextTransformer,1,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.00572802734375,0.0002715162000724032,99.99991269635098 -other,nn.Module: CLIPTextTransformer,1,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.001841796875,8.730364902166099e-05,100.0 +GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,2188,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",741.2650151367187,35.13680000977965,35.13680000977965 +CONV_fwd,nn.Module: Conv3d,396,"['aten::miopen_convolution', 'nn.Module: Conv3d_0']",612.1654331054688,29.017333823531093,64.15413383331074 +SDPA_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,248,"['aten::_efficient_attention_forward', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",321.82386572265625,15.254815183993989,79.40894901730472 +triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,3100,"['triton_red_fused_addmm_native_layer_norm_view_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",159.1116826171875,7.542073694532188,86.95102271183691 +elementwise,nn.Module: HunyuanVideoCausalConv3d,385,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']",110.90469482421875,5.257007956143036,92.20803066797995 +elementwise,nn.Module: Conv3d,407,"['aten::copy_', 'nn.Module: Conv3d_0']",29.71872412109375,1.4087011320722989,93.61673180005225 +NORM_fwd,nn.Module: GroupNorm,330,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",28.42794873046875,1.3475169188262834,94.96424871887854 +elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,165,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",25.1998505859375,1.1945014161380645,96.1587501350166 +elementwise,nn.Module: SiLU,319,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",20.5771474609375,0.9753800602249565,97.13413019524155 +GEMM,nn.Module: Linear,340,"['aten::mm', 'nn.Module: Linear_0', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",16.29271044921875,0.7722929006245618,97.90642309586612 +SDPA_fwd,nn.Module: Attention,11,"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",15.92249267578125,0.7547441594864953,98.66116725535261 +elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,165,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",8.07239404296875,0.3826406066602447,99.04380786201286 +elementwise,NA,203,['aten::copy_'],7.887646484375,0.37388336345296025,99.41769122546582 +elementwise,nn.Module: LlamaAttention,480,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",2.69003173828125,0.12751054653579613,99.54520177200162 +elementwise,nn.Module: LlamaRMSNorm,455,"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",2.51821728515625,0.11936634715370424,99.66456811915532 +SDPA_fwd,nn.Module: LlamaAttention,32,"['aten::_efficient_attention_forward', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",1.4376220703125,0.06814491193125984,99.73271303108658 +elementwise,nn.Module: HunyuanVideoMidBlock3D,66,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",1.06916064453125,0.05067942365834277,99.78339245474491 +other,nn.Module: LlamaAttention,128,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.927484375,0.04396380826169139,99.8273562630066 +elementwise,nn.Module: Attention,44,"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.58598583984375,0.027776391496575695,99.85513265450318 +reduce,nn.Module: LlamaRMSNorm,65,"['aten::mean', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.54281884765625,0.025730227249587515,99.88086288175276 +elementwise,nn.Module: SiLUActivation,32,"['aten::silu', 'nn.Module: SiLUActivation_0', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.38882275390625,0.018430638252549744,99.89929352000532 +elementwise,nn.Module: LlamaMLP,32,"['aten::mul', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.37224169921875,0.017644677508943826,99.91693819751426 +elementwise,nn.Module: LlamaDecoderLayer,64,"['aten::add', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']",0.285482421875,0.013532189647287364,99.93047038716155 +elementwise,nn.Module: Linear,33,"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.26980712890625,0.012789163033470864,99.94325955019502 +elementwise,nn.Module: QuickGELUActivation,36,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.2204580078125,0.010449958884992765,99.95370950908001 +CONV_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,4,"['aten::miopen_convolution', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.21186767578125,0.010042767431954928,99.96375227651197 +other,nn.Module: CLIPAttention,12,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.16567431640625,0.007853149957778175,99.97160542646975 +elementwise,nn.Module: CLIPEncoderLayer,24,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.12696728515625,0.006018392902971406,99.97762381937272 +NORM_fwd,nn.Module: LayerNorm,25,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.1179951171875,0.0055931019946800255,99.9832169213674 +other,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,8,"['aten::index', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']",0.08096826171875,0.003837987172005536,99.9870549085394 +other,nn.Module: HunyuanVideoMidBlock3D,11,"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']",0.0489013671875,0.0023179801069595557,99.98937288864637 +elementwise,nn.Module: LlamaRotaryEmbedding,7,"['aten::copy_', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.04490087890625,0.0021283524382993495,99.99150124108468 +elementwise,nn.Module: LlamaModel,10,"['aten::add', 'nn.Module: LlamaModel_0']",0.04273193359375,0.0020255419776391967,99.99352678306232 +elementwise,nn.Module: CLIPAttention,12,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0403251953125,0.0019114598613416062,99.99543824292367 +other,NA,3,['aten::cat'],0.02466796875,0.0011692896156125488,99.99660753253929 +other,nn.Module: LlamaModel,6,"['aten::arange', 'nn.Module: LlamaModel_0']",0.01321240234375,0.000626282812922802,99.9972338153522 +other,nn.Module: Embedding,3,"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: LlamaModel_0']",0.013056640625,0.0006188995313040291,99.9978527148835 +elementwise,nn.Module: CLIPTextTransformer,2,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0105341796875,0.0004993320302301094,99.99835204691374 +other,nn.Module: LlamaRotaryEmbedding,1,"['aten::cat', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.007490234375,0.00035504558003753955,99.99870709249377 +reduce,nn.Module: LlamaModel,1,"['aten::all', 'nn.Module: LlamaModel_0']",0.00696923828125,0.00033034977600233386,99.99903744226978 +GEMM,nn.Module: LlamaRotaryEmbedding,1,"['aten::bmm', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']",0.00676904296875,0.000320860291790118,99.99935830256157 +elementwise,nn.Module: CLIPTextEmbeddings,1,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.0059677734375,0.0002828792098578102,99.99964118177144 +reduce,nn.Module: CLIPTextTransformer,1,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.00572802734375,0.0002715149738865956,99.99991269674533 +other,nn.Module: CLIPTextTransformer,1,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']",0.001841796875,8.730325475238585e-05,100.00000000000009 diff --git a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_unique_args.csv b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_unique_args.csv index a94421463..091e4c79c 100644 --- a/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_unique_args.csv +++ b/tests/traces/inference/xdit_hunyuanvideo/perf_csvs/ops_unique_args.csv @@ -1,344 +1,344 @@ name,op category,parent_module,process_name,process_label,thread_name,Input Dims,Input type,Input Strides,Concrete Inputs,num_kernels,operation_count,total_direct_kernel_time_mean,total_subtree_kernel_time_mean,total_direct_kernel_time_median,total_subtree_kernel_time_median,total_direct_kernel_time_std,total_subtree_kernel_time_std,total_direct_kernel_time_min,total_subtree_kernel_time_min,total_direct_kernel_time_max,total_subtree_kernel_time_max,total_direct_kernel_time_sum,total_subtree_kernel_time_sum,ex_UID,call_stack,kernel_details_summary,trunc_kernel_details,Percentage (%),Cumulative Percentage (%) -aiter::fmha_v3_fwd,SDPA_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 24, 128), (1, 7431, 24, 128), (1, 7431, 24, 128), (), (), (), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '', '', '', '')","((22828032, 3072, 128, 1), (22828032, 3072, 128, 1), (22828032, 3072, 128, 1), (), (), (), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '0.', '0.088388347648318447', 'False', '-1', '-1', 'True', 'False', '2', '', '', '', '', '', '', '')",1,240,1339.5328959147134,1339.5328959147134,1306.480712890625,1306.480712890625,72.59150793277318,72.59150793277318,1239.56103515625,1239.56103515625,1522.662109375,1522.662109375,321487.89501953125,321487.89501953125,8865,"['aiter::fmha_v3_fwd', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'aiter::fmha_fwd_hd128_bf16_rtz', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(321487.896), 'mean_duration_us': np.float64(1339.5329), 'median_duration_us': np.float64(1306.4805000000001), 'std_dev_duration_us': np.float64(72.44012259887472), 'min_duration_us': np.float64(1239.561), 'max_duration_us': np.float64(1522.662)}]","[{'name': 'aiter::fmha_fwd_hd128_bf16_rtz', 'stream': 0, 'mean_duration_us': np.float64(1339.53)}]",15.238958612902277,15.238958612902277 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 15360), (15360, 3072), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((15360, 1), (1, 15360), (3072, 1))","('', '', '')",1,160,1207.4557647705078,1207.4557647705078,1246.35107421875,1246.35107421875,57.53356458370716,57.53356458370716,1100.955078125,1100.955078125,1275.69482421875,1275.69482421875,193192.92236328125,193192.92236328125,9539,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(193192.92099999997), 'mean_duration_us': np.float64(1207.45575625), 'median_duration_us': np.float64(1246.351), 'std_dev_duration_us': np.float64(57.35348854611493), 'min_duration_us': np.float64(1100.955), 'max_duration_us': np.float64(1275.695)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1207.46)}]",9.157604357143294,24.396562970045572 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,50,3611.637939453125,3821.61697265625,3602.0078125,3820.15087890625,73.71296412906315,76.71330912242925,3498.23388671875,3686.9130859375,3767.7138671875,3955.6318359375,180581.89697265625,191080.8486328125,16278,"['aten::miopen_convolution', 'nn.Module: Conv3d_29', 'nn.Module: HunyuanVideoCausalConv3d_28', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(259.779), 'mean_duration_us': np.float64(5.19558), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(1.0004229523556527), 'min_duration_us': np.float64(4.366), 'max_duration_us': np.float64(11.816)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(11850.718), 'mean_duration_us': np.float64(237.01436), 'median_duration_us': np.float64(236.5905), 'std_dev_duration_us': np.float64(6.365469421056075), 'min_duration_us': np.float64(219.525), 'max_duration_us': np.float64(248.408)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(12304.837000000001), 'mean_duration_us': np.float64(246.09674000000004), 'median_duration_us': np.float64(240.156), 'std_dev_duration_us': np.float64(17.29478605222973), 'min_duration_us': np.float64(215.68), 'max_duration_us': np.float64(294.397)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(17144.065), 'mean_duration_us': np.float64(342.88129999999995), 'median_duration_us': np.float64(360.83500000000004), 'std_dev_duration_us': np.float64(24.678367399202077), 'min_duration_us': np.float64(312.904), 'max_duration_us': np.float64(369.668)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(139022.499), 'mean_duration_us': np.float64(2780.4499800000003), 'median_duration_us': np.float64(2781.092), 'std_dev_duration_us': np.float64(63.67474031968724), 'min_duration_us': np.float64(2670.527), 'max_duration_us': np.float64(2930.994)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.2)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(237.01)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(246.1)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(342.88)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2780.45)}]",8.559824792278748,32.95638776232432 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072, 12288), (7431, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",1,160,1009.4202178955078,1009.4202178955078,1004.19140625,1004.19140625,29.21286359684354,29.21286359684354,940.876953125,940.876953125,1097.8310546875,1097.8310546875,161507.23486328125,161507.23486328125,9537,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(161507.23799999998), 'mean_duration_us': np.float64(1009.4202374999999), 'median_duration_us': np.float64(1004.1915), 'std_dev_duration_us': np.float64(29.121434685959308), 'min_duration_us': np.float64(940.877), 'max_duration_us': np.float64(1097.831)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1009.42)}]",7.655660153600202,40.61204791592452 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 19, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((284855296, 1112716, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,9663.39892578125,10077.0046875,9664.496337890625,10076.227294921875,45.14691610523872,39.66313516513159,9577.10595703125,10009.8291015625,9735.7021484375,10151.71923828125,96633.9892578125,100770.046875,16247,"['aten::miopen_convolution', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.512), 'mean_duration_us': np.float64(5.6512), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.069073019494479), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(11.856)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4484.494), 'mean_duration_us': np.float64(448.44939999999997), 'median_duration_us': np.float64(449.026), 'std_dev_duration_us': np.float64(2.4529009030126034), 'min_duration_us': np.float64(442.256), 'max_duration_us': np.float64(451.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(5357.794000000001), 'mean_duration_us': np.float64(535.7794000000001), 'median_duration_us': np.float64(535.4145), 'std_dev_duration_us': np.float64(1.8377387300701893), 'min_duration_us': np.float64(533.352), 'max_duration_us': np.float64(539.681)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(7224.526), 'mean_duration_us': np.float64(722.4526), 'median_duration_us': np.float64(722.553), 'std_dev_duration_us': np.float64(1.0228248334881278), 'min_duration_us': np.float64(720.429), 'max_duration_us': np.float64(723.914)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(79510.663), 'mean_duration_us': np.float64(7951.0663), 'median_duration_us': np.float64(7951.6545), 'std_dev_duration_us': np.float64(43.127390136779646), 'min_duration_us': np.float64(7868.292), 'max_duration_us': np.float64(8023.562)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(448.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(535.78)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(722.45)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(7951.07)}]",4.580581059856027,45.19262897578055 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072, 3072), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,320,252.77703704833985,252.77703704833985,251.35205078125,251.35205078125,7.451328398150328,7.451328398150328,236.630859375,236.630859375,298.1220703125,298.1220703125,80888.65185546875,80888.65185546875,9520,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(80888.65), 'mean_duration_us': np.float64(252.77703125), 'median_duration_us': np.float64(251.352), 'std_dev_duration_us': np.float64(7.439677096001779), 'min_duration_us': np.float64(236.631), 'max_duration_us': np.float64(298.122)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(252.78)}]",3.8342308901057125,49.026859865886266 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 12288), (7425, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",1,80,1004.6925109863281,1004.6925109863281,992.614013671875,992.614013671875,36.9064864035743,36.9064864035743,954.498046875,954.498046875,1121.38623046875,1121.38623046875,80375.40087890625,80375.40087890625,8875,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(80375.40100000001), 'mean_duration_us': np.float64(1004.6925125000001), 'median_duration_us': np.float64(992.614), 'std_dev_duration_us': np.float64(36.675073389154164), 'min_duration_us': np.float64(954.498), 'max_duration_us': np.float64(1121.386)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1004.69)}]",3.8099021035136307,52.836761969399895 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 19, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((284855296, 1112716, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,7953.00517578125,8152.997607421875,7934.805908203125,8126.16943359375,78.30825194053891,94.45440830871685,7828.50927734375,8023.1572265625,8080.68359375,8310.86474609375,79530.0517578125,81529.97607421875,16262,"['aten::miopen_convolution', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.385000000000005), 'mean_duration_us': np.float64(5.038500000000001), 'median_duration_us': np.float64(5.0265), 'std_dev_duration_us': np.float64(0.08560519844028162), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.207)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2352.646), 'mean_duration_us': np.float64(235.26460000000003), 'median_duration_us': np.float64(238.3735), 'std_dev_duration_us': np.float64(6.350920062479137), 'min_duration_us': np.float64(225.775), 'max_duration_us': np.float64(243.681)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2429.52), 'mean_duration_us': np.float64(242.952), 'median_duration_us': np.float64(241.21699999999998), 'std_dev_duration_us': np.float64(6.450974639540913), 'min_duration_us': np.float64(236.39), 'max_duration_us': np.float64(257.262)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(6880.575), 'mean_duration_us': np.float64(688.0575), 'median_duration_us': np.float64(721.2909999999999), 'std_dev_duration_us': np.float64(42.31107712939958), 'min_duration_us': np.float64(634.902), 'max_duration_us': np.float64(723.795)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67816.927), 'mean_duration_us': np.float64(6781.6927), 'median_duration_us': np.float64(6761.807000000001), 'std_dev_duration_us': np.float64(73.52589039250037), 'min_duration_us': np.float64(6714.697), 'max_duration_us': np.float64(6961.744)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.04)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(235.26)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(242.95)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(688.06)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(6781.69)}]",3.7698314182114103,56.606593387611305 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 12288), (12288, 3072), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",1,80,910.4198913574219,910.4198913574219,902.54052734375,902.54052734375,29.694066302401396,29.694066302401396,876.06103515625,876.06103515625,1024.32080078125,1024.32080078125,72833.59130859375,72833.59130859375,8877,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(72833.59099999999), 'mean_duration_us': np.float64(910.4198874999998), 'median_duration_us': np.float64(902.5405), 'std_dev_duration_us': np.float64(29.507910684676464), 'min_duration_us': np.float64(876.061), 'max_duration_us': np.float64(1024.321)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(910.42)}]",3.4524101864341397,60.05900357404545 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 3072), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,240,259.62062581380206,259.62062581380206,253.87646484375,253.87646484375,14.086526150668012,14.086526150668012,233.02587890625,233.02587890625,298.52197265625,298.52197265625,62308.9501953125,62308.9501953125,8851,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(62308.951), 'mean_duration_us': np.float64(259.6206291666667), 'median_duration_us': np.float64(253.8765), 'std_dev_duration_us': np.float64(14.057132431615726), 'min_duration_us': np.float64(233.026), 'max_duration_us': np.float64(298.522)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(259.62)}]",2.9535280424230907,63.012531616468536 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 11, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((41913344, 163724, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,50,1067.009375,1141.511875,1066.380126953125,1141.81103515625,19.22263457840547,19.821049310902435,1037.49560546875,1106.23828125,1107.6806640625,1176.94287109375,53350.46875,57075.59375,16134,"['aten::miopen_convolution', 'nn.Module: Conv3d_21', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(284.251), 'mean_duration_us': np.float64(5.68502), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.2562962730903437), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(6.328)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2293.155), 'mean_duration_us': np.float64(45.8631), 'median_duration_us': np.float64(45.647000000000006), 'std_dev_duration_us': np.float64(0.7717818927650476), 'min_duration_us': np.float64(44.746), 'max_duration_us': np.float64(49.032)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2980.0209999999997), 'mean_duration_us': np.float64(59.60041999999999), 'median_duration_us': np.float64(59.4275), 'std_dev_duration_us': np.float64(1.4246100110556579), 'min_duration_us': np.float64(57.084), 'max_duration_us': np.float64(62.932)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(5527.164999999999), 'mean_duration_us': np.float64(110.54329999999999), 'median_duration_us': np.float64(110.483), 'std_dev_duration_us': np.float64(0.8136805331332437), 'min_duration_us': np.float64(108.441), 'max_duration_us': np.float64(112.446)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(42265.876), 'mean_duration_us': np.float64(845.31752), 'median_duration_us': np.float64(843.492), 'std_dev_duration_us': np.float64(18.263799995882565), 'min_duration_us': np.float64(814.89), 'max_duration_us': np.float64(884.273)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(45.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.6)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(110.54)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(845.32)}]",2.528883973098875,65.5414155895674 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,4711.824853515625,4846.8685546875,4704.966796875,4839.705810546875,48.47913335133184,51.832171123411534,4637.20654296875,4764.634765625,4811.9453125,4950.71142578125,47118.24853515625,48468.685546875,16103,"['aten::miopen_convolution', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(154.176), 'mean_duration_us': np.float64(15.417599999999998), 'median_duration_us': np.float64(15.3615), 'std_dev_duration_us': np.float64(0.2204292176640837), 'min_duration_us': np.float64(15.181), 'max_duration_us': np.float64(15.902)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1104.153), 'mean_duration_us': np.float64(110.4153), 'median_duration_us': np.float64(110.684), 'std_dev_duration_us': np.float64(1.8032592187480978), 'min_duration_us': np.float64(106.077), 'max_duration_us': np.float64(112.887)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1168.2030000000002), 'mean_duration_us': np.float64(116.82030000000002), 'median_duration_us': np.float64(117.253), 'std_dev_duration_us': np.float64(1.4732819180319825), 'min_duration_us': np.float64(113.688), 'max_duration_us': np.float64(118.575)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1926.133), 'mean_duration_us': np.float64(192.6133), 'median_duration_us': np.float64(192.7255), 'std_dev_duration_us': np.float64(0.6498398341129935), 'min_duration_us': np.float64(191.284), 'max_duration_us': np.float64(193.526)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(42765.581999999995), 'mean_duration_us': np.float64(4276.5581999999995), 'median_duration_us': np.float64(4272.6685), 'std_dev_duration_us': np.float64(45.89578744677992), 'min_duration_us': np.float64(4200.241), 'max_duration_us': np.float64(4375.661)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.42)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(110.42)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(116.82)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(192.61)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4276.56)}]",2.233468352816416,67.77488394238382 -aten::addmm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((3072,), (7431, 3072), (3072, 3072), (), (), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",1,160,266.93495788574216,266.93495788574216,274.466796875,274.466796875,13.759746043159826,13.759746043159826,232.18408203125,232.18408203125,287.14501953125,287.14501953125,42709.59326171875,42709.59326171875,9527,"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(42709.591), 'mean_duration_us': np.float64(266.93494375), 'median_duration_us': np.float64(274.467), 'std_dev_duration_us': np.float64(13.71668299883707), 'min_duration_us': np.float64(232.184), 'max_duration_us': np.float64(287.145)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(266.93)}]",2.024492163382018,69.79937610576584 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((125337600, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,60,692.0326985677083,692.0326985677083,712.657958984375,712.657958984375,72.95844708347023,72.95844708347023,521.69384765625,521.69384765625,780.9599609375,780.9599609375,41521.9619140625,41521.9619140625,16274,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_28', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(41521.96300000001), 'mean_duration_us': np.float64(692.0327166666668), 'median_duration_us': np.float64(712.658), 'std_dev_duration_us': np.float64(72.34788857575403), 'min_duration_us': np.float64(521.694), 'max_duration_us': np.float64(780.96)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(692.03)}]",1.968196840184174,71.76757294595002 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((13776896, 26908, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,70,592.61953125,615.2607770647321,591.913818359375,615.72900390625,18.37654700515553,18.013305998583167,558.50341796875,580.736328125,670.7919921875,690.7001953125,41483.3671875,43068.25439453125,15969,"['aten::miopen_convolution', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(991.0010000000001), 'mean_duration_us': np.float64(14.157157142857145), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.8864840766552241), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(15.822)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1184.9680000000003), 'mean_duration_us': np.float64(16.92811428571429), 'median_duration_us': np.float64(17.245), 'std_dev_duration_us': np.float64(1.3201695079783953), 'min_duration_us': np.float64(14.18), 'max_duration_us': np.float64(19.387)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1536.7740000000003), 'mean_duration_us': np.float64(21.95391428571429), 'median_duration_us': np.float64(21.992), 'std_dev_duration_us': np.float64(0.8931553175257314), 'min_duration_us': np.float64(20.509), 'max_duration_us': np.float64(23.554)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1747.1659999999997), 'mean_duration_us': np.float64(24.95951428571428), 'median_duration_us': np.float64(24.976), 'std_dev_duration_us': np.float64(0.4623428765647894), 'min_duration_us': np.float64(23.915), 'max_duration_us': np.float64(25.878)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(36023.46), 'mean_duration_us': np.float64(514.6208571428572), 'median_duration_us': np.float64(513.7625), 'std_dev_duration_us': np.float64(19.46001120634365), 'min_duration_us': np.float64(479.151), 'max_duration_us': np.float64(598.088)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.16)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.93)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(21.95)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(24.96)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(514.62)}]",1.9663673982366743,73.73394034418669 -triton_poi_fused_addmm_cat_gelu_slice_view_25,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 24, 128), (7431, 12288), (12288,), (1, 7431, 15360), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 128, 1), (12288, 1), (1,), (114140160, 15360, 1), ())","('', '', '', '', '114140160')",1,160,167.68397216796876,167.68397216796876,166.24609375,166.24609375,7.21141663148745,7.21141663148745,156.671875,156.671875,200.85791015625,200.85791015625,26829.435546875,26829.435546875,9538,"['triton_poi_fused_addmm_cat_gelu_slice_view_25', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(26829.435999999998), 'mean_duration_us': np.float64(167.68397499999998), 'median_duration_us': np.float64(166.246), 'std_dev_duration_us': np.float64(7.188836548731304), 'min_duration_us': np.float64(156.672), 'max_duration_us': np.float64(200.858)}]","[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'mean_duration_us': np.float64(167.68)}]",1.2717513294910165,75.0056916736777 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,2489.3544921875,2566.5841796875,2491.45703125,2568.050048828125,49.46997046851107,54.01344552258528,2409.29541015625,2480.640625,2541.3310546875,2624.77392578125,24893.544921875,25665.841796875,16118,"['aten::miopen_convolution', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(94.812), 'mean_duration_us': np.float64(9.4812), 'median_duration_us': np.float64(9.3125), 'std_dev_duration_us': np.float64(0.4950209692528186), 'min_duration_us': np.float64(8.972), 'max_duration_us': np.float64(10.615)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(485.51099999999997), 'mean_duration_us': np.float64(48.5511), 'median_duration_us': np.float64(48.531), 'std_dev_duration_us': np.float64(0.7159562067612792), 'min_duration_us': np.float64(47.189), 'max_duration_us': np.float64(49.633)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(596.274), 'mean_duration_us': np.float64(59.6274), 'median_duration_us': np.float64(59.186499999999995), 'std_dev_duration_us': np.float64(2.106466339631375), 'min_duration_us': np.float64(56.042), 'max_duration_us': np.float64(62.932)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2167.893), 'mean_duration_us': np.float64(216.7893), 'median_duration_us': np.float64(217.042), 'std_dev_duration_us': np.float64(1.0544313206653126), 'min_duration_us': np.float64(214.598), 'max_duration_us': np.float64(218.403)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(21549.053000000004), 'mean_duration_us': np.float64(2154.9053000000004), 'median_duration_us': np.float64(2156.604), 'std_dev_duration_us': np.float64(45.69621782390749), 'min_duration_us': np.float64(2076.445), 'max_duration_us': np.float64(2205.356)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.48)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(48.55)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2154.91)}]",1.1799875101668449,76.18567918384454 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((3670016, 7168, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,100,240.975185546875,248.611943359375,232.840576171875,240.29150390625,18.52015534861287,18.835214182166514,226.65185546875,234.10205078125,311.21826171875,320.1103515625,24097.5185546875,24861.1943359375,15630,"['aten::miopen_convolution', 'nn.Module: Conv3d_2', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(496.76199999999994), 'mean_duration_us': np.float64(4.967619999999999), 'median_duration_us': np.float64(4.887), 'std_dev_duration_us': np.float64(0.22438590775714945), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.767)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(605.4789999999999), 'mean_duration_us': np.float64(6.05479), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.2873086248270316), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(6.809)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(731.9480000000001), 'mean_duration_us': np.float64(7.319480000000001), 'median_duration_us': np.float64(7.289), 'std_dev_duration_us': np.float64(0.4345492947871392), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(8.411)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1294.3890000000001), 'mean_duration_us': np.float64(12.943890000000001), 'median_duration_us': np.float64(12.818), 'std_dev_duration_us': np.float64(0.5245689639122774), 'min_duration_us': np.float64(12.218), 'max_duration_us': np.float64(15.101)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(20968.936999999998), 'mean_duration_us': np.float64(209.68936999999997), 'median_duration_us': np.float64(201.819), 'std_dev_duration_us': np.float64(17.316049904441257), 'min_duration_us': np.float64(196.571), 'max_duration_us': np.float64(275.408)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.32)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(209.69)}]",1.1422547897370063,77.32793397358155 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,20,1187.0187744140626,1187.0187744140626,1186.641845703125,1186.641845703125,101.97322723391864,101.97322723391864,1074.7158203125,1074.7158203125,1311.26708984375,1311.26708984375,23740.37548828125,23740.37548828125,16243,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(23740.376000000004), 'mean_duration_us': np.float64(1187.0188000000003), 'median_duration_us': np.float64(1186.642), 'std_dev_duration_us': np.float64(99.39126225911411), 'min_duration_us': np.float64(1074.716), 'max_duration_us': np.float64(1311.267)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1187.02)}]",1.1253257280455258,78.45325970162708 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,2221.71220703125,2233.801171875,2279.74267578125,2290.57763671875,151.5339457318205,151.6748699935203,1977.37353515625,1988.228515625,2382.013671875,2395.83251953125,22217.1220703125,22338.01171875,16368,"['aten::miopen_convolution', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.868), 'mean_duration_us': np.float64(5.0868), 'median_duration_us': np.float64(5.1265), 'std_dev_duration_us': np.float64(0.12902774895347116), 'min_duration_us': np.float64(4.847), 'max_duration_us': np.float64(5.247)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67.61), 'mean_duration_us': np.float64(6.761), 'median_duration_us': np.float64(6.7285), 'std_dev_duration_us': np.float64(0.28540567618742285), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(88.96000000000001), 'mean_duration_us': np.float64(8.896), 'median_duration_us': np.float64(8.992), 'std_dev_duration_us': np.float64(0.3516822429409821), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(9.413)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3541.25), 'mean_duration_us': np.float64(354.125), 'median_duration_us': np.float64(363.59900000000005), 'std_dev_duration_us': np.float64(19.5954072884439), 'min_duration_us': np.float64(314.626), 'max_duration_us': np.float64(368.547)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(18468.433), 'mean_duration_us': np.float64(1846.8433), 'median_duration_us': np.float64(1894.7145), 'std_dev_duration_us': np.float64(127.35508833890387), 'min_duration_us': np.float64(1639.595), 'max_duration_us': np.float64(1996.765)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.09)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(6.76)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(8.9)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(354.12)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1846.84)}]",1.0531214673159657,79.50638116894304 -aten::addmm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((3072,), (7425, 3072), (3072, 3072), (), (), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",1,80,264.46404418945315,264.46404418945315,264.6123046875,264.6123046875,8.391238658426342,8.391238658426342,246.44580078125,246.44580078125,287.7861328125,287.7861328125,21157.12353515625,21157.12353515625,8860,"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(21157.122), 'mean_duration_us': np.float64(264.464025), 'median_duration_us': np.float64(264.6125), 'std_dev_duration_us': np.float64(8.338616556382423), 'min_duration_us': np.float64(246.446), 'max_duration_us': np.float64(287.786)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(264.46)}]",1.0028761110918945,80.50925728003493 -triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), ())","('', '', '', '', '', '22809600')",1,320,54.79553985595703,54.79553985595703,53.718505859375,53.718505859375,3.1640130472265944,3.1640130472265944,49.671875,49.671875,63.69384765625,63.69384765625,17534.57275390625,17534.57275390625,9524,"['triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(17534.569), 'mean_duration_us': np.float64(54.795528125), 'median_duration_us': np.float64(53.718500000000006), 'std_dev_duration_us': np.float64(3.159070109297827), 'min_duration_us': np.float64(49.672), 'max_duration_us': np.float64(63.694)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(54.8)}]",0.8311623318677911,81.34041961190272 -triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",1,160,105.94866638183593,105.94866638183593,113.08740234375,113.08740234375,12.854668591841357,12.854668591841357,66.01708984375,66.01708984375,123.22216796875,123.22216796875,16951.78662109375,16951.78662109375,9526,"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(16951.782), 'mean_duration_us': np.float64(105.94863749999999), 'median_duration_us': np.float64(113.0875), 'std_dev_duration_us': np.float64(12.814423365141865), 'min_duration_us': np.float64(66.017), 'max_duration_us': np.float64(123.222)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(105.95)}]",0.8035374853473226,82.14395709725004 -aten::_efficient_attention_forward,SDPA_fwd,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 4500, 1, 512), (1, 4500, 1, 512), (1, 4500, 1, 512), (1, 1, 4500, 4500), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', '', '', '')","((2304000, 512, 512, 1), (2304000, 512, 512, 1), (2304000, 512, 512, 1), (20268000, 20268000, 4504, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '', '', '')",1,10,1508.128369140625,1508.128369140625,1518.034912109375,1518.034912109375,53.426057449049196,53.426057449049196,1386.09912109375,1386.09912109375,1579.9072265625,1579.9072265625,15081.28369140625,15081.28369140625,15766,"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(15081.283999999998), 'mean_duration_us': np.float64(1508.1283999999998), 'median_duration_us': np.float64(1518.035), 'std_dev_duration_us': np.float64(50.684445699247824), 'min_duration_us': np.float64(1386.099), 'max_duration_us': np.float64(1579.907)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1508.13)}]",0.7148731307249235,82.85883022797496 -triton_poi_fused_addmm_gelu_view_12,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((91238400, 12288, 1), (1,), ())","('', '', '91238400')",1,80,187.95579833984374,187.95579833984374,193.726318359375,193.726318359375,19.109414108015883,19.109414108015883,141.4091796875,141.4091796875,211.7939453125,211.7939453125,15036.4638671875,15036.4638671875,8876,"['triton_poi_fused_addmm_gelu_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(15036.464), 'mean_duration_us': np.float64(187.9558), 'median_duration_us': np.float64(193.7265), 'std_dev_duration_us': np.float64(18.989619966181525), 'min_duration_us': np.float64(141.409), 'max_duration_us': np.float64(211.794)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'mean_duration_us': np.float64(187.96)}]",0.712748610775998,83.57157883875097 -aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((29491200, 115200, 14400, 120, 1), (), (), (), ())","('', '[16, 240, 240]', '2.', '2.', '2.')",1,10,1476.82578125,1476.82578125,1479.277587890625,1479.277587890625,29.202630242023886,29.202630242023886,1430.48486328125,1430.48486328125,1511.56494140625,1511.56494140625,14768.2578125,14768.2578125,16234,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(14768.257999999998), 'mean_duration_us': np.float64(1476.8257999999998), 'median_duration_us': np.float64(1479.2775000000001), 'std_dev_duration_us': np.float64(27.70397874241174), 'min_duration_us': np.float64(1430.485), 'max_duration_us': np.float64(1511.565)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(1476.83)}]",0.7000352830568803,84.27161412180784 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (1, 128, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (128, 1, 1, 1, 1), ())","('', '', '1')",1,70,209.78906947544644,209.78906947544644,214.557373046875,214.557373046875,19.51384590754042,19.51384590754042,177.30322265625,177.30322265625,244.1220703125,244.1220703125,14685.23486328125,14685.23486328125,16266,"['aten::add_', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(14685.235), 'mean_duration_us': np.float64(209.78907142857145), 'median_duration_us': np.float64(214.5575), 'std_dev_duration_us': np.float64(19.37395957045836), 'min_duration_us': np.float64(177.303), 'max_duration_us': np.float64(244.122)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.79)}]",0.6960998836012063,84.96771400540905 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,60,235.86919759114582,235.86919759114582,234.7265625,234.7265625,16.57849384939928,16.57849384939928,197.97216796875,197.97216796875,281.89697265625,281.89697265625,14152.15185546875,14152.15185546875,16267,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_24', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(3840.8520000000003), 'mean_duration_us': np.float64(64.0142), 'median_duration_us': np.float64(61.6105), 'std_dev_duration_us': np.float64(6.60053405112041), 'min_duration_us': np.float64(53.398), 'max_duration_us': np.float64(97.223)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10311.298999999999), 'mean_duration_us': np.float64(171.8549833333333), 'median_duration_us': np.float64(173.136), 'std_dev_duration_us': np.float64(12.893305696486665), 'min_duration_us': np.float64(144.574), 'max_duration_us': np.float64(211.113)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.85)}]",0.6708310320545483,85.6385450374636 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,10,1360.63681640625,1360.63681640625,1359.61962890625,1359.61962890625,36.685556845731355,36.685556845731355,1282.78515625,1282.78515625,1423.033203125,1423.033203125,13606.3681640625,13606.3681640625,16284,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(13606.367), 'mean_duration_us': np.float64(1360.6367), 'median_duration_us': np.float64(1359.6195), 'std_dev_duration_us': np.float64(34.80297067794641), 'min_duration_us': np.float64(1282.785), 'max_duration_us': np.float64(1423.033)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1360.64)}]",0.6449601510236106,86.28350518848721 -triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (128,), (1, 24, 7425, 1), (1, 24, 7425, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (178200, 1, 24, 178200), (22809600, 950400, 128, 2, 1), (), ())","('', '', '', '', '', '178200', '128')",1,160,80.52618713378907,80.52618713378907,80.158203125,80.158203125,4.722485689939179,4.722485689939179,64.294921875,64.294921875,97.14404296875,97.14404296875,12884.18994140625,12884.18994140625,8852,"['triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(12884.190999999999), 'mean_duration_us': np.float64(80.52619374999999), 'median_duration_us': np.float64(80.158), 'std_dev_duration_us': np.float64(4.7077055272405195), 'min_duration_us': np.float64(64.295), 'max_duration_us': np.float64(97.144)}]","[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack...', 'stream': 0, 'mean_duration_us': np.float64(80.53)}]",0.6107279319674955,86.8942331204547 -triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 24, 7431, 128), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 951168, 128, 1), (22828032, 3072, 128, 1), ())","('', '', '22828032')",1,480,24.869404093424478,24.869404093424478,25.35693359375,25.35693359375,2.5455756263902543,2.5455756263902543,18.70703125,18.70703125,35.85302734375,35.85302734375,11937.31396484375,11937.31396484375,8862,"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'count': 480, 'total_duration_us': np.float64(11937.310000000001), 'mean_duration_us': np.float64(24.869395833333336), 'median_duration_us': np.float64(25.357), 'std_dev_duration_us': np.float64(2.5429265222343016), 'min_duration_us': np.float64(18.707), 'max_duration_us': np.float64(35.853)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'mean_duration_us': np.float64(24.87)}]",0.5658447371663018,87.460077857621 -triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",1,152,77.69896175986842,77.69896175986842,79.27685546875,79.27685546875,5.519513208278738,5.519513208278738,68.541015625,68.541015625,110.56396484375,110.56396484375,11810.2421875,11810.2421875,9562,"['triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(11810.244), 'mean_duration_us': np.float64(77.69897368421053), 'median_duration_us': np.float64(79.277), 'std_dev_duration_us': np.float64(5.5013074868704575), 'min_duration_us': np.float64(68.541), 'max_duration_us': np.float64(110.564)}]","[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'mean_duration_us': np.float64(77.7)}]",0.5598213640135064,88.0198992216345 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240),)","('c10::BFloat16',)","((125337600, 979200, 57600, 240, 1),)","('',)",1,60,181.23169759114583,181.23169759114583,185.97509765625,185.97509765625,17.872211160860086,17.872211160860086,144.5341796875,144.5341796875,210.23095703125,210.23095703125,10873.90185546875,10873.90185546875,16271,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10873.901), 'mean_duration_us': np.float64(181.23168333333334), 'median_duration_us': np.float64(185.97500000000002), 'std_dev_duration_us': np.float64(17.72266507563283), 'min_duration_us': np.float64(144.534), 'max_duration_us': np.float64(210.231)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(181.23)}]",0.5154375729331345,88.53533679456764 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,5,1852.3478515625,1974.61630859375,1866.2080078125,1988.9501953125,38.71382082119963,38.92279256154899,1785.1279296875,1906.14697265625,1883.35400390625,2002.44921875,9261.7392578125,9873.08154296875,24076,"['aten::miopen_convolution', 'nn.Module: Conv3d_29', 'nn.Module: HunyuanVideoCausalConv3d_28', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.833999999999996), 'mean_duration_us': np.float64(5.166799999999999), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.21052353787640943), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.367)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(602.692), 'mean_duration_us': np.float64(120.5384), 'median_duration_us': np.float64(121.78), 'std_dev_duration_us': np.float64(2.112858594416579), 'min_duration_us': np.float64(117.093), 'max_duration_us': np.float64(122.662)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(605.4540000000001), 'mean_duration_us': np.float64(121.09080000000002), 'median_duration_us': np.float64(121.86), 'std_dev_duration_us': np.float64(2.0797206927854526), 'min_duration_us': np.float64(117.053), 'max_duration_us': np.float64(122.982)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(919.682), 'mean_duration_us': np.float64(183.9364), 'median_duration_us': np.float64(184.353), 'std_dev_duration_us': np.float64(0.5806870413570518), 'min_duration_us': np.float64(183.152), 'max_duration_us': np.float64(184.513)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(7108.077), 'mean_duration_us': np.float64(1421.6154000000001), 'median_duration_us': np.float64(1432.568), 'std_dev_duration_us': np.float64(30.52483036218219), 'min_duration_us': np.float64(1363.064), 'max_duration_us': np.float64(1451.756)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.17)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(120.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.09)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(183.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1421.62)}]",0.43901889750692585,88.97435569207457 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((33177600, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,50,181.9982421875,181.9982421875,182.25,182.25,10.907357150483445,10.907357150483445,159.8359375,159.8359375,207.18701171875,207.18701171875,9099.912109375,9099.912109375,16130,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(9099.913), 'mean_duration_us': np.float64(181.99826000000002), 'median_duration_us': np.float64(182.25), 'std_dev_duration_us': np.float64(10.797747462892435), 'min_duration_us': np.float64(159.836), 'max_duration_us': np.float64(207.187)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.0)}]",0.43134807301963607,89.4057037650942 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '7431', '3072')",1,156,58.29872796474359,58.29872796474359,57.64453125,57.64453125,2.421970207712263,2.421970207712263,54.9609375,54.9609375,65.376953125,65.376953125,9094.6015625,9094.6015625,9541,"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(9094.601), 'mean_duration_us': np.float64(58.29872435897436), 'median_duration_us': np.float64(57.6445), 'std_dev_duration_us': np.float64(2.414204855491438), 'min_duration_us': np.float64(54.961), 'max_duration_us': np.float64(65.377)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(58.3)}]",0.4310963459552778,89.83680011104948 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 18432), (1, 18432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (18432, 1))","('', '', '')",1,160,54.699826049804685,54.699826049804685,55.56103515625,55.56103515625,4.2111945588866115,4.2111945588866115,41.2998046875,41.2998046875,65.09619140625,65.09619140625,8751.97216796875,8751.97216796875,8845,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(8751.971), 'mean_duration_us': np.float64(54.69981875), 'median_duration_us': np.float64(55.561), 'std_dev_duration_us': np.float64(4.198013704229471), 'min_duration_us': np.float64(41.3), 'max_duration_us': np.float64(65.096)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(54.7)}]",0.41485525183100824,90.2516553628805 -triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (1, 24, 7425, 64, 2), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178200, 1, 24, 178200), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (3072, 1), (1,), (178200, 1, 24, 178200), (1,), (22809600, 950400, 128, 2, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",1,80,107.70609130859376,107.70609130859376,110.1025390625,110.1025390625,7.575080293499654,7.575080293499654,86.68798828125,86.68798828125,119.01611328125,119.01611328125,8616.4873046875,8616.4873046875,8859,"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(8616.487000000001), 'mean_duration_us': np.float64(107.70608750000001), 'median_duration_us': np.float64(110.10249999999999), 'std_dev_duration_us': np.float64(7.527556552749621), 'min_duration_us': np.float64(86.688), 'max_duration_us': np.float64(119.016)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split...', 'stream': 0, 'mean_duration_us': np.float64(107.71)}]",0.40843308708949516,90.66008844996999 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((250675200, 979200, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,10,816.624658203125,1035.260546875,821.49951171875,1037.740478515625,13.611841405893097,15.841530677576912,789.33203125,1010.580078125,830.23291015625,1056.046875,8166.24658203125,10352.60546875,16288,"['aten::miopen_convolution', 'nn.Module: Conv3d_30', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(8166.246999999999), 'mean_duration_us': np.float64(816.6247), 'median_duration_us': np.float64(821.4995), 'std_dev_duration_us': np.float64(12.913326426990064), 'min_duration_us': np.float64(789.332), 'max_duration_us': np.float64(830.233)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(816.62)}]",0.38709107127896214,91.04717952124895 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,20,408.019287109375,408.019287109375,403.9189453125,403.9189453125,20.21189608764834,20.21189608764834,375.23583984375,375.23583984375,439.171875,439.171875,8160.3857421875,8160.3857421875,16099,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(8160.385999999999), 'mean_duration_us': np.float64(408.01929999999993), 'median_duration_us': np.float64(403.919), 'std_dev_duration_us': np.float64(19.700116299402907), 'min_duration_us': np.float64(375.236), 'max_duration_us': np.float64(439.172)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(408.02)}]",0.386813259587762,91.43399278083672 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 14336))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,64,121.13964080810547,121.13964080810547,121.31884765625,121.31884765625,1.1772421975752645,1.1772421975752645,118.65576171875,118.65576171875,123.3818359375,123.3818359375,7752.93701171875,7752.93701171875,356,"['aten::mm', 'nn.Module: Linear_4', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(7752.939), 'mean_duration_us': np.float64(121.139671875), 'median_duration_us': np.float64(121.319), 'std_dev_duration_us': np.float64(1.1680273174069968), 'min_duration_us': np.float64(118.656), 'max_duration_us': np.float64(123.382)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(121.14)}]",0.3674996417605165,91.80149242259724 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (129, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((57600, 7430400, 240, 1), (57600, 7430400, 240, 1), ())","('', '', 'False')",1,1,6620.17578125,6620.17578125,6620.17578125,6620.17578125,,,6620.17578125,6620.17578125,6620.17578125,6620.17578125,6620.17578125,6620.17578125,24640,['aten::copy_'],"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6620.176), 'mean_duration_us': np.float64(6620.176), 'median_duration_us': np.float64(6620.176), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6620.176), 'max_duration_us': np.float64(6620.176)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(6620.18)}]",0.31380523591557846,92.11529765851282 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",1,76,73.8177425986842,73.8177425986842,72.9482421875,72.9482421875,6.743495096271407,6.743495096271407,67.97998046875,67.97998046875,115.65087890625,115.65087890625,5610.1484375,5610.1484375,8904,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5610.146000000001), 'mean_duration_us': np.float64(73.81771052631579), 'median_duration_us': np.float64(72.948), 'std_dev_duration_us': np.float64(6.698992855991566), 'min_duration_us': np.float64(67.98), 'max_duration_us': np.float64(115.651)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(73.82)}]",0.2659285813735131,92.38122623988633 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '7425', '3072')",1,76,72.4171078330592,72.4171078330592,72.7470703125,72.7470703125,1.6808137308604874,1.6808137308604874,67.17919921875,67.17919921875,74.75,74.75,5503.7001953125,5503.7001953125,8878,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5503.700000000001), 'mean_duration_us': np.float64(72.41710526315791), 'median_duration_us': np.float64(72.747), 'std_dev_duration_us': np.float64(1.6697369126124988), 'min_duration_us': np.float64(67.179), 'max_duration_us': np.float64(74.75)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(72.42)}]",0.26088279152499344,92.64210903141132 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,70,74.988134765625,74.988134765625,74.81005859375,74.81005859375,4.709485432780471,4.709485432780471,66.658203125,66.658203125,92.3759765625,92.3759765625,5249.16943359375,5249.16943359375,16122,"['aten::add_', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(5249.169999999999), 'mean_duration_us': np.float64(74.98814285714285), 'median_duration_us': np.float64(74.81), 'std_dev_duration_us': np.float64(4.675748671254123), 'min_duration_us': np.float64(66.658), 'max_duration_us': np.float64(92.376)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(74.99)}]",0.24881769108534277,92.89092672249667 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (1, 128, 17, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (125337600, 979200, 57600, 240, 1), ())","('', '', '1')",1,30,174.19246419270834,174.19246419270834,175.199462890625,175.199462890625,13.554415174253906,13.554415174253906,145.6162109375,145.6162109375,203.4208984375,203.4208984375,5225.77392578125,5225.77392578125,16293,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(5225.774), 'mean_duration_us': np.float64(174.1924666666667), 'median_duration_us': np.float64(175.1995), 'std_dev_duration_us': np.float64(13.326603204951446), 'min_duration_us': np.float64(145.616), 'max_duration_us': np.float64(203.421)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(174.19)}]",0.24770871254896315,93.13863543504563 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,4962.44921875,5200.56201171875,4962.44921875,5200.56201171875,,,4962.44921875,5200.56201171875,4962.44921875,5200.56201171875,4962.44921875,5200.56201171875,24045,"['aten::miopen_convolution', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.823), 'mean_duration_us': np.float64(231.823), 'median_duration_us': np.float64(231.823), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.823), 'max_duration_us': np.float64(231.823)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(289.149), 'mean_duration_us': np.float64(289.149), 'median_duration_us': np.float64(289.149), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(289.149), 'max_duration_us': np.float64(289.149)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(421.745), 'mean_duration_us': np.float64(421.745), 'median_duration_us': np.float64(421.745), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(421.745), 'max_duration_us': np.float64(421.745)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4014.525), 'mean_duration_us': np.float64(4014.525), 'median_duration_us': np.float64(4014.525), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4014.525), 'max_duration_us': np.float64(4014.525)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.21)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.82)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(289.15)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(421.74)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4014.52)}]",0.2352267672739784,93.3738622023196 -triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (), ())","('', '', '', '178344', '128')",1,320,15.365415954589844,15.365415954589844,15.86279296875,15.86279296875,1.6736543542812599,1.6736543542812599,12.2978515625,12.2978515625,18.26611328125,18.26611328125,4916.93310546875,4916.93310546875,9521,"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(4916.939), 'mean_duration_us': np.float64(15.365434375000001), 'median_duration_us': np.float64(15.863), 'std_dev_duration_us': np.float64(1.6710358301644401), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(18.266)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'mean_duration_us': np.float64(15.37)}]",0.23306924228700807,93.6069314446066 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((250675200, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,484.24150390625,484.24150390625,482.014404296875,482.014404296875,6.429982929902523,6.429982929902523,478.34765625,478.34765625,497.89697265625,497.89697265625,4842.4150390625,4842.4150390625,16252,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_23', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1702.721), 'mean_duration_us': np.float64(170.2721), 'median_duration_us': np.float64(170.913), 'std_dev_duration_us': np.float64(1.7133133076002158), 'min_duration_us': np.float64(167.448), 'max_duration_us': np.float64(172.015)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3139.6940000000004), 'mean_duration_us': np.float64(313.96940000000006), 'median_duration_us': np.float64(313.004), 'std_dev_duration_us': np.float64(5.32169548546326), 'min_duration_us': np.float64(306.614), 'max_duration_us': np.float64(326.043)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(170.27)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(313.97)}]",0.22953698571539013,93.83646843032199 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 9216), (1, 9216))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (9216, 1))","('', '', '')",1,160,29.782489013671874,29.782489013671874,32.04638671875,32.04638671875,4.091631975479052,4.091631975479052,23.23291015625,23.23291015625,35.2119140625,35.2119140625,4765.1982421875,4765.1982421875,9511,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(4765.2), 'mean_duration_us': np.float64(29.7825), 'median_duration_us': np.float64(32.046499999999995), 'std_dev_duration_us': np.float64(4.07881045618695), 'min_duration_us': np.float64(23.233), 'max_duration_us': np.float64(35.212)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(29.78)}]",0.22587680568986376,94.06234523601185 -triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), ())","('', '', '', '', '22828032')",1,156,29.14972393329327,29.14972393329327,30.0439453125,30.0439453125,2.8026065809675935,2.8026065809675935,23.994140625,23.994140625,35.61181640625,35.61181640625,4547.35693359375,4547.35693359375,9542,"['triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(4547.359), 'mean_duration_us': np.float64(29.149737179487182), 'median_duration_us': np.float64(30.044), 'std_dev_duration_us': np.float64(2.7936151105786897), 'min_duration_us': np.float64(23.994), 'max_duration_us': np.float64(35.612)}]","[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'mean_duration_us': np.float64(29.15)}]",0.2155508346742554,94.27789607068611 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((9216000, 18000, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,70,59.625376674107144,59.625376674107144,60.569091796875,60.569091796875,6.965243076949578,6.965243076949578,47.669921875,47.669921875,72.787109375,72.787109375,4173.7763671875,4173.7763671875,15965,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(4173.776), 'mean_duration_us': np.float64(59.62537142857143), 'median_duration_us': np.float64(60.569), 'std_dev_duration_us': np.float64(6.915321565028997), 'min_duration_us': np.float64(47.67), 'max_duration_us': np.float64(72.787)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(59.63)}]",0.19784261337496334,94.47573868406107 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((250675200, 979200, 57600, 240, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,10,413.60576171875,413.60576171875,415.716552734375,415.716552734375,17.691055029252162,17.691055029252162,379.80419921875,379.80419921875,437.4091796875,437.4091796875,4136.0576171875,4136.0576171875,16251,"['aten::add_', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4136.057), 'mean_duration_us': np.float64(413.60569999999996), 'median_duration_us': np.float64(415.7165), 'std_dev_duration_us': np.float64(16.783204271234982), 'min_duration_us': np.float64(379.804), 'max_duration_us': np.float64(437.409)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(413.61)}]",0.19605469389468091,94.67179337795575 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,4078.21533203125,4188.41845703125,4078.21533203125,4188.41845703125,,,4078.21533203125,4188.41845703125,4078.21533203125,4188.41845703125,4078.21533203125,4188.41845703125,24060,"['aten::miopen_convolution', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(121.139), 'mean_duration_us': np.float64(121.139), 'median_duration_us': np.float64(121.139), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(121.139), 'max_duration_us': np.float64(121.139)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(137.964), 'mean_duration_us': np.float64(137.964), 'median_duration_us': np.float64(137.964), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(137.964), 'max_duration_us': np.float64(137.964)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(424.83), 'mean_duration_us': np.float64(424.83), 'median_duration_us': np.float64(424.83), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(424.83), 'max_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3388.955), 'mean_duration_us': np.float64(3388.955), 'median_duration_us': np.float64(3388.955), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3388.955), 'max_duration_us': np.float64(3388.955)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.33)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(137.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(3388.96)}]",0.19331289178260377,94.86510626973835 -aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((7372800, 14400, 3600, 60, 1), (), (), (), ())","('', '[8, 120, 120]', '2.', '2.', '2.')",1,10,397.7623046875,397.7623046875,397.570068359375,397.570068359375,9.699321350901494,9.699321350901494,382.1669921875,382.1669921875,415.296875,415.296875,3977.623046875,3977.623046875,16090,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3977.623), 'mean_duration_us': np.float64(397.7623), 'median_duration_us': np.float64(397.57000000000005), 'std_dev_duration_us': np.float64(9.20156966011779), 'min_duration_us': np.float64(382.167), 'max_duration_us': np.float64(415.297)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(397.76)}]",0.18854468217340456,95.05365095191175 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 14336), (14336, 4096))","('c10::BFloat16', 'c10::BFloat16')","((14336, 1), (1, 14336))","('', '')",1,32,114.64051818847656,114.64051818847656,114.78955078125,114.78955078125,0.8912301955518536,0.8912301955518536,111.2841796875,111.2841796875,115.85107421875,115.85107421875,3668.49658203125,3668.49658203125,376,"['aten::mm', 'nn.Module: Linear_6', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(3668.496), 'mean_duration_us': np.float64(114.6405), 'median_duration_us': np.float64(114.7895), 'std_dev_duration_us': np.float64(0.8772184733576919), 'min_duration_us': np.float64(111.284), 'max_duration_us': np.float64(115.851)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(114.64)}]",0.17389167197648717,95.22754262388824 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 12288), (12288, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",1,80,45.75550537109375,45.75550537109375,45.70703125,45.70703125,2.739651795895817,2.739651795895817,37.97607421875,37.97607421875,50.033203125,50.033203125,3660.4404296875,3660.4404296875,8882,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(3660.44), 'mean_duration_us': np.float64(45.7555), 'median_duration_us': np.float64(45.707), 'std_dev_duration_us': np.float64(2.722449365920329), 'min_duration_us': np.float64(37.976), 'max_duration_us': np.float64(50.033)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]",0.17350979952017528,95.40105242340842 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((9840640, 19220, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,7,496.45849609375,510.81619698660717,495.29150390625,509.83251953125,13.830426333897373,13.800335108151545,477.9052734375,492.72607421875,516.3623046875,530.703125,3475.20947265625,3575.71337890625,23767,"['aten::miopen_convolution', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(66.21100000000001), 'mean_duration_us': np.float64(9.458714285714288), 'median_duration_us': np.float64(9.533), 'std_dev_duration_us': np.float64(0.6017806231238647), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(10.455)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(90.72800000000001), 'mean_duration_us': np.float64(12.961142857142859), 'median_duration_us': np.float64(13.098), 'std_dev_duration_us': np.float64(0.5008011948215517), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(13.699)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(97.979), 'mean_duration_us': np.float64(13.997), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.6984055309877533), 'min_duration_us': np.float64(12.497), 'max_duration_us': np.float64(14.902)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(129.225), 'mean_duration_us': np.float64(18.460714285714285), 'median_duration_us': np.float64(18.547), 'std_dev_duration_us': np.float64(0.45106404812421497), 'min_duration_us': np.float64(17.705), 'max_duration_us': np.float64(19.188)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(3091.066), 'mean_duration_us': np.float64(441.5808571428571), 'median_duration_us': np.float64(442.336), 'std_dev_duration_us': np.float64(14.279286921257372), 'min_duration_us': np.float64(420.664), 'max_duration_us': np.float64(462.647)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.46)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.0)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(18.46)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(441.58)}]",0.16472960302831047,95.56578202643672 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,50,66.230859375,66.230859375,65.91552734375,65.91552734375,2.1482493381519303,2.1482493381519303,62.89111328125,62.89111328125,72.10595703125,72.10595703125,3311.54296875,3311.54296875,16123,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_18', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(1023.592), 'mean_duration_us': np.float64(20.47184), 'median_duration_us': np.float64(20.409), 'std_dev_duration_us': np.float64(0.5652406340665894), 'min_duration_us': np.float64(19.348), 'max_duration_us': np.float64(22.072)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2287.949), 'mean_duration_us': np.float64(45.75898), 'median_duration_us': np.float64(45.5865), 'std_dev_duration_us': np.float64(1.7036678020083613), 'min_duration_us': np.float64(42.782), 'max_duration_us': np.float64(50.034)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.47)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]",0.15697159061793892,95.72275361705466 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240),)","('c10::BFloat16',)","((250675200, 979200, 57600, 240, 1),)","('',)",1,10,320.531494140625,320.531494140625,319.593994140625,319.593994140625,6.902544584904398,6.902544584904398,310.02001953125,310.02001953125,329.88916015625,329.88916015625,3205.31494140625,3205.31494140625,16256,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3205.315), 'mean_duration_us': np.float64(320.5315), 'median_duration_us': np.float64(319.594), 'std_dev_duration_us': np.float64(6.548297232869021), 'min_duration_us': np.float64(310.02), 'max_duration_us': np.float64(329.889)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(320.53)}]",0.15193623924919356,95.87468985630386 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 7, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((26672128, 104188, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,5,617.39228515625,661.45712890625,602.08984375,645.07275390625,25.11184598708146,25.81166366349123,600.36669921875,644.1923828125,657.73193359375,702.9580078125,3086.96142578125,3307.28564453125,23932,"['aten::miopen_convolution', 'nn.Module: Conv3d_21', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(28.237000000000002), 'mean_duration_us': np.float64(5.6474), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.30903760289000437), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.168)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(130.58700000000002), 'mean_duration_us': np.float64(26.117400000000004), 'median_duration_us': np.float64(26.037), 'std_dev_duration_us': np.float64(0.3254293164421424), 'min_duration_us': np.float64(25.757), 'max_duration_us': np.float64(26.518)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(168.36599999999999), 'mean_duration_us': np.float64(33.673199999999994), 'median_duration_us': np.float64(33.93), 'std_dev_duration_us': np.float64(1.4436774431984447), 'min_duration_us': np.float64(31.045), 'max_duration_us': np.float64(35.292)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(335.37299999999993), 'mean_duration_us': np.float64(67.07459999999999), 'median_duration_us': np.float64(66.578), 'std_dev_duration_us': np.float64(2.3191535179888367), 'min_duration_us': np.float64(64.735), 'max_duration_us': np.float64(71.425)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(2424.399), 'mean_duration_us': np.float64(484.8798), 'median_duration_us': np.float64(472.902), 'std_dev_duration_us': np.float64(19.36392630021093), 'min_duration_us': np.float64(468.335), 'max_duration_us': np.float64(518.73)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.12)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(33.67)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(67.07)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(484.88)}]",0.14632612342759696,96.02101597973146 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,240,12.679276529947916,12.679276529947916,12.77783203125,12.77783203125,0.8926095073379748,0.8926095073379748,8.81201171875,8.81201171875,14.4208984375,14.4208984375,3043.0263671875,3043.0263671875,8855,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(3043.026), 'mean_duration_us': np.float64(12.679274999999999), 'median_duration_us': np.float64(12.778), 'std_dev_duration_us': np.float64(0.8907307764087119), 'min_duration_us': np.float64(8.812), 'max_duration_us': np.float64(14.421)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.68)}]",0.14424354255927246,96.16525952229073 -aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 16, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (235929600, 921600, 57600, 240, 1)), ())","('', '2')",2,10,281.219921875,281.219921875,282.0576171875,282.0576171875,4.5396044607664345,4.5396044607664345,271.841796875,271.841796875,288.26611328125,288.26611328125,2812.19921875,2812.19921875,16235,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(207.33700000000002), 'mean_duration_us': np.float64(20.733700000000002), 'median_duration_us': np.float64(20.628999999999998), 'std_dev_duration_us': np.float64(0.577282781659041), 'min_duration_us': np.float64(19.828), 'max_duration_us': np.float64(21.791)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2604.862), 'mean_duration_us': np.float64(260.4862), 'median_duration_us': np.float64(260.7265), 'std_dev_duration_us': np.float64(4.294674884086099), 'min_duration_us': np.float64(251.293), 'max_duration_us': np.float64(268.077)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(260.49)}]",0.13330202526961024,96.29856154756034 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,10,280.287548828125,280.287548828125,278.37255859375,278.37255859375,9.588244494036497,9.588244494036497,268.47802734375,268.47802734375,296.9609375,296.9609375,2802.87548828125,2802.87548828125,16140,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2802.8759999999997), 'mean_duration_us': np.float64(280.2876), 'median_duration_us': np.float64(278.3725), 'std_dev_duration_us': np.float64(9.096211367377077), 'min_duration_us': np.float64(268.478), 'max_duration_us': np.float64(296.961)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(280.29)}]",0.13286006790532906,96.43142161546567 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 12288), (6, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",1,80,33.6279541015625,33.6279541015625,34.06884765625,34.06884765625,1.7664908669493384,1.7664908669493384,27.759765625,27.759765625,36.69287109375,36.69287109375,2690.236328125,2690.236328125,8880,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2690.236), 'mean_duration_us': np.float64(33.62795), 'median_duration_us': np.float64(34.069), 'std_dev_duration_us': np.float64(1.7554012497147198), 'min_duration_us': np.float64(27.76), 'max_duration_us': np.float64(36.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(33.63)}]",0.12752082021854172,96.5589424356842 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,64,40.10546112060547,40.10546112060547,40.218505859375,40.218505859375,0.53788759861266,0.53788759861266,38.09619140625,38.09619140625,41.10009765625,41.10009765625,2566.74951171875,2566.74951171875,182,"['aten::mm', 'nn.Module: Linear_0', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(2566.749), 'mean_duration_us': np.float64(40.105453125), 'median_duration_us': np.float64(40.218500000000006), 'std_dev_duration_us': np.float64(0.5336704838219316), 'min_duration_us': np.float64(38.096), 'max_duration_us': np.float64(41.1)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(40.11)}]",0.12166737903581981,96.68060981472001 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((66355200, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,6,404.0126953125,404.0126953125,401.8359375,401.8359375,15.147103670447086,15.147103670447086,387.494140625,387.494140625,431.0400390625,431.0400390625,2424.076171875,2424.076171875,24072,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_28', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(2424.076), 'mean_duration_us': np.float64(404.0126666666667), 'median_duration_us': np.float64(401.836), 'std_dev_duration_us': np.float64(13.827378429124671), 'min_duration_us': np.float64(387.494), 'max_duration_us': np.float64(431.04)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(404.01)}]",0.11490447083701699,96.79551428555703 -triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (6, 3072), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (22828032, 3072, 128, 1), ())","('', '', '', '22828032')",1,80,29.719598388671876,29.719598388671876,30.3837890625,30.3837890625,2.0641929601593563,2.0641929601593563,23.39404296875,23.39404296875,32.1669921875,32.1669921875,2377.56787109375,2377.56787109375,8864,"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2377.568), 'mean_duration_us': np.float64(29.719600000000003), 'median_duration_us': np.float64(30.384), 'std_dev_duration_us': np.float64(2.0512508964044356), 'min_duration_us': np.float64(23.394), 'max_duration_us': np.float64(32.167)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'mean_duration_us': np.float64(29.72)}]",0.11269991482809223,96.90821420038513 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120),)","('c10::BFloat16',)","((33177600, 129600, 14400, 120, 1),)","('',)",1,50,46.65314453125,46.65314453125,46.60791015625,46.60791015625,2.3934584387965505,2.3934584387965505,41.86083984375,41.86083984375,52.55712890625,52.55712890625,2332.6572265625,2332.6572265625,16127,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2332.658), 'mean_duration_us': np.float64(46.65316), 'median_duration_us': np.float64(46.608000000000004), 'std_dev_duration_us': np.float64(2.369370678977859), 'min_duration_us': np.float64(41.861), 'max_duration_us': np.float64(52.557)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(46.65)}]",0.11057108987420428,97.01878529025933 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,2317.95849609375,2388.302734375,2317.95849609375,2388.302734375,,,2317.95849609375,2388.302734375,2317.95849609375,2388.302734375,2317.95849609375,2388.302734375,23901,"['aten::miopen_convolution', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.9), 'mean_duration_us': np.float64(13.9), 'median_duration_us': np.float64(13.9), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.9), 'max_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(43.864), 'mean_duration_us': np.float64(43.864), 'median_duration_us': np.float64(43.864), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(43.864), 'max_duration_us': np.float64(43.864)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(59.087), 'mean_duration_us': np.float64(59.087), 'median_duration_us': np.float64(59.087), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(59.087), 'max_duration_us': np.float64(59.087)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.591), 'mean_duration_us': np.float64(129.591), 'median_duration_us': np.float64(129.591), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.591), 'max_duration_us': np.float64(129.591)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2071.517), 'mean_duration_us': np.float64(2071.517), 'median_duration_us': np.float64(2071.517), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2071.517), 'max_duration_us': np.float64(2071.517)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(43.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.09)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(129.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2071.52)}]",0.10987435028075279,97.12865964054008 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((2621440, 5120, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,227.38876953125,233.757177734375,217.4384765625,224.166748046875,21.1918095192224,21.54917892698669,216.39599609375,221.80322265625,267.7119140625,275.68310546875,2273.8876953125,2337.57177734375,23428,"['aten::miopen_convolution', 'nn.Module: Conv3d_2', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.857), 'mean_duration_us': np.float64(4.4857), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.17267370963757053), 'min_duration_us': np.float64(4.365), 'max_duration_us': np.float64(4.846)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(51.626000000000005), 'mean_duration_us': np.float64(5.1626), 'median_duration_us': np.float64(5.167), 'std_dev_duration_us': np.float64(0.17233989671576339), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(58.315), 'mean_duration_us': np.float64(5.8315), 'median_duration_us': np.float64(5.8075), 'std_dev_duration_us': np.float64(0.33862139625251086), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.489)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.341), 'mean_duration_us': np.float64(12.834100000000001), 'median_duration_us': np.float64(12.777999999999999), 'std_dev_duration_us': np.float64(0.3268839090564112), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(13.579)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1990.749), 'mean_duration_us': np.float64(199.0749), 'median_duration_us': np.float64(189.5805), 'std_dev_duration_us': np.float64(19.490014086449502), 'min_duration_us': np.float64(188.359), 'max_duration_us': np.float64(238.514)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.16)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(199.07)}]",0.1077853350501727,97.23644497559025 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,100,16.73724609375,16.73724609375,15.02001953125,15.02001953125,3.7796122821716116,3.7796122821716116,14.6591796875,14.6591796875,28.8408203125,28.8408203125,1673.724609375,1673.724609375,15620,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(522.8009999999999), 'mean_duration_us': np.float64(5.228009999999999), 'median_duration_us': np.float64(5.0665), 'std_dev_duration_us': np.float64(0.4639569483260273), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(7.089)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1150.926), 'mean_duration_us': np.float64(11.50926), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(3.376708283580327), 'min_duration_us': np.float64(9.733), 'max_duration_us': np.float64(22.393)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.51)}]",0.07933679758023893,97.31578177317049 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,70,22.641245814732144,22.641245814732144,22.53271484375,22.53271484375,1.2290221033136148,1.2290221033136148,19.5078125,19.5078125,25.796875,25.796875,1584.88720703125,1584.88720703125,15973,"['aten::add_', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1584.885), 'mean_duration_us': np.float64(22.641214285714284), 'median_duration_us': np.float64(22.5325), 'std_dev_duration_us': np.float64(1.2201986828013724), 'min_duration_us': np.float64(19.508), 'max_duration_us': np.float64(25.797)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.64)}]",0.07512578522622196,97.3909075583967 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((2304000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,100,15.3385302734375,15.3385302734375,14.760986328125,14.760986328125,1.4763561330175836,1.4763561330175836,13.85888671875,13.85888671875,19.4677734375,19.4677734375,1533.85302734375,1533.85302734375,15626,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1533.8520000000003), 'mean_duration_us': np.float64(15.338520000000003), 'median_duration_us': np.float64(14.761), 'std_dev_duration_us': np.float64(1.4689585322942238), 'min_duration_us': np.float64(13.859), 'max_duration_us': np.float64(19.468)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(15.34)}]",0.07270669647000617,97.46361425486671 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,2,753.759033203125,753.759033203125,753.759033203125,753.759033203125,100.95503002861471,100.95503002861471,682.373046875,682.373046875,825.14501953125,825.14501953125,1507.51806640625,1507.51806640625,24041,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(1507.518), 'mean_duration_us': np.float64(753.759), 'median_duration_us': np.float64(753.759), 'std_dev_duration_us': np.float64(71.38599999999997), 'min_duration_us': np.float64(682.373), 'max_duration_us': np.float64(825.145)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(753.76)}]",0.07145838390204905,97.53507263876877 -aten::_efficient_attention_forward,SDPA_fwd,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 351, 32, 128), (1, 351, 32, 128), (1, 351, 32, 128), (1, 32, 351, 351), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '')","((1437696, 4096, 128, 1), (1437696, 128, 44928, 1), (1437696, 128, 44928, 1), (123552, 0, 352, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '0.088388347648318447', '', '')",1,32,44.925689697265625,44.925689697265625,44.74560546875,44.74560546875,0.8824982727758616,0.8824982727758616,44.22412109375,44.22412109375,49.51220703125,49.51220703125,1437.6220703125,1437.6220703125,302,"['aten::_efficient_attention_forward', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(1437.6219999999998), 'mean_duration_us': np.float64(44.925687499999995), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(0.8685557494160925), 'min_duration_us': np.float64(44.224), 'max_duration_us': np.float64(49.512)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(44.93)}]",0.0681452196797522,97.60321785844852 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,60,23.897591145833335,23.897591145833335,24.234130859375,24.234130859375,1.770591998505488,1.770591998505488,20.869140625,20.869140625,27.318359375,27.318359375,1433.85546875,1433.85546875,15974,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(445.928), 'mean_duration_us': np.float64(7.432133333333334), 'median_duration_us': np.float64(7.4704999999999995), 'std_dev_duration_us': np.float64(0.4628981337424275), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.451)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(987.925), 'mean_duration_us': np.float64(16.465416666666666), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(1.3029620650869138), 'min_duration_us': np.float64(14.14), 'max_duration_us': np.float64(18.867)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(7.43)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(16.47)}]",0.06796667769975404,97.67118453614827 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (1, 256, 9, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', '1')",1,30,47.671142578125,47.671142578125,47.449462890625,47.449462890625,1.3206365016932746,1.3206365016932746,45.70703125,45.70703125,49.953125,49.953125,1430.13427734375,1430.13427734375,16149,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(1430.1350000000002), 'mean_duration_us': np.float64(47.67116666666667), 'median_duration_us': np.float64(47.4495), 'std_dev_duration_us': np.float64(1.2984185016994922), 'min_duration_us': np.float64(45.707), 'max_duration_us': np.float64(49.953)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(47.67)}]",0.06779028822223704,97.73897482437052 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 129600, 14400, 120, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,10,135.043701171875,135.043701171875,135.179931640625,135.179931640625,5.501210547895183,5.501210547895183,127.42822265625,127.42822265625,144.1728515625,144.1728515625,1350.43701171875,1350.43701171875,16107,"['aten::add_', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1350.437), 'mean_duration_us': np.float64(135.0437), 'median_duration_us': np.float64(135.18), 'std_dev_duration_us': np.float64(5.218896589318471), 'min_duration_us': np.float64(127.428), 'max_duration_us': np.float64(144.173)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(135.04)}]",0.06401253064182466,97.80298735501233 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,132.519189453125,132.519189453125,130.8125,130.8125,4.220332799620465,4.220332799620465,127.06689453125,127.06689453125,139.68603515625,139.68603515625,1325.19189453125,1325.19189453125,16108,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_17', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(411.72300000000007), 'mean_duration_us': np.float64(41.17230000000001), 'median_duration_us': np.float64(41.321), 'std_dev_duration_us': np.float64(0.6129716225079271), 'min_duration_us': np.float64(40.298), 'max_duration_us': np.float64(42.142)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(913.469), 'mean_duration_us': np.float64(91.3469), 'median_duration_us': np.float64(90.45400000000001), 'std_dev_duration_us': np.float64(3.6463250389947413), 'min_duration_us': np.float64(86.047), 'max_duration_us': np.float64(97.544)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(41.17)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(91.35)}]",0.0628158781334159,97.86580323314575 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,1237.47412109375,1283.5810546875,1237.47412109375,1283.5810546875,,,1237.47412109375,1283.5810546875,1237.47412109375,1283.5810546875,1237.47412109375,1283.5810546875,23916,"['aten::miopen_convolution', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.693), 'mean_duration_us': np.float64(9.693), 'median_duration_us': np.float64(9.693), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.693), 'max_duration_us': np.float64(9.693)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.719), 'mean_duration_us': np.float64(26.719), 'median_duration_us': np.float64(26.719), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.719), 'max_duration_us': np.float64(26.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.848), 'mean_duration_us': np.float64(32.848), 'median_duration_us': np.float64(32.848), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.848), 'max_duration_us': np.float64(32.848)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(135.921), 'mean_duration_us': np.float64(135.921), 'median_duration_us': np.float64(135.921), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(135.921), 'max_duration_us': np.float64(135.921)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1032.293), 'mean_duration_us': np.float64(1032.293), 'median_duration_us': np.float64(1032.293), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1032.293), 'max_duration_us': np.float64(1032.293)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.72)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(32.85)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(135.92)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1032.29)}]",0.05865793769541342,97.92446117084117 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60),)","('c10::BFloat16',)","((9216000, 18000, 3600, 60, 1),)","('',)",1,60,20.029386393229167,20.029386393229167,18.8271484375,18.8271484375,3.3221468251065898,3.3221468251065898,15.4619140625,15.4619140625,26.51904296875,26.51904296875,1201.76318359375,1201.76318359375,15978,"['aten::silu', 'nn.Module: SiLU_5', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(1201.764), 'mean_duration_us': np.float64(20.0294), 'median_duration_us': np.float64(18.826999999999998), 'std_dev_duration_us': np.float64(3.2943422874174244), 'min_duration_us': np.float64(15.462), 'max_duration_us': np.float64(26.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(20.03)}]",0.05696519122806236,97.98142636206923 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,1175.90185546875,1185.7158203125,1175.90185546875,1185.7158203125,,,1175.90185546875,1185.7158203125,1175.90185546875,1185.7158203125,1175.90185546875,1185.7158203125,24166,"['aten::miopen_convolution', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.647), 'mean_duration_us': np.float64(5.647), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.647)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.248), 'mean_duration_us': np.float64(6.248), 'median_duration_us': np.float64(6.248), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.248), 'max_duration_us': np.float64(6.248)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(184.593), 'mean_duration_us': np.float64(184.593), 'median_duration_us': np.float64(184.593), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(184.593), 'max_duration_us': np.float64(184.593)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(974.007), 'mean_duration_us': np.float64(974.007), 'median_duration_us': np.float64(974.007), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(974.007), 'max_duration_us': np.float64(974.007)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(6.25)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(184.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(974.01)}]",0.05573932949243584,98.03716569156167 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 1024))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,64,18.144737243652344,18.144737243652344,17.90478515625,17.90478515625,0.5846290263867382,0.5846290263867382,17.22412109375,17.22412109375,19.42822265625,19.42822265625,1161.26318359375,1161.26318359375,194,"['aten::mm', 'nn.Module: Linear_1', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(1161.262), 'mean_duration_us': np.float64(18.14471875), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.5800629941208434), 'min_duration_us': np.float64(17.224), 'max_duration_us': np.float64(19.428)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(18.14)}]",0.0550454367571046,98.09221112831877 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((66355200, 129600, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,10,113.4955078125,188.670263671875,112.846435546875,189.9599609375,2.544025502241682,4.821601122779749,110.3232421875,179.98583984375,117.85400390625,195.3681640625,1134.955078125,1886.70263671875,16144,"['aten::miopen_convolution', 'nn.Module: Conv3d_22', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO16_SVW4_TSGRA0_TSGRB0_TT4_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW4_VWB2_VFLRP1_WSGRA1_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1134.955), 'mean_duration_us': np.float64(113.49549999999999), 'median_duration_us': np.float64(112.84649999999999), 'std_dev_duration_us': np.float64(2.4135129272494074), 'min_duration_us': np.float64(110.323), 'max_duration_us': np.float64(117.854)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(113.5)}]",0.05379839717448582,98.14600952549326 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120),)","('c10::BFloat16',)","((66355200, 129600, 14400, 120, 1),)","('',)",1,10,106.256689453125,106.256689453125,105.9365234375,105.9365234375,3.7388532278256914,3.7388532278256914,101.18896484375,101.18896484375,114.52880859375,114.52880859375,1062.56689453125,1062.56689453125,16112,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1062.567), 'mean_duration_us': np.float64(106.2567), 'median_duration_us': np.float64(105.9365), 'std_dev_duration_us': np.float64(3.547052806204047), 'min_duration_us': np.float64(101.189), 'max_duration_us': np.float64(114.529)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(106.26)}]",0.05036709991279169,98.19637662540605 -aten::addmm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((3072,), (6, 3072), (3072, 3072), (), (), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",1,80,11.99677734375,11.99677734375,12.01708984375,12.01708984375,0.7928533757608454,0.7928533757608454,8.89208984375,8.89208984375,13.17822265625,13.17822265625,959.7421875,959.7421875,8861,"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(959.742), 'mean_duration_us': np.float64(11.996775), 'median_duration_us': np.float64(12.017), 'std_dev_duration_us': np.float64(0.7878753228620631), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(13.178)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.0)}]",0.04549307050419506,98.24186969591024 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,110,7.681316583806818,7.681316583806818,7.60986328125,7.60986328125,0.5012591425966126,0.5012591425966126,6.68896484375,6.68896484375,9.3720703125,9.3720703125,844.94482421875,844.94482421875,15619,"['aten::add_', 'nn.Module: Conv3d_1', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 110, 'total_duration_us': np.float64(844.944), 'mean_duration_us': np.float64(7.681309090909091), 'median_duration_us': np.float64(7.61), 'std_dev_duration_us': np.float64(0.4989875157019925), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.372)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.68)}]",0.0400515210865817,98.28192121699682 -aten::_efficient_attention_forward,SDPA_fwd,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 2700, 1, 512), (1, 2700, 1, 512), (1, 2700, 1, 512), (1, 1, 2700, 2700), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', '', '', '')","((1382400, 512, 512, 1), (1382400, 512, 512, 1), (1382400, 512, 512, 1), (7300800, 7300800, 2704, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '', '', '')",1,1,841.208984375,841.208984375,841.208984375,841.208984375,,,841.208984375,841.208984375,841.208984375,841.208984375,841.208984375,841.208984375,23564,"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(841.209), 'mean_duration_us': np.float64(841.209), 'median_duration_us': np.float64(841.209), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(841.209), 'max_duration_us': np.float64(841.209)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(841.21)}]",0.03987443725342562,98.32179565425025 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (1, 128, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (128, 1, 1, 1, 1), ())","('', '', '1')",1,7,119.77120535714286,119.77120535714286,119.3759765625,119.3759765625,9.28833478021703,9.28833478021703,109.201171875,109.201171875,136.2412109375,136.2412109375,838.3984375,838.3984375,24064,"['aten::add_', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(838.398), 'mean_duration_us': np.float64(119.77114285714286), 'median_duration_us': np.float64(119.376), 'std_dev_duration_us': np.float64(8.599330811648274), 'min_duration_us': np.float64(109.201), 'max_duration_us': np.float64(136.241)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(119.77)}]",0.039741213551472095,98.36153686780172 -triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 3072), (3072,), (1, 24, 6, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (144, 1, 24, 144), (), ())","('', '', '', '144', '128')",1,160,5.227825927734375,5.227825927734375,5.287109375,5.287109375,0.44083111616836695,0.44083111616836695,3.00390625,3.00390625,6.087890625,6.087890625,836.4521484375,836.4521484375,8856,"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(836.449), 'mean_duration_us': np.float64(5.2278062499999995), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.43945555089330424), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]",0.03964895683222492,98.40118582463394 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30),)","('c10::BFloat16',)","((2304000, 4500, 900, 30, 1),)","('',)",1,100,7.666044921875,7.666044921875,7.6298828125,7.6298828125,1.0174137084075794,1.0174137084075794,5.88818359375,5.88818359375,9.85302734375,9.85302734375,766.6044921875,766.6044921875,15624,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(766.604), 'mean_duration_us': np.float64(7.666040000000001), 'median_duration_us': np.float64(7.630000000000001), 'std_dev_duration_us': np.float64(1.012318496521722), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(9.853)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.67)}]",0.03633808398353707,98.43752390861748 -aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 8, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (58982400, 115200, 14400, 120, 1)), ())","('', '2')",2,10,72.501708984375,72.501708984375,72.02490234375,72.02490234375,2.7954535278924006,2.7954535278924006,68.25927734375,68.25927734375,76.7919921875,76.7919921875,725.01708984375,725.01708984375,16091,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.589), 'mean_duration_us': np.float64(13.4589), 'median_duration_us': np.float64(13.018), 'std_dev_duration_us': np.float64(1.186606796710688), 'min_duration_us': np.float64(12.177), 'max_duration_us': np.float64(15.983)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(590.428), 'mean_duration_us': np.float64(59.0428), 'median_duration_us': np.float64(58.646), 'std_dev_duration_us': np.float64(2.601411878192303), 'min_duration_us': np.float64(55.481), 'max_duration_us': np.float64(63.734)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(59.04)}]",0.03436678517897083,98.47189069379645 -aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((14745600, 57600, 14400, 120, 1), (), (), (), ())","('', '[8, 240, 240]', '2.', '2.', '2.')",1,1,686.5791015625,686.5791015625,686.5791015625,686.5791015625,,,686.5791015625,686.5791015625,686.5791015625,686.5791015625,686.5791015625,686.5791015625,24032,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(686.579), 'mean_duration_us': np.float64(686.579), 'median_duration_us': np.float64(686.579), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(686.579), 'max_duration_us': np.float64(686.579)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(686.58)}]",0.032544772836809066,98.50443546663327 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,113.753662109375,113.753662109375,113.967041015625,113.967041015625,2.8280491391961675,2.8280491391961675,110.162109375,110.162109375,116.9716796875,116.9716796875,682.52197265625,682.52197265625,24065,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_24', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(206.863), 'mean_duration_us': np.float64(34.47716666666667), 'median_duration_us': np.float64(34.67100000000001), 'std_dev_duration_us': np.float64(0.5376580129495795), 'min_duration_us': np.float64(33.73), 'max_duration_us': np.float64(35.131)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(475.659), 'mean_duration_us': np.float64(79.2765), 'median_duration_us': np.float64(79.3965), 'std_dev_duration_us': np.float64(2.7204514178104104), 'min_duration_us': np.float64(75.271), 'max_duration_us': np.float64(82.281)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(34.48)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(79.28)}]",0.03235245946996893,98.53678792610323 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,1,671.7568359375,671.7568359375,671.7568359375,671.7568359375,,,671.7568359375,671.7568359375,671.7568359375,671.7568359375,671.7568359375,671.7568359375,24082,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(671.757), 'mean_duration_us': np.float64(671.757), 'median_duration_us': np.float64(671.757), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(671.757), 'max_duration_us': np.float64(671.757)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(671.76)}]",0.031842177510801234,98.56863010361403 -aten::copy_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 4, 351, 128), (1, 8, 4, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 179712, 44928, 128, 1), (359424, 44928, 0, 128, 1), ())","('', '', 'False')",1,64,9.871139526367188,9.871139526367188,10.4345703125,10.4345703125,1.5825210598707937,1.5825210598707937,7.208984375,7.208984375,12.6982421875,12.6982421875,631.7529296875,631.7529296875,259,"['aten::copy_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(631.752), 'mean_duration_us': np.float64(9.871125), 'median_duration_us': np.float64(10.4345), 'std_dev_duration_us': np.float64(1.5701190788838277), 'min_duration_us': np.float64(7.209), 'max_duration_us': np.float64(12.698)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}]",0.029945938550820683,98.59857604216485 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((18432000, 72000, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,5,117.5978515625,117.5978515625,121.09912109375,121.09912109375,6.0791423956177555,6.0791423956177555,110.80419921875,110.80419921875,123.54296875,123.54296875,587.9892578125,587.9892578125,23928,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(587.989), 'mean_duration_us': np.float64(117.5978), 'median_duration_us': np.float64(121.099), 'std_dev_duration_us': np.float64(5.437447540896374), 'min_duration_us': np.float64(110.804), 'max_duration_us': np.float64(123.543)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(117.6)}]",0.027871481643473535,98.62644752380832 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240),)","('c10::BFloat16',)","((66355200, 518400, 57600, 240, 1),)","('',)",1,6,96.74283854166667,96.74283854166667,95.361083984375,95.361083984375,3.415178432280567,3.415178432280567,94.3388671875,94.3388671875,103.15185546875,103.15185546875,580.45703125,580.45703125,24069,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(580.457), 'mean_duration_us': np.float64(96.74283333333334), 'median_duration_us': np.float64(95.361), 'std_dev_duration_us': np.float64(3.117643256086595), 'min_duration_us': np.float64(94.339), 'max_duration_us': np.float64(103.152)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(96.74)}]",0.02751444397385314,98.65396196778218 -aten::pow,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), ())","('float', 'Scalar')","((1437696, 4096, 1), ())","('', '2')",1,65,8.57967998798077,8.57967998798077,5.0869140625,5.0869140625,4.26215138489593,4.26215138489593,4.44482421875,4.44482421875,15.501953125,15.501953125,557.67919921875,557.67919921875,163,"['aten::pow', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(557.6830000000001), 'mean_duration_us': np.float64(8.579738461538463), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(4.22916112531851), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(15.502)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(8.58)}]",0.026434744100255193,98.68039671188244 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 3072), (6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",1,76,7.155408357319079,7.155408357319079,7.10888671875,7.10888671875,0.40602366553147473,0.40602366553147473,6.369140625,6.369140625,8.251953125,8.251953125,543.81103515625,543.81103515625,8906,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(543.8090000000001), 'mean_duration_us': np.float64(7.155381578947369), 'median_duration_us': np.float64(7.109), 'std_dev_duration_us': np.float64(0.40333442331282093), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(8.252)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.16)}]",0.025777374471540125,98.70617408635398 -aten::mean,reduce,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1437696, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",1,65,8.351059194711539,8.351059194711539,8.130859375,8.130859375,0.5903942556171845,0.5903942556171845,7.330078125,7.330078125,9.97412109375,9.97412109375,542.81884765625,542.81884765625,166,"['aten::mean', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(542.82), 'mean_duration_us': np.float64(8.351076923076924), 'median_duration_us': np.float64(8.131), 'std_dev_duration_us': np.float64(0.5858520765699322), 'min_duration_us': np.float64(7.33), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(466.692), 'mean_duration_us': np.float64(233.346), 'median_duration_us': np.float64(233.346), 'std_dev_duration_us': np.float64(22.192999999999998), 'min_duration_us': np.float64(211.153), 'max_duration_us': np.float64(255.539)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(233.35)}]",0.022121823483607694,98.87614524123066 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 12288), (256, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",1,8,58.2354736328125,58.2354736328125,58.4658203125,58.4658203125,0.5537596988904987,0.5537596988904987,57.32421875,57.32421875,58.72607421875,58.72607421875,465.8837890625,465.8837890625,8768,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(465.884), 'mean_duration_us': np.float64(58.2355), 'median_duration_us': np.float64(58.465999999999994), 'std_dev_duration_us': np.float64(0.518025819819823), 'min_duration_us': np.float64(57.324), 'max_duration_us': np.float64(58.726)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(58.24)}]",0.022083518197517863,98.89822875942818 -triton_poi_fused_addmm_gelu_view_14,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((73728, 12288, 1), (1,), ())","('', '', '73728')",1,80,5.645831298828125,5.645831298828125,5.64697265625,5.64697265625,0.1473221720033376,0.1473221720033376,5.3271484375,5.3271484375,6.087890625,6.087890625,451.66650390625,451.66650390625,8881,"['triton_poi_fused_addmm_gelu_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(451.668), 'mean_duration_us': np.float64(5.64585), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.1464002305326054), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",0.021409599759404475,98.91963835918759 -aten::cat,other,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"(((0,), (1, 8, 351, 128)), ())","('TensorList', 'Scalar')","(((1,), (359424, 128, 1024, 1)), ())","('', '-2')",1,64,7.05194091796875,7.05194091796875,6.84912109375,6.84912109375,0.5375223212185637,0.5375223212185637,6.12890625,6.12890625,8.01123046875,8.01123046875,451.32421875,451.32421875,249,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(451.324), 'mean_duration_us': np.float64(7.0519375), 'median_duration_us': np.float64(6.849), 'std_dev_duration_us': np.float64(0.5332750191915518), 'min_duration_us': np.float64(6.129), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(438.54699999999997), 'mean_duration_us': np.float64(6.746876923076923), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(1.7456149589334042), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(9.814)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.75)}]",0.02078775799422288,98.96181949216445 -aten::mul,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 1))","('float', 'float')","((1437696, 4096, 1), (351, 1, 1))","('', '')",1,65,6.6999098557692305,6.6999098557692305,6.68896484375,6.68896484375,0.9702103970057914,0.9702103970057914,5.326171875,5.326171875,8.85205078125,8.85205078125,435.494140625,435.494140625,169,"['aten::mul', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(435.495), 'mean_duration_us': np.float64(6.699923076923077), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.9627103295894487), 'min_duration_us': np.float64(5.326), 'max_duration_us': np.float64(8.852)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.7)}]",0.02064300798866046,98.98246250015312 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((132710400, 518400, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,1,417.77978515625,534.6328125,417.77978515625,534.6328125,,,417.77978515625,534.6328125,417.77978515625,534.6328125,417.77978515625,534.6328125,24086,"['aten::miopen_convolution', 'nn.Module: Conv3d_30', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(417.78), 'mean_duration_us': np.float64(417.78), 'median_duration_us': np.float64(417.78), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(417.78), 'max_duration_us': np.float64(417.78)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(417.78)}]",0.019803323714308166,99.00226582386743 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((2937600, 979200, 240, 1), ())","('', '')",1,76,5.4808349609375,5.4808349609375,5.4482421875,5.4482421875,0.26325786271629587,0.26325786271629587,4.84619140625,4.84619140625,6.2880859375,6.2880859375,416.54345703125,416.54345703125,24177,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(416.541), 'mean_duration_us': np.float64(5.480802631578947), 'median_duration_us': np.float64(5.448), 'std_dev_duration_us': np.float64(0.26152769903300077), 'min_duration_us': np.float64(4.846), 'max_duration_us': np.float64(6.288)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.48)}]",0.01974472009836892,99.0220105439658 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (1, 512, 5, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', '1')",1,30,13.604671223958333,13.604671223958333,13.599609375,13.599609375,0.3944050019152468,0.3944050019152468,12.6982421875,12.6982421875,14.6611328125,14.6611328125,408.14013671875,408.14013671875,16005,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(408.1389999999999), 'mean_duration_us': np.float64(13.60463333333333), 'median_duration_us': np.float64(13.599499999999999), 'std_dev_duration_us': np.float64(0.387789761196565), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(13.6)}]",0.0193463914134106,99.04135693537921 -aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((1843200, 3600, 900, 30, 1), (), (), (), ())","('', '[4, 60, 60]', '1.', '2.', '2.')",1,10,40.4791015625,40.4791015625,40.55908203125,40.55908203125,1.1539596188284338,1.1539596188284338,38.73681640625,38.73681640625,42.98291015625,42.98291015625,404.791015625,404.791015625,15956,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(404.791), 'mean_duration_us': np.float64(40.4791), 'median_duration_us': np.float64(40.559), 'std_dev_duration_us': np.float64(1.0947686011208024), 'min_duration_us': np.float64(38.737), 'max_duration_us': np.float64(42.983)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(40.48)}]",0.019187638569126513,99.06054457394833 -aten::silu,elementwise,nn.Module: SiLUActivation,python3,CPU,thread 416 (python3),"((1, 351, 14336),)","('c10::BFloat16',)","((5031936, 14336, 1),)","('',)",1,32,12.150711059570312,12.150711059570312,12.216796875,12.216796875,0.37123387869406144,0.37123387869406144,10.77490234375,10.77490234375,12.97802734375,12.97802734375,388.82275390625,388.82275390625,358,"['aten::silu', 'nn.Module: SiLUActivation_0', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(388.824), 'mean_duration_us': np.float64(12.15075), 'median_duration_us': np.float64(12.217), 'std_dev_duration_us': np.float64(0.3653646295141334), 'min_duration_us': np.float64(10.775), 'max_duration_us': np.float64(12.978)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(12.15)}]",0.018430721486953825,99.07897529543528 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((4500, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 4500), (1, 512))","('', '')",1,30,12.748746744791667,12.748746744791667,12.177490234375,12.177490234375,1.8363837130001566,1.8363837130001566,10.25390625,10.25390625,16.5029296875,16.5029296875,382.46240234375,382.46240234375,15714,"['aten::mm', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB2_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB0_LBSPPM0_LPA16_LPB0_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(382.4630000000001), 'mean_duration_us': np.float64(12.74876666666667), 'median_duration_us': np.float64(12.1775), 'std_dev_duration_us': np.float64(1.8054999618449796), 'min_duration_us': np.float64(10.254), 'max_duration_us': np.float64(16.503)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.75)}]",0.018129232268460676,99.09710452770375 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (1, 256, 8, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((29491200, 115200, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', 'False')",1,10,38.147509765625,38.147509765625,38.115478515625,38.115478515625,1.4737842299728579,1.4737842299728579,35.57177734375,35.57177734375,40.458984375,40.458984375,381.47509765625,381.47509765625,16232,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(381.476), 'mean_duration_us': np.float64(38.1476), 'median_duration_us': np.float64(38.1155), 'std_dev_duration_us': np.float64(1.3980922859382354), 'min_duration_us': np.float64(35.572), 'max_duration_us': np.float64(40.459)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(38.15)}]",0.018082432698385966,99.11518696040214 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((768,), (77, 768), (768, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",1,48,7.841481526692708,7.841481526692708,7.85009765625,7.85009765625,0.20665183970822962,0.20665183970822962,7.490234375,7.490234375,8.81201171875,8.81201171875,376.39111328125,376.39111328125,7316,"['aten::addmm', 'nn.Module: Linear_224', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(376.39), 'mean_duration_us': np.float64(7.841458333333333), 'median_duration_us': np.float64(7.85), 'std_dev_duration_us': np.float64(0.20446117788932164), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(8.812)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]",0.01784144500124558,99.1330284054034 -aten::mul,elementwise,nn.Module: LlamaMLP,python3,CPU,thread 416 (python3),"((1, 351, 14336), (1, 351, 14336))","('c10::BFloat16', 'c10::BFloat16')","((5031936, 14336, 1), (5031936, 14336, 1))","('', '')",1,32,11.632553100585938,11.632553100585938,11.576171875,11.576171875,0.2792152437804258,0.2792152437804258,11.2158203125,11.2158203125,12.296875,12.296875,372.24169921875,372.24169921875,368,"['aten::mul', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(372.242), 'mean_duration_us': np.float64(11.6325625), 'median_duration_us': np.float64(11.576), 'std_dev_duration_us': np.float64(0.27485666008621656), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(12.297)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(11.63)}]",0.017644757193879177,99.15067316259727 -aten::add,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 32, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 128, 4096, 1), (1437696, 44928, 128, 1), ())","('', '', '1')",1,32,11.448394775390625,11.448394775390625,11.47607421875,11.47607421875,1.1922998197142467,1.1922998197142467,8.4521484375,8.4521484375,13.93896484375,13.93896484375,366.3486328125,366.3486328125,223,"['aten::add', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(366.34899999999993), 'mean_duration_us': np.float64(11.448406249999998), 'median_duration_us': np.float64(11.475999999999999), 'std_dev_duration_us': np.float64(1.1735182641147677), 'min_duration_us': np.float64(8.452), 'max_duration_us': np.float64(13.939)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]",0.017365417920273022,99.16803858051755 -aten::copy_,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",1,65,5.313363882211538,5.313363882211538,4.9658203125,4.9658203125,2.1009148460708174,2.1009148460708174,4.52490234375,4.52490234375,14.78076171875,14.78076171875,345.36865234375,345.36865234375,162,"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(345.373), 'mean_duration_us': np.float64(5.313430769230769), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.0846667541783104), 'min_duration_us': np.float64(4.525), 'max_duration_us': np.float64(14.781)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(5.31)}]",0.01637093862877946,99.18440951914633 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', '1')",1,50,6.78431640625,6.78431640625,6.6689453125,6.6689453125,0.532550223901356,0.532550223901356,5.92822265625,5.92822265625,8.3310546875,8.3310546875,339.2158203125,339.2158203125,15651,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(339.217), 'mean_duration_us': np.float64(6.784339999999999), 'median_duration_us': np.float64(6.6690000000000005), 'std_dev_duration_us': np.float64(0.5272197116952286), 'min_duration_us': np.float64(5.928), 'max_duration_us': np.float64(8.331)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.78)}]",0.01607928611517343,99.2004888052615 -aten::where,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((4500, 4500), (), ())","('bool', 'float', 'float')","((4500, 1), (), ())","('', '', '')",1,10,33.732958984375,33.732958984375,34.050048828125,34.050048828125,2.197378221579753,2.197378221579753,29.8828125,29.8828125,37.1337890625,37.1337890625,337.32958984375,337.32958984375,15687,"['aten::where', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(337.33), 'mean_duration_us': np.float64(33.733), 'median_duration_us': np.float64(34.05), 'std_dev_duration_us': np.float64(2.0846242826946058), 'min_duration_us': np.float64(29.883), 'max_duration_us': np.float64(37.134)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(33.73)}]",0.015989876254046527,99.21647868151555 -aten::_efficient_attention_forward,SDPA_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 24, 128), (1, 256, 24, 128), (1, 256, 24, 128), (1, 24, 256, 256), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', '', '', '')","((786432, 3072, 128, 1), (786432, 3072, 128, 1), (786432, 3072, 128, 1), (1572864, 65536, 256, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '', '', '')",1,8,41.996337890625,41.996337890625,38.77587890625,38.77587890625,4.696939761735354,4.696939761735354,38.416015625,38.416015625,48.15087890625,48.15087890625,335.970703125,335.970703125,8736,"['aten::_efficient_attention_forward', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(335.971), 'mean_duration_us': np.float64(41.996375), 'median_duration_us': np.float64(38.775999999999996), 'std_dev_duration_us': np.float64(4.393628197102597), 'min_duration_us': np.float64(38.416), 'max_duration_us': np.float64(48.151)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(42.0)}]",0.015925463195926887,99.23240414471148 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 6, 3072), (1, 18432), (18432,), (6, 3072), (3072,), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '7431', '3072')",1,4,81.7803955078125,81.7803955078125,82.02099609375,82.02099609375,1.2703215423174574,1.2703215423174574,80.23779296875,80.23779296875,82.841796875,82.841796875,327.12158203125,327.12158203125,9518,"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(327.122), 'mean_duration_us': np.float64(81.7805), 'median_duration_us': np.float64(82.021), 'std_dev_duration_us': np.float64(1.1001921423096988), 'min_duration_us': np.float64(80.238), 'max_duration_us': np.float64(82.842)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(81.78)}]",0.015506002954352244,99.24791014766583 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 9216), (9216,), (7431, 3072), (3072,), (1, 7431, 3072), (1, 6144), (6144,), (1, 7425, 3072), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9216, 1), (1,), (3072, 1), (1,), (22828032, 3072, 1), (6144, 1), (1,), (22809600, 3072, 1), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '7425', '3072')",1,4,78.7860107421875,78.7860107421875,78.3349609375,78.3349609375,1.1400923770012072,1.1400923770012072,77.9951171875,77.9951171875,80.47900390625,80.47900390625,315.14404296875,315.14404296875,10411,"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(315.144), 'mean_duration_us': np.float64(78.786), 'median_duration_us': np.float64(78.33500000000001), 'std_dev_duration_us': np.float64(0.9873616358761349), 'min_duration_us': np.float64(77.995), 'max_duration_us': np.float64(80.479)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(78.79)}]",0.014938251493455809,99.2628483991593 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,7,43.91587611607143,43.91587611607143,44.26513671875,44.26513671875,1.7557904791528887,1.7557904791528887,40.97998046875,40.97998046875,46.10693359375,46.10693359375,307.4111328125,307.4111328125,23920,"['aten::add_', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(307.411), 'mean_duration_us': np.float64(43.91585714285714), 'median_duration_us': np.float64(44.265), 'std_dev_duration_us': np.float64(1.6255045307817015), 'min_duration_us': np.float64(40.98), 'max_duration_us': np.float64(46.107)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(43.92)}]",0.01457170115157987,99.27742010031088 -aten::copy_,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",1,65,4.647265625,4.647265625,4.76611328125,4.76611328125,0.3059762548695673,0.3059762548695673,4.0048828125,4.0048828125,5.24609375,5.24609375,302.072265625,302.072265625,173,"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(302.069), 'mean_duration_us': np.float64(4.647215384615385), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.30359114673965415), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.246)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.65)}]",0.014318631666319307,99.29173873197719 -aten::le,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500))","('int', 'int')","((0, 1), (1, 0))","('', '')",1,10,28.9501953125,28.9501953125,28.5615234375,28.5615234375,2.373956250174059,2.373956250174059,26.078125,26.078125,33.0078125,33.0078125,289.501953125,289.501953125,15679,"['aten::le', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(289.502), 'mean_duration_us': np.float64(28.950200000000002), 'median_duration_us': np.float64(28.561500000000002), 'std_dev_duration_us': np.float64(2.2521561579961547), 'min_duration_us': np.float64(26.078), 'max_duration_us': np.float64(33.008)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.95)}]",0.013722781947227676,99.30546151392441 -aten::add,elementwise,nn.Module: LlamaDecoderLayer,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', '1')",1,64,4.460662841796875,4.460662841796875,4.56591796875,4.56591796875,0.4034041318322504,0.4034041318322504,3.72412109375,3.72412109375,5.4072265625,5.4072265625,285.482421875,285.482421875,332,"['aten::add', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(285.48199999999997), 'mean_duration_us': np.float64(4.4606562499999995), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.40021659053059944), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",0.013532250759861208,99.31899376468428 -aten::cat,other,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"(((1, 32, 351, 64), (1, 32, 351, 64)), ())","('TensorList', 'Scalar')","(((718848, 64, 2048, 1), (1437696, 128, 4096, 1)), ())","('', '-1')",1,32,8.52154541015625,8.52154541015625,8.5322265625,8.5322265625,0.17887395708911727,0.17887395708911727,8.2109375,8.2109375,8.89208984375,8.89208984375,272.689453125,272.689453125,221,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(272.69), 'mean_duration_us': np.float64(8.5215625), 'median_duration_us': np.float64(8.532), 'std_dev_duration_us': np.float64(0.17609371395296866), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(260.85699999999997), 'mean_duration_us': np.float64(26.085699999999996), 'median_duration_us': np.float64(26.0575), 'std_dev_duration_us': np.float64(0.6917326145267407), 'min_duration_us': np.float64(25.156), 'max_duration_us': np.float64(27.28)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.09)}]",0.012364923204610023,99.35702732626736 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((132710400, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,259.82373046875,259.82373046875,259.82373046875,259.82373046875,,,259.82373046875,259.82373046875,259.82373046875,259.82373046875,259.82373046875,259.82373046875,24050,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_23', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(69.983), 'mean_duration_us': np.float64(69.983), 'median_duration_us': np.float64(69.983), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(69.983), 'max_duration_us': np.float64(69.983)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(189.841), 'mean_duration_us': np.float64(189.841), 'median_duration_us': np.float64(189.841), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(189.841), 'max_duration_us': np.float64(189.841)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(69.98)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(189.84)}]",0.012315994277242103,99.3693433205446 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((5529600, 10800, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,7,36.985142299107146,36.985142299107146,35.4921875,35.4921875,2.997844621887172,2.997844621887172,34.08984375,34.08984375,41.18017578125,41.18017578125,258.89599609375,258.89599609375,23763,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(258.89599999999996), 'mean_duration_us': np.float64(36.985142857142854), 'median_duration_us': np.float64(35.492), 'std_dev_duration_us': np.float64(2.7754504616919613), 'min_duration_us': np.float64(34.09), 'max_duration_us': np.float64(41.18)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(36.99)}]",0.012272018420099697,99.3816153389647 -aten::copy_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500), ())","('c10::BFloat16', 'float', 'Scalar')","((4500, 1), (4500, 1), ())","('', '', 'False')",1,10,25.14443359375,25.14443359375,25.01611328125,25.01611328125,0.5304924444151331,0.5304924444151331,24.51513671875,24.51513671875,26.078125,26.078125,251.4443359375,251.4443359375,15693,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(251.44399999999996), 'mean_duration_us': np.float64(25.144399999999997), 'median_duration_us': np.float64(25.016), 'std_dev_duration_us': np.float64(0.5033279646512797), 'min_duration_us': np.float64(24.515), 'max_duration_us': np.float64(26.078)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(25.14)}]",0.011918799706494298,99.3935341386712 -aten::add_,elementwise,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 4500, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (1,), ())","('', '', '1')",1,30,8.324674479166667,8.324674479166667,8.2509765625,8.2509765625,0.6475289678986142,0.6475289678986142,7.2099609375,7.2099609375,9.97412109375,9.97412109375,249.740234375,249.740234375,15716,"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(249.73699999999997), 'mean_duration_us': np.float64(8.324566666666666), 'median_duration_us': np.float64(8.251), 'std_dev_duration_us': np.float64(0.6366639450203608), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.32)}]",0.011838023000480088,99.40537216167168 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (1, 128, 9, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (66355200, 518400, 57600, 240, 1), ())","('', '', '1')",1,3,81.03971354166667,81.03971354166667,80.63818359375,80.63818359375,1.0603492885285808,1.0603492885285808,80.23876953125,80.23876953125,82.2421875,82.2421875,243.119140625,243.119140625,24091,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(243.119), 'mean_duration_us': np.float64(81.03966666666666), 'median_duration_us': np.float64(80.638), 'std_dev_duration_us': np.float64(0.8656420866745228), 'min_duration_us': np.float64(80.239), 'max_duration_us': np.float64(82.242)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(81.04)}]",0.011524174251611126,99.41689633592328 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((132710400, 518400, 57600, 240, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,1,238.11279296875,238.11279296875,238.11279296875,238.11279296875,,,238.11279296875,238.11279296875,238.11279296875,238.11279296875,238.11279296875,238.11279296875,24049,"['aten::add_', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(238.113), 'mean_duration_us': np.float64(238.113), 'median_duration_us': np.float64(238.113), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(238.113), 'max_duration_us': np.float64(238.113)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(238.11)}]",0.01128686663935792,99.42818320256264 -aten::rsqrt,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 1),)","('float',)","((351, 1, 1),)","('',)",1,65,3.5995192307692307,3.5995192307692307,3.56494140625,3.56494140625,0.7070860071860678,0.7070860071860678,2.76318359375,2.76318359375,4.3662109375,4.3662109375,233.96875,233.96875,168,"['aten::rsqrt', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(233.966), 'mean_duration_us': np.float64(3.599476923076923), 'median_duration_us': np.float64(3.565), 'std_dev_duration_us': np.float64(0.7015092105912641), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(4.366)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]",0.011090433429059186,99.4392736359917 -aten::copy_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4500), (1, 1, 4500, 4500), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), (20250000, 20250000, 4500, 1), ())","('', '', 'False')",1,10,22.71689453125,22.71689453125,23.19384765625,23.19384765625,1.1823191769798056,1.1823191769798056,20.830078125,20.830078125,24.39501953125,24.39501953125,227.1689453125,227.1689453125,15754,"['aten::copy_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(227.16899999999998), 'mean_duration_us': np.float64(22.7169), 'median_duration_us': np.float64(23.194000000000003), 'std_dev_duration_us': np.float64(1.1216505204385192), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(24.395)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.72)}]",0.010768113541393317,99.45004174953309 -aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 128, 4096, 1), (44928, 44928, 128, 1))","('', '')",1,32,7.0394287109375,7.0394287109375,6.989013671875,6.989013671875,0.23301198720589594,0.23301198720589594,6.64892578125,6.64892578125,7.52978515625,7.52978515625,225.26171875,225.26171875,215,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(225.261), 'mean_duration_us': np.float64(7.03940625), 'median_duration_us': np.float64(6.989000000000001), 'std_dev_duration_us': np.float64(0.22938693557161774), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.04)}]",0.010677708437183717,99.46071945797027 -aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((33177600, 129600, 120, 1), (), (), ())","('', '[240, 240]', '2.', '2.')",1,10,21.366796875,31.23642578125,21.2109375,31.30517578125,0.4724851524536447,0.6900769421467635,20.830078125,30.203125,22.11181640625,32.44580078125,213.66796875,312.3642578125,16220,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(213.668), 'mean_duration_us': np.float64(21.3668), 'median_duration_us': np.float64(21.211), 'std_dev_duration_us': np.float64(0.448329075568382), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.112)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(21.37)}]",0.01012814909403146,99.4708476070643 -triton_poi_fused_silu_0,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), (1, 3072), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (3072, 1), (3072, 1), (3072, 1), ())","('', '', '', '', '', '3072')",1,40,5.32086181640625,5.32086181640625,5.48681640625,5.48681640625,0.6771427092767259,0.6771427092767259,3.36376953125,3.36376953125,6.087890625,6.087890625,212.83447265625,212.83447265625,8844,"['triton_poi_fused_silu_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(212.83599999999998), 'mean_duration_us': np.float64(5.3209), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.6685760914062063), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]",0.010088640258167204,99.48093624732246 -aten::miopen_convolution,CONV_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (3072, 16, 1, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((475200, 29700, 900, 30, 1), (64, 4, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 2, 2]', '[1, 1, 1]', '1', 'False', 'False')",2,4,52.9669189453125,52.9669189453125,52.67626953125,52.67626953125,3.5973766299697525,3.5973766299697525,48.87109375,48.87109375,57.64404296875,57.64404296875,211.86767578125,211.86767578125,8804,"['aten::miopen_convolution', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Im3d2Col', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.557000000000002), 'mean_duration_us': np.float64(6.8892500000000005), 'median_duration_us': np.float64(6.1080000000000005), 'std_dev_duration_us': np.float64(2.277268470668314), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(10.695)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(184.31099999999998), 'mean_duration_us': np.float64(46.077749999999995), 'median_duration_us': np.float64(46.5685), 'std_dev_duration_us': np.float64(1.0810030931963137), 'min_duration_us': np.float64(44.225), 'max_duration_us': np.float64(46.949)}]","[{'name': 'Im3d2Col', 'stream': 0, 'mean_duration_us': np.float64(6.89)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(46.08)}]",0.010042812785987221,99.49097906010844 -aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((172800, 57600, 240, 1), (172800, 57600, 240, 1), ())","('', '', '1')",1,40,5.12955322265625,5.12955322265625,5.0869140625,5.0869140625,0.1278144411402751,0.1278144411402751,4.966796875,4.966796875,5.44677734375,5.44677734375,205.18212890625,205.18212890625,24181,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(205.18399999999997), 'mean_duration_us': np.float64(5.129599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.12611756420102632), 'min_duration_us': np.float64(4.967), 'max_duration_us': np.float64(5.447)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.13)}]",0.009725908872306262,99.50070496898076 -aten::add,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 1), (), ())","('float', 'double', 'Scalar')","((351, 1, 1), (), ())","('', '', '1')",1,65,3.15517578125,3.15517578125,2.3232421875,2.3232421875,1.1386083261282682,1.1386083261282682,1.9609375,1.9609375,4.44482421875,4.44482421875,205.08642578125,205.08642578125,167,"['aten::add', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(205.08299999999997), 'mean_duration_us': np.float64(3.1551230769230765), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(1.1297545207520807), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.16)}]",0.009721372415464204,99.51042634139623 -aten::cat,other,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"(((1, 8, 351, 64), (1, 8, 351, 64)), ())","('TensorList', 'Scalar')","(((179712, 64, 512, 1), (359424, 128, 1024, 1)), ())","('', '-1')",1,32,6.35845947265625,6.35845947265625,6.388671875,6.388671875,0.1797532206189524,0.1797532206189524,6.087890625,6.087890625,6.72900390625,6.72900390625,203.470703125,203.470703125,230,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(203.47), 'mean_duration_us': np.float64(6.3584375), 'median_duration_us': np.float64(6.3885000000000005), 'std_dev_duration_us': np.float64(0.17691522289998107), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(63.48799999999999), 'mean_duration_us': np.float64(12.697599999999998), 'median_duration_us': np.float64(12.658), 'std_dev_duration_us': np.float64(0.31837122985596544), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.218)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(139.40200000000002), 'mean_duration_us': np.float64(27.8804), 'median_duration_us': np.float64(28.161), 'std_dev_duration_us': np.float64(1.3720892973855596), 'min_duration_us': np.float64(26.358), 'max_duration_us': np.float64(30.084)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(12.7)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(27.88)}]",0.009617242214788579,99.52968836859948 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240),)","('c10::BFloat16',)","((132710400, 518400, 57600, 240, 1),)","('',)",1,1,202.4599609375,202.4599609375,202.4599609375,202.4599609375,,,202.4599609375,202.4599609375,202.4599609375,202.4599609375,202.4599609375,202.4599609375,24054,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.46), 'mean_duration_us': np.float64(202.46), 'median_duration_us': np.float64(202.46), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.46), 'max_duration_us': np.float64(202.46)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.46)}]",0.009596874449375254,99.53928524304885 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,20,10.023876953125,10.023876953125,10.074462890625,10.074462890625,0.41449718217519793,0.41449718217519793,9.453125,9.453125,10.77490234375,10.77490234375,200.4775390625,200.4775390625,8757,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(200.47699999999998), 'mean_duration_us': np.float64(10.02385), 'median_duration_us': np.float64(10.0745), 'std_dev_duration_us': np.float64(0.4040388935486285), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.775)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(10.02)}]",0.009502904986218325,99.54878814803507 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 6144), (1, 6144))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (6144, 1))","('', '', '')",1,12,16.677042643229168,16.677042643229168,16.703125,16.703125,0.43521086334175285,0.43521086334175285,15.90283203125,15.90283203125,17.544921875,17.544921875,200.12451171875,200.12451171875,8765,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(200.12500000000003), 'mean_duration_us': np.float64(16.677083333333336), 'median_duration_us': np.float64(16.703), 'std_dev_duration_us': np.float64(0.4166806247662062), 'min_duration_us': np.float64(15.903), 'max_duration_us': np.float64(17.545)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(16.68)}]",0.00948617101531624,99.55827431905038 -triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",1,4,49.2423095703125,49.2423095703125,49.192626953125,49.192626953125,1.0254499436432176,1.0254499436432176,48.06982421875,48.06982421875,50.51416015625,50.51416015625,196.96923828125,196.96923828125,9540,"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(196.969), 'mean_duration_us': np.float64(49.24225), 'median_duration_us': np.float64(49.192499999999995), 'std_dev_duration_us': np.float64(0.8879511177424136), 'min_duration_us': np.float64(48.07), 'max_duration_us': np.float64(50.514)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'mean_duration_us': np.float64(49.24)}]",0.009336606810656121,99.56761092586103 -aten::add,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 8, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((359424, 128, 1024, 1), (359424, 44928, 128, 1), ())","('', '', '1')",1,32,6.0743408203125,6.0743408203125,6.06787109375,6.06787109375,0.17698023169520577,0.17698023169520577,5.68701171875,5.68701171875,6.3681640625,6.3681640625,194.37890625,194.37890625,232,"['aten::add', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(194.37900000000002), 'mean_duration_us': np.float64(6.074343750000001), 'median_duration_us': np.float64(6.068), 'std_dev_duration_us': np.float64(0.17418714960047285), 'min_duration_us': np.float64(5.687), 'max_duration_us': np.float64(6.368)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}]",0.009213821588476927,99.5768247474495 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2937600, 979200, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",1,36,5.162204318576389,5.162204318576389,5.1259765625,5.1259765625,0.23417343393297987,0.23417343393297987,4.88623046875,4.88623046875,6.328125,6.328125,185.83935546875,185.83935546875,24184,['aten::copy_'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 36, 'total_duration_us': np.float64(185.84), 'mean_duration_us': np.float64(5.162222222222223), 'median_duration_us': np.float64(5.126), 'std_dev_duration_us': np.float64(0.23083376788299786), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.16)}]",0.008809035396075065,99.58563378284558 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((36864000, 72000, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,1,182.791015625,182.791015625,182.791015625,182.791015625,,,182.791015625,182.791015625,182.791015625,182.791015625,182.791015625,182.791015625,23938,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(182.791), 'mean_duration_us': np.float64(182.791), 'median_duration_us': np.float64(182.791), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(182.791), 'max_duration_us': np.float64(182.791)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.79)}]",0.008664539987580306,99.59429832283315 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 4500), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4500, 4500, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,17.736328125,17.736328125,17.544189453125,17.544189453125,1.2795679686855788,1.2795679686855788,15.861328125,15.861328125,20.02783203125,20.02783203125,177.36328125,177.36328125,15701,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_2', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(61.56), 'mean_duration_us': np.float64(6.156000000000001), 'median_duration_us': np.float64(6.088), 'std_dev_duration_us': np.float64(0.5113282702921871), 'min_duration_us': np.float64(5.286), 'max_duration_us': np.float64(7.129)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(115.80299999999998), 'mean_duration_us': np.float64(11.580299999999998), 'median_duration_us': np.float64(11.536000000000001), 'std_dev_duration_us': np.float64(1.026855398778231), 'min_duration_us': np.float64(9.694), 'max_duration_us': np.float64(13.379)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.58)}]",0.00840725807810926,99.60270558091126 -aten::neg,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 64),)","('c10::BFloat16',)","((1437696, 128, 4096, 1),)","('',)",1,32,5.4546661376953125,5.4546661376953125,5.44677734375,5.44677734375,0.17955712635322646,0.17955712635322646,5.126953125,5.126953125,5.9677734375,5.9677734375,174.54931640625,174.54931640625,220,"['aten::neg', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(174.54999999999998), 'mean_duration_us': np.float64(5.4546874999999995), 'median_duration_us': np.float64(5.447), 'std_dev_duration_us': np.float64(0.17679409589618653), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]",0.008273872359839953,99.6109794532711 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,8,21.510986328125,21.510986328125,21.531005859375,21.531005859375,0.41850110365772064,0.41850110365772064,20.830078125,20.830078125,22.15185546875,22.15185546875,172.087890625,172.087890625,8766,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(172.088), 'mean_duration_us': np.float64(21.511), 'median_duration_us': np.float64(21.531), 'std_dev_duration_us': np.float64(0.391523307096781), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.152)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.51)}]",0.008157197467284757,99.61913665073838 -aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((3686400, 7200, 3600, 60, 1), (), (), (), ())","('', '[4, 120, 120]', '2.', '2.', '2.')",1,1,170.73291015625,170.73291015625,170.73291015625,170.73291015625,,,170.73291015625,170.73291015625,170.73291015625,170.73291015625,170.73291015625,170.73291015625,23888,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(170.733), 'mean_duration_us': np.float64(170.733), 'median_duration_us': np.float64(170.733), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(170.733), 'max_duration_us': np.float64(170.733)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(170.73)}]",0.008092969570668875,99.62722962030905 -aten::_flash_attention_forward,other,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1, 77, 12, 64), (1, 77, 12, 64), (1, 77, 12, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((59136, 768, 64, 1), (59136, 768, 64, 1), (59136, 768, 64, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '77', '77', '0.', 'True', 'False', '0.125', '', '', '', '')",1,12,13.806193033854166,17.1666259765625,13.679443359375,15.94140625,0.45685059663038796,2.6112065924067016,13.3779296875,15.30078125,14.98095703125,22.912109375,165.67431640625,205.99951171875,7351,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(165.674), 'mean_duration_us': np.float64(13.806166666666668), 'median_duration_us': np.float64(13.6795), 'std_dev_duration_us': np.float64(0.4373817618003243), 'min_duration_us': np.float64(13.378), 'max_duration_us': np.float64(14.981)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.81)}]",0.007853185423302914,99.63508280573235 -aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 128, 1024, 1), (44928, 44928, 128, 1))","('', '')",1,32,5.1719207763671875,5.1719207763671875,5.14697265625,5.14697265625,0.4977407381986989,0.4977407381986989,4.2451171875,4.2451171875,6.369140625,6.369140625,165.50146484375,165.50146484375,224,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(165.5), 'mean_duration_us': np.float64(5.171875), 'median_duration_us': np.float64(5.147), 'std_dev_duration_us': np.float64(0.4898999100581669), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(6.369)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.17)}]",0.007844992026761645,99.64292779775911 -aten::add,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 4500, 512), (1, 4500, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (4500, 1, 4500), ())","('', '', '1')",1,10,15.9546875,15.9546875,15.98291015625,15.98291015625,0.24112172126375578,0.24112172126375578,15.6220703125,15.6220703125,16.3427734375,16.3427734375,159.546875,159.546875,15797,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(159.547), 'mean_duration_us': np.float64(15.954699999999999), 'median_duration_us': np.float64(15.983), 'std_dev_duration_us': np.float64(0.22880430502942894), 'min_duration_us': np.float64(15.622), 'max_duration_us': np.float64(16.343)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(15.95)}]",0.007562736459471306,99.65049053421859 -aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (117964800, 460800, 57600, 240, 1)), ())","('', '2')",2,1,158.67431640625,158.67431640625,158.67431640625,158.67431640625,,,158.67431640625,158.67431640625,158.67431640625,158.67431640625,158.67431640625,158.67431640625,24033,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.558), 'mean_duration_us': np.float64(26.558), 'median_duration_us': np.float64(26.558), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.558), 'max_duration_us': np.float64(26.558)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(132.116), 'mean_duration_us': np.float64(132.116), 'median_duration_us': np.float64(132.116), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(132.116), 'max_duration_us': np.float64(132.116)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.56)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(132.12)}]",0.007521376008569474,99.65801191022716 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,15.753125,15.753125,13.718017578125,13.718017578125,3.8272314794361426,3.8272314794361426,13.2177734375,13.2177734375,24.794921875,24.794921875,157.53125,157.53125,23418,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(55.06999999999999), 'mean_duration_us': np.float64(5.507), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(1.9236527753209518), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(11.135)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(102.462), 'mean_duration_us': np.float64(10.2462), 'median_duration_us': np.float64(9.053), 'std_dev_duration_us': np.float64(2.999576996844722), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(19.027)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.51)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.25)}]",0.007467193123532436,99.66547910335069 -aten::where,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (), ())","('bool', 'c10::BFloat16', 'c10::BFloat16')","((123201, 123201, 351, 1), (), ())","('', '', '')",1,32,4.8874053955078125,4.8874053955078125,4.88623046875,4.88623046875,0.15500533287165916,0.15500533287165916,4.60595703125,4.60595703125,5.2470703125,5.2470703125,156.39697265625,156.39697265625,280,"['aten::where', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(156.39600000000002), 'mean_duration_us': np.float64(4.8873750000000005), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.15261302164297783), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",0.007413426851878852,99.67289253020257 -triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1), (1, 7425, 1), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((0, 1, 7488), (7456, 1, 7456), (7456, 1, 7456), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",1,4,38.575927734375,38.575927734375,38.555908203125,38.555908203125,2.7097272122605083,2.7097272122605083,36.1318359375,36.1318359375,41.06005859375,41.06005859375,154.3037109375,154.3037109375,8850,"['triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(154.304), 'mean_duration_us': np.float64(38.576), 'median_duration_us': np.float64(38.556), 'std_dev_duration_us': np.float64(2.346681167095354), 'min_duration_us': np.float64(36.132), 'max_duration_us': np.float64(41.06)}]","[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(38.58)}]",0.007314203431052802,99.68020673363363 -aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",1,32,4.7911376953125,4.7911376953125,4.74609375,4.74609375,0.4589674339754898,0.4589674339754898,4.044921875,4.044921875,5.72705078125,5.72705078125,153.31640625,153.31640625,222,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(153.316), 'mean_duration_us': np.float64(4.791125), 'median_duration_us': np.float64(4.746), 'std_dev_duration_us': np.float64(0.45170425543158216), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(5.727)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.79)}]",0.007267403860978094,99.6874741374946 -aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 4, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (7372800, 14400, 3600, 60, 1)), ())","('', '2')",2,10,15.17275390625,15.17275390625,15.06103515625,15.06103515625,0.32528595041515274,0.32528595041515274,14.7802734375,14.7802734375,15.7021484375,15.7021484375,151.7275390625,151.7275390625,15957,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.82599999999999), 'mean_duration_us': np.float64(5.082599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.08492961791978107), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.207)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.902), 'mean_duration_us': np.float64(10.0902), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.2913725450347027), 'min_duration_us': np.float64(9.734), 'max_duration_us': np.float64(10.655)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.08)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.09)}]",0.007192089419324731,99.69466622691392 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120),)","('c10::BFloat16',)","((18432000, 72000, 14400, 120, 1),)","('',)",1,5,30.171875,30.171875,31.2861328125,31.2861328125,2.1300137500140033,2.1300137500140033,27.72021484375,27.72021484375,32.0458984375,32.0458984375,150.859375,150.859375,23925,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(150.859), 'mean_duration_us': np.float64(30.1718), 'median_duration_us': np.float64(31.286), 'std_dev_duration_us': np.float64(1.9051704805607295), 'min_duration_us': np.float64(27.72), 'max_duration_us': np.float64(32.046)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(30.17)}]",0.007150937275114627,99.70181716418904 -aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((9216000, 18000, 60, 1), (), (), ())","('', '[120, 120]', '2.', '2.')",1,10,14.97734375,20.66845703125,15.02099609375,20.60791015625,0.44885564752338747,0.45238589520729844,14.30078125,20.02783203125,15.5419921875,21.30908203125,149.7734375,206.6845703125,16076,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(149.774), 'mean_duration_us': np.float64(14.9774), 'median_duration_us': np.float64(15.021), 'std_dev_duration_us': np.float64(0.4257833251784293), 'min_duration_us': np.float64(14.301), 'max_duration_us': np.float64(15.542)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(14.98)}]",0.007099462377070042,99.70891662656611 -aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",1,32,4.3968048095703125,4.3968048095703125,4.3662109375,4.3662109375,0.14804499906876914,0.14804499906876914,4.125,4.125,4.76708984375,4.76708984375,140.69775390625,140.69775390625,231,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(140.697), 'mean_duration_us': np.float64(4.39678125), 'median_duration_us': np.float64(4.366), 'std_dev_duration_us': np.float64(0.14578424434223852), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.767)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.4)}]",0.006669262768277462,99.71558588933439 -aten::copy_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 351, 351), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), (123201, 123201, 351, 1), ())","('', '', 'False')",1,32,4.276641845703125,4.276641845703125,4.28515625,4.28515625,0.18087827426542186,0.18087827426542186,3.96484375,3.96484375,4.60595703125,4.60595703125,136.8525390625,136.8525390625,290,"['aten::copy_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(136.852), 'mean_duration_us': np.float64(4.276625), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.1780245330705855), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.28)}]",0.006486994413016174,99.7220728837474 -aten::neg,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 64),)","('c10::BFloat16',)","((359424, 128, 1024, 1),)","('',)",1,32,4.1689300537109375,4.1689300537109375,4.125,4.125,0.15816634330533075,0.15816634330533075,3.884765625,3.884765625,4.52587890625,4.52587890625,133.40576171875,133.40576171875,229,"['aten::neg', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(133.406), 'mean_duration_us': np.float64(4.1689375), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.1556189130335706), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.17)}]",0.00632361253113815,99.72839649627853 -triton_red_fused_native_layer_norm_1,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (), ())","('c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar')","((0, 1, 7488), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (), ())","('', '', '', '', '178200', '128')",1,4,32.1368408203125,32.1368408203125,32.26708984375,32.26708984375,0.33101828646015685,0.33101828646015685,31.64599609375,31.64599609375,32.3671875,32.3671875,128.54736328125,128.54736328125,8846,"['triton_red_fused_native_layer_norm_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(128.547), 'mean_duration_us': np.float64(32.13675), 'median_duration_us': np.float64(32.266999999999996), 'std_dev_duration_us': np.float64(0.2866098175220092), 'min_duration_us': np.float64(31.646), 'max_duration_us': np.float64(32.367)}]","[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'mean_duration_us': np.float64(32.14)}]",0.00609331791083976,99.73448981418937 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((512,), (4500, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",1,10,12.805810546875,12.805810546875,12.718017578125,12.718017578125,0.36069397961349864,0.36069397961349864,12.45703125,12.45703125,13.73876953125,13.73876953125,128.05810546875,128.05810546875,15794,"['aten::addmm', 'nn.Module: Linear_299', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.058), 'mean_duration_us': np.float64(12.8058), 'median_duration_us': np.float64(12.718), 'std_dev_duration_us': np.float64(0.3422799439055698), 'min_duration_us': np.float64(12.457), 'max_duration_us': np.float64(13.739)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(12.81)}]",0.006070126432494134,99.74055994062186 -aten::add,elementwise,nn.Module: CLIPEncoderLayer,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,24,5.290303548177083,5.290303548177083,5.2470703125,5.2470703125,0.30481366012550204,0.30481366012550204,4.72607421875,4.72607421875,5.9677734375,5.9677734375,126.96728515625,126.96728515625,7386,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(126.96699999999998), 'mean_duration_us': np.float64(5.290291666666666), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.2984396196841536), 'min_duration_us': np.float64(4.726), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",0.006018420082569852,99.74657836070443 -triton_poi_fused_convolution_13,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072, 33, 15, 15), (3072,), (1, 3072, 33, 15, 15), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22809600, 7425, 225, 15, 1), (1,), (23003136, 7488, 225, 15, 1), ())","('', '', '', '22809600')",1,4,31.324951171875,31.324951171875,31.46484375,31.46484375,0.41248052917149597,0.41248052917149597,30.72412109375,30.72412109375,31.64599609375,31.64599609375,125.2998046875,125.2998046875,8805,"['triton_poi_fused_convolution_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(125.3), 'mean_duration_us': np.float64(31.325), 'median_duration_us': np.float64(31.465), 'std_dev_duration_us': np.float64(0.3572960956965524), 'min_duration_us': np.float64(30.724), 'max_duration_us': np.float64(31.646)}]","[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'mean_duration_us': np.float64(31.32)}]",0.005939379265653369,99.75251773997009 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 3, 17, 240, 240), (1, 3, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2937600, 979200, 57600, 240, 1), (3, 1, 1, 1, 1), ())","('', '', '1')",1,10,12.08896484375,12.08896484375,12.578125,12.578125,1.4372981348982836,1.4372981348982836,9.77392578125,9.77392578125,13.81884765625,13.81884765625,120.8896484375,120.8896484375,16372,"['aten::add_', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(120.88999999999999), 'mean_duration_us': np.float64(12.088999999999999), 'median_duration_us': np.float64(12.578), 'std_dev_duration_us': np.float64(1.3635438386791976), 'min_duration_us': np.float64(9.774), 'max_duration_us': np.float64(13.819)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.09)}]",0.005730331927911152,99.758248071898 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,19.91455078125,19.91455078125,19.507568359375,19.507568359375,1.2612885205196425,1.2612885205196425,18.625,18.625,21.67041015625,21.67041015625,119.4873046875,119.4873046875,23772,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(36.448), 'mean_duration_us': np.float64(6.074666666666666), 'median_duration_us': np.float64(6.0485), 'std_dev_duration_us': np.float64(0.2942950144932046), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.449)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.038), 'mean_duration_us': np.float64(13.839666666666666), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8712071446498181), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(15.262)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.84)}]",0.00566385894806221,99.76391193084606 -aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', '1')",1,4,29.813232421875,29.813232421875,29.9833984375,29.9833984375,0.7855962782338508,0.7855962782338508,28.72216796875,28.72216796875,30.56396484375,30.56396484375,119.2529296875,119.2529296875,10434,['aten::add'],"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(119.25300000000001), 'mean_duration_us': np.float64(29.813250000000004), 'median_duration_us': np.float64(29.9835), 'std_dev_duration_us': np.float64(0.6804231679624079), 'min_duration_us': np.float64(28.722), 'max_duration_us': np.float64(30.564)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(29.81)}]",0.00565274925783676,99.7695646801039 -aten::native_layer_norm,NORM_fwd,nn.Module: LayerNorm,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (), (1,), (1,), ())","('', '[768]', '', '', '1.0000000000000001e-05')",1,25,4.7198046875,4.7198046875,4.68603515625,4.68603515625,0.2444226349748887,0.2444226349748887,3.84521484375,3.84521484375,5.287109375,5.287109375,117.9951171875,117.9951171875,7304,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 25, 'total_duration_us': np.float64(117.994), 'mean_duration_us': np.float64(4.71976), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.23948549517663897), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.72)}]",0.005593127253626845,99.77515780735753 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",1,4,28.7816162109375,28.7816162109375,28.921875,28.921875,0.3376165906830312,0.3376165906830312,28.28076171875,28.28076171875,29.001953125,29.001953125,115.12646484375,115.12646484375,8723,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.127), 'mean_duration_us': np.float64(28.78175), 'median_duration_us': np.float64(28.922), 'std_dev_duration_us': np.float64(0.29231864035671795), 'min_duration_us': np.float64(28.281), 'max_duration_us': np.float64(29.002)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(28.78)}]",0.005457149274304932,99.78061495663184 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((1382400, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,10,11.400146484375,11.400146484375,10.85546875,10.85546875,1.0742672872655885,1.0742672872655885,10.57421875,10.57421875,13.21923828125,13.21923828125,114.00146484375,114.00146484375,23424,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(114.00099999999999), 'mean_duration_us': np.float64(11.400099999999998), 'median_duration_us': np.float64(10.8555), 'std_dev_duration_us': np.float64(1.0190769794279526), 'min_duration_us': np.float64(10.574), 'max_duration_us': np.float64(13.219)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(11.4)}]",0.005403822761222771,99.78601877939306 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (1, 512, 4, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7372800, 14400, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', 'False')",1,10,11.23544921875,11.23544921875,11.19580078125,11.19580078125,0.2268741028729728,0.2268741028729728,10.89501953125,10.89501953125,11.5361328125,11.5361328125,112.3544921875,112.3544921875,16088,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(112.355), 'mean_duration_us': np.float64(11.2355), 'median_duration_us': np.float64(11.196), 'std_dev_duration_us': np.float64(0.2151749288369813), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(11.536)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.24)}]",0.005325754042201016,99.79134453343526 -triton_poi_fused_cat_slice_20,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (22828032, 3072, 1), ())","('', '', '22828032')",1,4,28.020751953125,28.020751953125,27.840576171875,27.840576171875,0.8238069732058474,0.8238069732058474,27.27880859375,27.27880859375,29.123046875,29.123046875,112.0830078125,112.0830078125,9519,"['triton_poi_fused_cat_slice_20', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(112.083), 'mean_duration_us': np.float64(28.02075), 'median_duration_us': np.float64(27.8405), 'std_dev_duration_us': np.float64(0.7133667973069681), 'min_duration_us': np.float64(27.279), 'max_duration_us': np.float64(29.123)}]","[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'mean_duration_us': np.float64(28.02)}]",0.00531288531768987,99.79665741875296 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",1,12,9.0390625,9.0390625,8.93212890625,8.93212890625,0.3101109126738394,0.3101109126738394,8.69189453125,8.69189453125,9.85400390625,9.85400390625,108.46875,108.46875,7411,"['aten::addmm', 'nn.Module: Linear_229', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(108.469), 'mean_duration_us': np.float64(9.039083333333332), 'median_duration_us': np.float64(8.931999999999999), 'std_dev_duration_us': np.float64(0.2969294131420611), 'min_duration_us': np.float64(8.692), 'max_duration_us': np.float64(9.854)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.04)}]",0.005141564636338244,99.80179898338929 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,7,14.357700892857142,14.357700892857142,14.3408203125,14.3408203125,0.3954942345461055,0.3954942345461055,13.7001953125,13.7001953125,14.82080078125,14.82080078125,100.50390625,100.50390625,23771,"['aten::add_', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(100.50399999999999), 'mean_duration_us': np.float64(14.357714285714284), 'median_duration_us': np.float64(14.341), 'std_dev_duration_us': np.float64(0.3663034317087854), 'min_duration_us': np.float64(13.7), 'max_duration_us': np.float64(14.821)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.36)}]",0.004764020330176702,99.80656300371946 -aten::fill_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4504), ())","('c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), ())","('', '0.')",1,10,10.009765625,10.009765625,10.013427734375,10.013427734375,0.43111397138173235,0.43111397138173235,9.453125,9.453125,10.5751953125,10.5751953125,100.09765625,100.09765625,15750,"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.09799999999998), 'mean_duration_us': np.float64(10.009799999999998), 'median_duration_us': np.float64(10.0135), 'std_dev_duration_us': np.float64(0.40890972108767476), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.575)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]",0.0047447635337859225,99.81130776725324 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (1, 256, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 14400, 120, 1), (33177600, 129600, 120, 1), ())","('', '', 'False')",1,10,9.86962890625,9.86962890625,9.994140625,9.994140625,0.5113869611427618,0.5113869611427618,8.89208984375,8.89208984375,10.5751953125,10.5751953125,98.6962890625,98.6962890625,16225,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(98.69599999999998), 'mean_duration_us': np.float64(9.869599999999998), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.48515300679270235), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(10.575)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}]",0.004678336844312919,99.81598610409755 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",1,12,8.214558919270834,8.214558919270834,8.091064453125,8.091064453125,0.4854992416870445,0.4854992416870445,7.85009765625,7.85009765625,9.69287109375,9.69287109375,98.57470703125,98.57470703125,7400,"['aten::addmm', 'nn.Module: Linear_228', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(98.574), 'mean_duration_us': np.float64(8.2145), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.4649102960070183), 'min_duration_us': np.float64(7.85), 'max_duration_us': np.float64(9.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",0.004672573692508467,99.82065867779005 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (1, 256, 5, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', '1')",1,3,29.7900390625,29.7900390625,29.162109375,29.162109375,1.1931431850768015,1.1931431850768015,29.0419921875,29.0419921875,31.166015625,31.166015625,89.3701171875,89.3701171875,23947,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.37), 'mean_duration_us': np.float64(29.790000000000003), 'median_duration_us': np.float64(29.162), 'std_dev_duration_us': np.float64(0.9742114760153464), 'min_duration_us': np.float64(29.042), 'max_duration_us': np.float64(31.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(29.79)}]",0.004236263754091889,99.82489494154414 -aten::fill_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 1, 351, 352), ())","('c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), ())","('', '0.')",1,32,2.7806549072265625,2.7806549072265625,2.76318359375,2.76318359375,0.14340866108737566,0.14340866108737566,2.60302734375,2.60302734375,3.36376953125,3.36376953125,88.98095703125,88.98095703125,286,"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(88.97999999999999), 'mean_duration_us': np.float64(2.7806249999999997), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.14124264361374722), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.78)}]",0.004217817039280048,99.82911275858342 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 64), (7425, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (64, 1))","('', '', '')",1,4,21.6011962890625,21.6011962890625,21.69140625,21.69140625,0.36163358406667456,0.36163358406667456,21.11083984375,21.11083984375,21.9111328125,21.9111328125,86.40478515625,86.40478515625,10412,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(86.405), 'mean_duration_us': np.float64(21.60125), 'median_duration_us': np.float64(21.691499999999998), 'std_dev_duration_us': np.float64(0.3130737732548036), 'min_duration_us': np.float64(21.111), 'max_duration_us': np.float64(21.911)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.6)}]",0.004095703027551978,99.83320846161097 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((36864000, 72000, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,1,81.72021484375,122.7001953125,81.72021484375,122.7001953125,,,81.72021484375,122.7001953125,81.72021484375,122.7001953125,81.72021484375,122.7001953125,23942,"['aten::miopen_convolution', 'nn.Module: Conv3d_22', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC1_NTD1_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT2_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGMn2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(81.72), 'mean_duration_us': np.float64(81.72), 'median_duration_us': np.float64(81.72), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(81.72), 'max_duration_us': np.float64(81.72)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(81.72)}]",0.0038736480941707965,99.83708210970514 -aten::sigmoid,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",1,12,6.72265625,6.72265625,6.708984375,6.708984375,0.38600629713516427,0.38600629713516427,6.3291015625,6.3291015625,7.73095703125,7.73095703125,80.671875,80.671875,7403,"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(80.67099999999999), 'mean_duration_us': np.float64(6.722583333333333), 'median_duration_us': np.float64(6.709), 'std_dev_duration_us': np.float64(0.3695933482295854), 'min_duration_us': np.float64(6.329), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.72)}]",0.0038239553755998776,99.84090606508073 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60),)","('c10::BFloat16',)","((5529600, 10800, 3600, 60, 1),)","('',)",1,6,13.412353515625,13.412353515625,13.99951171875,13.99951171875,2.9502668769184965,2.9502668769184965,9.93408203125,9.93408203125,16.6640625,16.6640625,80.47412109375,80.47412109375,23776,"['aten::silu', 'nn.Module: SiLU_5', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.474), 'mean_duration_us': np.float64(13.412333333333335), 'median_duration_us': np.float64(13.999500000000001), 'std_dev_duration_us': np.float64(2.693267820985421), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(16.664)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(13.41)}]",0.0038145815744721544,99.8447206466552 -triton_poi_fused_addmm_silu_view_10,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 12288, 1), (1,), ())","('', '', '3145728')",1,8,9.95880126953125,9.95880126953125,9.8740234375,9.8740234375,0.5239840543537515,0.5239840543537515,9.3330078125,9.3330078125,10.73486328125,10.73486328125,79.67041015625,79.67041015625,8769,"['triton_poi_fused_addmm_silu_view_10', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(79.67099999999999), 'mean_duration_us': np.float64(9.958874999999999), 'median_duration_us': np.float64(9.873999999999999), 'std_dev_duration_us': np.float64(0.4902161353678597), 'min_duration_us': np.float64(9.333), 'max_duration_us': np.float64(10.735)}]","[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'mean_duration_us': np.float64(9.96)}]",0.0037764845950740487,99.84849713125028 -aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",1,12,6.528645833333333,6.528645833333333,6.408447265625,6.408447265625,0.4531159275466089,0.4531159275466089,6.087890625,6.087890625,7.68994140625,7.68994140625,78.34375,78.34375,7402,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(78.34400000000001), 'mean_duration_us': np.float64(6.528666666666667), 'median_duration_us': np.float64(6.4085), 'std_dev_duration_us': np.float64(0.4338206874837678), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.69)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.003713599119360408,99.85221073036965 -triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",1,4,19.2677001953125,19.2677001953125,19.107421875,19.107421875,0.7119972658310234,0.7119972658310234,18.5869140625,18.5869140625,20.26904296875,20.26904296875,77.07080078125,77.07080078125,8801,"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(77.071), 'mean_duration_us': np.float64(19.26775), 'median_duration_us': np.float64(19.1075), 'std_dev_duration_us': np.float64(0.6165555023677911), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(20.269)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.27)}]",0.0036532596143234327,99.85586398998397 -triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (3072,), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (1,), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '256', '3072')",1,4,19.2274169921875,19.2274169921875,19.067626953125,19.067626953125,0.5314483833154173,0.5314483833154173,18.826171875,18.826171875,19.9482421875,19.9482421875,76.90966796875,76.90966796875,8767,"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(76.90899999999999), 'mean_duration_us': np.float64(19.227249999999998), 'median_duration_us': np.float64(19.067500000000003), 'std_dev_duration_us': np.float64(0.4602180868892483), 'min_duration_us': np.float64(18.826), 'max_duration_us': np.float64(19.948)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.23)}]",0.0036456217022934364,99.85950961168626 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((36864000, 72000, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,73.828125,73.828125,73.828125,73.828125,,,73.828125,73.828125,73.828125,73.828125,73.828125,73.828125,23906,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_17', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.71), 'mean_duration_us': np.float64(20.71), 'median_duration_us': np.float64(20.71), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.71), 'max_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(53.118), 'mean_duration_us': np.float64(53.118), 'median_duration_us': np.float64(53.118), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(53.118), 'max_duration_us': np.float64(53.118)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(53.12)}]",0.003499552421016739,99.86300916410728 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,11,6.5431906960227275,6.5431906960227275,6.0478515625,6.0478515625,1.285851387183815,1.285851387183815,5.2060546875,5.2060546875,8.291015625,8.291015625,71.97509765625,71.97509765625,23417,"['aten::add_', 'nn.Module: Conv3d_1', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(71.97500000000001), 'mean_duration_us': np.float64(6.543181818181819), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(1.2260501856984647), 'min_duration_us': np.float64(5.206), 'max_duration_us': np.float64(8.291)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.54)}]",0.003411716432671775,99.86642088053995 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((36864000, 72000, 14400, 120, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,1,70.34423828125,70.34423828125,70.34423828125,70.34423828125,,,70.34423828125,70.34423828125,70.34423828125,70.34423828125,70.34423828125,70.34423828125,23905,"['aten::add_', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(70.344), 'mean_duration_us': np.float64(70.344), 'median_duration_us': np.float64(70.344), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(70.344), 'max_duration_us': np.float64(70.344)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(70.34)}]",0.003334411504853019,99.8697552920448 -aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((2304000, 4500, 30, 1), (), (), ())","('', '[60, 60]', '2.', '2.')",1,10,7.021337890625,11.4830078125,6.948974609375,11.33447265625,0.2128980971647561,0.4077479987454964,6.80908203125,11.13525390625,7.4501953125,12.537109375,70.21337890625,114.830078125,15942,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(70.213), 'mean_duration_us': np.float64(7.021299999999999), 'median_duration_us': np.float64(6.949), 'std_dev_duration_us': np.float64(0.20199259887431512), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.45)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(7.02)}]",0.0033282085944771425,99.87308350063928 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (256, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (3072, 1))","('', '', '')",1,12,5.6510009765625,5.6510009765625,5.7080078125,5.7080078125,0.20468343430239708,0.20468343430239708,5.3671875,5.3671875,5.92822265625,5.92822265625,67.81201171875,67.81201171875,8755,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.81099999999999), 'mean_duration_us': np.float64(5.650916666666666), 'median_duration_us': np.float64(5.708), 'std_dev_duration_us': np.float64(0.19595554697147227), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",0.0032143805600422203,99.87629788119932 -aten::cat,elementwise,NA,python3,CPU,thread 416 (python3),"(((1, 3, 13, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (1555200, 518400, 57600, 240, 1)), ())","('', '2')",11,1,67.77099609375,67.77099609375,67.77099609375,67.77099609375,,,67.77099609375,67.77099609375,67.77099609375,67.77099609375,67.77099609375,67.77099609375,24594,['aten::cat'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.688), 'mean_duration_us': np.float64(5.688), 'median_duration_us': np.float64(5.688), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(5.688)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.727), 'mean_duration_us': np.float64(5.727), 'median_duration_us': np.float64(5.727), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(5.727)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.888), 'mean_duration_us': np.float64(5.888), 'median_duration_us': np.float64(5.888), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.208), 'mean_duration_us': np.float64(6.208), 'median_duration_us': np.float64(6.208), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(6.208)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.288), 'mean_duration_us': np.float64(6.288), 'median_duration_us': np.float64(6.288), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(6.288)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.328), 'mean_duration_us': np.float64(6.328), 'median_duration_us': np.float64(6.328), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.328), 'max_duration_us': np.float64(6.328)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.369), 'mean_duration_us': np.float64(6.369), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(6.369)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.011), 'mean_duration_us': np.float64(8.011), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.011), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.81)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.89)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.21)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.33)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.37)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.01)}]",0.0032124363642527663,99.87951031756357 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30),)","('c10::BFloat16',)","((1382400, 2700, 900, 30, 1),)","('',)",1,10,6.388623046875,6.388623046875,6.2685546875,6.2685546875,0.46857604295754646,0.46857604295754646,5.72705078125,5.72705078125,7.2099609375,7.2099609375,63.88623046875,63.88623046875,23422,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(63.886), 'mean_duration_us': np.float64(6.3886), 'median_duration_us': np.float64(6.2684999999999995), 'std_dev_duration_us': np.float64(0.4445501546507435), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(7.21)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(6.39)}]",0.003028293248765933,99.88253861081233 -aten::fill_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '-inf')",1,32,1.94549560546875,1.94549560546875,1.94140625,1.94140625,0.08448160107434809,0.08448160107434809,1.8017578125,1.8017578125,2.162109375,2.162109375,62.255859375,62.255859375,274,"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(62.259), 'mean_duration_us': np.float64(1.94559375), 'median_duration_us': np.float64(1.9415), 'std_dev_duration_us': np.float64(0.08307220480363749), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.162)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.95)}]",0.002951011466135147,99.88548962227847 -aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",1,12,5.120198567708333,5.120198567708333,5.10693359375,5.10693359375,0.3315673742872191,0.3315673742872191,4.52587890625,4.52587890625,5.68798828125,5.68798828125,61.4423828125,61.4423828125,7404,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.442), 'mean_duration_us': np.float64(5.120166666666667), 'median_duration_us': np.float64(5.106999999999999), 'std_dev_duration_us': np.float64(0.31744863976537824), 'min_duration_us': np.float64(4.526), 'max_duration_us': np.float64(5.688)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]",0.002912451582977648,99.88840207386144 -aten::fill_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '0.')",1,32,1.8853912353515625,1.8853912353515625,1.88134765625,1.88134765625,0.10690437015342119,0.10690437015342119,1.68212890625,1.68212890625,2.0419921875,2.0419921875,60.33251953125,60.33251953125,278,"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(60.334), 'mean_duration_us': np.float64(1.8854375), 'median_duration_us': np.float64(1.8815), 'std_dev_duration_us': np.float64(0.10526631034547564), 'min_duration_us': np.float64(1.682), 'max_duration_us': np.float64(2.042)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]",0.002859842570722548,99.89126191643217 -aten::nonzero,other,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256,),)","('bool',)","((1,),)","('',)",5,4,14.9569091796875,14.9569091796875,15.097412109375,15.097412109375,0.9578164441274859,0.9578164441274859,13.69482421875,13.69482421875,15.93798828125,15.93798828125,59.82763671875,59.82763671875,8827,"['aten::nonzero', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.845999999999999), 'mean_duration_us': np.float64(1.7114999999999998), 'median_duration_us': np.float64(1.7215), 'std_dev_duration_us': np.float64(0.27234215611983387), 'min_duration_us': np.float64(1.401), 'max_duration_us': np.float64(2.002)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.088999999999999), 'mean_duration_us': np.float64(2.2722499999999997), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.8777059231314325), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.765)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.012999999999998), 'mean_duration_us': np.float64(2.7532499999999995), 'median_duration_us': np.float64(2.643), 'std_dev_duration_us': np.float64(0.21467460841934716), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.124)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.335), 'mean_duration_us': np.float64(3.33375), 'median_duration_us': np.float64(3.404), 'std_dev_duration_us': np.float64(0.14568866634024752), 'min_duration_us': np.float64(3.083), 'max_duration_us': np.float64(3.444)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.545), 'mean_duration_us': np.float64(4.88625), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.20625272725469596), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.33)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(59.678999999999995), 'mean_duration_us': np.float64(5.967899999999999), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.4766303494323458), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.809)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]",0.0028288511640311366,99.89692667804256 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (1, 512, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 60, 1), (9216000, 18000, 60, 1), ())","('', '', 'False')",1,10,5.69111328125,5.69111328125,5.70751953125,5.70751953125,0.11077928798117594,0.11077928798117594,5.52685546875,5.52685546875,5.84716796875,5.84716796875,56.9111328125,56.9111328125,16081,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.91100000000001), 'mean_duration_us': np.float64(5.6911000000000005), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.10499185682708932), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(5.847)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}]",0.002697664238618948,99.89962434228119 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((72000, 4500, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,10,5.663232421875,10.369287109375,5.5869140625,10.27294921875,0.2895929138282026,0.4206487502631958,5.3671875,9.9326171875,6.2880859375,11.2939453125,56.63232421875,103.69287109375,15605,"['aten::miopen_convolution', 'nn.Module: Conv3d_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL2_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU16_SUM0_SUS128_SPO0_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.633), 'mean_duration_us': np.float64(5.6633000000000004), 'median_duration_us': np.float64(5.587), 'std_dev_duration_us': np.float64(0.2747045867836939), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(6.288)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.66)}]",0.0026844483362882567,99.90230879061747 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120),)","('c10::BFloat16',)","((36864000, 72000, 14400, 120, 1),)","('',)",1,1,56.2021484375,56.2021484375,56.2021484375,56.2021484375,,,56.2021484375,56.2021484375,56.2021484375,56.2021484375,56.2021484375,56.2021484375,23910,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(56.202), 'mean_duration_us': np.float64(56.202), 'median_duration_us': np.float64(56.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(56.202), 'max_duration_us': np.float64(56.202)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(56.2)}]",0.0026640574256869623,99.90497284804316 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((), (1, 16, 33, 30, 30))","('float', 'c10::BFloat16')","((), (475200, 29700, 900, 30, 1))","('', '')",1,4,13.67919921875,13.67919921875,13.718994140625,13.718994140625,0.307546133080185,0.307546133080185,13.3388671875,13.3388671875,13.93994140625,13.93994140625,54.716796875,54.716796875,10433,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(54.717), 'mean_duration_us': np.float64(13.67925), 'median_duration_us': np.float64(13.719000000000001), 'std_dev_duration_us': np.float64(0.26632721884929417), 'min_duration_us': np.float64(13.339), 'max_duration_us': np.float64(13.94)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.68)}]",0.002593649763883173,99.90756649780704 -aten::copy_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (1, 16, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((72000, 4500, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,10,5.359033203125,5.359033203125,5.3671875,5.3671875,0.19963068374529006,0.19963068374529006,5.126953125,5.126953125,5.68798828125,5.68798828125,53.59033203125,53.59033203125,15604,"['aten::copy_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(53.59000000000001), 'mean_duration_us': np.float64(5.359000000000001), 'median_duration_us': np.float64(5.367), 'std_dev_duration_us': np.float64(0.1893995776130454), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.688)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.36)}]",0.002540253815237104,99.91010675162228 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 4096), (4096, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",1,4,13.368896484375,13.368896484375,13.33837890625,13.33837890625,0.12458063350205915,0.12458063350205915,13.2587890625,13.2587890625,13.5400390625,13.5400390625,53.4755859375,53.4755859375,8761,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(53.476), 'mean_duration_us': np.float64(13.369), 'median_duration_us': np.float64(13.3385), 'std_dev_duration_us': np.float64(0.10779842299403042), 'min_duration_us': np.float64(13.259), 'max_duration_us': np.float64(13.54)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(13.37)}]",0.0025348146960642278,99.91264156631834 -triton_poi_fused_addmm_silu_4,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), ())","('', '', '3072')",1,20,2.4708251953125,2.4708251953125,2.283203125,2.283203125,0.3904354518977978,0.3904354518977978,2.08203125,2.08203125,3.44384765625,3.44384765625,49.41650390625,49.41650390625,8756,"['triton_poi_fused_addmm_silu_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(49.415), 'mean_duration_us': np.float64(2.47075), 'median_duration_us': np.float64(2.283), 'std_dev_duration_us': np.float64(0.3805816436718934), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(3.444)}]","[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'mean_duration_us': np.float64(2.47)}]",0.002342408748472216,99.91498397506682 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (1, 512, 4, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', 'False')",1,10,4.918505859375,4.918505859375,4.826171875,4.826171875,0.26837691894912835,0.26837691894912835,4.68603515625,4.68603515625,5.48779296875,5.48779296875,49.18505859375,49.18505859375,15954,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(49.184000000000005), 'mean_duration_us': np.float64(4.9184), 'median_duration_us': np.float64(4.8260000000000005), 'std_dev_duration_us': np.float64(0.25466613437989755), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.488)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.92)}]",0.002331437929374584,99.91731541299619 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 32, 32), (512, 16, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((81920, 5120, 1024, 32, 1), (432, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,48.2265625,56.517578125,48.2265625,56.517578125,,,48.2265625,56.517578125,48.2265625,56.517578125,48.2265625,56.517578125,23413,"['aten::miopen_convolution', 'nn.Module: Conv3d_1', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.486), 'mean_duration_us': np.float64(4.486), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(4.486)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.664), 'mean_duration_us': np.float64(16.664), 'median_duration_us': np.float64(16.664), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.664), 'max_duration_us': np.float64(16.664)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.904), 'mean_duration_us': np.float64(16.904), 'median_duration_us': np.float64(16.904), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.904), 'max_duration_us': np.float64(16.904)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.61)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.57)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.66)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(16.9)}]",0.002286003925390088,99.91960141692158 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (1, 16, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((72000, 4500, 900, 30, 1), (16, 1, 1, 1, 1), ())","('', '', '1')",1,10,4.7060546875,4.7060546875,4.64599609375,4.64599609375,0.22436085095860916,0.22436085095860916,4.44580078125,4.44580078125,5.1669921875,5.1669921875,47.060546875,47.060546875,15609,"['aten::add_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(47.061), 'mean_duration_us': np.float64(4.7061), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.21281938351569393), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.71)}]",0.002230733216518474,99.9218321501381 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((72000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,10,4.690087890625,4.690087890625,4.7060546875,4.7060546875,0.202737951359435,0.202737951359435,4.326171875,4.326171875,5.046875,5.046875,46.90087890625,46.90087890625,15611,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(46.901), 'mean_duration_us': np.float64(4.6901), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.19239358097400241), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.047)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]",0.0022231647400523863,99.92405531487816 -aten::fill_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '0')",1,11,4.223499644886363,4.223499644886363,4.40576171875,4.40576171875,0.8120007401551401,0.8120007401551401,1.8818359375,1.8818359375,4.88720703125,4.88720703125,46.45849609375,46.45849609375,15686,"['aten::fill_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(46.459), 'mean_duration_us': np.float64(4.223545454545455), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.7741596456964116), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.887)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.22)}]",0.0022021951997518493,99.92625751007792 -triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",1,4,11.446044921875,11.446044921875,11.43603515625,11.43603515625,0.038334483806650256,0.038334483806650256,11.416015625,11.416015625,11.49609375,11.49609375,45.7841796875,45.7841796875,8811,"['triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.78399999999999), 'mean_duration_us': np.float64(11.445999999999998), 'median_duration_us': np.float64(11.436), 'std_dev_duration_us': np.float64(0.033166247903553964), 'min_duration_us': np.float64(11.416), 'max_duration_us': np.float64(11.496)}]","[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]",0.0021702316951657113,99.92842774177308 -triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",1,4,11.295654296875,11.295654296875,11.29541015625,11.29541015625,0.0980764883845896,0.0980764883845896,11.17578125,11.17578125,11.416015625,11.416015625,45.1826171875,45.1826171875,8810,"['triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.183), 'mean_duration_us': np.float64(11.29575), 'median_duration_us': np.float64(11.2955), 'std_dev_duration_us': np.float64(0.0848539185895384), 'min_duration_us': np.float64(11.176), 'max_duration_us': np.float64(11.416)}]","[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'mean_duration_us': np.float64(11.3)}]",0.0021417168235870563,99.93056945859666 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (1, 512, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((460800, 900, 30, 1), (2304000, 4500, 30, 1), ())","('', '', 'False')",1,10,4.461669921875,4.461669921875,4.4052734375,4.4052734375,0.2252417466616448,0.2252417466616448,4.326171875,4.326171875,5.0869140625,5.0869140625,44.61669921875,44.61669921875,15947,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.617), 'mean_duration_us': np.float64(4.4616999999999996), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.213733502287311), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.087)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",0.0021148915507301883,99.9326843501474 -aten::fill_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '-inf')",1,11,4.055841619318182,4.055841619318182,4.2451171875,4.2451171875,0.7697365198769237,0.7697365198769237,1.8017578125,1.8017578125,4.64599609375,4.64599609375,44.6142578125,44.6142578125,15683,"['aten::fill_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(44.614), 'mean_duration_us': np.float64(4.055818181818181), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.733827180321438), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.06)}]",0.0021147758247903404,99.93479912597219 -aten::arange,other,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '6', '1', '')",1,10,4.449560546875,4.449560546875,4.42578125,4.42578125,0.20212210188296303,0.20212210188296303,4.1650390625,4.1650390625,4.80615234375,4.80615234375,44.49560546875,44.49560546875,15658,"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.496), 'mean_duration_us': np.float64(4.4496), 'median_duration_us': np.float64(4.426), 'std_dev_duration_us': np.float64(0.19173794616611492), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(43.693000000000005), 'mean_duration_us': np.float64(4.369300000000001), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.31885766417008077), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(4.847)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]",0.00207110085509154,99.9389793783714 -aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 4, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (29491200, 57600, 14400, 120, 1)), ())","('', '2')",2,1,42.6611328125,42.6611328125,42.6611328125,42.6611328125,,,42.6611328125,42.6611328125,42.6611328125,42.6611328125,42.6611328125,42.6611328125,23889,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.456), 'mean_duration_us': np.float64(11.456), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.456), 'max_duration_us': np.float64(11.456)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(31.205), 'mean_duration_us': np.float64(31.205), 'median_duration_us': np.float64(31.205), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(31.205), 'max_duration_us': np.float64(31.205)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(31.2)}]",0.0020221950729115905,99.94100157344431 -aten::fill_,elementwise,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1,), ())","('int', 'Scalar')","((1,), ())","('', '0')",1,12,3.3604329427083335,3.3604329427083335,2.06201171875,2.06201171875,2.7838505311476087,2.7838505311476087,1.80078125,1.80078125,9.4931640625,9.4931640625,40.3251953125,40.3251953125,7369,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(40.326), 'mean_duration_us': np.float64(3.3605), 'median_duration_us': np.float64(2.062), 'std_dev_duration_us': np.float64(2.6652849284832567), 'min_duration_us': np.float64(1.801), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}]",0.0019114684936646057,99.94291304193797 -triton_poi_fused_silu_18,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), ())","('', '', '3072')",1,8,4.98150634765625,4.98150634765625,4.966552734375,4.966552734375,0.3302784986302354,0.3302784986302354,4.64599609375,4.64599609375,5.44677734375,5.44677734375,39.85205078125,39.85205078125,9510,"['triton_poi_fused_silu_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(39.852), 'mean_duration_us': np.float64(4.9815), 'median_duration_us': np.float64(4.9665), 'std_dev_duration_us': np.float64(0.3089826046883546), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.447)}]","[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'mean_duration_us': np.float64(4.98)}]",0.0018890408065219786,99.94480208274449 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((2700, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 2700), (1, 512))","('', '')",1,3,12.417317708333334,12.417317708333334,11.4560546875,11.4560546875,1.770000157041956,1.770000157041956,11.3359375,11.3359375,14.4599609375,14.4599609375,37.251953125,37.251953125,23512,"['aten::mm', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB2048_LBSPPM0_LPA16_LPB32_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.252), 'mean_duration_us': np.float64(12.417333333333334), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(1.44521401721529), 'min_duration_us': np.float64(11.336), 'max_duration_us': np.float64(14.46)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.42)}]",0.0017657926805833932,99.94656787542507 -aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 768), (768, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768), (3072, 1))","('', '', '')",1,4,7.8402099609375,7.8402099609375,7.830078125,7.830078125,0.1648879704515517,0.1648879704515517,7.64990234375,7.64990234375,8.05078125,8.05078125,31.36083984375,31.36083984375,8822,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(31.361), 'mean_duration_us': np.float64(7.84025), 'median_duration_us': np.float64(7.83), 'std_dev_duration_us': np.float64(0.1428467272988779), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(8.051)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]",0.0014865459877291144,99.9480544214128 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', '1')",1,5,6.02421875,6.02421875,5.92822265625,5.92822265625,0.39087327315214687,0.39087327315214687,5.68798828125,5.68798828125,6.68896484375,6.68896484375,30.12109375,30.12109375,23449,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(30.121), 'mean_duration_us': np.float64(6.0241999999999996), 'median_duration_us': np.float64(5.928), 'std_dev_duration_us': np.float64(0.3496423315332399), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(6.689)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.02)}]",0.001427780355474078,99.94948220176828 -aten::where,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((2700, 2700), (), ())","('bool', 'float', 'float')","((2700, 1), (), ())","('', '', '')",1,1,28.9619140625,28.9619140625,28.9619140625,28.9619140625,,,28.9619140625,28.9619140625,28.9619140625,28.9619140625,28.9619140625,28.9619140625,23485,"['aten::where', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(28.962), 'mean_duration_us': np.float64(28.962), 'median_duration_us': np.float64(28.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(28.962), 'max_duration_us': np.float64(28.962)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.96)}]",0.00137283367923404,99.95085503544752 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",1,4,6.99951171875,6.99951171875,7.190185546875,7.190185546875,0.6636223025908732,0.6636223025908732,6.087890625,6.087890625,7.52978515625,7.52978515625,27.998046875,27.998046875,8771,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.998), 'mean_duration_us': np.float64(6.9995), 'median_duration_us': np.float64(7.1899999999999995), 'std_dev_duration_us': np.float64(0.5746923089793354), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.53)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.0)}]",0.001327145078181877,99.9521821805257 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",1,4,6.9896240234375,6.9896240234375,6.94970703125,6.94970703125,0.18656449590027488,0.18656449590027488,6.80908203125,6.80908203125,7.25,7.25,27.95849609375,27.95849609375,8873,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.958), 'mean_duration_us': np.float64(6.9895), 'median_duration_us': np.float64(6.9495000000000005), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.25)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(6.99)}]",0.0013252703179563324,99.95350745084366 -aten::clamp,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '0', '1')",1,1,27.64111328125,27.64111328125,27.64111328125,27.64111328125,,,27.64111328125,27.64111328125,27.64111328125,27.64111328125,27.64111328125,27.64111328125,24635,['aten::clamp'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.641), 'mean_duration_us': np.float64(27.641), 'median_duration_us': np.float64(27.641), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.641), 'max_duration_us': np.float64(27.641)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(27.64)}]",0.0013102259457760355,99.95481767678943 -triton_per_fused_native_layer_norm_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1), (1, 7425, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (7456, 1, 7456), (7456, 1, 7456), (), ())","('', '', '', '', '', '7425', '24')",1,4,6.5887451171875,6.5887451171875,6.468505859375,6.468505859375,0.43476345613526435,0.43476345613526435,6.2080078125,6.2080078125,7.2099609375,7.2099609375,26.35498046875,26.35498046875,8847,"['triton_per_fused_native_layer_norm_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(26.355), 'mean_duration_us': np.float64(6.58875), 'median_duration_us': np.float64(6.468500000000001), 'std_dev_duration_us': np.float64(0.37655104235680975), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(7.21)}]","[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'mean_duration_us': np.float64(6.59)}]",0.001249261520663879,99.9560669383101 -aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (1, 512, 3, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', '1')",1,3,8.384602864583334,8.384602864583334,8.61181640625,8.61181640625,0.4286879502189478,0.4286879502189478,7.89013671875,7.89013671875,8.65185546875,8.65185546875,25.15380859375,25.15380859375,23803,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(25.153999999999996), 'mean_duration_us': np.float64(8.384666666666666), 'median_duration_us': np.float64(8.612), 'std_dev_duration_us': np.float64(0.3501631365838246), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.652)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(8.38)}]",0.0011923243582584477,99.95725926266836 -triton_red_fused_addmm_native_layer_norm_view_0,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 3072), (3072,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '256', '3072')",1,4,5.74755859375,5.74755859375,5.78759765625,5.78759765625,0.346767475313975,0.346767475313975,5.287109375,5.287109375,6.1279296875,6.1279296875,22.990234375,22.990234375,8724,"['triton_red_fused_addmm_native_layer_norm_view_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.99), 'mean_duration_us': np.float64(5.7475), 'median_duration_us': np.float64(5.7875), 'std_dev_duration_us': np.float64(0.30036685902409416), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.128)}]","[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]",0.0010897680303647629,99.95834903069873 -aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '', '1')",1,1,22.591796875,22.591796875,22.591796875,22.591796875,,,22.591796875,22.591796875,22.591796875,22.591796875,22.591796875,22.591796875,24634,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.592), 'mean_duration_us': np.float64(22.592), 'median_duration_us': np.float64(22.592), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.592), 'max_duration_us': np.float64(22.592)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(22.59)}]",0.001070881556981498,99.95941991225571 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), ())","('c10::BFloat16', 'double')","((57600, 7430400, 240, 1), ())","('', '')",1,1,22.43212890625,22.43212890625,22.43212890625,22.43212890625,,,22.43212890625,22.43212890625,22.43212890625,22.43212890625,22.43212890625,22.43212890625,24633,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.432), 'mean_duration_us': np.float64(22.432), 'median_duration_us': np.float64(22.432), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.432), 'max_duration_us': np.float64(22.432)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(22.43)}]",0.00106331308051541,99.96048322533623 -triton_poi_fused__to_copy_cat_slice_3,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '256')",1,12,1.8617757161458333,1.8617757161458333,1.861328125,1.861328125,0.18005556047818996,0.18005556047818996,1.56201171875,1.56201171875,2.2421875,2.2421875,22.34130859375,22.34130859375,8754,"['triton_poi_fused__to_copy_cat_slice_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.342), 'mean_duration_us': np.float64(1.8618333333333332), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.17237596184567677), 'min_duration_us': np.float64(1.562), 'max_duration_us': np.float64(2.242)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'mean_duration_us': np.float64(1.86)}]",0.0010590080755530484,99.96154223341179 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '6', '3072')",1,4,5.4371337890625,5.4371337890625,5.4072265625,5.4072265625,0.059814453125000076,0.059814453125000076,5.4072265625,5.4072265625,5.52685546875,5.52685546875,21.74853515625,21.74853515625,8849,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.748), 'mean_duration_us': np.float64(5.437), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.05196152422706637), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.527)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]",0.0010309098173578476,99.96257314322915 -triton_red_fused__to_copy_mul_sum_unsqueeze_5,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256), (1, 4096, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((1048576, 4096, 1), (256, 1), (8192, 1, 4096), (), ())","('', '', '', '8192', '128')",1,4,5.43701171875,5.43701171875,5.427001953125,5.427001953125,0.10999305125165447,0.10999305125165447,5.3271484375,5.3271484375,5.56689453125,5.56689453125,21.748046875,21.748046875,8758,"['triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.747999999999998), 'mean_duration_us': np.float64(5.436999999999999), 'median_duration_us': np.float64(5.427), 'std_dev_duration_us': np.float64(0.09539392014169465), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.567)}]","[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]",0.0010308866721698779,99.96360402990132 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('c10::BFloat16', 'float', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,5,4.2052734375,4.2052734375,4.044921875,4.044921875,0.44987235908125317,0.44987235908125317,3.96484375,3.96484375,5.0068359375,5.0068359375,21.0263671875,21.0263671875,8714,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(21.027), 'mean_duration_us': np.float64(4.2054), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.4023936381206839), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.21)}]",0.0009966780843506798,99.96460070798567 -aten::copy_,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 1, 460800, 15360, 512), ())","('', '', 'False')",1,1,20.509765625,20.509765625,20.509765625,20.509765625,,,20.509765625,20.509765625,20.509765625,20.509765625,20.509765625,20.509765625,23605,"['aten::copy_', 'nn.Module: HunyuanVideoResnetBlockCausal3D_1', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.51), 'mean_duration_us': np.float64(20.51), 'median_duration_us': np.float64(20.51), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.51), 'max_duration_us': np.float64(20.51)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.51)}]",0.0009721904754787507,99.96557289846115 -aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((18432000, 72000, 120, 1), (), (), ())","('', '[240, 240]', '2.', '2.')",1,1,20.30908203125,29.44189453125,20.30908203125,29.44189453125,,,20.30908203125,29.44189453125,20.30908203125,29.44189453125,20.30908203125,29.44189453125,24018,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.309), 'mean_duration_us': np.float64(20.309), 'median_duration_us': np.float64(20.309), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.309), 'max_duration_us': np.float64(20.309)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.31)}]",0.0009626778032232091,99.96653557626438 -aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((921600, 1800, 900, 30, 1), (), (), (), ())","('', '[2, 60, 60]', '1.', '2.', '2.')",1,1,20.18896484375,20.18896484375,20.18896484375,20.18896484375,,,20.18896484375,20.18896484375,20.18896484375,20.18896484375,20.18896484375,20.18896484375,23754,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.189), 'mean_duration_us': np.float64(20.189), 'median_duration_us': np.float64(20.189), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.189), 'max_duration_us': np.float64(20.189)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.19)}]",0.000956984086982666,99.96749256035136 -aten::add_,elementwise,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 2700, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (1,), ())","('', '', '1')",1,3,6.68896484375,6.68896484375,7.08984375,7.08984375,0.9474872133303112,0.9474872133303112,5.60693359375,5.60693359375,7.3701171875,7.3701171875,20.06689453125,20.06689453125,23514,"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.067), 'mean_duration_us': np.float64(6.689), 'median_duration_us': np.float64(7.09), 'std_dev_duration_us': np.float64(0.7735817129862019), 'min_duration_us': np.float64(5.607), 'max_duration_us': np.float64(7.37)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.69)}]",0.0009511977899902442,99.96844375814135 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1555200, 518400, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",1,4,4.9666748046875,4.9666748046875,4.98681640625,4.98681640625,0.056854021444259904,0.056854021444259904,4.88623046875,4.88623046875,5.0068359375,5.0068359375,19.86669921875,19.86669921875,24562,['aten::copy_'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.867), 'mean_duration_us': np.float64(4.96675), 'median_duration_us': np.float64(4.987), 'std_dev_duration_us': np.float64(0.049398254017728016), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]",0.0009417082629226723,99.96938546640428 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((1555200, 518400, 240, 1), ())","('', '')",1,4,4.966552734375,4.966552734375,4.966796875,4.966796875,0.03309163842745591,0.03309163842745591,4.92578125,4.92578125,5.0068359375,5.0068359375,19.8662109375,19.8662109375,24558,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.866999999999997), 'mean_duration_us': np.float64(4.966749999999999), 'median_duration_us': np.float64(4.967), 'std_dev_duration_us': np.float64(0.02863891583143451), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]",0.0009416851177347026,99.97032715152201 -triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), ())","('', '', '', '', '', '786432')",1,4,4.66552734375,4.66552734375,4.60546875,4.60546875,0.1483710960296656,0.1483710960296656,4.56494140625,4.56494140625,4.88623046875,4.88623046875,18.662109375,18.662109375,8809,"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.662), 'mean_duration_us': np.float64(4.6655), 'median_duration_us': np.float64(4.6055), 'std_dev_duration_us': np.float64(0.12837542599734572), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.886)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'mean_duration_us': np.float64(4.67)}]",0.0008846090842014534,99.97121176060621 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (1, 256, 4, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((14745600, 57600, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', 'False')",1,1,18.5869140625,18.5869140625,18.5869140625,18.5869140625,,,18.5869140625,18.5869140625,18.5869140625,18.5869140625,18.5869140625,18.5869140625,24030,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(18.587), 'mean_duration_us': np.float64(18.587), 'median_duration_us': np.float64(18.587), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(18.587)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(18.59)}]",0.0008810447252541216,99.97209280533146 -triton_poi_fused_addmm_clone_permute_view_31,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 64), (64,), (1, 16, 33, 1, 15, 2, 15, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1), (1,), (475200, 29700, 900, 900, 60, 30, 2, 1), ())","('', '', '', '475200')",1,4,4.595703125,4.595703125,4.64599609375,4.64599609375,0.13275863452711426,0.13275863452711426,4.40478515625,4.40478515625,4.68603515625,4.68603515625,18.3828125,18.3828125,10413,"['triton_poi_fused_addmm_clone_permute_view_31', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.383000000000003), 'mean_duration_us': np.float64(4.595750000000001), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.11487030730349758), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(4.686)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",0.0008713700366827922,99.97296417536813 -triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (1, 24, 256, 256), (1, 24, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1), (1572864, 65536, 256, 1), (1572864, 65536, 256, 1), ())","('', '', '', '1572864')",1,4,4.335693359375,4.335693359375,4.325927734375,4.325927734375,0.15054089193657735,0.15054089193657735,4.2060546875,4.2060546875,4.48486328125,4.48486328125,17.3427734375,17.3427734375,8728,"['triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.343), 'mean_duration_us': np.float64(4.33575), 'median_duration_us': np.float64(4.3260000000000005), 'std_dev_duration_us': np.float64(0.13048060200658163), 'min_duration_us': np.float64(4.206), 'max_duration_us': np.float64(4.485)}]","[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_cop...', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]",0.0008220707863073579,99.97378624615445 -triton_per_fused__to_copy_div_mul_sum_unsqueeze_7,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 4096, 2), (1, 1), (1, 4096), (), ())","('float', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((8192, 1, 4096), (1, 1), (4096, 1), (), ())","('', '', '', '4096', '2')",1,4,4.33544921875,4.33544921875,4.405517578125,4.405517578125,0.29147214306464797,0.29147214306464797,3.9248046875,3.9248046875,4.60595703125,4.60595703125,17.341796875,17.341796875,8760,"['triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.342), 'mean_duration_us': np.float64(4.3355), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.25236927309004953), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.606)}]","[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]",0.0008220244959314186,99.97460827065038 -aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 2, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (3686400, 7200, 3600, 60, 1)), ())","('', '2')",2,1,15.822265625,15.822265625,15.822265625,15.822265625,,,15.822265625,15.822265625,15.822265625,15.822265625,15.822265625,15.822265625,23755,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.332), 'mean_duration_us': np.float64(8.332), 'median_duration_us': np.float64(8.332), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.332), 'max_duration_us': np.float64(8.332)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.33)}]",0.0007499966709697514,99.97535826732135 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 2700), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2700, 2700, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,15.62158203125,15.62158203125,15.62158203125,15.62158203125,,,15.62158203125,15.62158203125,15.62158203125,15.62158203125,15.62158203125,15.62158203125,23499,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_2', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.488), 'mean_duration_us': np.float64(5.488), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.488), 'max_duration_us': np.float64(5.488)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.134), 'mean_duration_us': np.float64(10.134), 'median_duration_us': np.float64(10.134), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.134), 'max_duration_us': np.float64(10.134)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.49)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.13)}]",0.0007404839987142099,99.97609875132007 -aten::nonzero,other,NA,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",5,1,14.5361328125,14.5361328125,14.5361328125,14.5361328125,,,14.5361328125,14.5361328125,14.5361328125,14.5361328125,14.5361328125,14.5361328125,10416,['aten::nonzero'],"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.881), 'mean_duration_us': np.float64(1.881), 'median_duration_us': np.float64(1.881), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(1.881)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.962), 'mean_duration_us': np.float64(1.962), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(1.962)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.284), 'mean_duration_us': np.float64(3.284), 'median_duration_us': np.float64(3.284), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.284), 'max_duration_us': np.float64(3.284)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.324), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.324)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.538), 'mean_duration_us': np.float64(4.512666666666667), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.0006417003364595839,99.97742948390238 -aten::index,other,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), ())","('c10::BFloat16', '')","((786432, 3072, 1), ())","('', '')",1,4,3.3837890625,18.3406982421875,3.3837890625,18.501220703125,0.02311656351247525,0.962001831388019,3.36376953125,17.05859375,3.40380859375,19.3017578125,13.53515625,73.36279296875,8826,"['aten::index', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536000000000001), 'mean_duration_us': np.float64(3.3840000000000003), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.404)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]",0.0006415846105197355,99.9780710685129 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",1,6,2.2089029947916665,2.2089029947916665,2.18212890625,2.18212890625,0.11725194218808946,0.11725194218808946,2.08203125,2.08203125,2.36181640625,2.36181640625,13.25341796875,13.25341796875,10481,"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(13.253000000000002), 'mean_duration_us': np.float64(2.2088333333333336), 'median_duration_us': np.float64(2.182), 'std_dev_duration_us': np.float64(0.10705203822855923), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.21)}]",0.0006282298370612258,99.97869929834997 -aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((5529600, 10800, 60, 1), (), (), ())","('', '[120, 120]', '2.', '2.')",1,1,13.2177734375,18.46484375,13.2177734375,18.46484375,,,13.2177734375,18.46484375,13.2177734375,18.46484375,13.2177734375,18.46484375,23874,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.218), 'mean_duration_us': np.float64(13.218), 'median_duration_us': np.float64(13.218), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.218), 'max_duration_us': np.float64(13.218)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(13.22)}]",0.0006265402383394387,99.97932583858831 -aten::add,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 2700, 512), (1, 2700, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (2700, 1, 2700), ())","('', '', '1')",1,1,12.6181640625,12.6181640625,12.6181640625,12.6181640625,,,12.6181640625,12.6181640625,12.6181640625,12.6181640625,12.6181640625,12.6181640625,23595,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.618), 'mean_duration_us': np.float64(12.618), 'median_duration_us': np.float64(12.618), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.618), 'max_duration_us': np.float64(12.618)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.62)}]",0.0005981179475126624,99.97992395653583 -aten::le,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700))","('int', 'int')","((0, 1), (1, 0))","('', '')",1,1,12.537109375,12.537109375,12.537109375,12.537109375,,,12.537109375,12.537109375,12.537109375,12.537109375,12.537109375,12.537109375,23477,"['aten::le', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.537), 'mean_duration_us': np.float64(12.537), 'median_duration_us': np.float64(12.537), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.537), 'max_duration_us': np.float64(12.537)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.54)}]",0.0005942758463096943,99.98051823238214 -aten::cos,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",1,1,12.09716796875,12.09716796875,12.09716796875,12.09716796875,,,12.09716796875,12.09716796875,12.09716796875,12.09716796875,12.09716796875,12.09716796875,147,"['aten::cos', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.097), 'mean_duration_us': np.float64(12.097), 'median_duration_us': np.float64(12.097), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.097), 'max_duration_us': np.float64(12.097)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(12.1)}]",0.000573422031949006,99.98109165441409 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((512,), (2700, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",1,1,12.05712890625,12.05712890625,12.05712890625,12.05712890625,,,12.05712890625,12.05712890625,12.05712890625,12.05712890625,12.05712890625,12.05712890625,23592,"['aten::addmm', 'nn.Module: Linear_299', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.057), 'mean_duration_us': np.float64(12.057), 'median_duration_us': np.float64(12.057), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.057), 'max_duration_us': np.float64(12.057)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.06)}]",0.0005715241265354916,99.98166317854063 -triton_poi_fused_add_addmm_silu_8,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (3072, 1), ())","('', '', '', '', '', '', '3072')",1,4,2.9234619140625,2.9234619140625,2.88330078125,2.88330078125,0.17329026350422627,0.17329026350422627,2.76318359375,2.76318359375,3.1640625,3.1640625,11.69384765625,11.69384765625,8764,"['triton_poi_fused_add_addmm_silu_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.693999999999999), 'mean_duration_us': np.float64(2.9234999999999998), 'median_duration_us': np.float64(2.8834999999999997), 'std_dev_duration_us': np.float64(0.1500674848193306), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.164)}]","[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'mean_duration_us': np.float64(2.92)}]",0.0005543041066860442,99.98221748264731 -aten::copy_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2700), (1, 1, 2700, 2700), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), (7290000, 7290000, 2700, 1), ())","('', '', 'False')",1,1,11.2158203125,11.2158203125,11.2158203125,11.2158203125,,,11.2158203125,11.2158203125,11.2158203125,11.2158203125,11.2158203125,11.2158203125,23552,"['aten::copy_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.216), 'mean_duration_us': np.float64(11.216), 'median_duration_us': np.float64(11.216), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(11.216)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.22)}]",0.0005316449676637202,99.98274912761498 -triton_poi_fused_add_addmm_17,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",1,3,3.5242513020833335,3.5242513020833335,3.52392578125,3.52392578125,0.040528324222577586,0.040528324222577586,3.48388671875,3.48388671875,3.56494140625,3.56494140625,10.57275390625,10.57275390625,10553,"['triton_poi_fused_add_addmm_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.573), 'mean_duration_us': np.float64(3.5243333333333333), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0330689515339624), 'min_duration_us': np.float64(3.484), 'max_duration_us': np.float64(3.565)}]","[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",0.0005011627551076419,99.9832502903701 -aten::copy_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700), ())","('c10::BFloat16', 'float', 'Scalar')","((2700, 1), (2700, 1), ())","('', '', 'False')",1,1,10.01416015625,10.01416015625,10.01416015625,10.01416015625,,,10.01416015625,10.01416015625,10.01416015625,10.01416015625,10.01416015625,10.01416015625,23491,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.014), 'mean_duration_us': np.float64(10.014), 'median_duration_us': np.float64(10.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.014), 'max_duration_us': np.float64(10.014)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]",0.00047468466007031943,99.98372497503017 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 3, 9, 240, 240), (1, 3, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1555200, 518400, 57600, 240, 1), (3, 1, 1, 1, 1), ())","('', '', '1')",1,1,9.81396484375,9.81396484375,9.81396484375,9.81396484375,,,9.81396484375,9.81396484375,9.81396484375,9.81396484375,9.81396484375,9.81396484375,24170,"['aten::add_', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.814), 'mean_duration_us': np.float64(9.814), 'median_duration_us': np.float64(9.814), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.814), 'max_duration_us': np.float64(9.814)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.81)}]",0.0004651951330027476,99.98419017016317 -aten::sin,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",1,1,9.212890625,9.212890625,9.212890625,9.212890625,,,9.212890625,9.212890625,9.212890625,9.212890625,9.212890625,9.212890625,149,"['aten::sin', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.213), 'mean_duration_us': np.float64(9.213), 'median_duration_us': np.float64(9.213), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.213), 'max_duration_us': np.float64(9.213)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(9.21)}]",0.00043670340661206236,99.98462687356978 -triton_per_fused__to_copy_any_sum_unsqueeze_6,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (1, 1), (256,), (), ())","('c10::BFloat16', 'float', 'bool', 'Scalar', 'Scalar')","((256, 1), (1, 1), (1,), (), ())","('', '', '', '1', '256')",1,4,2.29248046875,2.29248046875,1.98193359375,1.98193359375,0.9005283959186826,0.9005283959186826,1.60107421875,1.60107421875,3.60498046875,3.60498046875,9.169921875,9.169921875,8759,"['triton_per_fused__to_copy_any_sum_unsqueeze_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.17), 'mean_duration_us': np.float64(2.2925), 'median_duration_us': np.float64(1.982), 'std_dev_duration_us': np.float64(0.779879638149375), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.605)}]","[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'mean_duration_us': np.float64(2.29)}]",0.00043466663007072986,99.98506154019985 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (1, 256, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 14400, 120, 1), (18432000, 72000, 120, 1), ())","('', '', 'False')",1,1,9.1328125,9.1328125,9.1328125,9.1328125,,,9.1328125,9.1328125,9.1328125,9.1328125,9.1328125,9.1328125,24023,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.13)}]",0.0004329075957850336,99.98549444779563 -aten::mul,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 351, 128), ())","('float', 'double')","((44928, 128, 1), ())","('', '')",1,2,4.325439453125,4.325439453125,4.325439453125,4.325439453125,0.28346419304402126,0.28346419304402126,4.125,4.125,4.52587890625,4.52587890625,8.65087890625,8.65087890625,148,"['aten::mul', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.651), 'mean_duration_us': np.float64(4.3255), 'median_duration_us': np.float64(4.3255), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]",0.00041006329525895217,99.9859045110909 -aten::div,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 2700, 512), ())","('c10::BFloat16', 'double')","((1382400, 512, 1), ())","('', '')",1,1,8.57080078125,8.57080078125,8.57080078125,8.57080078125,,,8.57080078125,8.57080078125,8.57080078125,8.57080078125,8.57080078125,8.57080078125,23596,"['aten::div', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.571), 'mean_duration_us': np.float64(8.571), 'median_duration_us': np.float64(8.571), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.571), 'max_duration_us': np.float64(8.571)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.57)}]",0.00040626748443192337,99.98631077857533 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 351), (1, 351), ())","('long int', 'long int', 'Scalar')","((351, 1), (351, 1), ())","('', '', 'False')",1,2,4.205078125,4.205078125,4.205078125,4.205078125,0.6801759565124506,0.6801759565124506,3.72412109375,3.72412109375,4.68603515625,4.68603515625,8.41015625,8.41015625,15,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.41), 'mean_duration_us': np.float64(4.205), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.48099999999999987), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(4.686)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.2)}]",0.0003986527175898962,99.98670943129292 -aten::sub,elementwise,NA,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",1,4,2.011962890625,2.011962890625,2.001953125,2.001953125,0.06005859375000001,0.06005859375000001,1.9619140625,1.9619140625,2.08203125,2.08203125,8.0478515625,8.0478515625,10432,['aten::sub'],"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.047999999999998), 'mean_duration_us': np.float64(2.0119999999999996), 'median_duration_us': np.float64(2.002), 'std_dev_duration_us': np.float64(0.05196152422706626), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::unrolled_elementwise_kernel, 4, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(7.729), 'mean_duration_us': np.float64(2.5763333333333334), 'median_duration_us': np.float64(2.363), 'std_dev_duration_us': np.float64(0.3311136092374069), 'min_duration_us': np.float64(2.322), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::unrolled_elementwise_kernel(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.65), 'mean_duration_us': np.float64(7.65), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(7.65)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.65)}]",0.00036261565992109287,99.98781986797614 -aten::cat,other,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"(((1, 351, 64), (1, 351, 64)), ())","('TensorList', 'Scalar')","(((22464, 1, 351), (22464, 1, 351)), ())","('', '-1')",1,1,7.490234375,7.490234375,7.490234375,7.490234375,,,7.490234375,7.490234375,7.490234375,7.490234375,7.490234375,7.490234375,146,"['aten::cat', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 3, 64, 64>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.489), 'mean_duration_us': np.float64(3.7445), 'median_duration_us': np.float64(3.7445), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.965)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.74)}]",0.00035497774789109603,99.9885298929075 -aten::copy_,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 1, 351), (1, 1, 351), ())","('float', 'long int', 'Scalar')","((351, 351, 1), (351, 351, 1), ())","('', '', 'False')",1,1,7.451171875,7.451171875,7.451171875,7.451171875,,,7.451171875,7.451171875,7.451171875,7.451171875,7.451171875,7.451171875,130,"['aten::copy_', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.451), 'mean_duration_us': np.float64(7.451), 'median_duration_us': np.float64(7.451), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.451), 'max_duration_us': np.float64(7.451)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.45)}]",0.0003531955684174301,99.98888308847592 -aten::normal_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (), (), ())","('float', 'Scalar', 'Scalar', '')","((475200, 29700, 900, 30, 1), (), (), ())","('', '0.', '1.', '')",1,1,7.25,7.25,7.25,7.25,,,7.25,7.25,7.25,7.25,7.25,7.25,8691,['aten::normal_'],"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.25), 'mean_duration_us': np.float64(7.25), 'median_duration_us': np.float64(7.25), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.25), 'max_duration_us': np.float64(7.25)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(7.25)}]",0.0003436597509739189,99.98922674822688 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (1, 512, 2, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 7200, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', 'False')",1,1,7.169921875,7.169921875,7.169921875,7.169921875,,,7.169921875,7.169921875,7.169921875,7.169921875,7.169921875,7.169921875,23886,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.17), 'mean_duration_us': np.float64(7.17), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.17), 'max_duration_us': np.float64(7.17)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.17)}]",0.00033986394014689017,99.98956661216702 -aten::fill_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2704), ())","('c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), ())","('', '0.')",1,1,7.0888671875,7.0888671875,7.0888671875,7.0888671875,,,7.0888671875,7.0888671875,7.0888671875,7.0888671875,7.0888671875,7.0888671875,23548,"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.089), 'mean_duration_us': np.float64(7.089), 'median_duration_us': np.float64(7.089), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(7.089)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]",0.0003360218389439221,99.98990263400597 -aten::all,reduce,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 351),)","('bool',)","((351, 1),)","('',)",1,1,6.96923828125,6.96923828125,6.96923828125,6.96923828125,,,6.96923828125,6.96923828125,6.96923828125,6.96923828125,6.96923828125,6.96923828125,44,"['aten::all', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, bool, 4, 4> >(at::native::ReduceOp, unsigned int, bool, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.969), 'mean_duration_us': np.float64(6.969), 'median_duration_us': np.float64(6.969), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.969), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.807), 'mean_duration_us': np.float64(2.269), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.2078893936688451), 'min_duration_us': np.float64(2.122), 'max_duration_us': np.float64(2.563)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.27)}]",0.0003226670654854124,99.99055565233935 -aten::bmm,GEMM,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 64, 1), (1, 1, 351))","('float', 'float')","((64, 1, 1), (351, 351, 1))","('', '')",1,1,6.76904296875,6.76904296875,6.76904296875,6.76904296875,,,6.76904296875,6.76904296875,6.76904296875,6.76904296875,6.76904296875,6.76904296875,142,"['aten::bmm', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA4_GRVWB4_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB8_LPM0_LRVW4_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.769), 'mean_duration_us': np.float64(6.769), 'median_duration_us': np.float64(6.769), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.769), 'max_duration_us': np.float64(6.769)}]","[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_S...', 'stream': 0, 'mean_duration_us': np.float64(6.77)}]",0.00032086174082377676,99.99087651408017 -aten::le,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 351, 1))","('long int', 'long int')","((351, 351, 351, 1), (351, 351, 1, 1))","('', '')",1,1,6.52783203125,6.52783203125,6.52783203125,6.52783203125,,,6.52783203125,6.52783203125,6.52783203125,6.52783203125,6.52783203125,6.52783203125,95,"['aten::le', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.528), 'mean_duration_us': np.float64(6.528), 'median_duration_us': np.float64(6.528), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.0003094280179667512,99.99118594209814 -aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((1382400, 2700, 30, 1), (), (), ())","('', '[60, 60]', '2.', '2.')",1,1,6.2890625,10.5341796875,6.2890625,10.5341796875,,,6.2890625,10.5341796875,6.2890625,10.5341796875,6.2890625,10.5341796875,23740,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.289), 'mean_duration_us': np.float64(6.289), 'median_duration_us': np.float64(6.289), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(6.289)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}]",0.000298110021049574,99.99148405211919 -aten::arange,other,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '351', '1', '')",1,3,2.0421549479166665,2.0421549479166665,1.841796875,1.841796875,0.3822298351596716,0.3822298351596716,1.8017578125,1.8017578125,2.48291015625,2.48291015625,6.12646484375,6.12646484375,35,"['aten::arange', 'nn.Module: LlamaModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.127000000000001), 'mean_duration_us': np.float64(2.0423333333333336), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.3120259960679915), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.483)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}]",0.00028667629819254843,99.99206113109084 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",1,3,2.0016276041666665,2.0016276041666665,1.9208984375,1.9208984375,0.17475103197716266,0.17475103197716266,1.8818359375,1.8818359375,2.2021484375,2.2021484375,6.0048828125,6.0048828125,10545,"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.005), 'mean_duration_us': np.float64(2.0016666666666665), 'median_duration_us': np.float64(1.921), 'std_dev_duration_us': np.float64(0.14254901691075328), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(2.202)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.0)}]",0.000284639521651216,99.99234577061249 -aten::add,elementwise,nn.Module: CLIPTextEmbeddings,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,1,5.9677734375,5.9677734375,5.9677734375,5.9677734375,,,5.9677734375,5.9677734375,5.9677734375,5.9677734375,5.9677734375,5.9677734375,7302,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]",0.0002828804873655197,99.99262865109985 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((43200, 2700, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,1,5.76806640625,10.4541015625,5.76806640625,10.4541015625,,,5.76806640625,10.4541015625,5.76806640625,10.4541015625,5.76806640625,10.4541015625,23403,"['aten::miopen_convolution', 'nn.Module: Conv3d_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR0_DTVA0_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SPO1_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.768), 'mean_duration_us': np.float64(5.768), 'median_duration_us': np.float64(5.768), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(5.768)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.77)}]",0.00027341410548591756,99.99290206520534 -aten::argmax,reduce,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",1,1,5.72802734375,5.72802734375,5.72802734375,5.72802734375,,,5.72802734375,5.72802734375,5.72802734375,5.72802734375,5.72802734375,5.72802734375,8650,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.648), 'mean_duration_us': np.float64(5.648), 'median_duration_us': np.float64(5.648), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.648), 'max_duration_us': np.float64(5.648)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",0.0002677203892453745,99.99344130179466 -aten::copy_,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,1,5.3271484375,5.3271484375,5.3271484375,5.3271484375,,,5.3271484375,5.3271484375,5.3271484375,5.3271484375,5.3271484375,5.3271484375,8649,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.33)}]",0.00025251400074928986,99.99369381579541 -aten::index,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 351), ())","('bool', '')","((351, 1), ())","('', '')",1,1,5.287109375,8.73095703125,5.287109375,8.73095703125,,,5.287109375,8.73095703125,5.287109375,8.73095703125,5.287109375,8.73095703125,99,"['aten::index', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.287), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",0.00025061609533577546,99.99394443189074 -aten::_local_scalar_dense,other,NA,python3,CPU,thread 416 (python3),"((1,),)","('long int',)","((1,),)","('',)",1,1,5.2470703125,5.2470703125,5.2470703125,5.2470703125,,,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,10426,['aten::_local_scalar_dense'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.00024871818992226106,99.99419315008066 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (1, 512, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 60, 1), (5529600, 10800, 60, 1), ())","('', '', 'False')",1,1,5.2470703125,5.2470703125,5.2470703125,5.2470703125,,,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,23879,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.00024871818992226106,99.99444186827058 -aten::index,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",1,1,5.20703125,5.20703125,5.20703125,5.20703125,,,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,8652,"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",0.0002468202845087467,99.99468868855509 -aten::copy_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (1, 16, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((43200, 2700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,1,5.20703125,5.20703125,5.20703125,5.20703125,,,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,23402,"['aten::copy_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",0.0002468202845087467,99.99493550883959 -aten::bitwise_and,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), (1, 1, 351, 351))","('bool', 'bool')","((), (123201, 123201, 351, 1))","('', '')",1,1,4.80615234375,4.80615234375,4.80615234375,4.80615234375,,,4.80615234375,4.80615234375,4.80615234375,4.80615234375,4.80615234375,4.80615234375,98,"['aten::bitwise_and', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.806), 'mean_duration_us': np.float64(4.806), 'median_duration_us': np.float64(4.806), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",0.00022781808518563336,99.99516332692477 -aten::div,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), ())","('c10::BFloat16', 'double')","((475200, 29700, 900, 30, 1), ())","('', '')",1,1,4.68603515625,4.68603515625,4.68603515625,4.68603515625,,,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,15594,['aten::div'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]",0.00022212436894509022,99.99538545129371 -aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (1, 16, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((43200, 2700, 900, 30, 1), (16, 1, 1, 1, 1), ())","('', '', '1')",1,1,4.68603515625,4.68603515625,4.68603515625,4.68603515625,,,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,23407,"['aten::add_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]",0.00022212436894509022,99.99560757566266 -triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",1,2,2.322998046875,2.322998046875,2.322998046875,2.322998046875,0.16952608865361077,0.16952608865361077,2.203125,2.203125,2.44287109375,2.44287109375,4.64599609375,4.64599609375,8753,"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.646), 'mean_duration_us': np.float64(2.323), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.443)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'mean_duration_us': np.float64(2.32)}]",0.00022022646353157585,99.99582780212619 -aten::copy_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((3, 900), (3, 900), ())","('int', 'int', 'Scalar')","((900, 1), (1, 0), ())","('', '', 'False')",1,1,4.60595703125,4.60595703125,4.60595703125,4.60595703125,,,4.60595703125,4.60595703125,4.60595703125,4.60595703125,4.60595703125,4.60595703125,23467,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]",0.0002183285581180615,99.9960461306843 -aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((43200, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,1,4.56494140625,4.56494140625,4.56494140625,4.56494140625,,,4.56494140625,4.56494140625,4.56494140625,4.56494140625,4.56494140625,4.56494140625,23409,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.565), 'mean_duration_us': np.float64(4.565), 'median_duration_us': np.float64(4.565), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.565)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.57)}]",0.00021638436232860776,99.99626251504664 -aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (1, 512, 2, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((921600, 1800, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', 'False')",1,1,4.48486328125,4.48486328125,4.48486328125,4.48486328125,,,4.48486328125,4.48486328125,4.48486328125,4.48486328125,4.48486328125,4.48486328125,23752,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.485), 'mean_duration_us': np.float64(4.485), 'median_duration_us': np.float64(4.485), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.485), 'max_duration_us': np.float64(4.485)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}]",0.000212588551501579,99.99647510359814 -aten::bitwise_and,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 1, 351))","('bool', 'bool')","((123201, 123201, 351, 1), (351, 351, 351, 1))","('', '')",1,1,4.44482421875,4.44482421875,4.44482421875,4.44482421875,,,4.44482421875,4.44482421875,4.44482421875,4.44482421875,4.44482421875,4.44482421875,114,"['aten::bitwise_and', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.445), 'mean_duration_us': np.float64(4.445), 'median_duration_us': np.float64(4.445), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.44)}]",0.00021069064608806464,99.99668579424423 -aten::arange,other,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '4', '1', '')",1,1,4.40576171875,4.40576171875,4.40576171875,4.40576171875,,,4.40576171875,4.40576171875,4.40576171875,4.40576171875,4.40576171875,4.40576171875,23456,"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.406), 'mean_duration_us': np.float64(4.406), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.406)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.245), 'mean_duration_us': np.float64(4.245), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.245)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.24)}]",0.0002012242642084625,99.99709585753948 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1437696, 1437696, 1437696, 1437696, 4096, 1), ())","('', '', 'False')",1,1,4.0849609375,4.0849609375,4.0849609375,4.0849609375,,,4.0849609375,4.0849609375,4.0849609375,4.0849609375,4.0849609375,4.0849609375,7234,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.08)}]",0.000193632642554405,99.99728949018203 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,1,4.044921875,4.044921875,4.044921875,4.044921875,,,4.044921875,4.044921875,4.044921875,4.044921875,4.044921875,4.044921875,7285,"['aten::gather', 'nn.Module: Embedding_1', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.045), 'mean_duration_us': np.float64(4.045), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.045)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(4.04)}]",0.00019173473714089064,99.99748122491917 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,1,3.884765625,3.884765625,3.884765625,3.884765625,,,3.884765625,3.884765625,3.884765625,3.884765625,3.884765625,3.884765625,8682,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.885), 'mean_duration_us': np.float64(3.885), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(3.885)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.88)}]",0.00018414311548683315,99.99766536803466 -aten::fill_,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), ())","('bool', 'Scalar')","((), ())","('', '1.')",1,1,3.76513671875,3.76513671875,3.76513671875,3.76513671875,,,3.76513671875,3.76513671875,3.76513671875,3.76513671875,3.76513671875,3.76513671875,94,"['aten::fill_', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.765), 'mean_duration_us': np.float64(3.765), 'median_duration_us': np.float64(3.765), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::F...', 'stream': 0, 'mean_duration_us': np.float64(3.76)}]",0.00017847254443425974,99.9978438405791 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,1,3.68408203125,3.68408203125,3.68408203125,3.68408203125,,,3.68408203125,3.68408203125,3.68408203125,3.68408203125,3.68408203125,3.68408203125,7273,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.684), 'mean_duration_us': np.float64(3.684), 'median_duration_us': np.float64(3.684), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(3.684)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.68)}]",0.00017463044323129162,99.99801847102232 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,1,3.64404296875,3.64404296875,3.64404296875,3.64404296875,,,3.64404296875,3.64404296875,3.64404296875,3.64404296875,3.64404296875,3.64404296875,8697,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.644), 'mean_duration_us': np.float64(3.644), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(3.644)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.64)}]",0.00017273253781777728,99.99819120356014 -aten::arange,other,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1,2,1.781005859375,1.781005859375,1.781005859375,1.781005859375,0.027966625623100757,0.027966625623100757,1.76123046875,1.76123046875,1.80078125,1.80078125,3.56201171875,3.56201171875,51,"['aten::arange', 'nn.Module: LlamaModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.562), 'mean_duration_us': np.float64(1.781), 'median_duration_us': np.float64(1.781), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.801)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",0.00016703882157723414,99.99852708652796 -aten::copy_,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 1, 351), ())","('long int', 'long int', 'Scalar')","((351, 351, 351, 1), (0, 0, 0, 0), ())","('', '', 'False')",1,1,3.44384765625,3.44384765625,3.44384765625,3.44384765625,,,3.44384765625,3.44384765625,3.44384765625,3.44384765625,3.44384765625,3.44384765625,111,"['aten::copy_', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.444), 'mean_duration_us': np.float64(3.444), 'median_duration_us': np.float64(3.444), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.444), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]",0.0001632430107502054,99.9986903295387 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,1,3.36376953125,3.36376953125,3.36376953125,3.36376953125,,,3.36376953125,3.36376953125,3.36376953125,3.36376953125,3.36376953125,3.36376953125,7298,"['aten::gather', 'nn.Module: Embedding_2', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.364), 'mean_duration_us': np.float64(3.364), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}]",0.00015944719992317668,99.99884977673862 -aten::eq,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",1,1,3.00390625,3.00390625,3.00390625,3.00390625,,,3.00390625,3.00390625,3.00390625,3.00390625,3.00390625,3.00390625,10415,['aten::eq'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.004), 'mean_duration_us': np.float64(3.004), 'median_duration_us': np.float64(3.004), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(3.004)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]",0.00014238919638951704,99.99899216593501 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",1,1,3.0029296875,3.0029296875,3.0029296875,3.0029296875,,,3.0029296875,3.0029296875,3.0029296875,3.0029296875,3.0029296875,3.0029296875,8817,"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.003), 'mean_duration_us': np.float64(3.003), 'median_duration_us': np.float64(3.003), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.003)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]",0.0001423429060135777,99.99913450884102 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",1,1,2.962890625,2.962890625,2.962890625,2.962890625,,,2.962890625,2.962890625,2.962890625,2.962890625,2.962890625,2.962890625,8688,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.963), 'mean_duration_us': np.float64(2.963), 'median_duration_us': np.float64(2.963), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(2.963)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(2.96)}]",0.0001404450006000633,99.99927495384162 -triton_poi_fused_add_addmm_18,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",1,1,2.72314453125,2.72314453125,2.72314453125,2.72314453125,,,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,8825,"['triton_poi_fused_add_addmm_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",0.00012908071330694677,99.99940403455493 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), ())","('c10::BFloat16', 'double')","((1,), ())","('', '')",1,1,2.36181640625,2.36181640625,2.36181640625,2.36181640625,,,2.36181640625,2.36181640625,2.36181640625,2.36181640625,2.36181640625,2.36181640625,8701,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.362), 'mean_duration_us': np.float64(2.362), 'median_duration_us': np.float64(2.362), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.36)}]",0.00011195327420937808,99.99951598782914 -aten::fill_,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",1,1,2.203125,2.203125,2.203125,2.203125,,,2.203125,2.203125,2.203125,2.203125,2.203125,2.203125,8687,['aten::fill_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.203), 'mean_duration_us': np.float64(2.203), 'median_duration_us': np.float64(2.203), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.203)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]",0.00010443108811922966,99.99962041891726 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",1,1,2.2021484375,2.2021484375,2.2021484375,2.2021484375,,,2.2021484375,2.2021484375,2.2021484375,2.2021484375,2.2021484375,2.2021484375,8670,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]",0.0001043847977432903,99.999724803715 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",1,1,2.08203125,2.08203125,2.08203125,2.08203125,,,2.08203125,2.08203125,2.08203125,2.08203125,2.08203125,2.08203125,8683,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.082), 'mean_duration_us': np.float64(2.082), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.08)}]",9.869108150274719e-05,99.9998234947965 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 256), (1, 1, 1, 256), ())","('long int', 'long int', 'Scalar')","((256, 256, 256, 1), (351, 351, 351, 1), ())","('', '', 'False')",1,1,1.8818359375,1.8818359375,1.8818359375,1.8818359375,,,1.8818359375,1.8818359375,1.8818359375,1.8818359375,1.8818359375,1.8818359375,7248,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.882), 'mean_duration_us': np.float64(1.882), 'median_duration_us': np.float64(1.882), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(1.882)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.88)}]",8.920155443517533e-05,99.99991269635093 -aten::arange,other,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1,1,1.841796875,1.841796875,1.841796875,1.841796875,,,1.841796875,1.841796875,1.841796875,1.841796875,1.841796875,1.841796875,8644,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.842), 'mean_duration_us': np.float64(1.842), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.842), 'max_duration_us': np.float64(1.842)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(41521.96300000001), 'mean_duration_us': np.float64(692.0327166666668), 'median_duration_us': np.float64(712.658), 'std_dev_duration_us': np.float64(72.34788857575403), 'min_duration_us': np.float64(521.694), 'max_duration_us': np.float64(780.96)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(692.03)}]",1.9681879516720648,71.76724883866149 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((13776896, 26908, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,70,592.61953125,615.2607770647321,591.913818359375,615.72900390625,18.37654700515553,18.013305998583167,558.50341796875,580.736328125,670.7919921875,690.7001953125,41483.3671875,43068.25439453125,15969,"['aten::miopen_convolution', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(991.0010000000001), 'mean_duration_us': np.float64(14.157157142857145), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.8864840766552241), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(15.822)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1184.9680000000003), 'mean_duration_us': np.float64(16.92811428571429), 'median_duration_us': np.float64(17.245), 'std_dev_duration_us': np.float64(1.3201695079783953), 'min_duration_us': np.float64(14.18), 'max_duration_us': np.float64(19.387)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1536.7740000000003), 'mean_duration_us': np.float64(21.95391428571429), 'median_duration_us': np.float64(21.992), 'std_dev_duration_us': np.float64(0.8931553175257314), 'min_duration_us': np.float64(20.509), 'max_duration_us': np.float64(23.554)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1747.1659999999997), 'mean_duration_us': np.float64(24.95951428571428), 'median_duration_us': np.float64(24.976), 'std_dev_duration_us': np.float64(0.4623428765647894), 'min_duration_us': np.float64(23.915), 'max_duration_us': np.float64(25.878)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(36023.46), 'mean_duration_us': np.float64(514.6208571428572), 'median_duration_us': np.float64(513.7625), 'std_dev_duration_us': np.float64(19.46001120634365), 'min_duration_us': np.float64(479.151), 'max_duration_us': np.float64(598.088)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.16)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.93)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(21.95)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(24.96)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(514.62)}]",1.9663585179864502,73.73360735664794 +triton_poi_fused_addmm_cat_gelu_slice_view_25,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 24, 128), (7431, 12288), (12288,), (1, 7431, 15360), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 128, 1), (12288, 1), (1,), (114140160, 15360, 1), ())","('', '', '', '', '114140160')",1,160,167.68397216796876,167.68397216796876,166.24609375,166.24609375,7.21141663148745,7.21141663148745,156.671875,156.671875,200.85791015625,200.85791015625,26829.435546875,26829.435546875,9538,"['triton_poi_fused_addmm_cat_gelu_slice_view_25', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(26829.435999999998), 'mean_duration_us': np.float64(167.68397499999998), 'median_duration_us': np.float64(166.246), 'std_dev_duration_us': np.float64(7.188836548731304), 'min_duration_us': np.float64(156.672), 'max_duration_us': np.float64(200.858)}]","[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'mean_duration_us': np.float64(167.68)}]",1.2717455861746667,75.0053529428226 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,2489.3544921875,2566.5841796875,2491.45703125,2568.050048828125,49.46997046851107,54.01344552258528,2409.29541015625,2480.640625,2541.3310546875,2624.77392578125,24893.544921875,25665.841796875,16118,"['aten::miopen_convolution', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(94.812), 'mean_duration_us': np.float64(9.4812), 'median_duration_us': np.float64(9.3125), 'std_dev_duration_us': np.float64(0.4950209692528186), 'min_duration_us': np.float64(8.972), 'max_duration_us': np.float64(10.615)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(485.51099999999997), 'mean_duration_us': np.float64(48.5511), 'median_duration_us': np.float64(48.531), 'std_dev_duration_us': np.float64(0.7159562067612792), 'min_duration_us': np.float64(47.189), 'max_duration_us': np.float64(49.633)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(596.274), 'mean_duration_us': np.float64(59.6274), 'median_duration_us': np.float64(59.186499999999995), 'std_dev_duration_us': np.float64(2.106466339631375), 'min_duration_us': np.float64(56.042), 'max_duration_us': np.float64(62.932)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2167.893), 'mean_duration_us': np.float64(216.7893), 'median_duration_us': np.float64(217.042), 'std_dev_duration_us': np.float64(1.0544313206653126), 'min_duration_us': np.float64(214.598), 'max_duration_us': np.float64(218.403)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(21549.053000000004), 'mean_duration_us': np.float64(2154.9053000000004), 'median_duration_us': np.float64(2156.604), 'std_dev_duration_us': np.float64(45.69621782390749), 'min_duration_us': np.float64(2076.445), 'max_duration_us': np.float64(2205.356)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.48)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(48.55)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2154.91)}]",1.1799821812622056,76.1853351240848 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((3670016, 7168, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,100,240.975185546875,248.611943359375,232.840576171875,240.29150390625,18.52015534861287,18.835214182166514,226.65185546875,234.10205078125,311.21826171875,320.1103515625,24097.5185546875,24861.1943359375,15630,"['aten::miopen_convolution', 'nn.Module: Conv3d_2', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(496.76199999999994), 'mean_duration_us': np.float64(4.967619999999999), 'median_duration_us': np.float64(4.887), 'std_dev_duration_us': np.float64(0.22438590775714945), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.767)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(605.4789999999999), 'mean_duration_us': np.float64(6.05479), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.2873086248270316), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(6.809)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(731.9480000000001), 'mean_duration_us': np.float64(7.319480000000001), 'median_duration_us': np.float64(7.289), 'std_dev_duration_us': np.float64(0.4345492947871392), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(8.411)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1294.3890000000001), 'mean_duration_us': np.float64(12.943890000000001), 'median_duration_us': np.float64(12.818), 'std_dev_duration_us': np.float64(0.5245689639122774), 'min_duration_us': np.float64(12.218), 'max_duration_us': np.float64(15.101)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(20968.936999999998), 'mean_duration_us': np.float64(209.68936999999997), 'median_duration_us': np.float64(201.819), 'std_dev_duration_us': np.float64(17.316049904441257), 'min_duration_us': np.float64(196.571), 'max_duration_us': np.float64(275.408)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.32)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(209.69)}]",1.142249631235924,77.32758475532073 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,20,1187.0187744140626,1187.0187744140626,1186.641845703125,1186.641845703125,101.97322723391864,101.97322723391864,1074.7158203125,1074.7158203125,1311.26708984375,1311.26708984375,23740.37548828125,23740.37548828125,16243,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(23740.376000000004), 'mean_duration_us': np.float64(1187.0188000000003), 'median_duration_us': np.float64(1186.642), 'std_dev_duration_us': np.float64(99.39126225911411), 'min_duration_us': np.float64(1074.716), 'max_duration_us': np.float64(1311.267)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1187.02)}]",1.1253206459972487,78.45290540131798 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,2221.71220703125,2233.801171875,2279.74267578125,2290.57763671875,151.5339457318205,151.6748699935203,1977.37353515625,1988.228515625,2382.013671875,2395.83251953125,22217.1220703125,22338.01171875,16368,"['aten::miopen_convolution', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.868), 'mean_duration_us': np.float64(5.0868), 'median_duration_us': np.float64(5.1265), 'std_dev_duration_us': np.float64(0.12902774895347116), 'min_duration_us': np.float64(4.847), 'max_duration_us': np.float64(5.247)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67.61), 'mean_duration_us': np.float64(6.761), 'median_duration_us': np.float64(6.7285), 'std_dev_duration_us': np.float64(0.28540567618742285), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(88.96000000000001), 'mean_duration_us': np.float64(8.896), 'median_duration_us': np.float64(8.992), 'std_dev_duration_us': np.float64(0.3516822429409821), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(9.413)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3541.25), 'mean_duration_us': np.float64(354.125), 'median_duration_us': np.float64(363.59900000000005), 'std_dev_duration_us': np.float64(19.5954072884439), 'min_duration_us': np.float64(314.626), 'max_duration_us': np.float64(368.547)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(18468.433), 'mean_duration_us': np.float64(1846.8433), 'median_duration_us': np.float64(1894.7145), 'std_dev_duration_us': np.float64(127.35508833890387), 'min_duration_us': np.float64(1639.595), 'max_duration_us': np.float64(1996.765)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.09)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(6.76)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(8.9)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(354.12)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1846.84)}]",1.0531167113470892,79.50602211266506 +aten::addmm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((3072,), (7425, 3072), (3072, 3072), (), (), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",1,80,264.46404418945315,264.46404418945315,264.6123046875,264.6123046875,8.391238658426342,8.391238658426342,246.44580078125,246.44580078125,287.7861328125,287.7861328125,21157.12353515625,21157.12353515625,8860,"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(21157.122), 'mean_duration_us': np.float64(264.464025), 'median_duration_us': np.float64(264.6125), 'std_dev_duration_us': np.float64(8.338616556382423), 'min_duration_us': np.float64(246.446), 'max_duration_us': np.float64(287.786)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(264.46)}]",1.0028715820344976,80.50889369469957 +triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), ())","('', '', '', '', '', '22809600')",1,320,54.79553985595703,54.79553985595703,53.718505859375,53.718505859375,3.1640130472265944,3.1640130472265944,49.671875,49.671875,63.69384765625,63.69384765625,17534.57275390625,17534.57275390625,9524,"['triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(17534.569), 'mean_duration_us': np.float64(54.795528125), 'median_duration_us': np.float64(53.718500000000006), 'std_dev_duration_us': np.float64(3.159070109297827), 'min_duration_us': np.float64(49.672), 'max_duration_us': np.float64(63.694)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(54.8)}]",0.8311585782816147,81.34005227298118 +triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",1,160,105.94866638183593,105.94866638183593,113.08740234375,113.08740234375,12.854668591841357,12.854668591841357,66.01708984375,66.01708984375,123.22216796875,123.22216796875,16951.78662109375,16951.78662109375,9526,"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(16951.782), 'mean_duration_us': np.float64(105.94863749999999), 'median_duration_us': np.float64(113.0875), 'std_dev_duration_us': np.float64(12.814423365141865), 'min_duration_us': np.float64(66.017), 'max_duration_us': np.float64(123.222)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(105.95)}]",0.8035338565168504,82.14358612949803 +aten::_efficient_attention_forward,SDPA_fwd,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 4500, 1, 512), (1, 4500, 1, 512), (1, 4500, 1, 512), (1, 1, 4500, 4500), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', '', '', '')","((2304000, 512, 512, 1), (2304000, 512, 512, 1), (2304000, 512, 512, 1), (20268000, 20268000, 4504, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '', '', '')",1,10,1508.128369140625,1508.128369140625,1518.034912109375,1518.034912109375,53.426057449049196,53.426057449049196,1386.09912109375,1386.09912109375,1579.9072265625,1579.9072265625,15081.28369140625,15081.28369140625,15766,"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(15081.283999999998), 'mean_duration_us': np.float64(1508.1283999999998), 'median_duration_us': np.float64(1518.035), 'std_dev_duration_us': np.float64(50.684445699247824), 'min_duration_us': np.float64(1386.099), 'max_duration_us': np.float64(1579.907)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1508.13)}]",0.7148699023087666,82.8584560318068 +triton_poi_fused_addmm_gelu_view_12,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((91238400, 12288, 1), (1,), ())","('', '', '91238400')",1,80,187.95579833984374,187.95579833984374,193.726318359375,193.726318359375,19.109414108015883,19.109414108015883,141.4091796875,141.4091796875,211.7939453125,211.7939453125,15036.4638671875,15036.4638671875,8876,"['triton_poi_fused_addmm_gelu_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(15036.464), 'mean_duration_us': np.float64(187.9558), 'median_duration_us': np.float64(193.7265), 'std_dev_duration_us': np.float64(18.989619966181525), 'min_duration_us': np.float64(141.409), 'max_duration_us': np.float64(211.794)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'mean_duration_us': np.float64(187.96)}]",0.7127453919543191,83.57120142376111 +aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((29491200, 115200, 14400, 120, 1), (), (), (), ())","('', '[16, 240, 240]', '2.', '2.', '2.')",1,10,1476.82578125,1476.82578125,1479.277587890625,1479.277587890625,29.202630242023886,29.202630242023886,1430.48486328125,1430.48486328125,1511.56494140625,1511.56494140625,14768.2578125,14768.2578125,16234,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(14768.257999999998), 'mean_duration_us': np.float64(1476.8257999999998), 'median_duration_us': np.float64(1479.2775000000001), 'std_dev_duration_us': np.float64(27.70397874241174), 'min_duration_us': np.float64(1430.485), 'max_duration_us': np.float64(1511.565)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(1476.83)}]",0.7000321216494625,84.27123354541057 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (1, 128, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (128, 1, 1, 1, 1), ())","('', '', '1')",1,70,209.78906947544644,209.78906947544644,214.557373046875,214.557373046875,19.51384590754042,19.51384590754042,177.30322265625,177.30322265625,244.1220703125,244.1220703125,14685.23486328125,14685.23486328125,16266,"['aten::add_', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(14685.235), 'mean_duration_us': np.float64(209.78907142857145), 'median_duration_us': np.float64(214.5575), 'std_dev_duration_us': np.float64(19.37395957045836), 'min_duration_us': np.float64(177.303), 'max_duration_us': np.float64(244.122)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.79)}]",0.6960967399663227,84.96733028537689 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,60,235.86919759114582,235.86919759114582,234.7265625,234.7265625,16.57849384939928,16.57849384939928,197.97216796875,197.97216796875,281.89697265625,281.89697265625,14152.15185546875,14152.15185546875,16267,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_24', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(3840.8520000000003), 'mean_duration_us': np.float64(64.0142), 'median_duration_us': np.float64(61.6105), 'std_dev_duration_us': np.float64(6.60053405112041), 'min_duration_us': np.float64(53.398), 'max_duration_us': np.float64(97.223)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10311.298999999999), 'mean_duration_us': np.float64(171.8549833333333), 'median_duration_us': np.float64(173.136), 'std_dev_duration_us': np.float64(12.893305696486665), 'min_duration_us': np.float64(144.574), 'max_duration_us': np.float64(211.113)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.85)}]",0.6708280025355338,85.63815828791242 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,10,1360.63681640625,1360.63681640625,1359.61962890625,1359.61962890625,36.685556845731355,36.685556845731355,1282.78515625,1282.78515625,1423.033203125,1423.033203125,13606.3681640625,13606.3681640625,16284,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(13606.367), 'mean_duration_us': np.float64(1360.6367), 'median_duration_us': np.float64(1359.6195), 'std_dev_duration_us': np.float64(34.80297067794641), 'min_duration_us': np.float64(1282.785), 'max_duration_us': np.float64(1423.033)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1360.64)}]",0.6449572383392717,86.28311552625169 +triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (128,), (1, 24, 7425, 1), (1, 24, 7425, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (178200, 1, 24, 178200), (22809600, 950400, 128, 2, 1), (), ())","('', '', '', '', '', '178200', '128')",1,160,80.52618713378907,80.52618713378907,80.158203125,80.158203125,4.722485689939179,4.722485689939179,64.294921875,64.294921875,97.14404296875,97.14404296875,12884.18994140625,12884.18994140625,8852,"['triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(12884.190999999999), 'mean_duration_us': np.float64(80.52619374999999), 'median_duration_us': np.float64(80.158), 'std_dev_duration_us': np.float64(4.7077055272405195), 'min_duration_us': np.float64(64.295), 'max_duration_us': np.float64(97.144)}]","[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack...', 'stream': 0, 'mean_duration_us': np.float64(80.53)}]",0.6107251738782089,86.8938407001299 +triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 24, 7431, 128), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 951168, 128, 1), (22828032, 3072, 128, 1), ())","('', '', '22828032')",1,480,24.869404093424478,24.869404093424478,25.35693359375,25.35693359375,2.5455756263902543,2.5455756263902543,18.70703125,18.70703125,35.85302734375,35.85302734375,11937.31396484375,11937.31396484375,8862,"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'count': 480, 'total_duration_us': np.float64(11937.310000000001), 'mean_duration_us': np.float64(24.869395833333336), 'median_duration_us': np.float64(25.357), 'std_dev_duration_us': np.float64(2.5429265222343016), 'min_duration_us': np.float64(18.707), 'max_duration_us': np.float64(35.853)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'mean_duration_us': np.float64(24.87)}]",0.5658421817726056,87.45968288190251 +triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",1,152,77.69896175986842,77.69896175986842,79.27685546875,79.27685546875,5.519513208278738,5.519513208278738,68.541015625,68.541015625,110.56396484375,110.56396484375,11810.2421875,11810.2421875,9562,"['triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(11810.244), 'mean_duration_us': np.float64(77.69897368421053), 'median_duration_us': np.float64(79.277), 'std_dev_duration_us': np.float64(5.5013074868704575), 'min_duration_us': np.float64(68.541), 'max_duration_us': np.float64(110.564)}]","[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'mean_duration_us': np.float64(77.7)}]",0.559818835821777,88.01950171772428 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240),)","('c10::BFloat16',)","((125337600, 979200, 57600, 240, 1),)","('',)",1,60,181.23169759114583,181.23169759114583,185.97509765625,185.97509765625,17.872211160860086,17.872211160860086,144.5341796875,144.5341796875,210.23095703125,210.23095703125,10873.90185546875,10873.90185546875,16271,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10873.901), 'mean_duration_us': np.float64(181.23168333333334), 'median_duration_us': np.float64(185.97500000000002), 'std_dev_duration_us': np.float64(17.72266507563283), 'min_duration_us': np.float64(144.534), 'max_duration_us': np.float64(210.231)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(181.23)}]",0.515435245181654,88.53493696290593 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,5,1852.3478515625,1974.61630859375,1866.2080078125,1988.9501953125,38.71382082119963,38.92279256154899,1785.1279296875,1906.14697265625,1883.35400390625,2002.44921875,9261.7392578125,9873.08154296875,24076,"['aten::miopen_convolution', 'nn.Module: Conv3d_29', 'nn.Module: HunyuanVideoCausalConv3d_28', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.833999999999996), 'mean_duration_us': np.float64(5.166799999999999), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.21052353787640943), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.367)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(602.692), 'mean_duration_us': np.float64(120.5384), 'median_duration_us': np.float64(121.78), 'std_dev_duration_us': np.float64(2.112858594416579), 'min_duration_us': np.float64(117.093), 'max_duration_us': np.float64(122.662)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(605.4540000000001), 'mean_duration_us': np.float64(121.09080000000002), 'median_duration_us': np.float64(121.86), 'std_dev_duration_us': np.float64(2.0797206927854526), 'min_duration_us': np.float64(117.053), 'max_duration_us': np.float64(122.982)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(919.682), 'mean_duration_us': np.float64(183.9364), 'median_duration_us': np.float64(184.353), 'std_dev_duration_us': np.float64(0.5806870413570518), 'min_duration_us': np.float64(183.152), 'max_duration_us': np.float64(184.513)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(7108.077), 'mean_duration_us': np.float64(1421.6154000000001), 'median_duration_us': np.float64(1432.568), 'std_dev_duration_us': np.float64(30.52483036218219), 'min_duration_us': np.float64(1363.064), 'max_duration_us': np.float64(1451.756)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.17)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(120.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.09)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(183.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1421.62)}]",0.4390169148674321,88.97395387777337 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((33177600, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,50,181.9982421875,181.9982421875,182.25,182.25,10.907357150483445,10.907357150483445,159.8359375,159.8359375,207.18701171875,207.18701171875,9099.912109375,9099.912109375,16130,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(9099.913), 'mean_duration_us': np.float64(181.99826000000002), 'median_duration_us': np.float64(182.25), 'std_dev_duration_us': np.float64(10.797747462892435), 'min_duration_us': np.float64(159.836), 'max_duration_us': np.float64(207.187)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.0)}]",0.4313461250221126,89.40530000279549 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '7431', '3072')",1,156,58.29872796474359,58.29872796474359,57.64453125,57.64453125,2.421970207712263,2.421970207712263,54.9609375,54.9609375,65.376953125,65.376953125,9094.6015625,9094.6015625,9541,"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(9094.601), 'mean_duration_us': np.float64(58.29872435897436), 'median_duration_us': np.float64(57.6445), 'std_dev_duration_us': np.float64(2.414204855491438), 'min_duration_us': np.float64(54.961), 'max_duration_us': np.float64(65.377)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(58.3)}]",0.43109439909457103,89.83639440189006 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 18432), (1, 18432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (18432, 1))","('', '', '')",1,160,54.699826049804685,54.699826049804685,55.56103515625,55.56103515625,4.2111945588866115,4.2111945588866115,41.2998046875,41.2998046875,65.09619140625,65.09619140625,8751.97216796875,8751.97216796875,8845,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(8751.971), 'mean_duration_us': np.float64(54.69981875), 'median_duration_us': np.float64(55.561), 'std_dev_duration_us': np.float64(4.198013704229471), 'min_duration_us': np.float64(41.3), 'max_duration_us': np.float64(65.096)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(54.7)}]",0.414853378316198,90.25124778020626 +triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (1, 24, 7425, 64, 2), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178200, 1, 24, 178200), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (3072, 1), (1,), (178200, 1, 24, 178200), (1,), (22809600, 950400, 128, 2, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",1,80,107.70609130859376,107.70609130859376,110.1025390625,110.1025390625,7.575080293499654,7.575080293499654,86.68798828125,86.68798828125,119.01611328125,119.01611328125,8616.4873046875,8616.4873046875,8859,"['triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(8616.487000000001), 'mean_duration_us': np.float64(107.70608750000001), 'median_duration_us': np.float64(110.10249999999999), 'std_dev_duration_us': np.float64(7.527556552749621), 'min_duration_us': np.float64(86.688), 'max_duration_us': np.float64(119.016)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split...', 'stream': 0, 'mean_duration_us': np.float64(107.71)}]",0.40843124257762203,90.65967902278388 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((250675200, 979200, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,10,816.624658203125,1035.260546875,821.49951171875,1037.740478515625,13.611841405893097,15.841530677576912,789.33203125,1010.580078125,830.23291015625,1056.046875,8166.24658203125,10352.60546875,16288,"['aten::miopen_convolution', 'nn.Module: Conv3d_30', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(8166.246999999999), 'mean_duration_us': np.float64(816.6247), 'median_duration_us': np.float64(821.4995), 'std_dev_duration_us': np.float64(12.913326426990064), 'min_duration_us': np.float64(789.332), 'max_duration_us': np.float64(830.233)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(816.62)}]",0.3870893231490982,91.04676834593297 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,20,408.019287109375,408.019287109375,403.9189453125,403.9189453125,20.21189608764834,20.21189608764834,375.23583984375,375.23583984375,439.171875,439.171875,8160.3857421875,8160.3857421875,16099,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(8160.385999999999), 'mean_duration_us': np.float64(408.01929999999993), 'median_duration_us': np.float64(403.919), 'std_dev_duration_us': np.float64(19.700116299402907), 'min_duration_us': np.float64(375.236), 'max_duration_us': np.float64(439.172)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(408.02)}]",0.38681151271251474,91.43357985864549 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 14336))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,64,121.13964080810547,121.13964080810547,121.31884765625,121.31884765625,1.1772421975752645,1.1772421975752645,118.65576171875,118.65576171875,123.3818359375,123.3818359375,7752.93701171875,7752.93701171875,356,"['aten::mm', 'nn.Module: Linear_4', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(7752.939), 'mean_duration_us': np.float64(121.139671875), 'median_duration_us': np.float64(121.319), 'std_dev_duration_us': np.float64(1.1680273174069968), 'min_duration_us': np.float64(118.656), 'max_duration_us': np.float64(123.382)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(121.14)}]",0.36749798210689383,91.80107784075238 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (129, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((57600, 7430400, 240, 1), (57600, 7430400, 240, 1), ())","('', '', 'False')",1,1,6620.17578125,6620.17578125,6620.17578125,6620.17578125,,,6620.17578125,6620.17578125,6620.17578125,6620.17578125,6620.17578125,6620.17578125,24640,['aten::copy_'],"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6620.176), 'mean_duration_us': np.float64(6620.176), 'median_duration_us': np.float64(6620.176), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6620.176), 'max_duration_us': np.float64(6620.176)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(6620.18)}]",0.3138038187495804,92.11488165950196 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",1,76,73.8177425986842,73.8177425986842,72.9482421875,72.9482421875,6.743495096271407,6.743495096271407,67.97998046875,67.97998046875,115.65087890625,115.65087890625,5610.1484375,5610.1484375,8904,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5610.146000000001), 'mean_duration_us': np.float64(73.81771052631579), 'median_duration_us': np.float64(72.948), 'std_dev_duration_us': np.float64(6.698992855991566), 'min_duration_us': np.float64(67.98), 'max_duration_us': np.float64(115.651)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(73.82)}]",0.2659273804217753,92.38080903992373 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '7425', '3072')",1,76,72.4171078330592,72.4171078330592,72.7470703125,72.7470703125,1.6808137308604874,1.6808137308604874,67.17919921875,67.17919921875,74.75,74.75,5503.7001953125,5503.7001953125,8878,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5503.700000000001), 'mean_duration_us': np.float64(72.41710526315791), 'median_duration_us': np.float64(72.747), 'std_dev_duration_us': np.float64(1.6697369126124988), 'min_duration_us': np.float64(67.179), 'max_duration_us': np.float64(74.75)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(72.42)}]",0.26088161336038906,92.64169065328412 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,70,74.988134765625,74.988134765625,74.81005859375,74.81005859375,4.709485432780471,4.709485432780471,66.658203125,66.658203125,92.3759765625,92.3759765625,5249.16943359375,5249.16943359375,16122,"['aten::add_', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(5249.169999999999), 'mean_duration_us': np.float64(74.98814285714285), 'median_duration_us': np.float64(74.81), 'std_dev_duration_us': np.float64(4.675748671254123), 'min_duration_us': np.float64(66.658), 'max_duration_us': np.float64(92.376)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(74.99)}]",0.2488165674075606,92.89050722069167 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (1, 128, 17, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (125337600, 979200, 57600, 240, 1), ())","('', '', '1')",1,30,174.19246419270834,174.19246419270834,175.199462890625,175.199462890625,13.554415174253906,13.554415174253906,145.6162109375,145.6162109375,203.4208984375,203.4208984375,5225.77392578125,5225.77392578125,16293,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(5225.774), 'mean_duration_us': np.float64(174.1924666666667), 'median_duration_us': np.float64(175.1995), 'std_dev_duration_us': np.float64(13.326603204951446), 'min_duration_us': np.float64(145.616), 'max_duration_us': np.float64(203.421)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(174.19)}]",0.24770759387940425,93.13821481457107 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,4962.44921875,5200.56201171875,4962.44921875,5200.56201171875,,,4962.44921875,5200.56201171875,4962.44921875,5200.56201171875,4962.44921875,5200.56201171875,24045,"['aten::miopen_convolution', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.823), 'mean_duration_us': np.float64(231.823), 'median_duration_us': np.float64(231.823), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.823), 'max_duration_us': np.float64(231.823)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(289.149), 'mean_duration_us': np.float64(289.149), 'median_duration_us': np.float64(289.149), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(289.149), 'max_duration_us': np.float64(289.149)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(421.745), 'mean_duration_us': np.float64(421.745), 'median_duration_us': np.float64(421.745), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(421.745), 'max_duration_us': np.float64(421.745)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4014.525), 'mean_duration_us': np.float64(4014.525), 'median_duration_us': np.float64(4014.525), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4014.525), 'max_duration_us': np.float64(4014.525)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.21)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.82)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(289.15)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(421.74)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4014.52)}]",0.23522570497374165,93.37344051954481 +triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (), ())","('', '', '', '178344', '128')",1,320,15.365415954589844,15.365415954589844,15.86279296875,15.86279296875,1.6736543542812599,1.6736543542812599,12.2978515625,12.2978515625,18.26611328125,18.26611328125,4916.93310546875,4916.93310546875,9521,"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(4916.939), 'mean_duration_us': np.float64(15.365434375000001), 'median_duration_us': np.float64(15.863), 'std_dev_duration_us': np.float64(1.6710358301644401), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(18.266)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'mean_duration_us': np.float64(15.37)}]",0.2330681897303023,93.60650870927512 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((250675200, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,484.24150390625,484.24150390625,482.014404296875,482.014404296875,6.429982929902523,6.429982929902523,478.34765625,478.34765625,497.89697265625,497.89697265625,4842.4150390625,4842.4150390625,16252,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_23', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1702.721), 'mean_duration_us': np.float64(170.2721), 'median_duration_us': np.float64(170.913), 'std_dev_duration_us': np.float64(1.7133133076002158), 'min_duration_us': np.float64(167.448), 'max_duration_us': np.float64(172.015)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3139.6940000000004), 'mean_duration_us': np.float64(313.96940000000006), 'median_duration_us': np.float64(313.004), 'std_dev_duration_us': np.float64(5.32169548546326), 'min_duration_us': np.float64(306.614), 'max_duration_us': np.float64(326.043)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(170.27)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(313.97)}]",0.22953594911059766,93.83604465838572 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 9216), (1, 9216))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (9216, 1))","('', '', '')",1,160,29.782489013671874,29.782489013671874,32.04638671875,32.04638671875,4.091631975479052,4.091631975479052,23.23291015625,23.23291015625,35.2119140625,35.2119140625,4765.1982421875,4765.1982421875,9511,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(4765.2), 'mean_duration_us': np.float64(29.7825), 'median_duration_us': np.float64(32.046499999999995), 'std_dev_duration_us': np.float64(4.07881045618695), 'min_duration_us': np.float64(23.233), 'max_duration_us': np.float64(35.212)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(29.78)}]",0.22587578561469568,94.0619204440004 +triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), ())","('', '', '', '', '22828032')",1,156,29.14972393329327,29.14972393329327,30.0439453125,30.0439453125,2.8026065809675935,2.8026065809675935,23.994140625,23.994140625,35.61181640625,35.61181640625,4547.35693359375,4547.35693359375,9542,"['triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(4547.359), 'mean_duration_us': np.float64(29.149737179487182), 'median_duration_us': np.float64(30.044), 'std_dev_duration_us': np.float64(2.7936151105786897), 'min_duration_us': np.float64(23.994), 'max_duration_us': np.float64(35.612)}]","[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'mean_duration_us': np.float64(29.15)}]",0.21554986123188158,94.27747030523228 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((9216000, 18000, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,70,59.625376674107144,59.625376674107144,60.569091796875,60.569091796875,6.965243076949578,6.965243076949578,47.669921875,47.669921875,72.787109375,72.787109375,4173.7763671875,4173.7763671875,15965,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(4173.776), 'mean_duration_us': np.float64(59.62537142857143), 'median_duration_us': np.float64(60.569), 'std_dev_duration_us': np.float64(6.915321565028997), 'min_duration_us': np.float64(47.67), 'max_duration_us': np.float64(72.787)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(59.63)}]",0.19784171990413318,94.47531202513642 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((250675200, 979200, 57600, 240, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,10,413.60576171875,413.60576171875,415.716552734375,415.716552734375,17.691055029252162,17.691055029252162,379.80419921875,379.80419921875,437.4091796875,437.4091796875,4136.0576171875,4136.0576171875,16251,"['aten::add_', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4136.057), 'mean_duration_us': np.float64(413.60569999999996), 'median_duration_us': np.float64(415.7165), 'std_dev_duration_us': np.float64(16.783204271234982), 'min_duration_us': np.float64(379.804), 'max_duration_us': np.float64(437.409)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(413.61)}]",0.19605380849821794,94.67136583363464 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,4078.21533203125,4188.41845703125,4078.21533203125,4188.41845703125,,,4078.21533203125,4188.41845703125,4078.21533203125,4188.41845703125,4078.21533203125,4188.41845703125,24060,"['aten::miopen_convolution', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(121.139), 'mean_duration_us': np.float64(121.139), 'median_duration_us': np.float64(121.139), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(121.139), 'max_duration_us': np.float64(121.139)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(137.964), 'mean_duration_us': np.float64(137.964), 'median_duration_us': np.float64(137.964), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(137.964), 'max_duration_us': np.float64(137.964)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(424.83), 'mean_duration_us': np.float64(424.83), 'median_duration_us': np.float64(424.83), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(424.83), 'max_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3388.955), 'mean_duration_us': np.float64(3388.955), 'median_duration_us': np.float64(3388.955), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3388.955), 'max_duration_us': np.float64(3388.955)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.33)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(137.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(3388.96)}]",0.19331201876830745,94.86467785240295 +aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((7372800, 14400, 3600, 60, 1), (), (), (), ())","('', '[8, 120, 120]', '2.', '2.', '2.')",1,10,397.7623046875,397.7623046875,397.570068359375,397.570068359375,9.699321350901494,9.699321350901494,382.1669921875,382.1669921875,415.296875,415.296875,3977.623046875,3977.623046875,16090,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3977.623), 'mean_duration_us': np.float64(397.7623), 'median_duration_us': np.float64(397.57000000000005), 'std_dev_duration_us': np.float64(9.20156966011779), 'min_duration_us': np.float64(382.167), 'max_duration_us': np.float64(415.297)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(397.76)}]",0.1885438306926703,95.05322168309561 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 14336), (14336, 4096))","('c10::BFloat16', 'c10::BFloat16')","((14336, 1), (1, 14336))","('', '')",1,32,114.64051818847656,114.64051818847656,114.78955078125,114.78955078125,0.8912301955518536,0.8912301955518536,111.2841796875,111.2841796875,115.85107421875,115.85107421875,3668.49658203125,3668.49658203125,376,"['aten::mm', 'nn.Module: Linear_6', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(3668.496), 'mean_duration_us': np.float64(114.6405), 'median_duration_us': np.float64(114.7895), 'std_dev_duration_us': np.float64(0.8772184733576919), 'min_duration_us': np.float64(111.284), 'max_duration_us': np.float64(115.851)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(114.64)}]",0.17389088666975336,95.22711256976537 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 12288), (12288, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",1,80,45.75550537109375,45.75550537109375,45.70703125,45.70703125,2.739651795895817,2.739651795895817,37.97607421875,37.97607421875,50.033203125,50.033203125,3660.4404296875,3660.4404296875,8882,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(3660.44), 'mean_duration_us': np.float64(45.7555), 'median_duration_us': np.float64(45.707), 'std_dev_duration_us': np.float64(2.722449365920329), 'min_duration_us': np.float64(37.976), 'max_duration_us': np.float64(50.033)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]",0.17350901593800372,95.40062158570338 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((9840640, 19220, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,7,496.45849609375,510.81619698660717,495.29150390625,509.83251953125,13.830426333897373,13.800335108151545,477.9052734375,492.72607421875,516.3623046875,530.703125,3475.20947265625,3575.71337890625,23767,"['aten::miopen_convolution', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(66.21100000000001), 'mean_duration_us': np.float64(9.458714285714288), 'median_duration_us': np.float64(9.533), 'std_dev_duration_us': np.float64(0.6017806231238647), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(10.455)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(90.72800000000001), 'mean_duration_us': np.float64(12.961142857142859), 'median_duration_us': np.float64(13.098), 'std_dev_duration_us': np.float64(0.5008011948215517), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(13.699)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(97.979), 'mean_duration_us': np.float64(13.997), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.6984055309877533), 'min_duration_us': np.float64(12.497), 'max_duration_us': np.float64(14.902)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(129.225), 'mean_duration_us': np.float64(18.460714285714285), 'median_duration_us': np.float64(18.547), 'std_dev_duration_us': np.float64(0.45106404812421497), 'min_duration_us': np.float64(17.705), 'max_duration_us': np.float64(19.188)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(3091.066), 'mean_duration_us': np.float64(441.5808571428571), 'median_duration_us': np.float64(442.336), 'std_dev_duration_us': np.float64(14.279286921257372), 'min_duration_us': np.float64(420.664), 'max_duration_us': np.float64(462.647)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.46)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.0)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(18.46)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(441.58)}]",0.16472885909810928,95.56535044480148 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,50,66.230859375,66.230859375,65.91552734375,65.91552734375,2.1482493381519303,2.1482493381519303,62.89111328125,62.89111328125,72.10595703125,72.10595703125,3311.54296875,3311.54296875,16123,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_18', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(1023.592), 'mean_duration_us': np.float64(20.47184), 'median_duration_us': np.float64(20.409), 'std_dev_duration_us': np.float64(0.5652406340665894), 'min_duration_us': np.float64(19.348), 'max_duration_us': np.float64(22.072)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2287.949), 'mean_duration_us': np.float64(45.75898), 'median_duration_us': np.float64(45.5865), 'std_dev_duration_us': np.float64(1.7036678020083613), 'min_duration_us': np.float64(42.782), 'max_duration_us': np.float64(50.034)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.47)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]",0.1569708817234546,95.72232132652493 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240),)","('c10::BFloat16',)","((250675200, 979200, 57600, 240, 1),)","('',)",1,10,320.531494140625,320.531494140625,319.593994140625,319.593994140625,6.902544584904398,6.902544584904398,310.02001953125,310.02001953125,329.88916015625,329.88916015625,3205.31494140625,3205.31494140625,16256,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3205.315), 'mean_duration_us': np.float64(320.5315), 'median_duration_us': np.float64(319.594), 'std_dev_duration_us': np.float64(6.548297232869021), 'min_duration_us': np.float64(310.02), 'max_duration_us': np.float64(329.889)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(320.53)}]",0.1519355530947019,95.87425687961964 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 7, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((26672128, 104188, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,5,617.39228515625,661.45712890625,602.08984375,645.07275390625,25.11184598708146,25.81166366349123,600.36669921875,644.1923828125,657.73193359375,702.9580078125,3086.96142578125,3307.28564453125,23932,"['aten::miopen_convolution', 'nn.Module: Conv3d_21', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(28.237000000000002), 'mean_duration_us': np.float64(5.6474), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.30903760289000437), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.168)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(130.58700000000002), 'mean_duration_us': np.float64(26.117400000000004), 'median_duration_us': np.float64(26.037), 'std_dev_duration_us': np.float64(0.3254293164421424), 'min_duration_us': np.float64(25.757), 'max_duration_us': np.float64(26.518)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(168.36599999999999), 'mean_duration_us': np.float64(33.673199999999994), 'median_duration_us': np.float64(33.93), 'std_dev_duration_us': np.float64(1.4436774431984447), 'min_duration_us': np.float64(31.045), 'max_duration_us': np.float64(35.292)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(335.37299999999993), 'mean_duration_us': np.float64(67.07459999999999), 'median_duration_us': np.float64(66.578), 'std_dev_duration_us': np.float64(2.3191535179888367), 'min_duration_us': np.float64(64.735), 'max_duration_us': np.float64(71.425)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(2424.399), 'mean_duration_us': np.float64(484.8798), 'median_duration_us': np.float64(472.902), 'std_dev_duration_us': np.float64(19.36392630021093), 'min_duration_us': np.float64(468.335), 'max_duration_us': np.float64(518.73)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.12)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(33.67)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(67.07)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(484.88)}]",0.14632546260877366,96.02058234222841 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,240,12.679276529947916,12.679276529947916,12.77783203125,12.77783203125,0.8926095073379748,0.8926095073379748,8.81201171875,8.81201171875,14.4208984375,14.4208984375,3043.0263671875,3043.0263671875,8855,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(3043.026), 'mean_duration_us': np.float64(12.679274999999999), 'median_duration_us': np.float64(12.778), 'std_dev_duration_us': np.float64(0.8907307764087119), 'min_duration_us': np.float64(8.812), 'max_duration_us': np.float64(14.421)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.68)}]",0.14424289114552738,96.16482523337393 +aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 16, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (235929600, 921600, 57600, 240, 1)), ())","('', '2')",2,10,281.219921875,281.219921875,282.0576171875,282.0576171875,4.5396044607664345,4.5396044607664345,271.841796875,271.841796875,288.26611328125,288.26611328125,2812.19921875,2812.19921875,16235,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(207.33700000000002), 'mean_duration_us': np.float64(20.733700000000002), 'median_duration_us': np.float64(20.628999999999998), 'std_dev_duration_us': np.float64(0.577282781659041), 'min_duration_us': np.float64(19.828), 'max_duration_us': np.float64(21.791)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2604.862), 'mean_duration_us': np.float64(260.4862), 'median_duration_us': np.float64(260.7265), 'std_dev_duration_us': np.float64(4.294674884086099), 'min_duration_us': np.float64(251.293), 'max_duration_us': np.float64(268.077)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(260.49)}]",0.13330142326850872,96.29812665664244 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,10,280.287548828125,280.287548828125,278.37255859375,278.37255859375,9.588244494036497,9.588244494036497,268.47802734375,268.47802734375,296.9609375,296.9609375,2802.87548828125,2802.87548828125,16140,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2802.8759999999997), 'mean_duration_us': np.float64(280.2876), 'median_duration_us': np.float64(278.3725), 'std_dev_duration_us': np.float64(9.096211367377077), 'min_duration_us': np.float64(268.478), 'max_duration_us': np.float64(296.961)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(280.29)}]",0.13285946790013736,96.43098612454257 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 12288), (6, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",1,80,33.6279541015625,33.6279541015625,34.06884765625,34.06884765625,1.7664908669493384,1.7664908669493384,27.759765625,27.759765625,36.69287109375,36.69287109375,2690.236328125,2690.236328125,8880,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2690.236), 'mean_duration_us': np.float64(33.62795), 'median_duration_us': np.float64(34.069), 'std_dev_duration_us': np.float64(1.7554012497147198), 'min_duration_us': np.float64(27.76), 'max_duration_us': np.float64(36.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(33.63)}]",0.12752024432575929,96.55850636886834 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,64,40.10546112060547,40.10546112060547,40.218505859375,40.218505859375,0.53788759861266,0.53788759861266,38.09619140625,38.09619140625,41.10009765625,41.10009765625,2566.74951171875,2566.74951171875,182,"['aten::mm', 'nn.Module: Linear_0', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(2566.749), 'mean_duration_us': np.float64(40.105453125), 'median_duration_us': np.float64(40.218500000000006), 'std_dev_duration_us': np.float64(0.5336704838219316), 'min_duration_us': np.float64(38.096), 'max_duration_us': np.float64(41.1)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(40.11)}]",0.12166682957757975,96.68017319844591 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((66355200, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,6,404.0126953125,404.0126953125,401.8359375,401.8359375,15.147103670447086,15.147103670447086,387.494140625,387.494140625,431.0400390625,431.0400390625,2424.076171875,2424.076171875,24072,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_28', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(2424.076), 'mean_duration_us': np.float64(404.0126666666667), 'median_duration_us': np.float64(401.836), 'std_dev_duration_us': np.float64(13.827378429124671), 'min_duration_us': np.float64(387.494), 'max_duration_us': np.float64(431.04)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(404.01)}]",0.11490395192053486,96.79507715036645 +triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (6, 3072), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (22828032, 3072, 128, 1), ())","('', '', '', '22828032')",1,80,29.719598388671876,29.719598388671876,30.3837890625,30.3837890625,2.0641929601593563,2.0641929601593563,23.39404296875,23.39404296875,32.1669921875,32.1669921875,2377.56787109375,2377.56787109375,8864,"['triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2377.568), 'mean_duration_us': np.float64(29.719600000000003), 'median_duration_us': np.float64(30.384), 'std_dev_duration_us': np.float64(2.0512508964044356), 'min_duration_us': np.float64(23.394), 'max_duration_us': np.float64(32.167)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'mean_duration_us': np.float64(29.72)}]",0.11269940586753643,96.90777655623398 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120),)","('c10::BFloat16',)","((33177600, 129600, 14400, 120, 1),)","('',)",1,50,46.65314453125,46.65314453125,46.60791015625,46.60791015625,2.3934584387965505,2.3934584387965505,41.86083984375,41.86083984375,52.55712890625,52.55712890625,2332.6572265625,2332.6572265625,16127,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2332.658), 'mean_duration_us': np.float64(46.65316), 'median_duration_us': np.float64(46.608000000000004), 'std_dev_duration_us': np.float64(2.369370678977859), 'min_duration_us': np.float64(41.861), 'max_duration_us': np.float64(52.557)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(46.65)}]",0.11057059052756821,97.01834714676156 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,2317.95849609375,2388.302734375,2317.95849609375,2388.302734375,,,2317.95849609375,2388.302734375,2317.95849609375,2388.302734375,2317.95849609375,2388.302734375,23901,"['aten::miopen_convolution', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.9), 'mean_duration_us': np.float64(13.9), 'median_duration_us': np.float64(13.9), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.9), 'max_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(43.864), 'mean_duration_us': np.float64(43.864), 'median_duration_us': np.float64(43.864), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(43.864), 'max_duration_us': np.float64(43.864)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(59.087), 'mean_duration_us': np.float64(59.087), 'median_duration_us': np.float64(59.087), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(59.087), 'max_duration_us': np.float64(59.087)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.591), 'mean_duration_us': np.float64(129.591), 'median_duration_us': np.float64(129.591), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.591), 'max_duration_us': np.float64(129.591)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2071.517), 'mean_duration_us': np.float64(2071.517), 'median_duration_us': np.float64(2071.517), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2071.517), 'max_duration_us': np.float64(2071.517)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(43.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.09)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(129.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2071.52)}]",0.10987385408064057,97.1282210008422 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((2621440, 5120, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,10,227.38876953125,233.757177734375,217.4384765625,224.166748046875,21.1918095192224,21.54917892698669,216.39599609375,221.80322265625,267.7119140625,275.68310546875,2273.8876953125,2337.57177734375,23428,"['aten::miopen_convolution', 'nn.Module: Conv3d_2', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.857), 'mean_duration_us': np.float64(4.4857), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.17267370963757053), 'min_duration_us': np.float64(4.365), 'max_duration_us': np.float64(4.846)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(51.626000000000005), 'mean_duration_us': np.float64(5.1626), 'median_duration_us': np.float64(5.167), 'std_dev_duration_us': np.float64(0.17233989671576339), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(58.315), 'mean_duration_us': np.float64(5.8315), 'median_duration_us': np.float64(5.8075), 'std_dev_duration_us': np.float64(0.33862139625251086), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.489)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.341), 'mean_duration_us': np.float64(12.834100000000001), 'median_duration_us': np.float64(12.777999999999999), 'std_dev_duration_us': np.float64(0.3268839090564112), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(13.579)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1990.749), 'mean_duration_us': np.float64(199.0749), 'median_duration_us': np.float64(189.5805), 'std_dev_duration_us': np.float64(19.490014086449502), 'min_duration_us': np.float64(188.359), 'max_duration_us': np.float64(238.514)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.16)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(199.07)}]",0.10778484828419674,97.2360058491264 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,100,16.73724609375,16.73724609375,15.02001953125,15.02001953125,3.7796122821716116,3.7796122821716116,14.6591796875,14.6591796875,28.8408203125,28.8408203125,1673.724609375,1673.724609375,15620,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(522.8009999999999), 'mean_duration_us': np.float64(5.228009999999999), 'median_duration_us': np.float64(5.0665), 'std_dev_duration_us': np.float64(0.4639569483260273), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(7.089)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1150.926), 'mean_duration_us': np.float64(11.50926), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(3.376708283580327), 'min_duration_us': np.float64(9.733), 'max_duration_us': np.float64(22.393)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.51)}]",0.07933643928981207,97.31534228841622 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,70,22.641245814732144,22.641245814732144,22.53271484375,22.53271484375,1.2290221033136148,1.2290221033136148,19.5078125,19.5078125,25.796875,25.796875,1584.88720703125,1584.88720703125,15973,"['aten::add_', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1584.885), 'mean_duration_us': np.float64(22.641214285714284), 'median_duration_us': np.float64(22.5325), 'std_dev_duration_us': np.float64(1.2201986828013724), 'min_duration_us': np.float64(19.508), 'max_duration_us': np.float64(25.797)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.64)}]",0.07512544595301611,97.39046773436924 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((2304000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,100,15.3385302734375,15.3385302734375,14.760986328125,14.760986328125,1.4763561330175836,1.4763561330175836,13.85888671875,13.85888671875,19.4677734375,19.4677734375,1533.85302734375,1533.85302734375,15626,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1533.8520000000003), 'mean_duration_us': np.float64(15.338520000000003), 'median_duration_us': np.float64(14.761), 'std_dev_duration_us': np.float64(1.4689585322942238), 'min_duration_us': np.float64(13.859), 'max_duration_us': np.float64(19.468)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(15.34)}]",0.0727063681215713,97.46317410249081 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,2,753.759033203125,753.759033203125,753.759033203125,753.759033203125,100.95503002861471,100.95503002861471,682.373046875,682.373046875,825.14501953125,825.14501953125,1507.51806640625,1507.51806640625,24041,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(1507.518), 'mean_duration_us': np.float64(753.759), 'median_duration_us': np.float64(753.759), 'std_dev_duration_us': np.float64(71.38599999999997), 'min_duration_us': np.float64(682.373), 'max_duration_us': np.float64(825.145)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(753.76)}]",0.07145806119107946,97.53463216368189 +aten::_efficient_attention_forward,SDPA_fwd,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 351, 32, 128), (1, 351, 32, 128), (1, 351, 32, 128), (1, 32, 351, 351), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '')","((1437696, 4096, 128, 1), (1437696, 128, 44928, 1), (1437696, 128, 44928, 1), (123552, 0, 352, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '0.088388347648318447', '', '')",1,32,44.925689697265625,44.925689697265625,44.74560546875,44.74560546875,0.8824982727758616,0.8824982727758616,44.22412109375,44.22412109375,49.51220703125,49.51220703125,1437.6220703125,1437.6220703125,302,"['aten::_efficient_attention_forward', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(1437.6219999999998), 'mean_duration_us': np.float64(44.925687499999995), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(0.8685557494160925), 'min_duration_us': np.float64(44.224), 'max_duration_us': np.float64(49.512)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(44.93)}]",0.0681449119312598,97.60277707561315 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,60,23.897591145833335,23.897591145833335,24.234130859375,24.234130859375,1.770591998505488,1.770591998505488,20.869140625,20.869140625,27.318359375,27.318359375,1433.85546875,1433.85546875,15974,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(445.928), 'mean_duration_us': np.float64(7.432133333333334), 'median_duration_us': np.float64(7.4704999999999995), 'std_dev_duration_us': np.float64(0.4628981337424275), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.451)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(987.925), 'mean_duration_us': np.float64(16.465416666666666), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(1.3029620650869138), 'min_duration_us': np.float64(14.14), 'max_duration_us': np.float64(18.867)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(7.43)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(16.47)}]",0.06796637075756948,97.67074344637072 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (1, 256, 9, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', '1')",1,30,47.671142578125,47.671142578125,47.449462890625,47.449462890625,1.3206365016932746,1.3206365016932746,45.70703125,45.70703125,49.953125,49.953125,1430.13427734375,1430.13427734375,16149,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(1430.1350000000002), 'mean_duration_us': np.float64(47.67116666666667), 'median_duration_us': np.float64(47.4495), 'std_dev_duration_us': np.float64(1.2984185016994922), 'min_duration_us': np.float64(45.707), 'max_duration_us': np.float64(49.953)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(47.67)}]",0.06778998207663949,97.73853342844735 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 129600, 14400, 120, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,10,135.043701171875,135.043701171875,135.179931640625,135.179931640625,5.501210547895183,5.501210547895183,127.42822265625,127.42822265625,144.1728515625,144.1728515625,1350.43701171875,1350.43701171875,16107,"['aten::add_', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1350.437), 'mean_duration_us': np.float64(135.0437), 'median_duration_us': np.float64(135.18), 'std_dev_duration_us': np.float64(5.218896589318471), 'min_duration_us': np.float64(127.428), 'max_duration_us': np.float64(144.173)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(135.04)}]",0.0640122415568398,97.80254567000419 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,132.519189453125,132.519189453125,130.8125,130.8125,4.220332799620465,4.220332799620465,127.06689453125,127.06689453125,139.68603515625,139.68603515625,1325.19189453125,1325.19189453125,16108,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_17', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(411.72300000000007), 'mean_duration_us': np.float64(41.17230000000001), 'median_duration_us': np.float64(41.321), 'std_dev_duration_us': np.float64(0.6129716225079271), 'min_duration_us': np.float64(40.298), 'max_duration_us': np.float64(42.142)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(913.469), 'mean_duration_us': np.float64(91.3469), 'median_duration_us': np.float64(90.45400000000001), 'std_dev_duration_us': np.float64(3.6463250389947413), 'min_duration_us': np.float64(86.047), 'max_duration_us': np.float64(97.544)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(41.17)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(91.35)}]",0.06281559445259594,97.8653612644568 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,1237.47412109375,1283.5810546875,1237.47412109375,1283.5810546875,,,1237.47412109375,1283.5810546875,1237.47412109375,1283.5810546875,1237.47412109375,1283.5810546875,23916,"['aten::miopen_convolution', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.693), 'mean_duration_us': np.float64(9.693), 'median_duration_us': np.float64(9.693), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.693), 'max_duration_us': np.float64(9.693)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.719), 'mean_duration_us': np.float64(26.719), 'median_duration_us': np.float64(26.719), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.719), 'max_duration_us': np.float64(26.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.848), 'mean_duration_us': np.float64(32.848), 'median_duration_us': np.float64(32.848), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.848), 'max_duration_us': np.float64(32.848)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(135.921), 'mean_duration_us': np.float64(135.921), 'median_duration_us': np.float64(135.921), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(135.921), 'max_duration_us': np.float64(135.921)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1032.293), 'mean_duration_us': np.float64(1032.293), 'median_duration_us': np.float64(1032.293), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1032.293), 'max_duration_us': np.float64(1032.293)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.72)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(32.85)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(135.92)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1032.29)}]",0.058657672792138064,97.92401893724893 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60),)","('c10::BFloat16',)","((9216000, 18000, 3600, 60, 1),)","('',)",1,60,20.029386393229167,20.029386393229167,18.8271484375,18.8271484375,3.3221468251065898,3.3221468251065898,15.4619140625,15.4619140625,26.51904296875,26.51904296875,1201.76318359375,1201.76318359375,15978,"['aten::silu', 'nn.Module: SiLU_5', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(1201.764), 'mean_duration_us': np.float64(20.0294), 'median_duration_us': np.float64(18.826999999999998), 'std_dev_duration_us': np.float64(3.2943422874174244), 'min_duration_us': np.float64(15.462), 'max_duration_us': np.float64(26.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(20.03)}]",0.056964933969346314,97.98098387121827 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,1175.90185546875,1185.7158203125,1175.90185546875,1185.7158203125,,,1175.90185546875,1185.7158203125,1175.90185546875,1185.7158203125,1175.90185546875,1185.7158203125,24166,"['aten::miopen_convolution', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.647), 'mean_duration_us': np.float64(5.647), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.647)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.248), 'mean_duration_us': np.float64(6.248), 'median_duration_us': np.float64(6.248), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.248), 'max_duration_us': np.float64(6.248)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(184.593), 'mean_duration_us': np.float64(184.593), 'median_duration_us': np.float64(184.593), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(184.593), 'max_duration_us': np.float64(184.593)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(974.007), 'mean_duration_us': np.float64(974.007), 'median_duration_us': np.float64(974.007), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(974.007), 'max_duration_us': np.float64(974.007)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(6.25)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(184.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(974.01)}]",0.05573907776979558,98.03672294898807 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 1024))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,64,18.144737243652344,18.144737243652344,17.90478515625,17.90478515625,0.5846290263867382,0.5846290263867382,17.22412109375,17.22412109375,19.42822265625,19.42822265625,1161.26318359375,1161.26318359375,194,"['aten::mm', 'nn.Module: Linear_1', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(1161.262), 'mean_duration_us': np.float64(18.14471875), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.5800629941208434), 'min_duration_us': np.float64(17.224), 'max_duration_us': np.float64(19.428)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(18.14)}]",0.055045188168131594,98.09176813715621 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((66355200, 129600, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,10,113.4955078125,188.670263671875,112.846435546875,189.9599609375,2.544025502241682,4.821601122779749,110.3232421875,179.98583984375,117.85400390625,195.3681640625,1134.955078125,1886.70263671875,16144,"['aten::miopen_convolution', 'nn.Module: Conv3d_22', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO16_SVW4_TSGRA0_TSGRB0_TT4_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW4_VWB2_VFLRP1_WSGRA1_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1134.955), 'mean_duration_us': np.float64(113.49549999999999), 'median_duration_us': np.float64(112.84649999999999), 'std_dev_duration_us': np.float64(2.4135129272494074), 'min_duration_us': np.float64(110.323), 'max_duration_us': np.float64(117.854)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(113.5)}]",0.05379815421722921,98.14556629137344 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120),)","('c10::BFloat16',)","((66355200, 129600, 14400, 120, 1),)","('',)",1,10,106.256689453125,106.256689453125,105.9365234375,105.9365234375,3.7388532278256914,3.7388532278256914,101.18896484375,101.18896484375,114.52880859375,114.52880859375,1062.56689453125,1062.56689453125,16112,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1062.567), 'mean_duration_us': np.float64(106.2567), 'median_duration_us': np.float64(105.9365), 'std_dev_duration_us': np.float64(3.547052806204047), 'min_duration_us': np.float64(101.189), 'max_duration_us': np.float64(114.529)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(106.26)}]",0.05036687245150918,98.19593316382495 +aten::addmm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((3072,), (6, 3072), (3072, 3072), (), (), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",1,80,11.99677734375,11.99677734375,12.01708984375,12.01708984375,0.7928533757608454,0.7928533757608454,8.89208984375,8.89208984375,13.17822265625,13.17822265625,959.7421875,959.7421875,8861,"['aten::addmm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(959.742), 'mean_duration_us': np.float64(11.996775), 'median_duration_us': np.float64(12.017), 'std_dev_duration_us': np.float64(0.7878753228620631), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(13.178)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.0)}]",0.04549286505436412,98.24142602887932 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,110,7.681316583806818,7.681316583806818,7.60986328125,7.60986328125,0.5012591425966126,0.5012591425966126,6.68896484375,6.68896484375,9.3720703125,9.3720703125,844.94482421875,844.94482421875,15619,"['aten::add_', 'nn.Module: Conv3d_1', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 110, 'total_duration_us': np.float64(844.944), 'mean_duration_us': np.float64(7.681309090909091), 'median_duration_us': np.float64(7.61), 'std_dev_duration_us': np.float64(0.4989875157019925), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.372)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.68)}]",0.04005134021116166,98.28147736909048 +aten::_efficient_attention_forward,SDPA_fwd,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 2700, 1, 512), (1, 2700, 1, 512), (1, 2700, 1, 512), (1, 1, 2700, 2700), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', '', '', '')","((1382400, 512, 512, 1), (1382400, 512, 512, 1), (1382400, 512, 512, 1), (7300800, 7300800, 2704, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '', '', '')",1,1,841.208984375,841.208984375,841.208984375,841.208984375,,,841.208984375,841.208984375,841.208984375,841.208984375,841.208984375,841.208984375,23564,"['aten::_efficient_attention_forward', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(841.209), 'mean_duration_us': np.float64(841.209), 'median_duration_us': np.float64(841.209), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(841.209), 'max_duration_us': np.float64(841.209)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(841.21)}]",0.03987425717772834,98.32135162626821 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (1, 128, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (128, 1, 1, 1, 1), ())","('', '', '1')",1,7,119.77120535714286,119.77120535714286,119.3759765625,119.3759765625,9.28833478021703,9.28833478021703,109.201171875,109.201171875,136.2412109375,136.2412109375,838.3984375,838.3984375,24064,"['aten::add_', 'nn.Module: Conv3d_28', 'nn.Module: HunyuanVideoCausalConv3d_27', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(838.398), 'mean_duration_us': np.float64(119.77114285714286), 'median_duration_us': np.float64(119.376), 'std_dev_duration_us': np.float64(8.599330811648274), 'min_duration_us': np.float64(109.201), 'max_duration_us': np.float64(136.241)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(119.77)}]",0.0397410340774222,98.36109266034563 +triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((6, 3072), (3072,), (1, 24, 6, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (144, 1, 24, 144), (), ())","('', '', '', '144', '128')",1,160,5.227825927734375,5.227825927734375,5.287109375,5.287109375,0.44083111616836695,0.44083111616836695,3.00390625,3.00390625,6.087890625,6.087890625,836.4521484375,836.4521484375,8856,"['triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(836.449), 'mean_duration_us': np.float64(5.2278062499999995), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.43945555089330424), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]",0.03964877777481271,98.40074143812045 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30),)","('c10::BFloat16',)","((2304000, 4500, 900, 30, 1),)","('',)",1,100,7.666044921875,7.666044921875,7.6298828125,7.6298828125,1.0174137084075794,1.0174137084075794,5.88818359375,5.88818359375,9.85302734375,9.85302734375,766.6044921875,766.6044921875,15624,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(766.604), 'mean_duration_us': np.float64(7.666040000000001), 'median_duration_us': np.float64(7.630000000000001), 'std_dev_duration_us': np.float64(1.012318496521722), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(9.853)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.67)}]",0.03633791987825404,98.4370793579987 +aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 8, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (58982400, 115200, 14400, 120, 1)), ())","('', '2')",2,10,72.501708984375,72.501708984375,72.02490234375,72.02490234375,2.7954535278924006,2.7954535278924006,68.25927734375,68.25927734375,76.7919921875,76.7919921875,725.01708984375,725.01708984375,16091,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.589), 'mean_duration_us': np.float64(13.4589), 'median_duration_us': np.float64(13.018), 'std_dev_duration_us': np.float64(1.186606796710688), 'min_duration_us': np.float64(12.177), 'max_duration_us': np.float64(15.983)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(590.428), 'mean_duration_us': np.float64(59.0428), 'median_duration_us': np.float64(58.646), 'std_dev_duration_us': np.float64(2.601411878192303), 'min_duration_us': np.float64(55.481), 'max_duration_us': np.float64(63.734)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(59.04)}]",0.034366629976208596,98.4714459879749 +aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((14745600, 57600, 14400, 120, 1), (), (), (), ())","('', '[8, 240, 240]', '2.', '2.', '2.')",1,1,686.5791015625,686.5791015625,686.5791015625,686.5791015625,,,686.5791015625,686.5791015625,686.5791015625,686.5791015625,686.5791015625,686.5791015625,24032,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(686.579), 'mean_duration_us': np.float64(686.579), 'median_duration_us': np.float64(686.579), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(686.579), 'max_duration_us': np.float64(686.579)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(686.58)}]",0.0325446258623797,98.50399061383729 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,113.753662109375,113.753662109375,113.967041015625,113.967041015625,2.8280491391961675,2.8280491391961675,110.162109375,110.162109375,116.9716796875,116.9716796875,682.52197265625,682.52197265625,24065,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_24', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(206.863), 'mean_duration_us': np.float64(34.47716666666667), 'median_duration_us': np.float64(34.67100000000001), 'std_dev_duration_us': np.float64(0.5376580129495795), 'min_duration_us': np.float64(33.73), 'max_duration_us': np.float64(35.131)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(475.659), 'mean_duration_us': np.float64(79.2765), 'median_duration_us': np.float64(79.3965), 'std_dev_duration_us': np.float64(2.7204514178104104), 'min_duration_us': np.float64(75.271), 'max_duration_us': np.float64(82.281)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(34.48)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(79.28)}]",0.032352313364039945,98.53634292720133 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,1,671.7568359375,671.7568359375,671.7568359375,671.7568359375,,,671.7568359375,671.7568359375,671.7568359375,671.7568359375,671.7568359375,671.7568359375,24082,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(671.757), 'mean_duration_us': np.float64(671.757), 'median_duration_us': np.float64(671.757), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(671.757), 'max_duration_us': np.float64(671.757)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(671.76)}]",0.03184203370934062,98.56818496091067 +aten::copy_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 4, 351, 128), (1, 8, 4, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 179712, 44928, 128, 1), (359424, 44928, 0, 128, 1), ())","('', '', 'False')",1,64,9.871139526367188,9.871139526367188,10.4345703125,10.4345703125,1.5825210598707937,1.5825210598707937,7.208984375,7.208984375,12.6982421875,12.6982421875,631.7529296875,631.7529296875,259,"['aten::copy_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(631.752), 'mean_duration_us': np.float64(9.871125), 'median_duration_us': np.float64(10.4345), 'std_dev_duration_us': np.float64(1.5701190788838277), 'min_duration_us': np.float64(7.209), 'max_duration_us': np.float64(12.698)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}]",0.02994580331290545,98.59813076422357 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((18432000, 72000, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,5,117.5978515625,117.5978515625,121.09912109375,121.09912109375,6.0791423956177555,6.0791423956177555,110.80419921875,110.80419921875,123.54296875,123.54296875,587.9892578125,587.9892578125,23928,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_20', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(587.989), 'mean_duration_us': np.float64(117.5978), 'median_duration_us': np.float64(121.099), 'std_dev_duration_us': np.float64(5.437447540896374), 'min_duration_us': np.float64(110.804), 'max_duration_us': np.float64(123.543)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(117.6)}]",0.027871355773948177,98.62600211999752 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240),)","('c10::BFloat16',)","((66355200, 518400, 57600, 240, 1),)","('',)",1,6,96.74283854166667,96.74283854166667,95.361083984375,95.361083984375,3.415178432280567,3.415178432280567,94.3388671875,94.3388671875,103.15185546875,103.15185546875,580.45703125,580.45703125,24069,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(580.457), 'mean_duration_us': np.float64(96.74283333333334), 'median_duration_us': np.float64(95.361), 'std_dev_duration_us': np.float64(3.117643256086595), 'min_duration_us': np.float64(94.339), 'max_duration_us': np.float64(103.152)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(96.74)}]",0.027514319716734414,98.65351643971425 +aten::pow,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), ())","('float', 'Scalar')","((1437696, 4096, 1), ())","('', '2')",1,65,8.57967998798077,8.57967998798077,5.0869140625,5.0869140625,4.26215138489593,4.26215138489593,4.44482421875,4.44482421875,15.501953125,15.501953125,557.67919921875,557.67919921875,163,"['aten::pow', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(557.6830000000001), 'mean_duration_us': np.float64(8.579738461538463), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(4.22916112531851), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(15.502)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(8.58)}]",0.02643462471913525,98.67995106443338 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 3072), (6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",1,76,7.155408357319079,7.155408357319079,7.10888671875,7.10888671875,0.40602366553147473,0.40602366553147473,6.369140625,6.369140625,8.251953125,8.251953125,543.81103515625,543.81103515625,8906,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(543.8090000000001), 'mean_duration_us': np.float64(7.155381578947369), 'median_duration_us': np.float64(7.109), 'std_dev_duration_us': np.float64(0.40333442331282093), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(8.252)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.16)}]",0.02577725805914658,98.70572832249253 +aten::mean,reduce,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1437696, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",1,65,8.351059194711539,8.351059194711539,8.130859375,8.130859375,0.5903942556171845,0.5903942556171845,7.330078125,7.330078125,9.97412109375,9.97412109375,542.81884765625,542.81884765625,166,"['aten::mean', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(542.82), 'mean_duration_us': np.float64(8.351076923076924), 'median_duration_us': np.float64(8.131), 'std_dev_duration_us': np.float64(0.5858520765699322), 'min_duration_us': np.float64(7.33), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(466.692), 'mean_duration_us': np.float64(233.346), 'median_duration_us': np.float64(233.346), 'std_dev_duration_us': np.float64(22.192999999999998), 'min_duration_us': np.float64(211.153), 'max_duration_us': np.float64(255.539)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(233.35)}]",0.022121723579933483,98.8756987097678 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 12288), (256, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",1,8,58.2354736328125,58.2354736328125,58.4658203125,58.4658203125,0.5537596988904987,0.5537596988904987,57.32421875,57.32421875,58.72607421875,58.72607421875,465.8837890625,465.8837890625,8768,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(465.884), 'mean_duration_us': np.float64(58.2355), 'median_duration_us': np.float64(58.465999999999994), 'std_dev_duration_us': np.float64(0.518025819819823), 'min_duration_us': np.float64(57.324), 'max_duration_us': np.float64(58.726)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(58.24)}]",0.02208341846683295,98.89778212823464 +triton_poi_fused_addmm_gelu_view_14,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((73728, 12288, 1), (1,), ())","('', '', '73728')",1,80,5.645831298828125,5.645831298828125,5.64697265625,5.64697265625,0.1473221720033376,0.1473221720033376,5.3271484375,5.3271484375,6.087890625,6.087890625,451.66650390625,451.66650390625,8881,"['triton_poi_fused_addmm_gelu_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(451.668), 'mean_duration_us': np.float64(5.64585), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.1464002305326054), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",0.021409503072181514,98.91919163130682 +aten::cat,other,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"(((0,), (1, 8, 351, 128)), ())","('TensorList', 'Scalar')","(((1,), (359424, 128, 1024, 1)), ())","('', '-2')",1,64,7.05194091796875,7.05194091796875,6.84912109375,6.84912109375,0.5375223212185637,0.5375223212185637,6.12890625,6.12890625,8.01123046875,8.01123046875,451.32421875,451.32421875,249,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(451.324), 'mean_duration_us': np.float64(7.0519375), 'median_duration_us': np.float64(6.849), 'std_dev_duration_us': np.float64(0.5332750191915518), 'min_duration_us': np.float64(6.129), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(438.54699999999997), 'mean_duration_us': np.float64(6.746876923076923), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(1.7456149589334042), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(9.814)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.75)}]",0.020787664115280043,98.96137257379078 +aten::mul,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 1))","('float', 'float')","((1437696, 4096, 1), (351, 1, 1))","('', '')",1,65,6.6999098557692305,6.6999098557692305,6.68896484375,6.68896484375,0.9702103970057914,0.9702103970057914,5.326171875,5.326171875,8.85205078125,8.85205078125,435.494140625,435.494140625,169,"['aten::mul', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(435.495), 'mean_duration_us': np.float64(6.699923076923077), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.9627103295894487), 'min_duration_us': np.float64(5.326), 'max_duration_us': np.float64(8.852)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.7)}]",0.020642914763418584,98.9820154885542 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((132710400, 518400, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,1,417.77978515625,534.6328125,417.77978515625,534.6328125,,,417.77978515625,534.6328125,417.77978515625,534.6328125,417.77978515625,534.6328125,24086,"['aten::miopen_convolution', 'nn.Module: Conv3d_30', 'nn.Module: HunyuanVideoCausalConv3d_29', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(417.78), 'mean_duration_us': np.float64(417.78), 'median_duration_us': np.float64(417.78), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(417.78), 'max_duration_us': np.float64(417.78)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(417.78)}]",0.019803234281138147,99.00181872283534 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((2937600, 979200, 240, 1), ())","('', '')",1,76,5.4808349609375,5.4808349609375,5.4482421875,5.4482421875,0.26325786271629587,0.26325786271629587,4.84619140625,4.84619140625,6.2880859375,6.2880859375,416.54345703125,416.54345703125,24177,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(416.541), 'mean_duration_us': np.float64(5.480802631578947), 'median_duration_us': np.float64(5.448), 'std_dev_duration_us': np.float64(0.26152769903300077), 'min_duration_us': np.float64(4.846), 'max_duration_us': np.float64(6.288)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.48)}]",0.019744630929856854,99.02156335376519 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (1, 512, 5, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', '1')",1,30,13.604671223958333,13.604671223958333,13.599609375,13.599609375,0.3944050019152468,0.3944050019152468,12.6982421875,12.6982421875,14.6611328125,14.6611328125,408.14013671875,408.14013671875,16005,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(408.1389999999999), 'mean_duration_us': np.float64(13.60463333333333), 'median_duration_us': np.float64(13.599499999999999), 'std_dev_duration_us': np.float64(0.387789761196565), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(13.6)}]",0.019346304043778233,99.04090965780897 +aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((1843200, 3600, 900, 30, 1), (), (), (), ())","('', '[4, 60, 60]', '1.', '2.', '2.')",1,10,40.4791015625,40.4791015625,40.55908203125,40.55908203125,1.1539596188284338,1.1539596188284338,38.73681640625,38.73681640625,42.98291015625,42.98291015625,404.791015625,404.791015625,15956,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(404.791), 'mean_duration_us': np.float64(40.4791), 'median_duration_us': np.float64(40.559), 'std_dev_duration_us': np.float64(1.0947686011208024), 'min_duration_us': np.float64(38.737), 'max_duration_us': np.float64(42.983)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(40.48)}]",0.019187551916432895,99.0600972097254 +aten::silu,elementwise,nn.Module: SiLUActivation,python3,CPU,thread 416 (python3),"((1, 351, 14336),)","('c10::BFloat16',)","((5031936, 14336, 1),)","('',)",1,32,12.150711059570312,12.150711059570312,12.216796875,12.216796875,0.37123387869406144,0.37123387869406144,10.77490234375,10.77490234375,12.97802734375,12.97802734375,388.82275390625,388.82275390625,358,"['aten::silu', 'nn.Module: SiLUActivation_0', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(388.824), 'mean_duration_us': np.float64(12.15075), 'median_duration_us': np.float64(12.217), 'std_dev_duration_us': np.float64(0.3653646295141334), 'min_duration_us': np.float64(10.775), 'max_duration_us': np.float64(12.978)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(12.15)}]",0.018430638252549737,99.07852784797795 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((4500, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 4500), (1, 512))","('', '')",1,30,12.748746744791667,12.748746744791667,12.177490234375,12.177490234375,1.8363837130001566,1.8363837130001566,10.25390625,10.25390625,16.5029296875,16.5029296875,382.46240234375,382.46240234375,15714,"['aten::mm', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB2_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB0_LBSPPM0_LPA16_LPB0_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(382.4630000000001), 'mean_duration_us': np.float64(12.74876666666667), 'median_duration_us': np.float64(12.1775), 'std_dev_duration_us': np.float64(1.8054999618449796), 'min_duration_us': np.float64(10.254), 'max_duration_us': np.float64(16.503)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.75)}]",0.018129150395602606,99.09665699837356 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (1, 256, 8, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((29491200, 115200, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', 'False')",1,10,38.147509765625,38.147509765625,38.115478515625,38.115478515625,1.4737842299728579,1.4737842299728579,35.57177734375,35.57177734375,40.458984375,40.458984375,381.47509765625,381.47509765625,16232,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(381.476), 'mean_duration_us': np.float64(38.1476), 'median_duration_us': np.float64(38.1155), 'std_dev_duration_us': np.float64(1.3980922859382354), 'min_duration_us': np.float64(35.572), 'max_duration_us': np.float64(40.459)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(38.15)}]",0.01808235103687797,99.11473934941044 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((768,), (77, 768), (768, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",1,48,7.841481526692708,7.841481526692708,7.85009765625,7.85009765625,0.20665183970822962,0.20665183970822962,7.490234375,7.490234375,8.81201171875,8.81201171875,376.39111328125,376.39111328125,7316,"['aten::addmm', 'nn.Module: Linear_224', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(376.39), 'mean_duration_us': np.float64(7.841458333333333), 'median_duration_us': np.float64(7.85), 'std_dev_duration_us': np.float64(0.20446117788932164), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(8.812)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]",0.017841364428054576,99.1325807138385 +aten::mul,elementwise,nn.Module: LlamaMLP,python3,CPU,thread 416 (python3),"((1, 351, 14336), (1, 351, 14336))","('c10::BFloat16', 'c10::BFloat16')","((5031936, 14336, 1), (5031936, 14336, 1))","('', '')",1,32,11.632553100585938,11.632553100585938,11.576171875,11.576171875,0.2792152437804258,0.2792152437804258,11.2158203125,11.2158203125,12.296875,12.296875,372.24169921875,372.24169921875,368,"['aten::mul', 'nn.Module: LlamaMLP_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(372.242), 'mean_duration_us': np.float64(11.6325625), 'median_duration_us': np.float64(11.576), 'std_dev_duration_us': np.float64(0.27485666008621656), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(12.297)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(11.63)}]",0.01764467750894382,99.15022539134743 +aten::add,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 32, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 128, 4096, 1), (1437696, 44928, 128, 1), ())","('', '', '1')",1,32,11.448394775390625,11.448394775390625,11.47607421875,11.47607421875,1.1922998197142467,1.1922998197142467,8.4521484375,8.4521484375,13.93896484375,13.93896484375,366.3486328125,366.3486328125,223,"['aten::add', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(366.34899999999993), 'mean_duration_us': np.float64(11.448406249999998), 'median_duration_us': np.float64(11.475999999999999), 'std_dev_duration_us': np.float64(1.1735182641147677), 'min_duration_us': np.float64(8.452), 'max_duration_us': np.float64(13.939)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]",0.017365339496853007,99.16759073084428 +aten::copy_,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",1,65,5.313363882211538,5.313363882211538,4.9658203125,4.9658203125,2.1009148460708174,2.1009148460708174,4.52490234375,4.52490234375,14.78076171875,14.78076171875,345.36865234375,345.36865234375,162,"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(345.373), 'mean_duration_us': np.float64(5.313430769230769), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.0846667541783104), 'min_duration_us': np.float64(4.525), 'max_duration_us': np.float64(14.781)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(5.31)}]",0.01637086469649623,99.18396159554078 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', '1')",1,50,6.78431640625,6.78431640625,6.6689453125,6.6689453125,0.532550223901356,0.532550223901356,5.92822265625,5.92822265625,8.3310546875,8.3310546875,339.2158203125,339.2158203125,15651,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(339.217), 'mean_duration_us': np.float64(6.784339999999999), 'median_duration_us': np.float64(6.6690000000000005), 'std_dev_duration_us': np.float64(0.5272197116952286), 'min_duration_us': np.float64(5.928), 'max_duration_us': np.float64(8.331)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.78)}]",0.01607921350001298,99.20004080904079 +aten::where,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((4500, 4500), (), ())","('bool', 'float', 'float')","((4500, 1), (), ())","('', '', '')",1,10,33.732958984375,33.732958984375,34.050048828125,34.050048828125,2.197378221579753,2.197378221579753,29.8828125,29.8828125,37.1337890625,37.1337890625,337.32958984375,337.32958984375,15687,"['aten::where', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(337.33), 'mean_duration_us': np.float64(33.733), 'median_duration_us': np.float64(34.05), 'std_dev_duration_us': np.float64(2.0846242826946058), 'min_duration_us': np.float64(29.883), 'max_duration_us': np.float64(37.134)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(33.73)}]",0.015989804042667154,99.21603061308345 +aten::_efficient_attention_forward,SDPA_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 24, 128), (1, 256, 24, 128), (1, 256, 24, 128), (1, 24, 256, 256), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', '', '', 'Scalar', 'Scalar', 'Scalar', '', '', '')","((786432, 3072, 128, 1), (786432, 3072, 128, 1), (786432, 3072, 128, 1), (1572864, 65536, 256, 1), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '', '', '', '0.', '0', 'False', '', '', '')",1,8,41.996337890625,41.996337890625,38.77587890625,38.77587890625,4.696939761735354,4.696939761735354,38.416015625,38.416015625,48.15087890625,48.15087890625,335.970703125,335.970703125,8736,"['aten::_efficient_attention_forward', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(335.971), 'mean_duration_us': np.float64(41.996375), 'median_duration_us': np.float64(38.775999999999996), 'std_dev_duration_us': np.float64(4.393628197102597), 'min_duration_us': np.float64(38.416), 'max_duration_us': np.float64(48.151)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(42.0)}]",0.01592539127544131,99.23195600435889 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 6, 3072), (1, 18432), (18432,), (6, 3072), (3072,), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '7431', '3072')",1,4,81.7803955078125,81.7803955078125,82.02099609375,82.02099609375,1.2703215423174574,1.2703215423174574,80.23779296875,80.23779296875,82.841796875,82.841796875,327.12158203125,327.12158203125,9518,"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(327.122), 'mean_duration_us': np.float64(81.7805), 'median_duration_us': np.float64(82.021), 'std_dev_duration_us': np.float64(1.1001921423096988), 'min_duration_us': np.float64(80.238), 'max_duration_us': np.float64(82.842)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(81.78)}]",0.015505932928177923,99.24746193728707 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 9216), (9216,), (7431, 3072), (3072,), (1, 7431, 3072), (1, 6144), (6144,), (1, 7425, 3072), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9216, 1), (1,), (3072, 1), (1,), (22828032, 3072, 1), (6144, 1), (1,), (22809600, 3072, 1), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '7425', '3072')",1,4,78.7860107421875,78.7860107421875,78.3349609375,78.3349609375,1.1400923770012072,1.1400923770012072,77.9951171875,77.9951171875,80.47900390625,80.47900390625,315.14404296875,315.14404296875,10411,"['triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(315.144), 'mean_duration_us': np.float64(78.786), 'median_duration_us': np.float64(78.33500000000001), 'std_dev_duration_us': np.float64(0.9873616358761349), 'min_duration_us': np.float64(77.995), 'max_duration_us': np.float64(80.479)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(78.79)}]",0.014938184031286082,99.26240012131835 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,7,43.91587611607143,43.91587611607143,44.26513671875,44.26513671875,1.7557904791528887,1.7557904791528887,40.97998046875,40.97998046875,46.10693359375,46.10693359375,307.4111328125,307.4111328125,23920,"['aten::add_', 'nn.Module: Conv3d_20', 'nn.Module: HunyuanVideoCausalConv3d_19', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(307.411), 'mean_duration_us': np.float64(43.91585714285714), 'median_duration_us': np.float64(44.265), 'std_dev_duration_us': np.float64(1.6255045307817015), 'min_duration_us': np.float64(40.98), 'max_duration_us': np.float64(46.107)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(43.92)}]",0.01457163534477666,99.27697175666313 +aten::copy_,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",1,65,4.647265625,4.647265625,4.76611328125,4.76611328125,0.3059762548695673,0.3059762548695673,4.0048828125,4.0048828125,5.24609375,5.24609375,302.072265625,302.072265625,173,"['aten::copy_', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(302.069), 'mean_duration_us': np.float64(4.647215384615385), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.30359114673965415), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.246)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.65)}]",0.014318567002395276,99.29129032366552 +aten::le,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500))","('int', 'int')","((0, 1), (1, 0))","('', '')",1,10,28.9501953125,28.9501953125,28.5615234375,28.5615234375,2.373956250174059,2.373956250174059,26.078125,26.078125,33.0078125,33.0078125,289.501953125,289.501953125,15679,"['aten::le', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(289.502), 'mean_duration_us': np.float64(28.950200000000002), 'median_duration_us': np.float64(28.561500000000002), 'std_dev_duration_us': np.float64(2.2521561579961547), 'min_duration_us': np.float64(26.078), 'max_duration_us': np.float64(33.008)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.95)}]",0.013722719974201898,99.30501304363972 +aten::add,elementwise,nn.Module: LlamaDecoderLayer,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', '1')",1,64,4.460662841796875,4.460662841796875,4.56591796875,4.56591796875,0.4034041318322504,0.4034041318322504,3.72412109375,3.72412109375,5.4072265625,5.4072265625,285.482421875,285.482421875,332,"['aten::add', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(285.48199999999997), 'mean_duration_us': np.float64(4.4606562499999995), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.40021659053059944), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",0.01353218964728736,99.31854523328701 +aten::cat,other,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"(((1, 32, 351, 64), (1, 32, 351, 64)), ())","('TensorList', 'Scalar')","(((718848, 64, 2048, 1), (1437696, 128, 4096, 1)), ())","('', '-1')",1,32,8.52154541015625,8.52154541015625,8.5322265625,8.5322265625,0.17887395708911727,0.17887395708911727,8.2109375,8.2109375,8.89208984375,8.89208984375,272.689453125,272.689453125,221,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(272.69), 'mean_duration_us': np.float64(8.5215625), 'median_duration_us': np.float64(8.532), 'std_dev_duration_us': np.float64(0.17609371395296866), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(260.85699999999997), 'mean_duration_us': np.float64(26.085699999999996), 'median_duration_us': np.float64(26.0575), 'std_dev_duration_us': np.float64(0.6917326145267407), 'min_duration_us': np.float64(25.156), 'max_duration_us': np.float64(27.28)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.09)}]",0.012364867363767587,99.35657862310791 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((132710400, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,259.82373046875,259.82373046875,259.82373046875,259.82373046875,,,259.82373046875,259.82373046875,259.82373046875,259.82373046875,259.82373046875,259.82373046875,24050,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_23', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(69.983), 'mean_duration_us': np.float64(69.983), 'median_duration_us': np.float64(69.983), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(69.983), 'max_duration_us': np.float64(69.983)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(189.841), 'mean_duration_us': np.float64(189.841), 'median_duration_us': np.float64(189.841), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(189.841), 'max_duration_us': np.float64(189.841)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(69.98)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(189.84)}]",0.012315938657366063,99.36889456176527 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((5529600, 10800, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,7,36.985142299107146,36.985142299107146,35.4921875,35.4921875,2.997844621887172,2.997844621887172,34.08984375,34.08984375,41.18017578125,41.18017578125,258.89599609375,258.89599609375,23763,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(258.89599999999996), 'mean_duration_us': np.float64(36.985142857142854), 'median_duration_us': np.float64(35.492), 'std_dev_duration_us': np.float64(2.7754504616919613), 'min_duration_us': np.float64(34.09), 'max_duration_us': np.float64(41.18)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(36.99)}]",0.01227196299882165,99.3811665247641 +aten::copy_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500), ())","('c10::BFloat16', 'float', 'Scalar')","((4500, 1), (4500, 1), ())","('', '', 'False')",1,10,25.14443359375,25.14443359375,25.01611328125,25.01611328125,0.5304924444151331,0.5304924444151331,24.51513671875,24.51513671875,26.078125,26.078125,251.4443359375,251.4443359375,15693,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(251.44399999999996), 'mean_duration_us': np.float64(25.144399999999997), 'median_duration_us': np.float64(25.016), 'std_dev_duration_us': np.float64(0.5033279646512797), 'min_duration_us': np.float64(24.515), 'max_duration_us': np.float64(26.078)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(25.14)}]",0.01191874588037622,99.39308527064448 +aten::add_,elementwise,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 4500, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (1,), ())","('', '', '1')",1,30,8.324674479166667,8.324674479166667,8.2509765625,8.2509765625,0.6475289678986142,0.6475289678986142,7.2099609375,7.2099609375,9.97412109375,9.97412109375,249.740234375,249.740234375,15716,"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(249.73699999999997), 'mean_duration_us': np.float64(8.324566666666666), 'median_duration_us': np.float64(8.251), 'std_dev_duration_us': np.float64(0.6366639450203608), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.32)}]",0.011837969539155163,99.40492324018363 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (1, 128, 9, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (66355200, 518400, 57600, 240, 1), ())","('', '', '1')",1,3,81.03971354166667,81.03971354166667,80.63818359375,80.63818359375,1.0603492885285808,1.0603492885285808,80.23876953125,80.23876953125,82.2421875,82.2421875,243.119140625,243.119140625,24091,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(243.119), 'mean_duration_us': np.float64(81.03966666666666), 'median_duration_us': np.float64(80.638), 'std_dev_duration_us': np.float64(0.8656420866745228), 'min_duration_us': np.float64(80.239), 'max_duration_us': np.float64(82.242)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(81.04)}]",0.011524122207648707,99.41644736239128 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (1, 256, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((132710400, 518400, 57600, 240, 1), (256, 1, 1, 1, 1), ())","('', '', '1')",1,1,238.11279296875,238.11279296875,238.11279296875,238.11279296875,,,238.11279296875,238.11279296875,238.11279296875,238.11279296875,238.11279296875,238.11279296875,24049,"['aten::add_', 'nn.Module: Conv3d_27', 'nn.Module: HunyuanVideoCausalConv3d_26', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(238.113), 'mean_duration_us': np.float64(238.113), 'median_duration_us': np.float64(238.113), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(238.113), 'max_duration_us': np.float64(238.113)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(238.11)}]",0.011286815667092977,99.42773417805837 +aten::rsqrt,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 1),)","('float',)","((351, 1, 1),)","('',)",1,65,3.5995192307692307,3.5995192307692307,3.56494140625,3.56494140625,0.7070860071860678,0.7070860071860678,2.76318359375,2.76318359375,4.3662109375,4.3662109375,233.96875,233.96875,168,"['aten::rsqrt', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(233.966), 'mean_duration_us': np.float64(3.599476923076923), 'median_duration_us': np.float64(3.565), 'std_dev_duration_us': np.float64(0.7015092105912641), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(4.366)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]",0.011090383343900109,99.43882456140227 +aten::copy_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4500), (1, 1, 4500, 4500), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), (20250000, 20250000, 4500, 1), ())","('', '', 'False')",1,10,22.71689453125,22.71689453125,23.19384765625,23.19384765625,1.1823191769798056,1.1823191769798056,20.830078125,20.830078125,24.39501953125,24.39501953125,227.1689453125,227.1689453125,15754,"['aten::copy_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(227.16899999999998), 'mean_duration_us': np.float64(22.7169), 'median_duration_us': np.float64(23.194000000000003), 'std_dev_duration_us': np.float64(1.1216505204385192), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(24.395)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.72)}]",0.010768064911852991,99.44959262631413 +aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 128, 4096, 1), (44928, 44928, 128, 1))","('', '')",1,32,7.0394287109375,7.0394287109375,6.989013671875,6.989013671875,0.23301198720589594,0.23301198720589594,6.64892578125,6.64892578125,7.52978515625,7.52978515625,225.26171875,225.26171875,215,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(225.261), 'mean_duration_us': np.float64(7.03940625), 'median_duration_us': np.float64(6.989000000000001), 'std_dev_duration_us': np.float64(0.22938693557161774), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.04)}]",0.010677660215919054,99.46027028653005 +aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((33177600, 129600, 120, 1), (), (), ())","('', '[240, 240]', '2.', '2.')",1,10,21.366796875,31.23642578125,21.2109375,31.30517578125,0.4724851524536447,0.6900769421467635,20.830078125,30.203125,22.11181640625,32.44580078125,213.66796875,312.3642578125,16220,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(213.668), 'mean_duration_us': np.float64(21.3668), 'median_duration_us': np.float64(21.211), 'std_dev_duration_us': np.float64(0.448329075568382), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.112)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(21.37)}]",0.010128103354614533,99.47039838988466 +triton_poi_fused_silu_0,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), (1, 3072), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (3072, 1), (3072, 1), (3072, 1), ())","('', '', '', '', '', '3072')",1,40,5.32086181640625,5.32086181640625,5.48681640625,5.48681640625,0.6771427092767259,0.6771427092767259,3.36376953125,3.36376953125,6.087890625,6.087890625,212.83447265625,212.83447265625,8844,"['triton_poi_fused_silu_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(212.83599999999998), 'mean_duration_us': np.float64(5.3209), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.6685760914062063), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]",0.010088594697174894,99.48048698458184 +aten::miopen_convolution,CONV_fwd,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (3072, 16, 1, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((475200, 29700, 900, 30, 1), (64, 4, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 2, 2]', '[1, 1, 1]', '1', 'False', 'False')",2,4,52.9669189453125,52.9669189453125,52.67626953125,52.67626953125,3.5973766299697525,3.5973766299697525,48.87109375,48.87109375,57.64404296875,57.64404296875,211.86767578125,211.86767578125,8804,"['aten::miopen_convolution', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Im3d2Col', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.557000000000002), 'mean_duration_us': np.float64(6.8892500000000005), 'median_duration_us': np.float64(6.1080000000000005), 'std_dev_duration_us': np.float64(2.277268470668314), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(10.695)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(184.31099999999998), 'mean_duration_us': np.float64(46.077749999999995), 'median_duration_us': np.float64(46.5685), 'std_dev_duration_us': np.float64(1.0810030931963137), 'min_duration_us': np.float64(44.225), 'max_duration_us': np.float64(46.949)}]","[{'name': 'Im3d2Col', 'stream': 0, 'mean_duration_us': np.float64(6.89)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(46.08)}]",0.010042767431954923,99.4905297520138 +aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((172800, 57600, 240, 1), (172800, 57600, 240, 1), ())","('', '', '1')",1,40,5.12955322265625,5.12955322265625,5.0869140625,5.0869140625,0.1278144411402751,0.1278144411402751,4.966796875,4.966796875,5.44677734375,5.44677734375,205.18212890625,205.18212890625,24181,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(205.18399999999997), 'mean_duration_us': np.float64(5.129599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.12611756420102632), 'min_duration_us': np.float64(4.967), 'max_duration_us': np.float64(5.447)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.13)}]",0.009725864949433803,99.50025561696323 +aten::add,elementwise,nn.Module: LlamaRMSNorm,python3,CPU,thread 416 (python3),"((1, 351, 1), (), ())","('float', 'double', 'Scalar')","((351, 1, 1), (), ())","('', '', '1')",1,65,3.15517578125,3.15517578125,2.3232421875,2.3232421875,1.1386083261282682,1.1386083261282682,1.9609375,1.9609375,4.44482421875,4.44482421875,205.08642578125,205.08642578125,167,"['aten::add', 'nn.Module: LlamaRMSNorm_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(205.08299999999997), 'mean_duration_us': np.float64(3.1551230769230765), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(1.1297545207520807), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.16)}]",0.009721328513078695,99.50997694547631 +aten::cat,other,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"(((1, 8, 351, 64), (1, 8, 351, 64)), ())","('TensorList', 'Scalar')","(((179712, 64, 512, 1), (359424, 128, 1024, 1)), ())","('', '-1')",1,32,6.35845947265625,6.35845947265625,6.388671875,6.388671875,0.1797532206189524,0.1797532206189524,6.087890625,6.087890625,6.72900390625,6.72900390625,203.470703125,203.470703125,230,"['aten::cat', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(203.47), 'mean_duration_us': np.float64(6.3584375), 'median_duration_us': np.float64(6.3885000000000005), 'std_dev_duration_us': np.float64(0.17691522289998107), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(63.48799999999999), 'mean_duration_us': np.float64(12.697599999999998), 'median_duration_us': np.float64(12.658), 'std_dev_duration_us': np.float64(0.31837122985596544), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.218)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(139.40200000000002), 'mean_duration_us': np.float64(27.8804), 'median_duration_us': np.float64(28.161), 'std_dev_duration_us': np.float64(1.3720892973855596), 'min_duration_us': np.float64(26.358), 'max_duration_us': np.float64(30.084)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(12.7)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(27.88)}]",0.00961719878266221,99.52923888569093 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240),)","('c10::BFloat16',)","((132710400, 518400, 57600, 240, 1),)","('',)",1,1,202.4599609375,202.4599609375,202.4599609375,202.4599609375,,,202.4599609375,202.4599609375,202.4599609375,202.4599609375,202.4599609375,202.4599609375,24054,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_11', 'nn.Module: HunyuanVideoUpBlock3D_3', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.46), 'mean_duration_us': np.float64(202.46), 'median_duration_us': np.float64(202.46), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.46), 'max_duration_us': np.float64(202.46)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.46)}]",0.009596831109231112,99.53883571680016 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,20,10.023876953125,10.023876953125,10.074462890625,10.074462890625,0.41449718217519793,0.41449718217519793,9.453125,9.453125,10.77490234375,10.77490234375,200.4775390625,200.4775390625,8757,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(200.47699999999998), 'mean_duration_us': np.float64(10.02385), 'median_duration_us': np.float64(10.0745), 'std_dev_duration_us': np.float64(0.4040388935486285), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.775)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(10.02)}]",0.00950286207044673,99.54833857887061 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 6144), (1, 6144))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (6144, 1))","('', '', '')",1,12,16.677042643229168,16.677042643229168,16.703125,16.703125,0.43521086334175285,0.43521086334175285,15.90283203125,15.90283203125,17.544921875,17.544921875,200.12451171875,200.12451171875,8765,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(200.12500000000003), 'mean_duration_us': np.float64(16.677083333333336), 'median_duration_us': np.float64(16.703), 'std_dev_duration_us': np.float64(0.4166806247662062), 'min_duration_us': np.float64(15.903), 'max_duration_us': np.float64(17.545)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(16.68)}]",0.00948612817511641,99.55782470704573 +triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",1,4,49.2423095703125,49.2423095703125,49.192626953125,49.192626953125,1.0254499436432176,1.0254499436432176,48.06982421875,48.06982421875,50.51416015625,50.51416015625,196.96923828125,196.96923828125,9540,"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(196.969), 'mean_duration_us': np.float64(49.24225), 'median_duration_us': np.float64(49.192499999999995), 'std_dev_duration_us': np.float64(0.8879511177424136), 'min_duration_us': np.float64(48.07), 'max_duration_us': np.float64(50.514)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'mean_duration_us': np.float64(49.24)}]",0.00933656464589851,99.56716127169162 +aten::add,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 8, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((359424, 128, 1024, 1), (359424, 44928, 128, 1), ())","('', '', '1')",1,32,6.0743408203125,6.0743408203125,6.06787109375,6.06787109375,0.17698023169520577,0.17698023169520577,5.68701171875,5.68701171875,6.3681640625,6.3681640625,194.37890625,194.37890625,232,"['aten::add', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(194.37900000000002), 'mean_duration_us': np.float64(6.074343750000001), 'median_duration_us': np.float64(6.068), 'std_dev_duration_us': np.float64(0.17418714960047285), 'min_duration_us': np.float64(5.687), 'max_duration_us': np.float64(6.368)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}]",0.009213779978225813,99.57637505166984 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2937600, 979200, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",1,36,5.162204318576389,5.162204318576389,5.1259765625,5.1259765625,0.23417343393297987,0.23417343393297987,4.88623046875,4.88623046875,6.328125,6.328125,185.83935546875,185.83935546875,24184,['aten::copy_'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 36, 'total_duration_us': np.float64(185.84), 'mean_duration_us': np.float64(5.162222222222223), 'median_duration_us': np.float64(5.126), 'std_dev_duration_us': np.float64(0.23083376788299786), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.16)}]",0.008808995613866197,99.5851840472837 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((36864000, 72000, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",1,1,182.791015625,182.791015625,182.791015625,182.791015625,,,182.791015625,182.791015625,182.791015625,182.791015625,182.791015625,182.791015625,23938,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(182.791), 'mean_duration_us': np.float64(182.791), 'median_duration_us': np.float64(182.791), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(182.791), 'max_duration_us': np.float64(182.791)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.79)}]",0.008664500857922627,99.59384854814162 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 4500), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4500, 4500, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,17.736328125,17.736328125,17.544189453125,17.544189453125,1.2795679686855788,1.2795679686855788,15.861328125,15.861328125,20.02783203125,20.02783203125,177.36328125,177.36328125,15701,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_2', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(61.56), 'mean_duration_us': np.float64(6.156000000000001), 'median_duration_us': np.float64(6.088), 'std_dev_duration_us': np.float64(0.5113282702921871), 'min_duration_us': np.float64(5.286), 'max_duration_us': np.float64(7.129)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(115.80299999999998), 'mean_duration_us': np.float64(11.580299999999998), 'median_duration_us': np.float64(11.536000000000001), 'std_dev_duration_us': np.float64(1.026855398778231), 'min_duration_us': np.float64(9.694), 'max_duration_us': np.float64(13.379)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.58)}]",0.008407220110354356,99.60225576825198 +aten::neg,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 64),)","('c10::BFloat16',)","((1437696, 128, 4096, 1),)","('',)",1,32,5.4546661376953125,5.4546661376953125,5.44677734375,5.44677734375,0.17955712635322646,0.17955712635322646,5.126953125,5.126953125,5.9677734375,5.9677734375,174.54931640625,174.54931640625,220,"['aten::neg', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(174.54999999999998), 'mean_duration_us': np.float64(5.4546874999999995), 'median_duration_us': np.float64(5.447), 'std_dev_duration_us': np.float64(0.17679409589618653), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]",0.00827383499446411,99.61052960324645 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",1,8,21.510986328125,21.510986328125,21.531005859375,21.531005859375,0.41850110365772064,0.41850110365772064,20.830078125,20.830078125,22.15185546875,22.15185546875,172.087890625,172.087890625,8766,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(172.088), 'mean_duration_us': np.float64(21.511), 'median_duration_us': np.float64(21.531), 'std_dev_duration_us': np.float64(0.391523307096781), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.152)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.51)}]",0.008157160628820746,99.61868676387527 +aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((3686400, 7200, 3600, 60, 1), (), (), (), ())","('', '[4, 120, 120]', '2.', '2.', '2.')",1,1,170.73291015625,170.73291015625,170.73291015625,170.73291015625,,,170.73291015625,170.73291015625,170.73291015625,170.73291015625,170.73291015625,170.73291015625,23888,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(170.733), 'mean_duration_us': np.float64(170.733), 'median_duration_us': np.float64(170.733), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(170.733), 'max_duration_us': np.float64(170.733)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(170.73)}]",0.008092933022262456,99.62677969689754 +aten::_flash_attention_forward,other,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1, 77, 12, 64), (1, 77, 12, 64), (1, 77, 12, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((59136, 768, 64, 1), (59136, 768, 64, 1), (59136, 768, 64, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '77', '77', '0.', 'True', 'False', '0.125', '', '', '', '')",1,12,13.806193033854166,17.1666259765625,13.679443359375,15.94140625,0.45685059663038796,2.6112065924067016,13.3779296875,15.30078125,14.98095703125,22.912109375,165.67431640625,205.99951171875,7351,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(165.674), 'mean_duration_us': np.float64(13.806166666666668), 'median_duration_us': np.float64(13.6795), 'std_dev_duration_us': np.float64(0.4373817618003243), 'min_duration_us': np.float64(13.378), 'max_duration_us': np.float64(14.981)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.81)}]",0.007853149957778171,99.63463284685533 +aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 128, 1024, 1), (44928, 44928, 128, 1))","('', '')",1,32,5.1719207763671875,5.1719207763671875,5.14697265625,5.14697265625,0.4977407381986989,0.4977407381986989,4.2451171875,4.2451171875,6.369140625,6.369140625,165.50146484375,165.50146484375,224,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(165.5), 'mean_duration_us': np.float64(5.171875), 'median_duration_us': np.float64(5.147), 'std_dev_duration_us': np.float64(0.4898999100581669), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(6.369)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.17)}]",0.007844956598238844,99.64247780345356 +aten::add,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 4500, 512), (1, 4500, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (4500, 1, 4500), ())","('', '', '1')",1,10,15.9546875,15.9546875,15.98291015625,15.98291015625,0.24112172126375578,0.24112172126375578,15.6220703125,15.6220703125,16.3427734375,16.3427734375,159.546875,159.546875,15797,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(159.547), 'mean_duration_us': np.float64(15.954699999999999), 'median_duration_us': np.float64(15.983), 'std_dev_duration_us': np.float64(0.22880430502942894), 'min_duration_us': np.float64(15.622), 'max_duration_us': np.float64(16.343)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(15.95)}]",0.007562702305634034,99.6500405057592 +aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (117964800, 460800, 57600, 240, 1)), ())","('', '2')",2,1,158.67431640625,158.67431640625,158.67431640625,158.67431640625,,,158.67431640625,158.67431640625,158.67431640625,158.67431640625,158.67431640625,158.67431640625,24033,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.558), 'mean_duration_us': np.float64(26.558), 'median_duration_us': np.float64(26.558), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.558), 'max_duration_us': np.float64(26.558)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(132.116), 'mean_duration_us': np.float64(132.116), 'median_duration_us': np.float64(132.116), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(132.116), 'max_duration_us': np.float64(132.116)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.56)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(132.12)}]",0.007521342041518839,99.65756184780071 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,10,15.753125,15.753125,13.718017578125,13.718017578125,3.8272314794361426,3.8272314794361426,13.2177734375,13.2177734375,24.794921875,24.794921875,157.53125,157.53125,23418,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(55.06999999999999), 'mean_duration_us': np.float64(5.507), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(1.9236527753209518), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(11.135)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(102.462), 'mean_duration_us': np.float64(10.2462), 'median_duration_us': np.float64(9.053), 'std_dev_duration_us': np.float64(2.999576996844722), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(19.027)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.51)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.25)}]",0.0074671594011754315,99.66502900720188 +aten::where,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (), ())","('bool', 'c10::BFloat16', 'c10::BFloat16')","((123201, 123201, 351, 1), (), ())","('', '', '')",1,32,4.8874053955078125,4.8874053955078125,4.88623046875,4.88623046875,0.15500533287165916,0.15500533287165916,4.60595703125,4.60595703125,5.2470703125,5.2470703125,156.39697265625,156.39697265625,280,"['aten::where', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(156.39600000000002), 'mean_duration_us': np.float64(4.8873750000000005), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.15261302164297783), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",0.007413393372334023,99.67244240057421 +triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1), (1, 7425, 1), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((0, 1, 7488), (7456, 1, 7456), (7456, 1, 7456), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",1,4,38.575927734375,38.575927734375,38.555908203125,38.555908203125,2.7097272122605083,2.7097272122605083,36.1318359375,36.1318359375,41.06005859375,41.06005859375,154.3037109375,154.3037109375,8850,"['triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(154.304), 'mean_duration_us': np.float64(38.576), 'median_duration_us': np.float64(38.556), 'std_dev_duration_us': np.float64(2.346681167095354), 'min_duration_us': np.float64(36.132), 'max_duration_us': np.float64(41.06)}]","[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(38.58)}]",0.007314170399607757,99.67975657097382 +aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",1,32,4.7911376953125,4.7911376953125,4.74609375,4.74609375,0.4589674339754898,0.4589674339754898,4.044921875,4.044921875,5.72705078125,5.72705078125,153.31640625,153.31640625,222,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(153.316), 'mean_duration_us': np.float64(4.791125), 'median_duration_us': np.float64(4.746), 'std_dev_duration_us': np.float64(0.45170425543158216), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(5.727)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.79)}]",0.007267371040883121,99.6870239420147 +aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 4, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (7372800, 14400, 3600, 60, 1)), ())","('', '2')",2,10,15.17275390625,15.17275390625,15.06103515625,15.06103515625,0.32528595041515274,0.32528595041515274,14.7802734375,14.7802734375,15.7021484375,15.7021484375,151.7275390625,151.7275390625,15957,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.82599999999999), 'mean_duration_us': np.float64(5.082599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.08492961791978107), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.207)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.902), 'mean_duration_us': np.float64(10.0902), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.2913725450347027), 'min_duration_us': np.float64(9.734), 'max_duration_us': np.float64(10.655)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.08)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.09)}]",0.0071920569393549485,99.69421599895406 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120),)","('c10::BFloat16',)","((18432000, 72000, 14400, 120, 1),)","('',)",1,5,30.171875,30.171875,31.2861328125,31.2861328125,2.1300137500140033,2.1300137500140033,27.72021484375,27.72021484375,32.0458984375,32.0458984375,150.859375,150.859375,23925,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(150.859), 'mean_duration_us': np.float64(30.1718), 'median_duration_us': np.float64(31.286), 'std_dev_duration_us': np.float64(1.9051704805607295), 'min_duration_us': np.float64(27.72), 'max_duration_us': np.float64(32.046)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(30.17)}]",0.0071509049809907535,99.70136690393505 +aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((9216000, 18000, 60, 1), (), (), ())","('', '[120, 120]', '2.', '2.')",1,10,14.97734375,20.66845703125,15.02099609375,20.60791015625,0.44885564752338747,0.45238589520729844,14.30078125,20.02783203125,15.5419921875,21.30908203125,149.7734375,206.6845703125,16076,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(149.774), 'mean_duration_us': np.float64(14.9774), 'median_duration_us': np.float64(15.021), 'std_dev_duration_us': np.float64(0.4257833251784293), 'min_duration_us': np.float64(14.301), 'max_duration_us': np.float64(15.542)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(14.98)}]",0.007099430315410344,99.70846633425046 +aten::mul,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",1,32,4.3968048095703125,4.3968048095703125,4.3662109375,4.3662109375,0.14804499906876914,0.14804499906876914,4.125,4.125,4.76708984375,4.76708984375,140.69775390625,140.69775390625,231,"['aten::mul', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(140.697), 'mean_duration_us': np.float64(4.39678125), 'median_duration_us': np.float64(4.366), 'std_dev_duration_us': np.float64(0.14578424434223852), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.767)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.4)}]",0.006669232649428745,99.71513556689989 +aten::copy_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 351, 351), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), (123201, 123201, 351, 1), ())","('', '', 'False')",1,32,4.276641845703125,4.276641845703125,4.28515625,4.28515625,0.18087827426542186,0.18087827426542186,3.96484375,3.96484375,4.60595703125,4.60595703125,136.8525390625,136.8525390625,290,"['aten::copy_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(136.852), 'mean_duration_us': np.float64(4.276625), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.1780245330705855), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.28)}]",0.006486965117303867,99.7216225320172 +aten::neg,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 8, 351, 64),)","('c10::BFloat16',)","((359424, 128, 1024, 1),)","('',)",1,32,4.1689300537109375,4.1689300537109375,4.125,4.125,0.15816634330533075,0.15816634330533075,3.884765625,3.884765625,4.52587890625,4.52587890625,133.40576171875,133.40576171875,229,"['aten::neg', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(133.406), 'mean_duration_us': np.float64(4.1689375), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.1556189130335706), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.17)}]",0.0063235839732696435,99.72794611599046 +triton_red_fused_native_layer_norm_1,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (), ())","('c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar')","((0, 1, 7488), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (), ())","('', '', '', '', '178200', '128')",1,4,32.1368408203125,32.1368408203125,32.26708984375,32.26708984375,0.33101828646015685,0.33101828646015685,31.64599609375,31.64599609375,32.3671875,32.3671875,128.54736328125,128.54736328125,8846,"['triton_red_fused_native_layer_norm_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(128.547), 'mean_duration_us': np.float64(32.13675), 'median_duration_us': np.float64(32.266999999999996), 'std_dev_duration_us': np.float64(0.2866098175220092), 'min_duration_us': np.float64(31.646), 'max_duration_us': np.float64(32.367)}]","[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'mean_duration_us': np.float64(32.14)}]",0.006093290392997576,99.73403940638346 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((512,), (4500, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",1,10,12.805810546875,12.805810546875,12.718017578125,12.718017578125,0.36069397961349864,0.36069397961349864,12.45703125,12.45703125,13.73876953125,13.73876953125,128.05810546875,128.05810546875,15794,"['aten::addmm', 'nn.Module: Linear_299', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.058), 'mean_duration_us': np.float64(12.8058), 'median_duration_us': np.float64(12.718), 'std_dev_duration_us': np.float64(0.3422799439055698), 'min_duration_us': np.float64(12.457), 'max_duration_us': np.float64(13.739)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(12.81)}]",0.006070099019386258,99.74010950540284 +aten::add,elementwise,nn.Module: CLIPEncoderLayer,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,24,5.290303548177083,5.290303548177083,5.2470703125,5.2470703125,0.30481366012550204,0.30481366012550204,4.72607421875,4.72607421875,5.9677734375,5.9677734375,126.96728515625,126.96728515625,7386,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(126.96699999999998), 'mean_duration_us': np.float64(5.290291666666666), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.2984396196841536), 'min_duration_us': np.float64(4.726), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",0.006018392902971403,99.74612789830582 +triton_poi_fused_convolution_13,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072, 33, 15, 15), (3072,), (1, 3072, 33, 15, 15), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22809600, 7425, 225, 15, 1), (1,), (23003136, 7488, 225, 15, 1), ())","('', '', '', '22809600')",1,4,31.324951171875,31.324951171875,31.46484375,31.46484375,0.41248052917149597,0.41248052917149597,30.72412109375,30.72412109375,31.64599609375,31.64599609375,125.2998046875,125.2998046875,8805,"['triton_poi_fused_convolution_13', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(125.3), 'mean_duration_us': np.float64(31.325), 'median_duration_us': np.float64(31.465), 'std_dev_duration_us': np.float64(0.3572960956965524), 'min_duration_us': np.float64(30.724), 'max_duration_us': np.float64(31.646)}]","[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'mean_duration_us': np.float64(31.32)}]",0.005939352443008679,99.75206725074882 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 3, 17, 240, 240), (1, 3, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2937600, 979200, 57600, 240, 1), (3, 1, 1, 1, 1), ())","('', '', '1')",1,10,12.08896484375,12.08896484375,12.578125,12.578125,1.4372981348982836,1.4372981348982836,9.77392578125,9.77392578125,13.81884765625,13.81884765625,120.8896484375,120.8896484375,16372,"['aten::add_', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(120.88999999999999), 'mean_duration_us': np.float64(12.088999999999999), 'median_duration_us': np.float64(12.578), 'std_dev_duration_us': np.float64(1.3635438386791976), 'min_duration_us': np.float64(9.774), 'max_duration_us': np.float64(13.819)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.09)}]",0.0057303060493385976,99.75779755679817 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,19.91455078125,19.91455078125,19.507568359375,19.507568359375,1.2612885205196425,1.2612885205196425,18.625,18.625,21.67041015625,21.67041015625,119.4873046875,119.4873046875,23772,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_11', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(36.448), 'mean_duration_us': np.float64(6.074666666666666), 'median_duration_us': np.float64(6.0485), 'std_dev_duration_us': np.float64(0.2942950144932046), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.449)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.038), 'mean_duration_us': np.float64(13.839666666666666), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8712071446498181), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(15.262)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.84)}]",0.0056638333696861975,99.76346139016785 +aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', '1')",1,4,29.813232421875,29.813232421875,29.9833984375,29.9833984375,0.7855962782338508,0.7855962782338508,28.72216796875,28.72216796875,30.56396484375,30.56396484375,119.2529296875,119.2529296875,10434,['aten::add'],"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(119.25300000000001), 'mean_duration_us': np.float64(29.813250000000004), 'median_duration_us': np.float64(29.9835), 'std_dev_duration_us': np.float64(0.6804231679624079), 'min_duration_us': np.float64(28.722), 'max_duration_us': np.float64(30.564)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(29.81)}]",0.005652723729632872,99.76911411389749 +aten::native_layer_norm,NORM_fwd,nn.Module: LayerNorm,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (), (1,), (1,), ())","('', '[768]', '', '', '1.0000000000000001e-05')",1,25,4.7198046875,4.7198046875,4.68603515625,4.68603515625,0.2444226349748887,0.2444226349748887,3.84521484375,3.84521484375,5.287109375,5.287109375,117.9951171875,117.9951171875,7304,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 25, 'total_duration_us': np.float64(117.994), 'mean_duration_us': np.float64(4.71976), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.23948549517663897), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.72)}]",0.005593101994680022,99.77470721589216 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",1,4,28.7816162109375,28.7816162109375,28.921875,28.921875,0.3376165906830312,0.3376165906830312,28.28076171875,28.28076171875,29.001953125,29.001953125,115.12646484375,115.12646484375,8723,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.127), 'mean_duration_us': np.float64(28.78175), 'median_duration_us': np.float64(28.922), 'std_dev_duration_us': np.float64(0.29231864035671795), 'min_duration_us': np.float64(28.281), 'max_duration_us': np.float64(29.002)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(28.78)}]",0.005457124629444003,99.78016434052161 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((1382400, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,10,11.400146484375,11.400146484375,10.85546875,10.85546875,1.0742672872655885,1.0742672872655885,10.57421875,10.57421875,13.21923828125,13.21923828125,114.00146484375,114.00146484375,23424,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_1', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(114.00099999999999), 'mean_duration_us': np.float64(11.400099999999998), 'median_duration_us': np.float64(10.8555), 'std_dev_duration_us': np.float64(1.0190769794279526), 'min_duration_us': np.float64(10.574), 'max_duration_us': np.float64(13.219)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(11.4)}]",0.005403798357188038,99.7855681388788 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (1, 512, 4, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7372800, 14400, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', 'False')",1,10,11.23544921875,11.23544921875,11.19580078125,11.19580078125,0.2268741028729728,0.2268741028729728,10.89501953125,10.89501953125,11.5361328125,11.5361328125,112.3544921875,112.3544921875,16088,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(112.355), 'mean_duration_us': np.float64(11.2355), 'median_duration_us': np.float64(11.196), 'std_dev_duration_us': np.float64(0.2151749288369813), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(11.536)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.24)}]",0.005325729990729979,99.79089386886953 +triton_poi_fused_cat_slice_20,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (22828032, 3072, 1), ())","('', '', '22828032')",1,4,28.020751953125,28.020751953125,27.840576171875,27.840576171875,0.8238069732058474,0.8238069732058474,27.27880859375,27.27880859375,29.123046875,29.123046875,112.0830078125,112.0830078125,9519,"['triton_poi_fused_cat_slice_20', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(112.083), 'mean_duration_us': np.float64(28.02075), 'median_duration_us': np.float64(27.8405), 'std_dev_duration_us': np.float64(0.7133667973069681), 'min_duration_us': np.float64(27.279), 'max_duration_us': np.float64(29.123)}]","[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'mean_duration_us': np.float64(28.02)}]",0.005312861324334877,99.79620673019387 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",1,12,9.0390625,9.0390625,8.93212890625,8.93212890625,0.3101109126738394,0.3101109126738394,8.69189453125,8.69189453125,9.85400390625,9.85400390625,108.46875,108.46875,7411,"['aten::addmm', 'nn.Module: Linear_229', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(108.469), 'mean_duration_us': np.float64(9.039083333333332), 'median_duration_us': np.float64(8.931999999999999), 'std_dev_duration_us': np.float64(0.2969294131420611), 'min_duration_us': np.float64(8.692), 'max_duration_us': np.float64(9.854)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.04)}]",0.005141541416679215,99.80134827161055 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,7,14.357700892857142,14.357700892857142,14.3408203125,14.3408203125,0.3954942345461055,0.3954942345461055,13.7001953125,13.7001953125,14.82080078125,14.82080078125,100.50390625,100.50390625,23771,"['aten::add_', 'nn.Module: Conv3d_12', 'nn.Module: HunyuanVideoCausalConv3d_11', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(100.50399999999999), 'mean_duration_us': np.float64(14.357714285714284), 'median_duration_us': np.float64(14.341), 'std_dev_duration_us': np.float64(0.3663034317087854), 'min_duration_us': np.float64(13.7), 'max_duration_us': np.float64(14.821)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.36)}]",0.00476399881553369,99.80611227042608 +aten::fill_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4504), ())","('c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), ())","('', '0.')",1,10,10.009765625,10.009765625,10.013427734375,10.013427734375,0.43111397138173235,0.43111397138173235,9.453125,9.453125,10.5751953125,10.5751953125,100.09765625,100.09765625,15750,"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.09799999999998), 'mean_duration_us': np.float64(10.009799999999998), 'median_duration_us': np.float64(10.0135), 'std_dev_duration_us': np.float64(0.40890972108767476), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.575)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]",0.004744742106107925,99.8108570125322 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (1, 256, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 14400, 120, 1), (33177600, 129600, 120, 1), ())","('', '', 'False')",1,10,9.86962890625,9.86962890625,9.994140625,9.994140625,0.5113869611427618,0.5113869611427618,8.89208984375,8.89208984375,10.5751953125,10.5751953125,98.6962890625,98.6962890625,16225,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(98.69599999999998), 'mean_duration_us': np.float64(9.869599999999998), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.48515300679270235), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(10.575)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}]",0.004678315716622414,99.81553532824881 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",1,12,8.214558919270834,8.214558919270834,8.091064453125,8.091064453125,0.4854992416870445,0.4854992416870445,7.85009765625,7.85009765625,9.69287109375,9.69287109375,98.57470703125,98.57470703125,7400,"['aten::addmm', 'nn.Module: Linear_228', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(98.574), 'mean_duration_us': np.float64(8.2145), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.4649102960070183), 'min_duration_us': np.float64(7.85), 'max_duration_us': np.float64(9.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",0.0046725525908447516,99.82020788083966 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (1, 256, 5, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', '1')",1,3,29.7900390625,29.7900390625,29.162109375,29.162109375,1.1931431850768015,1.1931431850768015,29.0419921875,29.0419921875,31.166015625,31.166015625,89.3701171875,89.3701171875,23947,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.37), 'mean_duration_us': np.float64(29.790000000000003), 'median_duration_us': np.float64(29.162), 'std_dev_duration_us': np.float64(0.9742114760153464), 'min_duration_us': np.float64(29.042), 'max_duration_us': np.float64(31.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(29.79)}]",0.004236244622833822,99.82444412546249 +aten::fill_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((1, 1, 351, 352), ())","('c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), ())","('', '0.')",1,32,2.7806549072265625,2.7806549072265625,2.76318359375,2.76318359375,0.14340866108737566,0.14340866108737566,2.60302734375,2.60302734375,3.36376953125,3.36376953125,88.98095703125,88.98095703125,286,"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(88.97999999999999), 'mean_duration_us': np.float64(2.7806249999999997), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.14124264361374722), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.78)}]",0.004217797991328613,99.82866192345382 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 64), (7425, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (64, 1))","('', '', '')",1,4,21.6011962890625,21.6011962890625,21.69140625,21.69140625,0.36163358406667456,0.36163358406667456,21.11083984375,21.11083984375,21.9111328125,21.9111328125,86.40478515625,86.40478515625,10412,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(86.405), 'mean_duration_us': np.float64(21.60125), 'median_duration_us': np.float64(21.691499999999998), 'std_dev_duration_us': np.float64(0.3130737732548036), 'min_duration_us': np.float64(21.111), 'max_duration_us': np.float64(21.911)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.6)}]",0.004095684531075805,99.8327576079849 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((36864000, 72000, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,1,81.72021484375,122.7001953125,81.72021484375,122.7001953125,,,81.72021484375,122.7001953125,81.72021484375,122.7001953125,81.72021484375,122.7001953125,23942,"['aten::miopen_convolution', 'nn.Module: Conv3d_22', 'nn.Module: HunyuanVideoCausalConv3d_21', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC1_NTD1_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT2_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGMn2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(81.72), 'mean_duration_us': np.float64(81.72), 'median_duration_us': np.float64(81.72), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(81.72), 'max_duration_us': np.float64(81.72)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(81.72)}]",0.0038736306005099546,99.83663123858541 +aten::sigmoid,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",1,12,6.72265625,6.72265625,6.708984375,6.708984375,0.38600629713516427,0.38600629713516427,6.3291015625,6.3291015625,7.73095703125,7.73095703125,80.671875,80.671875,7403,"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(80.67099999999999), 'mean_duration_us': np.float64(6.722583333333333), 'median_duration_us': np.float64(6.709), 'std_dev_duration_us': np.float64(0.3695933482295854), 'min_duration_us': np.float64(6.329), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.72)}]",0.003823938106354766,99.84045517669176 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60),)","('c10::BFloat16',)","((5529600, 10800, 3600, 60, 1),)","('',)",1,6,13.412353515625,13.412353515625,13.99951171875,13.99951171875,2.9502668769184965,2.9502668769184965,9.93408203125,9.93408203125,16.6640625,16.6640625,80.47412109375,80.47412109375,23776,"['aten::silu', 'nn.Module: SiLU_5', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.474), 'mean_duration_us': np.float64(13.412333333333335), 'median_duration_us': np.float64(13.999500000000001), 'std_dev_duration_us': np.float64(2.693267820985421), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(16.664)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(13.41)}]",0.0038145643475597725,99.84426974103933 +triton_poi_fused_addmm_silu_view_10,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 12288, 1), (1,), ())","('', '', '3145728')",1,8,9.95880126953125,9.95880126953125,9.8740234375,9.8740234375,0.5239840543537515,0.5239840543537515,9.3330078125,9.3330078125,10.73486328125,10.73486328125,79.67041015625,79.67041015625,8769,"['triton_poi_fused_addmm_silu_view_10', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(79.67099999999999), 'mean_duration_us': np.float64(9.958874999999999), 'median_duration_us': np.float64(9.873999999999999), 'std_dev_duration_us': np.float64(0.4902161353678597), 'min_duration_us': np.float64(9.333), 'max_duration_us': np.float64(10.735)}]","[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'mean_duration_us': np.float64(9.96)}]",0.0037764675402102424,99.84804620857953 +aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",1,12,6.528645833333333,6.528645833333333,6.408447265625,6.408447265625,0.4531159275466089,0.4531159275466089,6.087890625,6.087890625,7.68994140625,7.68994140625,78.34375,78.34375,7402,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(78.34400000000001), 'mean_duration_us': np.float64(6.528666666666667), 'median_duration_us': np.float64(6.4085), 'std_dev_duration_us': np.float64(0.4338206874837678), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.69)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.003713582348491729,99.85175979092803 +triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",1,4,19.2677001953125,19.2677001953125,19.107421875,19.107421875,0.7119972658310234,0.7119972658310234,18.5869140625,18.5869140625,20.26904296875,20.26904296875,77.07080078125,77.07080078125,8801,"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(77.071), 'mean_duration_us': np.float64(19.26775), 'median_duration_us': np.float64(19.1075), 'std_dev_duration_us': np.float64(0.6165555023677911), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(20.269)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.27)}]",0.0036532431159521025,99.85541303404398 +triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (3072,), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (1,), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '256', '3072')",1,4,19.2274169921875,19.2274169921875,19.067626953125,19.067626953125,0.5314483833154173,0.5314483833154173,18.826171875,18.826171875,19.9482421875,19.9482421875,76.90966796875,76.90966796875,8767,"['triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(76.90899999999999), 'mean_duration_us': np.float64(19.227249999999998), 'median_duration_us': np.float64(19.067500000000003), 'std_dev_duration_us': np.float64(0.4602180868892483), 'min_duration_us': np.float64(18.826), 'max_duration_us': np.float64(19.948)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.23)}]",0.003645605238415441,99.8590586392824 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((36864000, 72000, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,73.828125,73.828125,73.828125,73.828125,,,73.828125,73.828125,73.828125,73.828125,73.828125,73.828125,23906,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_17', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.71), 'mean_duration_us': np.float64(20.71), 'median_duration_us': np.float64(20.71), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.71), 'max_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(53.118), 'mean_duration_us': np.float64(53.118), 'median_duration_us': np.float64(53.118), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(53.118), 'max_duration_us': np.float64(53.118)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(53.12)}]",0.00349953661679765,99.8625581758992 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,11,6.5431906960227275,6.5431906960227275,6.0478515625,6.0478515625,1.285851387183815,1.285851387183815,5.2060546875,5.2060546875,8.291015625,8.291015625,71.97509765625,71.97509765625,23417,"['aten::add_', 'nn.Module: Conv3d_1', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(71.97500000000001), 'mean_duration_us': np.float64(6.543181818181819), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(1.2260501856984647), 'min_duration_us': np.float64(5.206), 'max_duration_us': np.float64(8.291)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.54)}]",0.0034117010251260424,99.86596987692432 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (1, 512, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((36864000, 72000, 14400, 120, 1), (512, 1, 1, 1, 1), ())","('', '', '1')",1,1,70.34423828125,70.34423828125,70.34423828125,70.34423828125,,,70.34423828125,70.34423828125,70.34423828125,70.34423828125,70.34423828125,70.34423828125,23905,"['aten::add_', 'nn.Module: Conv3d_19', 'nn.Module: HunyuanVideoCausalConv3d_18', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(70.344), 'mean_duration_us': np.float64(70.344), 'median_duration_us': np.float64(70.344), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(70.344), 'max_duration_us': np.float64(70.344)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(70.34)}]",0.00333439644642165,99.86930427337074 +aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((2304000, 4500, 30, 1), (), (), ())","('', '[60, 60]', '2.', '2.')",1,10,7.021337890625,11.4830078125,6.948974609375,11.33447265625,0.2128980971647561,0.4077479987454964,6.80908203125,11.13525390625,7.4501953125,12.537109375,70.21337890625,114.830078125,15942,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(70.213), 'mean_duration_us': np.float64(7.021299999999999), 'median_duration_us': np.float64(6.949), 'std_dev_duration_us': np.float64(0.20199259887431512), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.45)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(7.02)}]",0.003328193564058543,99.8726324669348 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (256, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (3072, 1))","('', '', '')",1,12,5.6510009765625,5.6510009765625,5.7080078125,5.7080078125,0.20468343430239708,0.20468343430239708,5.3671875,5.3671875,5.92822265625,5.92822265625,67.81201171875,67.81201171875,8755,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.81099999999999), 'mean_duration_us': np.float64(5.650916666666666), 'median_duration_us': np.float64(5.708), 'std_dev_duration_us': np.float64(0.19595554697147227), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",0.0032143660436788415,99.87584683297848 +aten::cat,elementwise,NA,python3,CPU,thread 416 (python3),"(((1, 3, 13, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (1555200, 518400, 57600, 240, 1)), ())","('', '2')",11,1,67.77099609375,67.77099609375,67.77099609375,67.77099609375,,,67.77099609375,67.77099609375,67.77099609375,67.77099609375,67.77099609375,67.77099609375,24594,['aten::cat'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.688), 'mean_duration_us': np.float64(5.688), 'median_duration_us': np.float64(5.688), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(5.688)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.727), 'mean_duration_us': np.float64(5.727), 'median_duration_us': np.float64(5.727), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(5.727)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.888), 'mean_duration_us': np.float64(5.888), 'median_duration_us': np.float64(5.888), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.208), 'mean_duration_us': np.float64(6.208), 'median_duration_us': np.float64(6.208), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(6.208)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.288), 'mean_duration_us': np.float64(6.288), 'median_duration_us': np.float64(6.288), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(6.288)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.328), 'mean_duration_us': np.float64(6.328), 'median_duration_us': np.float64(6.328), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.328), 'max_duration_us': np.float64(6.328)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.369), 'mean_duration_us': np.float64(6.369), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(6.369)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.011), 'mean_duration_us': np.float64(8.011), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.011), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.81)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.89)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.21)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.33)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.37)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.01)}]",0.0032124218566695097,99.87905925483516 +aten::nonzero,other,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256,),)","('bool',)","((1,),)","('',)",6,4,16.8582763671875,16.8582763671875,16.998779296875,16.998779296875,0.9243385781142673,0.9243385781142673,15.65673828125,15.65673828125,17.77880859375,17.77880859375,67.43310546875,67.43310546875,8827,"['aten::nonzero', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.845999999999999), 'mean_duration_us': np.float64(1.7114999999999998), 'median_duration_us': np.float64(1.7215), 'std_dev_duration_us': np.float64(0.27234215611983387), 'min_duration_us': np.float64(1.401), 'max_duration_us': np.float64(2.002)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(7.606), 'mean_duration_us': np.float64(1.9015), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.0605), 'min_duration_us': np.float64(1.841), 'max_duration_us': np.float64(1.962)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.088999999999999), 'mean_duration_us': np.float64(2.2722499999999997), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.8777059231314325), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.765)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.012999999999998), 'mean_duration_us': np.float64(2.7532499999999995), 'median_duration_us': np.float64(2.643), 'std_dev_duration_us': np.float64(0.21467460841934716), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.124)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.335), 'mean_duration_us': np.float64(3.33375), 'median_duration_us': np.float64(3.404), 'std_dev_duration_us': np.float64(0.14568866634024752), 'min_duration_us': np.float64(3.083), 'max_duration_us': np.float64(3.444)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.545), 'mean_duration_us': np.float64(4.88625), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.20625272725469596), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(1.9)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.33)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(63.886), 'mean_duration_us': np.float64(6.3886), 'median_duration_us': np.float64(6.2684999999999995), 'std_dev_duration_us': np.float64(0.4445501546507435), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(7.21)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(6.39)}]",0.003028279572785633,99.88528393986687 +aten::fill_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '-inf')",1,32,1.94549560546875,1.94549560546875,1.94140625,1.94140625,0.08448160107434809,0.08448160107434809,1.8017578125,1.8017578125,2.162109375,2.162109375,62.255859375,62.255859375,274,"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(62.259), 'mean_duration_us': np.float64(1.94559375), 'median_duration_us': np.float64(1.9415), 'std_dev_duration_us': np.float64(0.08307220480363749), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.162)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.95)}]",0.0029509981391646852,99.88823493800604 +aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",1,12,5.120198567708333,5.120198567708333,5.10693359375,5.10693359375,0.3315673742872191,0.3315673742872191,4.52587890625,4.52587890625,5.68798828125,5.68798828125,61.4423828125,61.4423828125,7404,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.442), 'mean_duration_us': np.float64(5.120166666666667), 'median_duration_us': np.float64(5.106999999999999), 'std_dev_duration_us': np.float64(0.31744863976537824), 'min_duration_us': np.float64(4.526), 'max_duration_us': np.float64(5.688)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]",0.0029124384301462665,99.89114737643618 +aten::fill_,elementwise,nn.Module: LlamaAttention,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '0.')",1,32,1.8853912353515625,1.8853912353515625,1.88134765625,1.88134765625,0.10690437015342119,0.10690437015342119,1.68212890625,1.68212890625,2.0419921875,2.0419921875,60.33251953125,60.33251953125,278,"['aten::fill_', 'nn.Module: LlamaAttention_0', 'nn.Module: LlamaDecoderLayer_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(60.334), 'mean_duration_us': np.float64(1.8854375), 'median_duration_us': np.float64(1.8815), 'std_dev_duration_us': np.float64(0.10526631034547564), 'min_duration_us': np.float64(1.682), 'max_duration_us': np.float64(2.042)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]",0.0028598296554770797,99.89400720609166 +aten::div,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 4500, 512), ())","('c10::BFloat16', 'double')","((2304000, 512, 1), ())","('', '')",1,10,5.96787109375,5.96787109375,5.968017578125,5.968017578125,0.5024323533781808,0.5024323533781808,5.3271484375,5.3271484375,6.80908203125,6.80908203125,59.6787109375,59.6787109375,15798,"['aten::div', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(59.678999999999995), 'mean_duration_us': np.float64(5.967899999999999), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.4766303494323458), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.809)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]",0.0028288383887449895,99.89683604448041 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (1, 512, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 60, 1), (9216000, 18000, 60, 1), ())","('', '', 'False')",1,10,5.69111328125,5.69111328125,5.70751953125,5.70751953125,0.11077928798117594,0.11077928798117594,5.52685546875,5.52685546875,5.84716796875,5.84716796875,56.9111328125,56.9111328125,16081,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.91100000000001), 'mean_duration_us': np.float64(5.6911000000000005), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.10499185682708932), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(5.847)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}]",0.0026976520557819668,99.8995336965362 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((72000, 4500, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,10,5.663232421875,10.369287109375,5.5869140625,10.27294921875,0.2895929138282026,0.4206487502631958,5.3671875,9.9326171875,6.2880859375,11.2939453125,56.63232421875,103.69287109375,15605,"['aten::miopen_convolution', 'nn.Module: Conv3d_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL2_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU16_SUM0_SUS128_SPO0_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.633), 'mean_duration_us': np.float64(5.6633000000000004), 'median_duration_us': np.float64(5.587), 'std_dev_duration_us': np.float64(0.2747045867836939), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(6.288)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.66)}]",0.0026844362131351975,99.90221813274933 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120),)","('c10::BFloat16',)","((36864000, 72000, 14400, 120, 1),)","('',)",1,1,56.2021484375,56.2021484375,56.2021484375,56.2021484375,,,56.2021484375,56.2021484375,56.2021484375,56.2021484375,56.2021484375,56.2021484375,23910,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: HunyuanVideoResnetBlockCausal3D_8', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(56.202), 'mean_duration_us': np.float64(56.202), 'median_duration_us': np.float64(56.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(56.202), 'max_duration_us': np.float64(56.202)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(56.2)}]",0.002664045394620656,99.90488217814395 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((), (1, 16, 33, 30, 30))","('float', 'c10::BFloat16')","((), (475200, 29700, 900, 30, 1))","('', '')",1,4,13.67919921875,13.67919921875,13.718994140625,13.718994140625,0.307546133080185,0.307546133080185,13.3388671875,13.3388671875,13.93994140625,13.93994140625,54.716796875,54.716796875,10433,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(54.717), 'mean_duration_us': np.float64(13.67925), 'median_duration_us': np.float64(13.719000000000001), 'std_dev_duration_us': np.float64(0.26632721884929417), 'min_duration_us': np.float64(13.339), 'max_duration_us': np.float64(13.94)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.68)}]",0.002593638050782703,99.90747581619473 +aten::copy_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (1, 16, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((72000, 4500, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,10,5.359033203125,5.359033203125,5.3671875,5.3671875,0.19963068374529006,0.19963068374529006,5.126953125,5.126953125,5.68798828125,5.68798828125,53.59033203125,53.59033203125,15604,"['aten::copy_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(53.59000000000001), 'mean_duration_us': np.float64(5.359000000000001), 'median_duration_us': np.float64(5.367), 'std_dev_duration_us': np.float64(0.1893995776130454), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.688)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.36)}]",0.0025402423432764054,99.910016058538 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 4096), (4096, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",1,4,13.368896484375,13.368896484375,13.33837890625,13.33837890625,0.12458063350205915,0.12458063350205915,13.2587890625,13.2587890625,13.5400390625,13.5400390625,53.4755859375,53.4755859375,8761,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(53.476), 'mean_duration_us': np.float64(13.369), 'median_duration_us': np.float64(13.3385), 'std_dev_duration_us': np.float64(0.10779842299403042), 'min_duration_us': np.float64(13.259), 'max_duration_us': np.float64(13.54)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(13.37)}]",0.0025348032486669646,99.91255086178667 +triton_poi_fused_addmm_silu_4,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), ())","('', '', '3072')",1,20,2.4708251953125,2.4708251953125,2.283203125,2.283203125,0.3904354518977978,0.3904354518977978,2.08203125,2.08203125,3.44384765625,3.44384765625,49.41650390625,49.41650390625,8756,"['triton_poi_fused_addmm_silu_4', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(49.415), 'mean_duration_us': np.float64(2.47075), 'median_duration_us': np.float64(2.283), 'std_dev_duration_us': np.float64(0.3805816436718934), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(3.444)}]","[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'mean_duration_us': np.float64(2.47)}]",0.0023423981699934276,99.91489325995666 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (1, 512, 4, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', 'False')",1,10,4.918505859375,4.918505859375,4.826171875,4.826171875,0.26837691894912835,0.26837691894912835,4.68603515625,4.68603515625,5.48779296875,5.48779296875,49.18505859375,49.18505859375,15954,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(49.184000000000005), 'mean_duration_us': np.float64(4.9184), 'median_duration_us': np.float64(4.8260000000000005), 'std_dev_duration_us': np.float64(0.25466613437989755), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.488)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.92)}]",0.002331427400440768,99.91722468735709 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 32, 32), (512, 16, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((81920, 5120, 1024, 32, 1), (432, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",5,1,48.2265625,56.517578125,48.2265625,56.517578125,,,48.2265625,56.517578125,48.2265625,56.517578125,48.2265625,56.517578125,23413,"['aten::miopen_convolution', 'nn.Module: Conv3d_1', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.486), 'mean_duration_us': np.float64(4.486), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(4.486)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.664), 'mean_duration_us': np.float64(16.664), 'median_duration_us': np.float64(16.664), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.664), 'max_duration_us': np.float64(16.664)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.904), 'mean_duration_us': np.float64(16.904), 'median_duration_us': np.float64(16.904), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.904), 'max_duration_us': np.float64(16.904)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.61)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.57)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.66)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(16.9)}]",0.002285993601639354,99.91951068095874 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (1, 16, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((72000, 4500, 900, 30, 1), (16, 1, 1, 1, 1), ())","('', '', '1')",1,10,4.7060546875,4.7060546875,4.64599609375,4.64599609375,0.22436085095860916,0.22436085095860916,4.44580078125,4.44580078125,5.1669921875,5.1669921875,47.060546875,47.060546875,15609,"['aten::add_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(47.061), 'mean_duration_us': np.float64(4.7061), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.21281938351569393), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.71)}]",0.002230723142374058,99.92174140410111 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((72000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,10,4.690087890625,4.690087890625,4.7060546875,4.7060546875,0.202737951359435,0.202737951359435,4.326171875,4.326171875,5.046875,5.046875,46.90087890625,46.90087890625,15611,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(46.901), 'mean_duration_us': np.float64(4.6901), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.19239358097400241), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.047)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]",0.0022231547000877297,99.9239645588012 +aten::fill_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '0')",1,11,4.223499644886363,4.223499644886363,4.40576171875,4.40576171875,0.8120007401551401,0.8120007401551401,1.8818359375,1.8818359375,4.88720703125,4.88720703125,46.45849609375,46.45849609375,15686,"['aten::fill_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(46.459), 'mean_duration_us': np.float64(4.223545454545455), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.7741596456964116), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.887)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.22)}]",0.002202185254487077,99.92616674405569 +triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",1,4,11.446044921875,11.446044921875,11.43603515625,11.43603515625,0.038334483806650256,0.038334483806650256,11.416015625,11.416015625,11.49609375,11.49609375,45.7841796875,45.7841796875,8811,"['triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.78399999999999), 'mean_duration_us': np.float64(11.445999999999998), 'median_duration_us': np.float64(11.436), 'std_dev_duration_us': np.float64(0.033166247903553964), 'min_duration_us': np.float64(11.416), 'max_duration_us': np.float64(11.496)}]","[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]",0.0021702218942503205,99.92833696594994 +triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",1,4,11.295654296875,11.295654296875,11.29541015625,11.29541015625,0.0980764883845896,0.0980764883845896,11.17578125,11.17578125,11.416015625,11.416015625,45.1826171875,45.1826171875,8810,"['triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.183), 'mean_duration_us': np.float64(11.29575), 'median_duration_us': np.float64(11.2955), 'std_dev_duration_us': np.float64(0.0848539185895384), 'min_duration_us': np.float64(11.176), 'max_duration_us': np.float64(11.416)}]","[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'mean_duration_us': np.float64(11.3)}]",0.002141707151446784,99.93047867310139 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (1, 512, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((460800, 900, 30, 1), (2304000, 4500, 30, 1), ())","('', '', 'False')",1,10,4.461669921875,4.461669921875,4.4052734375,4.4052734375,0.2252417466616448,0.2252417466616448,4.326171875,4.326171875,5.0869140625,5.0869140625,44.61669921875,44.61669921875,15947,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.617), 'mean_duration_us': np.float64(4.4616999999999996), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.213733502287311), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.087)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",0.002114881999734691,99.93259355510112 +aten::fill_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '-inf')",1,11,4.055841619318182,4.055841619318182,4.2451171875,4.2451171875,0.7697365198769237,0.7697365198769237,1.8017578125,1.8017578125,4.64599609375,4.64599609375,44.6142578125,44.6142578125,15683,"['aten::fill_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(44.614), 'mean_duration_us': np.float64(4.055818181818181), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.733827180321438), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.06)}]",0.002114766274317469,99.93470832137544 +aten::arange,other,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '6', '1', '')",1,10,4.449560546875,4.449560546875,4.42578125,4.42578125,0.20212210188296303,0.20212210188296303,4.1650390625,4.1650390625,4.80615234375,4.80615234375,44.49560546875,44.49560546875,15658,"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.496), 'mean_duration_us': np.float64(4.4496), 'median_duration_us': np.float64(4.426), 'std_dev_duration_us': np.float64(0.19173794616611492), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(43.693000000000005), 'mean_duration_us': np.float64(4.369300000000001), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.31885766417008077), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(4.847)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]",0.0020710915018578315,99.93888855489634 +aten::cat,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 4, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (29491200, 57600, 14400, 120, 1)), ())","('', '2')",2,1,42.6611328125,42.6611328125,42.6611328125,42.6611328125,,,42.6611328125,42.6611328125,42.6611328125,42.6611328125,42.6611328125,42.6611328125,23889,"['aten::cat', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.456), 'mean_duration_us': np.float64(11.456), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.456), 'max_duration_us': np.float64(11.456)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(31.205), 'mean_duration_us': np.float64(31.205), 'median_duration_us': np.float64(31.205), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(31.205), 'max_duration_us': np.float64(31.205)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(31.2)}]",0.0020221859405397534,99.94091074083688 +aten::fill_,elementwise,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1,), ())","('int', 'Scalar')","((1,), ())","('', '0')",1,12,3.3604329427083335,3.3604329427083335,2.06201171875,2.06201171875,2.7838505311476087,2.7838505311476087,1.80078125,1.80078125,9.4931640625,9.4931640625,40.3251953125,40.3251953125,7369,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(40.326), 'mean_duration_us': np.float64(3.3605), 'median_duration_us': np.float64(2.062), 'std_dev_duration_us': np.float64(2.6652849284832567), 'min_duration_us': np.float64(1.801), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}]",0.0019114598613416056,99.94282220069823 +triton_poi_fused_silu_18,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), ())","('', '', '3072')",1,8,4.98150634765625,4.98150634765625,4.966552734375,4.966552734375,0.3302784986302354,0.3302784986302354,4.64599609375,4.64599609375,5.44677734375,5.44677734375,39.85205078125,39.85205078125,9510,"['triton_poi_fused_silu_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(39.852), 'mean_duration_us': np.float64(4.9815), 'median_duration_us': np.float64(4.9665), 'std_dev_duration_us': np.float64(0.3089826046883546), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.447)}]","[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'mean_duration_us': np.float64(4.98)}]",0.0018890322754839537,99.94471123297372 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((2700, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 2700), (1, 512))","('', '')",1,3,12.417317708333334,12.417317708333334,11.4560546875,11.4560546875,1.770000157041956,1.770000157041956,11.3359375,11.3359375,14.4599609375,14.4599609375,37.251953125,37.251953125,23512,"['aten::mm', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB2048_LBSPPM0_LPA16_LPB32_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.252), 'mean_duration_us': np.float64(12.417333333333334), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(1.44521401721529), 'min_duration_us': np.float64(11.336), 'max_duration_us': np.float64(14.46)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.42)}]",0.00176578470614237,99.94647701767985 +aten::mm,GEMM,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 768), (768, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768), (3072, 1))","('', '', '')",1,4,7.8402099609375,7.8402099609375,7.830078125,7.830078125,0.1648879704515517,0.1648879704515517,7.64990234375,7.64990234375,8.05078125,8.05078125,31.36083984375,31.36083984375,8822,"['aten::mm', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(31.361), 'mean_duration_us': np.float64(7.84025), 'median_duration_us': np.float64(7.83), 'std_dev_duration_us': np.float64(0.1428467272988779), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(8.051)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]",0.0014865392743853352,99.94796355695424 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', '1')",1,5,6.02421875,6.02421875,5.92822265625,5.92822265625,0.39087327315214687,0.39087327315214687,5.68798828125,5.68798828125,6.68896484375,6.68896484375,30.12109375,30.12109375,23449,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(30.121), 'mean_duration_us': np.float64(6.0241999999999996), 'median_duration_us': np.float64(5.928), 'std_dev_duration_us': np.float64(0.3496423315332399), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(6.689)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.02)}]",0.0014277739075199303,99.94939133086176 +aten::where,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((2700, 2700), (), ())","('bool', 'float', 'float')","((2700, 1), (), ())","('', '', '')",1,1,28.9619140625,28.9619140625,28.9619140625,28.9619140625,,,28.9619140625,28.9619140625,28.9619140625,28.9619140625,28.9619140625,28.9619140625,23485,"['aten::where', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(28.962), 'mean_duration_us': np.float64(28.962), 'median_duration_us': np.float64(28.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(28.962), 'max_duration_us': np.float64(28.962)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.96)}]",0.001372827479422856,99.95076415834119 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",1,4,6.99951171875,6.99951171875,7.190185546875,7.190185546875,0.6636223025908732,0.6636223025908732,6.087890625,6.087890625,7.52978515625,7.52978515625,27.998046875,27.998046875,8771,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.998), 'mean_duration_us': np.float64(6.9995), 'median_duration_us': np.float64(7.1899999999999995), 'std_dev_duration_us': np.float64(0.5746923089793354), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.53)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.0)}]",0.0013271390847035534,99.9520912974259 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",1,4,6.9896240234375,6.9896240234375,6.94970703125,6.94970703125,0.18656449590027488,0.18656449590027488,6.80908203125,6.80908203125,7.25,7.25,27.95849609375,27.95849609375,8873,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.958), 'mean_duration_us': np.float64(6.9895), 'median_duration_us': np.float64(6.9495000000000005), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.25)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(6.99)}]",0.0013252643329445548,99.95341656175884 +aten::clamp,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '0', '1')",1,1,27.64111328125,27.64111328125,27.64111328125,27.64111328125,,,27.64111328125,27.64111328125,27.64111328125,27.64111328125,27.64111328125,27.64111328125,24635,['aten::clamp'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.641), 'mean_duration_us': np.float64(27.641), 'median_duration_us': np.float64(27.641), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.641), 'max_duration_us': np.float64(27.641)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(27.64)}]",0.0013102200287056758,99.95472678178754 +triton_per_fused_native_layer_norm_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1), (1, 7425, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (7456, 1, 7456), (7456, 1, 7456), (), ())","('', '', '', '', '', '7425', '24')",1,4,6.5887451171875,6.5887451171875,6.468505859375,6.468505859375,0.43476345613526435,0.43476345613526435,6.2080078125,6.2080078125,7.2099609375,7.2099609375,26.35498046875,26.35498046875,8847,"['triton_per_fused_native_layer_norm_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(26.355), 'mean_duration_us': np.float64(6.58875), 'median_duration_us': np.float64(6.468500000000001), 'std_dev_duration_us': np.float64(0.37655104235680975), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(7.21)}]","[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'mean_duration_us': np.float64(6.59)}]",0.00124925587891305,99.95597603766646 +aten::add,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (1, 512, 3, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', '1')",1,3,8.384602864583334,8.384602864583334,8.61181640625,8.61181640625,0.4286879502189478,0.4286879502189478,7.89013671875,7.89013671875,8.65185546875,8.65185546875,25.15380859375,25.15380859375,23803,"['aten::add', 'nn.Module: HunyuanVideoResnetBlockCausal3D_5', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(25.153999999999996), 'mean_duration_us': np.float64(8.384666666666666), 'median_duration_us': np.float64(8.612), 'std_dev_duration_us': np.float64(0.3501631365838246), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.652)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(8.38)}]",0.0011923189736397551,99.9571683566401 +triton_red_fused_addmm_native_layer_norm_view_0,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((256, 3072), (3072,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '256', '3072')",1,4,5.74755859375,5.74755859375,5.78759765625,5.78759765625,0.346767475313975,0.346767475313975,5.287109375,5.287109375,6.1279296875,6.1279296875,22.990234375,22.990234375,8724,"['triton_red_fused_addmm_native_layer_norm_view_0', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.99), 'mean_duration_us': np.float64(5.7475), 'median_duration_us': np.float64(5.7875), 'std_dev_duration_us': np.float64(0.30036685902409416), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.128)}]","[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]",0.0010897631088974905,99.95825811974899 +aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '', '1')",1,1,22.591796875,22.591796875,22.591796875,22.591796875,,,22.591796875,22.591796875,22.591796875,22.591796875,22.591796875,22.591796875,24634,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.592), 'mean_duration_us': np.float64(22.592), 'median_duration_us': np.float64(22.592), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.592), 'max_duration_us': np.float64(22.592)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(22.59)}]",0.0010708767208068366,99.9593289964698 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), ())","('c10::BFloat16', 'double')","((57600, 7430400, 240, 1), ())","('', '')",1,1,22.43212890625,22.43212890625,22.43212890625,22.43212890625,,,22.43212890625,22.43212890625,22.43212890625,22.43212890625,22.43212890625,22.43212890625,24633,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.432), 'mean_duration_us': np.float64(22.432), 'median_duration_us': np.float64(22.432), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.432), 'max_duration_us': np.float64(22.432)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(22.43)}]",0.0010633082785205083,99.96039230474831 +triton_poi_fused__to_copy_cat_slice_3,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '256')",1,12,1.8617757161458333,1.8617757161458333,1.861328125,1.861328125,0.18005556047818996,0.18005556047818996,1.56201171875,1.56201171875,2.2421875,2.2421875,22.34130859375,22.34130859375,8754,"['triton_poi_fused__to_copy_cat_slice_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.342), 'mean_duration_us': np.float64(1.8618333333333332), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.17237596184567677), 'min_duration_us': np.float64(1.562), 'max_duration_us': np.float64(2.242)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'mean_duration_us': np.float64(1.86)}]",0.0010590032929998444,99.9614513080413 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '6', '3072')",1,4,5.4371337890625,5.4371337890625,5.4072265625,5.4072265625,0.059814453125000076,0.059814453125000076,5.4072265625,5.4072265625,5.52685546875,5.52685546875,21.74853515625,21.74853515625,8849,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.748), 'mean_duration_us': np.float64(5.437), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.05196152422706637), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.527)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]",0.0010309051616983079,99.962482213203 +triton_red_fused__to_copy_mul_sum_unsqueeze_5,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256), (1, 4096, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((1048576, 4096, 1), (256, 1), (8192, 1, 4096), (), ())","('', '', '', '8192', '128')",1,4,5.43701171875,5.43701171875,5.427001953125,5.427001953125,0.10999305125165447,0.10999305125165447,5.3271484375,5.3271484375,5.56689453125,5.56689453125,21.748046875,21.748046875,8758,"['triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.747999999999998), 'mean_duration_us': np.float64(5.436999999999999), 'median_duration_us': np.float64(5.427), 'std_dev_duration_us': np.float64(0.09539392014169465), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.567)}]","[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]",0.0010308820166148635,99.96351309521962 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('c10::BFloat16', 'float', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,5,4.2052734375,4.2052734375,4.044921875,4.044921875,0.44987235908125317,0.44987235908125317,3.96484375,3.96484375,5.0068359375,5.0068359375,21.0263671875,21.0263671875,8714,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(21.027), 'mean_duration_us': np.float64(4.2054), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.4023936381206839), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.21)}]",0.0009966735832839975,99.96450976880291 +aten::copy_,elementwise,nn.Module: HunyuanVideoResnetBlockCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 1, 460800, 15360, 512), ())","('', '', 'False')",1,1,20.509765625,20.509765625,20.509765625,20.509765625,,,20.509765625,20.509765625,20.509765625,20.509765625,20.509765625,20.509765625,23605,"['aten::copy_', 'nn.Module: HunyuanVideoResnetBlockCausal3D_1', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.51), 'mean_duration_us': np.float64(20.51), 'median_duration_us': np.float64(20.51), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.51), 'max_duration_us': np.float64(20.51)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.51)}]",0.0009721860849997916,99.9654819548879 +aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((18432000, 72000, 120, 1), (), (), ())","('', '[240, 240]', '2.', '2.')",1,1,20.30908203125,29.44189453125,20.30908203125,29.44189453125,,,20.30908203125,29.44189453125,20.30908203125,29.44189453125,20.30908203125,29.44189453125,24018,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.309), 'mean_duration_us': np.float64(20.309), 'median_duration_us': np.float64(20.309), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.309), 'max_duration_us': np.float64(20.309)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.31)}]",0.0009626734557041315,99.96644462834361 +aten::upsample_nearest3d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((921600, 1800, 900, 30, 1), (), (), (), ())","('', '[2, 60, 60]', '1.', '2.', '2.')",1,1,20.18896484375,20.18896484375,20.18896484375,20.18896484375,,,20.18896484375,20.18896484375,20.18896484375,20.18896484375,20.18896484375,20.18896484375,23754,"['aten::upsample_nearest3d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.189), 'mean_duration_us': np.float64(20.189), 'median_duration_us': np.float64(20.189), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.189), 'max_duration_us': np.float64(20.189)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.19)}]",0.0009569797651768019,99.96740160810879 +aten::add_,elementwise,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 2700, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (1,), ())","('', '', '1')",1,3,6.68896484375,6.68896484375,7.08984375,7.08984375,0.9474872133303112,0.9474872133303112,5.60693359375,5.60693359375,7.3701171875,7.3701171875,20.06689453125,20.06689453125,23514,"['aten::add_', 'nn.Module: Linear_296', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.067), 'mean_duration_us': np.float64(6.689), 'median_duration_us': np.float64(7.09), 'std_dev_duration_us': np.float64(0.7735817129862019), 'min_duration_us': np.float64(5.607), 'max_duration_us': np.float64(7.37)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.69)}]",0.0009511934943156947,99.9683528016031 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1555200, 518400, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",1,4,4.9666748046875,4.9666748046875,4.98681640625,4.98681640625,0.056854021444259904,0.056854021444259904,4.88623046875,4.88623046875,5.0068359375,5.0068359375,19.86669921875,19.86669921875,24562,['aten::copy_'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.867), 'mean_duration_us': np.float64(4.96675), 'median_duration_us': np.float64(4.987), 'std_dev_duration_us': np.float64(0.049398254017728016), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]",0.0009417040101034788,99.9692945056132 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((1555200, 518400, 240, 1), ())","('', '')",1,4,4.966552734375,4.966552734375,4.966796875,4.966796875,0.03309163842745591,0.03309163842745591,4.92578125,4.92578125,5.0068359375,5.0068359375,19.8662109375,19.8662109375,24558,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.866999999999997), 'mean_duration_us': np.float64(4.966749999999999), 'median_duration_us': np.float64(4.967), 'std_dev_duration_us': np.float64(0.02863891583143451), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]",0.0009416808650200344,99.97023618647823 +triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), ())","('', '', '', '', '', '786432')",1,4,4.66552734375,4.66552734375,4.60546875,4.60546875,0.1483710960296656,0.1483710960296656,4.56494140625,4.56494140625,4.88623046875,4.88623046875,18.662109375,18.662109375,8809,"['triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.662), 'mean_duration_us': np.float64(4.6655), 'median_duration_us': np.float64(4.6055), 'std_dev_duration_us': np.float64(0.12837542599734572), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.886)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'mean_duration_us': np.float64(4.67)}]",0.0008846050892460727,99.97112079156747 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (1, 256, 4, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((14745600, 57600, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', 'False')",1,1,18.5869140625,18.5869140625,18.5869140625,18.5869140625,,,18.5869140625,18.5869140625,18.5869140625,18.5869140625,18.5869140625,18.5869140625,24030,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(18.587), 'mean_duration_us': np.float64(18.587), 'median_duration_us': np.float64(18.587), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(18.587)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(18.59)}]",0.0008810407463956307,99.97200183231386 +triton_poi_fused_addmm_clone_permute_view_31,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((7425, 64), (64,), (1, 16, 33, 1, 15, 2, 15, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1), (1,), (475200, 29700, 900, 900, 60, 30, 2, 1), ())","('', '', '', '475200')",1,4,4.595703125,4.595703125,4.64599609375,4.64599609375,0.13275863452711426,0.13275863452711426,4.40478515625,4.40478515625,4.68603515625,4.68603515625,18.3828125,18.3828125,10413,"['triton_poi_fused_addmm_clone_permute_view_31', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.383000000000003), 'mean_duration_us': np.float64(4.595750000000001), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.11487030730349758), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(4.686)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",0.0008713661015158595,99.97287319841539 +triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (1, 24, 256, 256), (1, 24, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1), (1572864, 65536, 256, 1), (1572864, 65536, 256, 1), ())","('', '', '', '1572864')",1,4,4.335693359375,4.335693359375,4.325927734375,4.325927734375,0.15054089193657735,0.15054089193657735,4.2060546875,4.2060546875,4.48486328125,4.48486328125,17.3427734375,17.3427734375,8728,"['triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.343), 'mean_duration_us': np.float64(4.33575), 'median_duration_us': np.float64(4.3260000000000005), 'std_dev_duration_us': np.float64(0.13048060200658163), 'min_duration_us': np.float64(4.206), 'max_duration_us': np.float64(4.485)}]","[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_cop...', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]",0.0008220670737792259,99.97369526548917 +triton_per_fused__to_copy_div_mul_sum_unsqueeze_7,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 4096, 2), (1, 1), (1, 4096), (), ())","('float', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((8192, 1, 4096), (1, 1), (4096, 1), (), ())","('', '', '', '4096', '2')",1,4,4.33544921875,4.33544921875,4.405517578125,4.405517578125,0.29147214306464797,0.29147214306464797,3.9248046875,3.9248046875,4.60595703125,4.60595703125,17.341796875,17.341796875,8760,"['triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.342), 'mean_duration_us': np.float64(4.3355), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.25236927309004953), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.606)}]","[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]",0.000822020783612337,99.97451728627279 +aten::nonzero,other,NA,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",6,1,16.4580078125,16.4580078125,16.4580078125,16.4580078125,,,16.4580078125,16.4580078125,16.4580078125,16.4580078125,16.4580078125,16.4580078125,10416,['aten::nonzero'],"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.881), 'mean_duration_us': np.float64(1.881), 'median_duration_us': np.float64(1.881), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(1.881)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.922), 'mean_duration_us': np.float64(1.922), 'median_duration_us': np.float64(1.922), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.922), 'max_duration_us': np.float64(1.922)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.962), 'mean_duration_us': np.float64(1.962), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(1.962)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.284), 'mean_duration_us': np.float64(3.284), 'median_duration_us': np.float64(3.284), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.284), 'max_duration_us': np.float64(3.284)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.324), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.324)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.332), 'mean_duration_us': np.float64(8.332), 'median_duration_us': np.float64(8.332), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.332), 'max_duration_us': np.float64(8.332)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.33)}]",0.0007499932839332741,99.9760474077393 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 2700), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2700, 2700, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,15.62158203125,15.62158203125,15.62158203125,15.62158203125,,,15.62158203125,15.62158203125,15.62158203125,15.62158203125,15.62158203125,15.62158203125,23499,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_2', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.488), 'mean_duration_us': np.float64(5.488), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.488), 'max_duration_us': np.float64(5.488)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.134), 'mean_duration_us': np.float64(10.134), 'median_duration_us': np.float64(10.134), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.134), 'max_duration_us': np.float64(10.134)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.49)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.13)}]",0.0007404806546376139,99.97678788839394 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,3,4.512532552083333,4.512532552083333,4.48583984375,4.48583984375,0.12232135644087852,0.12232135644087852,4.40576171875,4.40576171875,4.64599609375,4.64599609375,13.53759765625,13.53759765625,12145,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.538), 'mean_duration_us': np.float64(4.512666666666667), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.0006416974384967914,99.97742958583244 +aten::index,other,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256, 3072), ())","('c10::BFloat16', '')","((786432, 3072, 1), ())","('', '')",1,4,3.3837890625,20.2420654296875,3.3837890625,20.402587890625,0.02311656351247525,0.9286748569565053,3.36376953125,19.0205078125,3.40380859375,21.142578125,13.53515625,80.96826171875,8826,"['aten::index', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536000000000001), 'mean_duration_us': np.float64(3.3840000000000003), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.404)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]",0.0006415817130795693,99.97807116754552 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",1,6,2.2089029947916665,2.2089029947916665,2.18212890625,2.18212890625,0.11725194218808946,0.11725194218808946,2.08203125,2.08203125,2.36181640625,2.36181640625,13.25341796875,13.25341796875,10481,"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(13.253000000000002), 'mean_duration_us': np.float64(2.2088333333333336), 'median_duration_us': np.float64(2.182), 'std_dev_duration_us': np.float64(0.10705203822855923), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.21)}]",0.0006282269999321337,99.97869939454546 +aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((5529600, 10800, 60, 1), (), (), ())","('', '[120, 120]', '2.', '2.')",1,1,13.2177734375,18.46484375,13.2177734375,18.46484375,,,13.2177734375,18.46484375,13.2177734375,18.46484375,13.2177734375,18.46484375,23874,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.218), 'mean_duration_us': np.float64(13.218), 'median_duration_us': np.float64(13.218), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.218), 'max_duration_us': np.float64(13.218)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(13.22)}]",0.0006265374088406905,99.97932593195429 +aten::add,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 2700, 512), (1, 2700, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (2700, 1, 2700), ())","('', '', '1')",1,1,12.6181640625,12.6181640625,12.6181640625,12.6181640625,,,12.6181640625,12.6181640625,12.6181640625,12.6181640625,12.6181640625,12.6181640625,23595,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.618), 'mean_duration_us': np.float64(12.618), 'median_duration_us': np.float64(12.618), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.618), 'max_duration_us': np.float64(12.618)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.62)}]",0.0005981152463709318,99.97992404720067 +aten::le,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700))","('int', 'int')","((0, 1), (1, 0))","('', '')",1,1,12.537109375,12.537109375,12.537109375,12.537109375,,,12.537109375,12.537109375,12.537109375,12.537109375,12.537109375,12.537109375,23477,"['aten::le', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.537), 'mean_duration_us': np.float64(12.537), 'median_duration_us': np.float64(12.537), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.537), 'max_duration_us': np.float64(12.537)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.54)}]",0.0005942731625191565,99.98051832036319 +aten::cos,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",1,1,12.09716796875,12.09716796875,12.09716796875,12.09716796875,,,12.09716796875,12.09716796875,12.09716796875,12.09716796875,12.09716796875,12.09716796875,147,"['aten::cos', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.097), 'mean_duration_us': np.float64(12.097), 'median_duration_us': np.float64(12.097), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.097), 'max_duration_us': np.float64(12.097)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(12.1)}]",0.0005734194423357261,99.98109173980552 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((512,), (2700, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",1,1,12.05712890625,12.05712890625,12.05712890625,12.05712890625,,,12.05712890625,12.05712890625,12.05712890625,12.05712890625,12.05712890625,12.05712890625,23592,"['aten::addmm', 'nn.Module: Linear_299', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.057), 'mean_duration_us': np.float64(12.057), 'median_duration_us': np.float64(12.057), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.057), 'max_duration_us': np.float64(12.057)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.06)}]",0.0005715215454932829,99.98166326135102 +triton_poi_fused_add_addmm_silu_8,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (3072, 1), ())","('', '', '', '', '', '', '3072')",1,4,2.9234619140625,2.9234619140625,2.88330078125,2.88330078125,0.17329026350422627,0.17329026350422627,2.76318359375,2.76318359375,3.1640625,3.1640625,11.69384765625,11.69384765625,8764,"['triton_poi_fused_add_addmm_silu_8', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.693999999999999), 'mean_duration_us': np.float64(2.9234999999999998), 'median_duration_us': np.float64(2.8834999999999997), 'std_dev_duration_us': np.float64(0.1500674848193306), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.164)}]","[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'mean_duration_us': np.float64(2.92)}]",0.0005543016034106279,99.98221756295443 +aten::copy_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2700), (1, 1, 2700, 2700), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), (7290000, 7290000, 2700, 1), ())","('', '', 'False')",1,1,11.2158203125,11.2158203125,11.2158203125,11.2158203125,,,11.2158203125,11.2158203125,11.2158203125,11.2158203125,11.2158203125,11.2158203125,23552,"['aten::copy_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.216), 'mean_duration_us': np.float64(11.216), 'median_duration_us': np.float64(11.216), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(11.216)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.22)}]",0.0005316425667185319,99.98274920552115 +triton_poi_fused_add_addmm_17,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",1,3,3.5242513020833335,3.5242513020833335,3.52392578125,3.52392578125,0.040528324222577586,0.040528324222577586,3.48388671875,3.48388671875,3.56494140625,3.56494140625,10.57275390625,10.57275390625,10553,"['triton_poi_fused_add_addmm_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.573), 'mean_duration_us': np.float64(3.5243333333333333), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0330689515339624), 'min_duration_us': np.float64(3.484), 'max_duration_us': np.float64(3.565)}]","[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",0.0005011604918222191,99.98325036601297 +aten::copy_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700), ())","('c10::BFloat16', 'float', 'Scalar')","((2700, 1), (2700, 1), ())","('', '', 'False')",1,1,10.01416015625,10.01416015625,10.01416015625,10.01416015625,,,10.01416015625,10.01416015625,10.01416015625,10.01416015625,10.01416015625,10.01416015625,23491,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.014), 'mean_duration_us': np.float64(10.014), 'median_duration_us': np.float64(10.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.014), 'max_duration_us': np.float64(10.014)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]",0.0004746825163617924,99.98372504852932 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 3, 9, 240, 240), (1, 3, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1555200, 518400, 57600, 240, 1), (3, 1, 1, 1, 1), ())","('', '', '1')",1,1,9.81396484375,9.81396484375,9.81396484375,9.81396484375,,,9.81396484375,9.81396484375,9.81396484375,9.81396484375,9.81396484375,9.81396484375,24170,"['aten::add_', 'nn.Module: Conv3d_35', 'nn.Module: HunyuanVideoCausalConv3d_34', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.814), 'mean_duration_us': np.float64(9.814), 'median_duration_us': np.float64(9.814), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.814), 'max_duration_us': np.float64(9.814)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.81)}]",0.00046519303214957654,99.98419024156148 +aten::sin,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",1,1,9.212890625,9.212890625,9.212890625,9.212890625,,,9.212890625,9.212890625,9.212890625,9.212890625,9.212890625,9.212890625,149,"['aten::sin', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.213), 'mean_duration_us': np.float64(9.213), 'median_duration_us': np.float64(9.213), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.213), 'max_duration_us': np.float64(9.213)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(9.21)}]",0.0004367014344294846,99.9846269429959 +triton_per_fused__to_copy_any_sum_unsqueeze_6,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 256), (1, 1), (256,), (), ())","('c10::BFloat16', 'float', 'bool', 'Scalar', 'Scalar')","((256, 1), (1, 1), (1,), (), ())","('', '', '', '1', '256')",1,4,2.29248046875,2.29248046875,1.98193359375,1.98193359375,0.9005283959186826,0.9005283959186826,1.60107421875,1.60107421875,3.60498046875,3.60498046875,9.169921875,9.169921875,8759,"['triton_per_fused__to_copy_any_sum_unsqueeze_6', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.17), 'mean_duration_us': np.float64(2.2925), 'median_duration_us': np.float64(1.982), 'std_dev_duration_us': np.float64(0.779879638149375), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.605)}]","[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'mean_duration_us': np.float64(2.29)}]",0.0004346646670863748,99.98506160766298 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (1, 256, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 14400, 120, 1), (18432000, 72000, 120, 1), ())","('', '', 'False')",1,1,9.1328125,9.1328125,9.1328125,9.1328125,,,9.1328125,9.1328125,9.1328125,9.1328125,9.1328125,9.1328125,24023,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_2', 'nn.Module: HunyuanVideoUpBlock3D_2', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.13)}]",0.0004329056407445982,99.98549451330373 +aten::mul,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 351, 128), ())","('float', 'double')","((44928, 128, 1), ())","('', '')",1,2,4.325439453125,4.325439453125,4.325439453125,4.325439453125,0.28346419304402126,0.28346419304402126,4.125,4.125,4.52587890625,4.52587890625,8.65087890625,8.65087890625,148,"['aten::mul', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.651), 'mean_duration_us': np.float64(4.3255), 'median_duration_us': np.float64(4.3255), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]",0.00041006144338494695,99.98590457474712 +aten::div,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 2700, 512), ())","('c10::BFloat16', 'double')","((1382400, 512, 1), ())","('', '')",1,1,8.57080078125,8.57080078125,8.57080078125,8.57080078125,,,8.57080078125,8.57080078125,8.57080078125,8.57080078125,8.57080078125,8.57080078125,23596,"['aten::div', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.571), 'mean_duration_us': np.float64(8.571), 'median_duration_us': np.float64(8.571), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.571), 'max_duration_us': np.float64(8.571)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.57)}]",0.00040626564970006057,99.98631084039683 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 351), (1, 351), ())","('long int', 'long int', 'Scalar')","((351, 1), (351, 1), ())","('', '', 'False')",1,2,4.205078125,4.205078125,4.205078125,4.205078125,0.6801759565124506,0.6801759565124506,3.72412109375,3.72412109375,4.68603515625,4.68603515625,8.41015625,8.41015625,15,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.41), 'mean_duration_us': np.float64(4.205), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.48099999999999987), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(4.686)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.2)}]",0.00039865091724684343,99.98670949131407 +aten::sub,elementwise,NA,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",1,4,2.011962890625,2.011962890625,2.001953125,2.001953125,0.06005859375000001,0.06005859375000001,1.9619140625,1.9619140625,2.08203125,2.08203125,8.0478515625,8.0478515625,10432,['aten::sub'],"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.047999999999998), 'mean_duration_us': np.float64(2.0119999999999996), 'median_duration_us': np.float64(2.002), 'std_dev_duration_us': np.float64(0.05196152422706626), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::unrolled_elementwise_kernel, 4, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(7.729), 'mean_duration_us': np.float64(2.5763333333333334), 'median_duration_us': np.float64(2.363), 'std_dev_duration_us': np.float64(0.3311136092374069), 'min_duration_us': np.float64(2.322), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::unrolled_elementwise_kernel(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.65), 'mean_duration_us': np.float64(7.65), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(7.65)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.65)}]",0.0003626140223238676,99.9878199229825 +aten::cat,other,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"(((1, 351, 64), (1, 351, 64)), ())","('TensorList', 'Scalar')","(((22464, 1, 351), (22464, 1, 351)), ())","('', '-1')",1,1,7.490234375,7.490234375,7.490234375,7.490234375,,,7.490234375,7.490234375,7.490234375,7.490234375,7.490234375,7.490234375,146,"['aten::cat', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 3, 64, 64>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.489), 'mean_duration_us': np.float64(3.7445), 'median_duration_us': np.float64(3.7445), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.965)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.74)}]",0.0003549761447872061,99.98852994470732 +aten::copy_,elementwise,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 1, 351), (1, 1, 351), ())","('float', 'long int', 'Scalar')","((351, 351, 1), (351, 351, 1), ())","('', '', 'False')",1,1,7.451171875,7.451171875,7.451171875,7.451171875,,,7.451171875,7.451171875,7.451171875,7.451171875,7.451171875,7.451171875,130,"['aten::copy_', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.451), 'mean_duration_us': np.float64(7.451), 'median_duration_us': np.float64(7.451), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.451), 'max_duration_us': np.float64(7.451)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.45)}]",0.00035319397336198505,99.98888313868069 +aten::normal_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (), (), ())","('float', 'Scalar', 'Scalar', '')","((475200, 29700, 900, 30, 1), (), (), ())","('', '0.', '1.', '')",1,1,7.25,7.25,7.25,7.25,,,7.25,7.25,7.25,7.25,7.25,7.25,8691,['aten::normal_'],"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.25), 'mean_duration_us': np.float64(7.25), 'median_duration_us': np.float64(7.25), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.25), 'max_duration_us': np.float64(7.25)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(7.25)}]",0.00034365819898288035,99.98922679687968 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (1, 512, 2, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 7200, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', 'False')",1,1,7.169921875,7.169921875,7.169921875,7.169921875,,,7.169921875,7.169921875,7.169921875,7.169921875,7.169921875,7.169921875,23886,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.17), 'mean_duration_us': np.float64(7.17), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.17), 'max_duration_us': np.float64(7.17)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.17)}]",0.000339862405297994,99.98956665928498 +aten::fill_,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2704), ())","('c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), ())","('', '0.')",1,1,7.0888671875,7.0888671875,7.0888671875,7.0888671875,,,7.0888671875,7.0888671875,7.0888671875,7.0888671875,7.0888671875,7.0888671875,23548,"['aten::fill_', 'nn.Module: Attention_0', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.089), 'mean_duration_us': np.float64(7.089), 'median_duration_us': np.float64(7.089), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(7.089)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]",0.00033602032144621884,99.98990267960642 +aten::all,reduce,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 351),)","('bool',)","((351, 1),)","('',)",1,1,6.96923828125,6.96923828125,6.96923828125,6.96923828125,,,6.96923828125,6.96923828125,6.96923828125,6.96923828125,6.96923828125,6.96923828125,44,"['aten::all', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, bool, 4, 4> >(at::native::ReduceOp, unsigned int, bool, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.969), 'mean_duration_us': np.float64(6.969), 'median_duration_us': np.float64(6.969), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.969), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.807), 'mean_duration_us': np.float64(2.269), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.2078893936688451), 'min_duration_us': np.float64(2.122), 'max_duration_us': np.float64(2.563)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.27)}]",0.0003226656082987834,99.99055569499072 +aten::bmm,GEMM,nn.Module: LlamaRotaryEmbedding,python3,CPU,thread 416 (python3),"((1, 64, 1), (1, 1, 351))","('float', 'float')","((64, 1, 1), (351, 351, 1))","('', '')",1,1,6.76904296875,6.76904296875,6.76904296875,6.76904296875,,,6.76904296875,6.76904296875,6.76904296875,6.76904296875,6.76904296875,6.76904296875,142,"['aten::bmm', 'nn.Module: LlamaRotaryEmbedding_0', 'nn.Module: LlamaModel_0']","[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA4_GRVWB4_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB8_LPM0_LRVW4_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.769), 'mean_duration_us': np.float64(6.769), 'median_duration_us': np.float64(6.769), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.769), 'max_duration_us': np.float64(6.769)}]","[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_S...', 'stream': 0, 'mean_duration_us': np.float64(6.77)}]",0.0003208602917901179,99.99087655528251 +aten::le,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 351, 1))","('long int', 'long int')","((351, 351, 351, 1), (351, 351, 1, 1))","('', '')",1,1,6.52783203125,6.52783203125,6.52783203125,6.52783203125,,,6.52783203125,6.52783203125,6.52783203125,6.52783203125,6.52783203125,6.52783203125,95,"['aten::le', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.528), 'mean_duration_us': np.float64(6.528), 'median_duration_us': np.float64(6.528), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.00030942662056857,99.99118598190309 +aten::upsample_nearest2d,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((1382400, 2700, 30, 1), (), (), ())","('', '[60, 60]', '2.', '2.')",1,1,6.2890625,10.5341796875,6.2890625,10.5341796875,,,6.2890625,10.5341796875,6.2890625,10.5341796875,6.2890625,10.5341796875,23740,"['aten::upsample_nearest2d', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.289), 'mean_duration_us': np.float64(6.289), 'median_duration_us': np.float64(6.289), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(6.289)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}]",0.00029810867476424426,99.99148409057786 +aten::arange,other,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '351', '1', '')",1,3,2.0421549479166665,2.0421549479166665,1.841796875,1.841796875,0.3822298351596716,0.3822298351596716,1.8017578125,1.8017578125,2.48291015625,2.48291015625,6.12646484375,6.12646484375,35,"['aten::arange', 'nn.Module: LlamaModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.127000000000001), 'mean_duration_us': np.float64(2.0423333333333336), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.3120259960679915), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.483)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}]",0.0002866750035426964,99.99206116694337 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",1,3,2.0016276041666665,2.0016276041666665,1.9208984375,1.9208984375,0.17475103197716266,0.17475103197716266,1.8818359375,1.8818359375,2.2021484375,2.2021484375,6.0048828125,6.0048828125,10545,"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.005), 'mean_duration_us': np.float64(2.0016666666666665), 'median_duration_us': np.float64(1.921), 'std_dev_duration_us': np.float64(0.14254901691075328), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(2.202)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.0)}]",0.00028463823619958667,99.99234580517957 +aten::add,elementwise,nn.Module: CLIPTextEmbeddings,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,1,5.9677734375,5.9677734375,5.9677734375,5.9677734375,,,5.9677734375,5.9677734375,5.9677734375,5.9677734375,5.9677734375,5.9677734375,7302,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]",0.00028287920985781004,99.99262868438943 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((43200, 2700, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0, 0]', '[1, 1, 1]', '[1, 1, 1]', '1', 'False', 'False')",1,1,5.76806640625,10.4541015625,5.76806640625,10.4541015625,,,5.76806640625,10.4541015625,5.76806640625,10.4541015625,5.76806640625,10.4541015625,23403,"['aten::miopen_convolution', 'nn.Module: Conv3d_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR0_DTVA0_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SPO1_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.768), 'mean_duration_us': np.float64(5.768), 'median_duration_us': np.float64(5.768), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(5.768)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.77)}]",0.0002734128707290386,99.99290209726016 +aten::argmax,reduce,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",1,1,5.72802734375,5.72802734375,5.72802734375,5.72802734375,,,5.72802734375,5.72802734375,5.72802734375,5.72802734375,5.72802734375,5.72802734375,8650,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.648), 'mean_duration_us': np.float64(5.648), 'median_duration_us': np.float64(5.648), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.648), 'max_duration_us': np.float64(5.648)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",0.00026771918020170916,99.99344133141425 +aten::copy_,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,1,5.3271484375,5.3271484375,5.3271484375,5.3271484375,,,5.3271484375,5.3271484375,5.3271484375,5.3271484375,5.3271484375,5.3271484375,8649,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.33)}]",0.0002525128603787193,99.99369384427463 +aten::index,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 351), ())","('bool', '')","((351, 1), ())","('', '')",1,1,5.287109375,8.73095703125,5.287109375,8.73095703125,,,5.287109375,8.73095703125,5.287109375,8.73095703125,5.287109375,8.73095703125,99,"['aten::index', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.287), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",0.0002506149635362762,99.99394445923816 +aten::_local_scalar_dense,other,NA,python3,CPU,thread 416 (python3),"((1,),)","('long int',)","((1,),)","('',)",1,1,5.2470703125,5.2470703125,5.2470703125,5.2470703125,,,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,10426,['aten::_local_scalar_dense'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.00024871706669383304,99.99419317630486 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (1, 512, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 60, 1), (5529600, 10800, 60, 1), ())","('', '', 'False')",1,1,5.2470703125,5.2470703125,5.2470703125,5.2470703125,,,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,23879,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_1', 'nn.Module: HunyuanVideoUpBlock3D_1', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.00024871706669383304,99.99444189337156 +aten::index,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",1,1,5.20703125,5.20703125,5.20703125,5.20703125,,,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,8652,"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",0.00024681916985138985,99.9946887125414 +aten::copy_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (1, 16, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((43200, 2700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",1,1,5.20703125,5.20703125,5.20703125,5.20703125,,,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,5.20703125,23402,"['aten::copy_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",0.00024681916985138985,99.99493553171125 +aten::bitwise_and,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), (1, 1, 351, 351))","('bool', 'bool')","((), (123201, 123201, 351, 1))","('', '')",1,1,4.80615234375,4.80615234375,4.80615234375,4.80615234375,,,4.80615234375,4.80615234375,4.80615234375,4.80615234375,4.80615234375,4.80615234375,98,"['aten::bitwise_and', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.806), 'mean_duration_us': np.float64(4.806), 'median_duration_us': np.float64(4.806), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",0.0002278170563435137,99.99516334876759 +aten::div,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), ())","('c10::BFloat16', 'double')","((475200, 29700, 900, 30, 1), ())","('', '')",1,1,4.68603515625,4.68603515625,4.68603515625,4.68603515625,,,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,15594,['aten::div'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]",0.00022212336581618422,99.9953854721334 +aten::add_,elementwise,nn.Module: Conv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (1, 16, 1, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((43200, 2700, 900, 30, 1), (16, 1, 1, 1, 1), ())","('', '', '1')",1,1,4.68603515625,4.68603515625,4.68603515625,4.68603515625,,,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,4.68603515625,23407,"['aten::add_', 'nn.Module: Conv3d_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]",0.00022212336581618422,99.99560759549922 +triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",1,2,2.322998046875,2.322998046875,2.322998046875,2.322998046875,0.16952608865361077,0.16952608865361077,2.203125,2.203125,2.44287109375,2.44287109375,4.64599609375,4.64599609375,8753,"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.646), 'mean_duration_us': np.float64(2.323), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.443)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'mean_duration_us': np.float64(2.32)}]",0.00022022546897374103,99.9958278209682 +aten::copy_,elementwise,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((3, 900), (3, 900), ())","('int', 'int', 'Scalar')","((900, 1), (1, 0), ())","('', '', 'False')",1,1,4.60595703125,4.60595703125,4.60595703125,4.60595703125,,,4.60595703125,4.60595703125,4.60595703125,4.60595703125,4.60595703125,4.60595703125,23467,"['aten::copy_', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]",0.00021832757213129786,99.99604614854033 +aten::replication_pad3d,elementwise,nn.Module: HunyuanVideoCausalConv3d,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((43200, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",1,1,4.56494140625,4.56494140625,4.56494140625,4.56494140625,,,4.56494140625,4.56494140625,4.56494140625,4.56494140625,4.56494140625,4.56494140625,23409,"['aten::replication_pad3d', 'nn.Module: HunyuanVideoCausalConv3d_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.565), 'mean_duration_us': np.float64(4.565), 'median_duration_us': np.float64(4.565), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.565)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.57)}]",0.00021638338512196582,99.99626253192545 +aten::copy_,elementwise,nn.Module: HunyuanVideoUpsampleCausal3D,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (1, 512, 2, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((921600, 1800, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', 'False')",1,1,4.48486328125,4.48486328125,4.48486328125,4.48486328125,,,4.48486328125,4.48486328125,4.48486328125,4.48486328125,4.48486328125,4.48486328125,23752,"['aten::copy_', 'nn.Module: HunyuanVideoUpsampleCausal3D_0', 'nn.Module: HunyuanVideoUpBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.485), 'mean_duration_us': np.float64(4.485), 'median_duration_us': np.float64(4.485), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.485), 'max_duration_us': np.float64(4.485)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}]",0.0002125875914370795,99.99647511951689 +aten::bitwise_and,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 1, 351))","('bool', 'bool')","((123201, 123201, 351, 1), (351, 351, 351, 1))","('', '')",1,1,4.44482421875,4.44482421875,4.44482421875,4.44482421875,,,4.44482421875,4.44482421875,4.44482421875,4.44482421875,4.44482421875,4.44482421875,114,"['aten::bitwise_and', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.445), 'mean_duration_us': np.float64(4.445), 'median_duration_us': np.float64(4.445), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.44)}]",0.00021068969459463633,99.99668580921148 +aten::arange,other,nn.Module: HunyuanVideoMidBlock3D,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '4', '1', '')",1,1,4.40576171875,4.40576171875,4.40576171875,4.40576171875,,,4.40576171875,4.40576171875,4.40576171875,4.40576171875,4.40576171875,4.40576171875,23456,"['aten::arange', 'nn.Module: HunyuanVideoMidBlock3D_0', 'nn.Module: HunyuanVideoDecoder3D_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.406), 'mean_duration_us': np.float64(4.406), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.406)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.245), 'mean_duration_us': np.float64(4.245), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.245)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.24)}]",0.0002012233554658649,99.99709587065486 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1437696, 1437696, 1437696, 1437696, 4096, 1), ())","('', '', 'False')",1,1,4.0849609375,4.0849609375,4.0849609375,4.0849609375,,,4.0849609375,4.0849609375,4.0849609375,4.0849609375,4.0849609375,4.0849609375,7234,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.08)}]",0.00019363176809609223,99.99728950242296 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,1,4.044921875,4.044921875,4.044921875,4.044921875,,,4.044921875,4.044921875,4.044921875,4.044921875,4.044921875,4.044921875,7285,"['aten::gather', 'nn.Module: Embedding_1', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.045), 'mean_duration_us': np.float64(4.045), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.045)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(4.04)}]",0.00019173387125364904,99.9974812362942 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,1,3.884765625,3.884765625,3.884765625,3.884765625,,,3.884765625,3.884765625,3.884765625,3.884765625,3.884765625,3.884765625,8682,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.885), 'mean_duration_us': np.float64(3.885), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(3.885)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.88)}]",0.00018414228388387638,99.99766537857809 +aten::fill_,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), ())","('bool', 'Scalar')","((), ())","('', '1.')",1,1,3.76513671875,3.76513671875,3.76513671875,3.76513671875,,,3.76513671875,3.76513671875,3.76513671875,3.76513671875,3.76513671875,3.76513671875,94,"['aten::fill_', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.765), 'mean_duration_us': np.float64(3.765), 'median_duration_us': np.float64(3.765), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::F...', 'stream': 0, 'mean_duration_us': np.float64(3.76)}]",0.0001784717384399913,99.99784385031653 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,1,3.68408203125,3.68408203125,3.68408203125,3.68408203125,,,3.68408203125,3.68408203125,3.68408203125,3.68408203125,3.68408203125,3.68408203125,7273,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.684), 'mean_duration_us': np.float64(3.684), 'median_duration_us': np.float64(3.684), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(3.684)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.68)}]",0.00017462965458821608,99.99801847997112 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,1,3.64404296875,3.64404296875,3.64404296875,3.64404296875,,,3.64404296875,3.64404296875,3.64404296875,3.64404296875,3.64404296875,3.64404296875,8697,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.644), 'mean_duration_us': np.float64(3.644), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(3.644)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.64)}]",0.00017273175774577292,99.99819121172887 +aten::arange,other,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1,2,1.781005859375,1.781005859375,1.781005859375,1.781005859375,0.027966625623100757,0.027966625623100757,1.76123046875,1.76123046875,1.80078125,1.80078125,3.56201171875,3.56201171875,51,"['aten::arange', 'nn.Module: LlamaModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.562), 'mean_duration_us': np.float64(1.781), 'median_duration_us': np.float64(1.781), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.801)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",0.00016703806721844343,99.99852709317982 +aten::copy_,elementwise,nn.Module: LlamaModel,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 1, 351), ())","('long int', 'long int', 'Scalar')","((351, 351, 351, 1), (0, 0, 0, 0), ())","('', '', 'False')",1,1,3.44384765625,3.44384765625,3.44384765625,3.44384765625,,,3.44384765625,3.44384765625,3.44384765625,3.44384765625,3.44384765625,3.44384765625,111,"['aten::copy_', 'nn.Module: LlamaModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.444), 'mean_duration_us': np.float64(3.444), 'median_duration_us': np.float64(3.444), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.444), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]",0.00016324227353355704,99.99869033545335 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,1,3.36376953125,3.36376953125,3.36376953125,3.36376953125,,,3.36376953125,3.36376953125,3.36376953125,3.36376953125,3.36376953125,3.36376953125,7298,"['aten::gather', 'nn.Module: Embedding_2', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.364), 'mean_duration_us': np.float64(3.364), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}]",0.00015944647984867072,99.9988497819332 +aten::eq,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",1,1,3.00390625,3.00390625,3.00390625,3.00390625,,,3.00390625,3.00390625,3.00390625,3.00390625,3.00390625,3.00390625,10415,['aten::eq'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.004), 'mean_duration_us': np.float64(3.004), 'median_duration_us': np.float64(3.004), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(3.004)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]",0.00014238855335012662,99.99899217048656 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",1,1,3.0029296875,3.0029296875,3.0029296875,3.0029296875,,,3.0029296875,3.0029296875,3.0029296875,3.0029296875,3.0029296875,3.0029296875,8817,"['triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.003), 'mean_duration_us': np.float64(3.003), 'median_duration_us': np.float64(3.003), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.003)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]",0.00014234226318323776,99.99913451274975 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",1,1,2.962890625,2.962890625,2.962890625,2.962890625,,,2.962890625,2.962890625,2.962890625,2.962890625,2.962890625,2.962890625,8688,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.963), 'mean_duration_us': np.float64(2.963), 'median_duration_us': np.float64(2.963), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(2.963)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(2.96)}]",0.00014044436634079457,99.99927495711609 +triton_poi_fused_add_addmm_18,triton,nn.Module: xFuserHunyuanVideoTransformer3DWrapper,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",1,1,2.72314453125,2.72314453125,2.72314453125,2.72314453125,,,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,8825,"['triton_poi_fused_add_addmm_18', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper_0']","[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",0.00012908013036958,99.99940403724645 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), ())","('c10::BFloat16', 'double')","((1,), ())","('', '')",1,1,2.36181640625,2.36181640625,2.36181640625,2.36181640625,,,2.36181640625,2.36181640625,2.36181640625,2.36181640625,2.36181640625,2.36181640625,8701,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.362), 'mean_duration_us': np.float64(2.362), 'median_duration_us': np.float64(2.362), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.36)}]",0.00011195276862070262,99.99951599001507 +aten::fill_,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",1,1,2.203125,2.203125,2.203125,2.203125,,,2.203125,2.203125,2.203125,2.203125,2.203125,2.203125,8687,['aten::fill_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.203), 'mean_duration_us': np.float64(2.203), 'median_duration_us': np.float64(2.203), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.203)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]",0.00010443061650126321,99.99962042063157 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",1,1,2.2021484375,2.2021484375,2.2021484375,2.2021484375,,,2.2021484375,2.2021484375,2.2021484375,2.2021484375,2.2021484375,2.2021484375,8670,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]",0.00010438432633437435,99.9997248049579 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",1,1,2.08203125,2.08203125,2.08203125,2.08203125,,,2.08203125,2.08203125,2.08203125,2.08203125,2.08203125,2.08203125,8683,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.082), 'mean_duration_us': np.float64(2.082), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.08)}]",9.869063580704486e-05,99.99982349559372 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 256), (1, 1, 1, 256), ())","('long int', 'long int', 'Scalar')","((256, 256, 256, 1), (351, 351, 351, 1), ())","('', '', 'False')",1,1,1.8818359375,1.8818359375,1.8818359375,1.8818359375,,,1.8818359375,1.8818359375,1.8818359375,1.8818359375,1.8818359375,1.8818359375,7248,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.882), 'mean_duration_us': np.float64(1.882), 'median_duration_us': np.float64(1.882), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(1.882)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.88)}]",8.920115159482899e-05,99.99991269674531 +aten::arange,other,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1,1,1.841796875,1.841796875,1.841796875,1.841796875,,,1.841796875,1.841796875,1.841796875,1.841796875,1.841796875,1.841796875,8644,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.842), 'mean_duration_us': np.float64(1.842), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.842), 'max_duration_us': np.float64(1.842)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_ops.py(840): __call__', 'aiter::fmha_v3_fwd', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', 'aiter::fmha_fwd_hd128_bf16_rtz']",15.238958612902277,15.238958612902277 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7431, 15360), (15360, 3072), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((15360, 1), (1, 15360), (3072, 1))","('', '', '')",9539,160,5512.889,34.45555625,3.033314858082256,701.27714304,351.24609375,1904.0496446802122,matrix_bf16,0.30573069403779546,0.014837754018409713,582.1264193504992,28.251820266605336,1207.4557647705078,57.53356458370716,193192.92236328125,34.386,28.432,52.979,0.29550921283242176,0.2887118588299957,0.3345351970465984,562.6642116933019,549.721712220217,636.9716230696006,1246.35107421875,1100.955078125,1275.69482421875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(193192.92099999997), 'mean_duration_us': np.float64(1207.45575625), 'median_duration_us': np.float64(1246.351), 'std_dev_duration_us': np.float64(57.35348854611493), 'min_duration_us': np.float64(1100.955), 'max_duration_us': np.float64(1275.695)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1207.46)}]","{'M': 7431, 'N': 3072, 'K': 15360, 'bias': False, 'stride_A': (15360, 1), 'stride_B': (1, 15360), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",9.157604357143294,24.396562970045572 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16276,50,3989.842,79.79684,4.6734198349248945,866.3334912,511.5654296875,1615.0426749999522,matrix_bf16,0.14041879738583984,0.002815463026887009,226.7823501503031,4.547092938307056,3821.61697265625,76.71330912242925,191080.8486328125,78.9625,72.959,95.532,0.14041729213378512,0.13560797724565474,0.1454916944058098,226.7799191039981,219.01267032215492,234.9752953234347,3820.15087890625,3686.9130859375,3955.6318359375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(259.779), 'mean_duration_us': np.float64(5.19558), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(1.0004229523556527), 'min_duration_us': np.float64(4.366), 'max_duration_us': np.float64(11.816)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(10498.952), 'mean_duration_us': np.float64(209.97904), 'median_duration_us': np.float64(214.5575), 'std_dev_duration_us': np.float64(19.349372106567177), 'min_duration_us': np.float64(179.947), 'max_duration_us': np.float64(244.122)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(11850.718), 'mean_duration_us': np.float64(237.01436), 'median_duration_us': np.float64(236.5905), 'std_dev_duration_us': np.float64(6.365469421056075), 'min_duration_us': np.float64(219.525), 'max_duration_us': np.float64(248.408)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(12304.837000000001), 'mean_duration_us': np.float64(246.09674000000004), 'median_duration_us': np.float64(240.156), 'std_dev_duration_us': np.float64(17.29478605222973), 'min_duration_us': np.float64(215.68), 'max_duration_us': np.float64(294.397)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(17144.065), 'mean_duration_us': np.float64(342.88129999999995), 'median_duration_us': np.float64(360.83500000000004), 'std_dev_duration_us': np.float64(24.678367399202077), 'min_duration_us': np.float64(312.904), 'max_duration_us': np.float64(369.668)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(139022.499), 'mean_duration_us': np.float64(2780.4499800000003), 'median_duration_us': np.float64(2781.092), 'std_dev_duration_us': np.float64(63.67474031968724), 'min_duration_us': np.float64(2670.527), 'max_duration_us': np.float64(2930.994)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.2)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.98)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(237.01)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(246.1)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(342.88)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2780.45)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 19, 242, 242), 'filter_shape': (128, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (142427648, 1112716, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",9.057489221660337,33.45405219170591 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7431, 3072), (3072, 12288), (7431, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",9537,160,4792.07,29.9504375,7.644694694832572,561.021714432,289.705078125,1846.8160912565986,matrix_bf16,0.30119010525745527,0.008604641409019943,556.2427329167369,15.891190213670846,1009.4202178955078,29.21286359684354,161507.23486328125,28.903,23.615,96.313,0.3025098533578273,0.27670723168463385,0.3228666522131738,558.6800649449094,511.02736804224946,596.2753286374372,1004.19140625,940.876953125,1097.8310546875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(161507.23799999998), 'mean_duration_us': np.float64(1009.4202374999999), 'median_duration_us': np.float64(1004.1915), 'std_dev_duration_us': np.float64(29.121434685959308), 'min_duration_us': np.float64(940.877), 'max_duration_us': np.float64(1097.831)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1009.42)}]","{'M': 7431, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1']",7.655660153600202,41.109712345306114 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 19, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((284855296, 1112716, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16245,10,851.855,85.1855,4.375053707606856,3465.3339648,1024.818359375,3224.766584017366,matrix_bf16,0.10664031034759139,0.00041940503995421244,343.89010931815403,1.3524833580128082,10077.0046875,39.66313516513159,100770.046875,83.309,80.84,92.447,0.10664705315475578,0.10585398500263651,0.10735447379738569,343.9118532973803,341.35439362157763,346.1931197465772,10076.227294921875,10009.8291015625,10151.71923828125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.512), 'mean_duration_us': np.float64(5.6512), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.069073019494479), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(11.856)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4136.057), 'mean_duration_us': np.float64(413.60569999999996), 'median_duration_us': np.float64(415.7165), 'std_dev_duration_us': np.float64(16.783204271234982), 'min_duration_us': np.float64(379.804), 'max_duration_us': np.float64(437.409)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4484.494), 'mean_duration_us': np.float64(448.44939999999997), 'median_duration_us': np.float64(449.026), 'std_dev_duration_us': np.float64(2.4529009030126034), 'min_duration_us': np.float64(442.256), 'max_duration_us': np.float64(451.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(5357.794000000001), 'mean_duration_us': np.float64(535.7794000000001), 'median_duration_us': np.float64(535.4145), 'std_dev_duration_us': np.float64(1.8377387300701893), 'min_duration_us': np.float64(533.352), 'max_duration_us': np.float64(539.681)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(7224.526), 'mean_duration_us': np.float64(722.4526), 'median_duration_us': np.float64(722.553), 'std_dev_duration_us': np.float64(1.0228248334881278), 'min_duration_us': np.float64(720.429), 'max_duration_us': np.float64(723.914)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(79510.663), 'mean_duration_us': np.float64(7951.0663), 'median_duration_us': np.float64(7951.6545), 'std_dev_duration_us': np.float64(43.127390136779646), 'min_duration_us': np.float64(7868.292), 'max_duration_us': np.float64(8023.562)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(413.61)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(448.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(535.78)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(722.45)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(7951.07)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 19, 242, 242), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (284855296, 1112716, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",4.776635753750709,45.886348099056825 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 19, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((284855296, 1112716, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16260,10,800.2570000000001,80.0257,6.121166629001375,1732.6669824,784.068359375,2107.4693044840737,matrix_bf16,0.10085296458425237,0.0011612908331801054,212.54452712753127,2.4473847845058123,8152.997607421875,94.45440830871685,81529.97607421875,77.6505,76.433,96.483,0.10117379150016818,0.09892535724232875,0.10247278481319881,213.22066000487615,208.48215382332907,215.95824853881825,8126.16943359375,8023.1572265625,8310.86474609375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.385000000000005), 'mean_duration_us': np.float64(5.038500000000001), 'median_duration_us': np.float64(5.0265), 'std_dev_duration_us': np.float64(0.08560519844028162), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.207)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1999.924), 'mean_duration_us': np.float64(199.9924), 'median_duration_us': np.float64(193.3865), 'std_dev_duration_us': np.float64(18.92179609973641), 'min_duration_us': np.float64(177.303), 'max_duration_us': np.float64(230.181)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2352.646), 'mean_duration_us': np.float64(235.26460000000003), 'median_duration_us': np.float64(238.3735), 'std_dev_duration_us': np.float64(6.350920062479137), 'min_duration_us': np.float64(225.775), 'max_duration_us': np.float64(243.681)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2429.52), 'mean_duration_us': np.float64(242.952), 'median_duration_us': np.float64(241.21699999999998), 'std_dev_duration_us': np.float64(6.450974639540913), 'min_duration_us': np.float64(236.39), 'max_duration_us': np.float64(257.262)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(6880.575), 'mean_duration_us': np.float64(688.0575), 'median_duration_us': np.float64(721.2909999999999), 'std_dev_duration_us': np.float64(42.31107712939958), 'min_duration_us': np.float64(634.902), 'max_duration_us': np.float64(723.795)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67816.927), 'mean_duration_us': np.float64(6781.6927), 'median_duration_us': np.float64(6761.807000000001), 'std_dev_duration_us': np.float64(73.52589039250037), 'min_duration_us': np.float64(6714.697), 'max_duration_us': np.float64(6961.744)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.04)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(199.99)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(235.26)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(242.95)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(688.06)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(6781.69)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 19, 242, 242), 'filter_shape': (128, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (284855296, 1112716, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",3.8646305206311147,49.75097861968794 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7431, 3072), (3072, 3072), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",9520,320,11256.682999999999,35.177134374999994,9.428809262595857,140.255428608,105.08203125,1272.8912679826028,matrix_bf16,0.43626116717929675,0.012184683825149784,555.3130302624253,15.509777644162014,252.77703704833985,7.451328398150328,80888.65185546875,34.230999999999995,28.232,161.29,0.43837516485944705,0.36960194152851344,0.46564719534480625,558.0039194500241,470.4630840010613,592.7182489149932,251.35205078125,236.630859375,298.1220703125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(80888.65), 'mean_duration_us': np.float64(252.77703125), 'median_duration_us': np.float64(251.352), 'std_dev_duration_us': np.float64(7.439677096001779), 'min_duration_us': np.float64(236.631), 'max_duration_us': np.float64(298.122)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(252.78)}]","{'M': 7431, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",3.8342308901057125,53.58520950979366 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 12288), (7425, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",8875,80,2000.052,25.00065,5.070851682640873,560.5687296,289.529296875,1846.4452674397426,matrix_bf16,0.3025589960428053,0.010581083772321654,558.6586263645576,19.53739205578678,1004.6925109863281,36.9064864035743,80375.40087890625,24.311,21.191,64.486,0.3058533118342575,0.2707305152775909,0.3180661008096943,564.7414001671366,499.88907868583067,587.2916465730721,992.614013671875,954.498046875,1121.38623046875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(80375.40100000001), 'mean_duration_us': np.float64(1004.6925125000001), 'median_duration_us': np.float64(992.614), 'std_dev_duration_us': np.float64(36.675073389154164), 'min_duration_us': np.float64(954.498), 'max_duration_us': np.float64(1121.386)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1004.69)}]","{'M': 7425, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1']",3.8099021035136307,57.395111613307286 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 12288), (12288, 3072), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",8877,80,2404.302,30.053775,7.303010896285575,560.5687296,289.529296875,1846.4452674397426,matrix_bf16,0.3337977483088363,0.010331168727461508,616.3392726468932,19.075937603942798,910.4198913574219,29.694066302401396,72833.59130859375,29.033,25.478,91.456,0.3363766071422527,0.2963851478642718,0.346543745032391,621.1009943352501,547.2589536134129,639.8740579759032,902.54052734375,876.06103515625,1024.32080078125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(72833.59099999999), 'mean_duration_us': np.float64(910.4198874999998), 'median_duration_us': np.float64(902.5405), 'std_dev_duration_us': np.float64(29.507910684676464), 'min_duration_us': np.float64(876.061), 'max_duration_us': np.float64(1024.321)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(910.42)}]","{'M': 7425, 'N': 3072, 'K': 12288, 'bias': False, 'stride_A': (12288, 1), 'stride_B': (1, 12288), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",3.4524101864341397,60.84752179974143 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 3072), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8851,240,7973.796,33.22415,7.790864100027969,140.1421824,105.01171875,1272.715098761299,matrix_bf16,0.42535100150554706,0.022625503217407618,541.3506418893498,28.795819561867024,259.62062581380206,14.086526150668012,62308.9501953125,30.11,25.258,102.852,0.43372591410672456,0.3688598431137783,0.472534503535979,552.0095196076746,469.4534916576296,601.4017973359149,253.87646484375,233.02587890625,298.52197265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(62308.951), 'mean_duration_us': np.float64(259.6206291666667), 'median_duration_us': np.float64(253.8765), 'std_dev_duration_us': np.float64(14.057132431615726), 'min_duration_us': np.float64(233.026), 'max_duration_us': np.float64(298.522)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(259.62)}]","{'M': 7425, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",2.9535280424230907,63.80104984216452 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 11, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((41913344, 163724, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16132,50,3918.451,78.36902,4.7933404205571435,458.6471424,146.599609375,2983.6368723271025,matrix_bf16,0.13470407943452864,0.002341337792543414,401.90805825373866,6.985701768405475,1141.511875,19.821049310902435,57075.59375,76.874,72.598,91.406,0.13462904760224562,0.1306102749551004,0.13895815630815297,401.6841905123407,389.69363226081873,414.60067887159823,1141.81103515625,1106.23828125,1176.94287109375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(284.251), 'mean_duration_us': np.float64(5.68502), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.2562962730903437), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(6.328)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2293.155), 'mean_duration_us': np.float64(45.8631), 'median_duration_us': np.float64(45.647000000000006), 'std_dev_duration_us': np.float64(0.7717818927650476), 'min_duration_us': np.float64(44.746), 'max_duration_us': np.float64(49.032)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2980.0209999999997), 'mean_duration_us': np.float64(59.60041999999999), 'median_duration_us': np.float64(59.4275), 'std_dev_duration_us': np.float64(1.4246100110556579), 'min_duration_us': np.float64(57.084), 'max_duration_us': np.float64(62.932)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(3725.125), 'mean_duration_us': np.float64(74.5025), 'median_duration_us': np.float64(73.549), 'std_dev_duration_us': np.float64(4.626893023401341), 'min_duration_us': np.float64(66.658), 'max_duration_us': np.float64(92.376)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(5527.164999999999), 'mean_duration_us': np.float64(110.54329999999999), 'median_duration_us': np.float64(110.483), 'std_dev_duration_us': np.float64(0.8136805331332437), 'min_duration_us': np.float64(108.441), 'max_duration_us': np.float64(112.446)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(42265.876), 'mean_duration_us': np.float64(845.31752), 'median_duration_us': np.float64(843.492), 'std_dev_duration_us': np.float64(18.263799995882565), 'min_duration_us': np.float64(814.89), 'max_duration_us': np.float64(884.273)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(45.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.6)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(74.5)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(110.54)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(845.32)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 11, 122, 122), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (41913344, 163724, 14884, 122, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",2.7054599082501465,66.50650975041466 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16101,10,874.301,87.43010000000001,3.996066105837366,1834.5885696,299.94921875,5832.987354630341,matrix_bf16,0.06489794240066861,0.0006912762170342854,378.54887736462825,4.0322054325176895,4846.8685546875,51.832171123411534,48468.685546875,86.3335,82.613,94.31,0.06498734068058426,0.06353017272671413,0.06601126161214645,379.0703364009019,370.57069415240494,385.04285424684554,4839.705810546875,4764.634765625,4950.71142578125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(154.176), 'mean_duration_us': np.float64(15.417599999999998), 'median_duration_us': np.float64(15.3615), 'std_dev_duration_us': np.float64(0.2204292176640837), 'min_duration_us': np.float64(15.181), 'max_duration_us': np.float64(15.902)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1104.153), 'mean_duration_us': np.float64(110.4153), 'median_duration_us': np.float64(110.684), 'std_dev_duration_us': np.float64(1.8032592187480978), 'min_duration_us': np.float64(106.077), 'max_duration_us': np.float64(112.887)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1168.2030000000002), 'mean_duration_us': np.float64(116.82030000000002), 'median_duration_us': np.float64(117.253), 'std_dev_duration_us': np.float64(1.4732819180319825), 'min_duration_us': np.float64(113.688), 'max_duration_us': np.float64(118.575)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1350.437), 'mean_duration_us': np.float64(135.0437), 'median_duration_us': np.float64(135.18), 'std_dev_duration_us': np.float64(5.218896589318471), 'min_duration_us': np.float64(127.428), 'max_duration_us': np.float64(144.173)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1926.133), 'mean_duration_us': np.float64(192.6133), 'median_duration_us': np.float64(192.7255), 'std_dev_duration_us': np.float64(0.6498398341129935), 'min_duration_us': np.float64(191.284), 'max_duration_us': np.float64(193.526)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(42765.581999999995), 'mean_duration_us': np.float64(4276.5581999999995), 'median_duration_us': np.float64(4272.6685), 'std_dev_duration_us': np.float64(45.89578744677992), 'min_duration_us': np.float64(4200.241), 'max_duration_us': np.float64(4375.661)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.42)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(110.42)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(116.82)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(135.04)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(192.61)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4276.56)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 11, 122, 122), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (83826688, 163724, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",2.2974808834582405,68.8039906338729 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((13776896, 26908, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15967,70,5477.071,78.24387142857142,5.3537215606012944,254.803968,57.35546875,4236.736361778928,matrix_bf16,0.09783072634000399,0.0028117242507438352,414.4829955839384,11.912534372422018,615.2607770647321,18.013305998583167,43068.25439453125,77.0595,72.338,102.152,0.0976753858954719,0.08707333284130545,0.10356088484110622,413.8248590741344,368.9067553900381,438.76016646431486,615.72900390625,580.736328125,690.7001953125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(991.0010000000001), 'mean_duration_us': np.float64(14.157157142857145), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.8864840766552241), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(15.822)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1184.9680000000003), 'mean_duration_us': np.float64(16.92811428571429), 'median_duration_us': np.float64(17.245), 'std_dev_duration_us': np.float64(1.3201695079783953), 'min_duration_us': np.float64(14.18), 'max_duration_us': np.float64(19.387)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1536.7740000000003), 'mean_duration_us': np.float64(21.95391428571429), 'median_duration_us': np.float64(21.992), 'std_dev_duration_us': np.float64(0.8931553175257314), 'min_duration_us': np.float64(20.509), 'max_duration_us': np.float64(23.554)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1584.885), 'mean_duration_us': np.float64(22.641214285714284), 'median_duration_us': np.float64(22.5325), 'std_dev_duration_us': np.float64(1.2201986828013724), 'min_duration_us': np.float64(19.508), 'max_duration_us': np.float64(25.797)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1747.1659999999997), 'mean_duration_us': np.float64(24.95951428571428), 'median_duration_us': np.float64(24.976), 'std_dev_duration_us': np.float64(0.4623428765647894), 'min_duration_us': np.float64(23.915), 'max_duration_us': np.float64(25.878)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(36023.46), 'mean_duration_us': np.float64(514.6208571428572), 'median_duration_us': np.float64(513.7625), 'std_dev_duration_us': np.float64(19.46001120634365), 'min_duration_us': np.float64(479.151), 'max_duration_us': np.float64(598.088)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.16)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.93)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(21.95)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.64)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(24.96)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(514.62)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 62, 62), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (13776896, 26908, 3844, 62, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['batched_transpose_32x16_half'], ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",2.0414931834628964,70.84548381733579 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (7431, 3072), (3072, 3072), (), (), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",9527,160,6761.297,42.25810625,9.75039884854056,140.27825664,105.087890625,1273.0274602732088,matrix_bf16,0.41395263894935147,0.02238309389279187,526.9730766350855,28.49429317139764,266.93495788574216,13.759746043159826,42709.59326171875,41.852,33.921,133.618,0.4014789469650569,0.3837525727588242,0.47459170773459397,511.0937242080887,488.5275630724757,604.1682763640952,274.466796875,232.18408203125,287.14501953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(42709.591), 'mean_duration_us': np.float64(266.93494375), 'median_duration_us': np.float64(274.467), 'std_dev_duration_us': np.float64(13.71668299883707), 'min_duration_us': np.float64(232.184), 'max_duration_us': np.float64(287.145)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(266.93)}]","{'M': 7431, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",2.024492163382018,72.86997598071781 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((125337600, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16274,60,462.069,7.70115,1.1481258985031038,0.142427648,510.7216796875,0.26595618562122,vector_bf16,0.7838312785748368,0.09666518608536541,0.20846477702036748,0.025708704173629218,692.0326985677083,72.95844708347023,41521.9619140625,7.5065,6.76,16.044,0.7514577394990287,0.6857336134840059,1.026522544603338,0.1998548340527061,0.18237509619446218,0.27301002041689243,712.657958984375,521.69384765625,780.9599609375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(41521.96300000001), 'mean_duration_us': np.float64(692.0327166666668), 'median_duration_us': np.float64(712.658), 'std_dev_duration_us': np.float64(72.34788857575403), 'min_duration_us': np.float64(521.694), 'max_duration_us': np.float64(780.96)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(692.03)}]","{'input_shape': (1, 128, 17, 240, 240), 'output_shape': (1, 128, 19, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 128, 19, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (125337600, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",1.968196840184174,74.83817282090199 -triton_poi_fused_addmm_cat_gelu_slice_view_25,triton,python3,CPU,thread 416 (python3),"((1, 7431, 24, 128), (7431, 12288), (12288,), (1, 7431, 15360), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 128, 1), (12288, 1), (1,), (114140160, 15360, 1), ())","('', '', '', '', '114140160')",9538,160,4101.407,25.633793750000002,2.703069659872682,0.91312128,653.138671875,1.3332854874449398,vector_bfloat16,4.091406793050248,0.16754211734136887,5.455013300407538,0.22338147358704402,167.68397216796876,7.21141663148745,26829.435546875,25.358,21.452,48.572,4.119588740712893,3.409701591872753,4.371336820983346,5.4925878822340755,4.546105648961851,5.828239944150793,166.24609375,156.671875,200.85791015625,"[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(26829.435999999998), 'mean_duration_us': np.float64(167.68397499999998), 'median_duration_us': np.float64(166.246), 'std_dev_duration_us': np.float64(7.188836548731304), 'min_duration_us': np.float64(156.672), 'max_duration_us': np.float64(200.858)}]","[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'mean_duration_us': np.float64(167.68)}]","{'fused_ops': 'aten.addmm, aten.cat, aten.gelu, aten.slice, aten.view', 'xnumel': 114140160, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_cat_gelu_slice_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_cat_gelu_slice_view_25']",1.2717513294910165,76.109924150393 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16116,10,827.941,82.7941,5.741154151291261,917.2942848,229.91796875,3804.835284323553,matrix_bf16,0.09397070389896388,0.0020009664859535667,357.5430498874986,7.613347888505033,2566.5841796875,54.01344552258528,25665.841796875,84.255,74.802,95.061,0.09387920128981073,0.09185037295287894,0.09718717881595605,357.19489753158507,349.47553988939154,369.7812071428121,2568.050048828125,2480.640625,2624.77392578125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(94.812), 'mean_duration_us': np.float64(9.4812), 'median_duration_us': np.float64(9.3125), 'std_dev_duration_us': np.float64(0.4950209692528186), 'min_duration_us': np.float64(8.972), 'max_duration_us': np.float64(10.615)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(485.51099999999997), 'mean_duration_us': np.float64(48.5511), 'median_duration_us': np.float64(48.531), 'std_dev_duration_us': np.float64(0.7159562067612792), 'min_duration_us': np.float64(47.189), 'max_duration_us': np.float64(49.633)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(596.274), 'mean_duration_us': np.float64(59.6274), 'median_duration_us': np.float64(59.186499999999995), 'std_dev_duration_us': np.float64(2.106466339631375), 'min_duration_us': np.float64(56.042), 'max_duration_us': np.float64(62.932)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(772.2969999999999), 'mean_duration_us': np.float64(77.2297), 'median_duration_us': np.float64(76.95349999999999), 'std_dev_duration_us': np.float64(4.776871717976106), 'min_duration_us': np.float64(68.501), 'max_duration_us': np.float64(85.406)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2167.893), 'mean_duration_us': np.float64(216.7893), 'median_duration_us': np.float64(217.042), 'std_dev_duration_us': np.float64(1.0544313206653126), 'min_duration_us': np.float64(214.598), 'max_duration_us': np.float64(218.403)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(21549.053000000004), 'mean_duration_us': np.float64(2154.9053000000004), 'median_duration_us': np.float64(2156.604), 'std_dev_duration_us': np.float64(45.69621782390749), 'min_duration_us': np.float64(2076.445), 'max_duration_us': np.float64(2205.356)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.48)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(48.55)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.63)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(77.23)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2154.91)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 11, 122, 122), 'filter_shape': (256, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (83826688, 163724, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",1.2165954207517327,77.32651957114473 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((3670016, 7168, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15628,100,7950.537,79.50537,7.138073697731232,63.700992,24.89453125,2440.294994508081,matrix_bf16,0.10552178126518877,0.007005568970964542,257.50427463301673,17.0956548935259,248.611943359375,18.835214182166514,24861.1943359375,77.64500000000001,71.056,101.44,0.1086339268471194,0.08154627887721824,0.11150610561883527,265.0988279187825,198.99697616483573,272.10779139873307,240.29150390625,234.10205078125,320.1103515625,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(496.76199999999994), 'mean_duration_us': np.float64(4.967619999999999), 'median_duration_us': np.float64(4.887), 'std_dev_duration_us': np.float64(0.22438590775714945), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.767)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(605.4789999999999), 'mean_duration_us': np.float64(6.05479), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.2873086248270316), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(6.809)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(731.9480000000001), 'mean_duration_us': np.float64(7.319480000000001), 'median_duration_us': np.float64(7.289), 'std_dev_duration_us': np.float64(0.4345492947871392), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(8.411)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(763.6749999999998), 'mean_duration_us': np.float64(7.636749999999998), 'median_duration_us': np.float64(7.57), 'std_dev_duration_us': np.float64(0.49094399629692986), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.372)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1294.3890000000001), 'mean_duration_us': np.float64(12.943890000000001), 'median_duration_us': np.float64(12.818), 'std_dev_duration_us': np.float64(0.5245689639122774), 'min_duration_us': np.float64(12.218), 'max_duration_us': np.float64(15.101)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(20968.936999999998), 'mean_duration_us': np.float64(209.68936999999997), 'median_duration_us': np.float64(201.819), 'std_dev_duration_us': np.float64(17.316049904441257), 'min_duration_us': np.float64(196.571), 'max_duration_us': np.float64(275.408)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.32)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.64)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(209.69)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 32, 32), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (3670016, 7168, 1024, 32, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",1.1784540488831015,78.50497362002783 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16243,20,148.691,7.43455,0.31294685524946,0.284855296,1021.443359375,0.26595618562122,vector_bf16,0.908679631279201,0.0780387641432326,0.24166896868671292,0.020754892042128183,1187.0187744140626,101.97322723391864,23740.37548828125,7.391,6.98,8.333,0.9068447149482133,0.8168137523588936,0.9965992607129973,0.24118096133838932,0.21723666994032714,0.26505173797215653,1186.641845703125,1074.7158203125,1311.26708984375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(23740.376000000004), 'mean_duration_us': np.float64(1187.0188000000003), 'median_duration_us': np.float64(1186.642), 'std_dev_duration_us': np.float64(99.39126225911411), 'min_duration_us': np.float64(1074.716), 'max_duration_us': np.float64(1311.267)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1187.02)}]","{'input_shape': (1, 256, 17, 240, 240), 'output_shape': (1, 256, 19, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 19, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",1.1253257280455258,79.63029934807335 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16366,10,848.62,84.862,4.205663218935997,20.3046912,277.281982421875,69.83527141167883,matrix_bf16,0.1307241703155456,0.009243006872590666,9.129157914052655,0.6454878936073826,2233.801171875,151.6748699935203,22338.01171875,85.8825,77.945,92.448,0.1269450126248617,0.12135707718705067,0.14623632530921743,8.865239411016208,8.47500442308574,10.212453468215758,2290.57763671875,1988.228515625,2395.83251953125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.868), 'mean_duration_us': np.float64(5.0868), 'median_duration_us': np.float64(5.1265), 'std_dev_duration_us': np.float64(0.12902774895347116), 'min_duration_us': np.float64(4.847), 'max_duration_us': np.float64(5.247)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67.61), 'mean_duration_us': np.float64(6.761), 'median_duration_us': np.float64(6.7285), 'std_dev_duration_us': np.float64(0.28540567618742285), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(88.96000000000001), 'mean_duration_us': np.float64(8.896), 'median_duration_us': np.float64(8.992), 'std_dev_duration_us': np.float64(0.3516822429409821), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(9.413)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(120.88999999999999), 'mean_duration_us': np.float64(12.088999999999999), 'median_duration_us': np.float64(12.578), 'std_dev_duration_us': np.float64(1.3635438386791976), 'min_duration_us': np.float64(9.774), 'max_duration_us': np.float64(13.819)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3541.25), 'mean_duration_us': np.float64(354.125), 'median_duration_us': np.float64(363.59900000000005), 'std_dev_duration_us': np.float64(19.5954072884439), 'min_duration_us': np.float64(314.626), 'max_duration_us': np.float64(368.547)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(18468.433), 'mean_duration_us': np.float64(1846.8433), 'median_duration_us': np.float64(1894.7145), 'std_dev_duration_us': np.float64(127.35508833890387), 'min_duration_us': np.float64(1639.595), 'max_duration_us': np.float64(1996.765)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.09)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(6.76)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(8.9)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.09)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(354.12)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1846.84)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 19, 242, 242), 'filter_shape': (3, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (142427648, 1112716, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['batched_transpose_4x256_half'], ['batched_transpose_256x4_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",1.0588517992438768,80.68915114731723 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (7425, 3072), (3072, 3072), (), (), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",8860,80,2984.279,37.3034875,4.402219819774329,140.164992,105.017578125,1272.8512246833677,matrix_bf16,0.41679834117082637,0.013199277685953581,530.5222790052825,16.80071676750187,264.46404418945315,8.391238658426342,21157.12353515625,36.269000000000005,30.686,58.657,0.4161519166517704,0.382641480754548,0.4468281125136462,529.6994767645367,487.04567739308374,568.7457102359523,264.6123046875,246.44580078125,287.7861328125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(21157.122), 'mean_duration_us': np.float64(264.464025), 'median_duration_us': np.float64(264.6125), 'std_dev_duration_us': np.float64(8.338616556382423), 'min_duration_us': np.float64(246.446), 'max_duration_us': np.float64(287.786)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(264.46)}]","{'M': 7425, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",1.0028761110918945,81.69202725840913 -triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22,triton,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), ())","('', '', '', '', '', '22809600')",9524,320,5719.904,17.8747,2.484506516538245,0.1824768,130.558837890625,1.3329119675972243,vector_bfloat16,2.5064777741006186,0.14062752710123103,3.340914221615166,0.1874441138468333,54.79553985595703,3.1640130472265944,17534.57275390625,17.731,14.352,42.193,2.5484860726363174,2.1493577329295874,2.7561042139037437,3.396907585471796,2.864904644869485,3.6736442906574394,53.718505859375,49.671875,63.69384765625,"[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(17534.569), 'mean_duration_us': np.float64(54.795528125), 'median_duration_us': np.float64(53.718500000000006), 'std_dev_duration_us': np.float64(3.159070109297827), 'min_duration_us': np.float64(49.672), 'max_duration_us': np.float64(63.694)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(54.8)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.neg, aten.pow, aten.rsqrt, aten.slice, aten.stack, aten.transpose, aten.unbind, aten.view', 'xnumel': 22809600, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22']",0.8311623318677911,82.52318959027691 -triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23,triton,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",9526,160,3854.271,24.08919375,5.261794475327747,0.159796224,304.72900390625,0.5000953395771409,vector_bfloat16,3.0651079233980463,0.41141587274173846,1.5328461877923314,0.2057471605862055,105.94866638183593,12.854668591841357,16951.78662109375,23.1295,21.061,71.376,2.8255271001334172,2.5931334050301356,4.84013337692211,1.4130329346256358,1.2968139307573734,2.4205281447305165,113.08740234375,66.01708984375,123.22216796875,"[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(16951.782), 'mean_duration_us': np.float64(105.94863749999999), 'median_duration_us': np.float64(113.0875), 'std_dev_duration_us': np.float64(12.814423365141865), 'min_duration_us': np.float64(66.017), 'max_duration_us': np.float64(123.222)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(105.95)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.cat, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.slice, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23']",0.8035374853473226,83.32672707562423 -aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 1, 4500, 512), (1, 1, 4500, 512), (1, 1, 4500, 512), (1, 1, 4500, 4500), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', '')","((2304000, 512, 512, 1), (2304000, 512, 512, 1), (2304000, 512, 512, 1), (20268000, 20268000, 4504, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '')",15759,10,440.464,44.0464,4.535675576287763,41.472,17.578125,2250.0,matrix_bf16,0.012236119129099315,0.0004504971629313214,27.531268040473456,1.0136186165954741,1508.128369140625,53.426057449049196,15081.28369140625,42.0775,40.811,54.12,0.012142090365408744,0.01166650781141347,0.01329775029758015,27.31970332216968,26.249642575680312,29.91993816955534,1518.034912109375,1386.09912109375,1579.9072265625,"[{'name': 'attn_fwd', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(15081.283999999998), 'mean_duration_us': np.float64(1508.1283999999998), 'median_duration_us': np.float64(1518.035), 'std_dev_duration_us': np.float64(50.684445699247824), 'min_duration_us': np.float64(1386.099), 'max_duration_us': np.float64(1579.907)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1508.13)}]","{'B': 1, 'N_Q': 4500, 'H_Q': 1, 'N_KV': 4500, 'H_KV': 1, 'd_h_qk': 512, 'd_h_v': 512, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.7148731307249235,84.04160020634916 -triton_poi_fused_addmm_gelu_view_12,triton,python3,CPU,thread 416 (python3),"((1, 7425, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((91238400, 12288, 1), (1,), ())","('', '', '91238400')",8876,80,1726.359,21.5794875,1.7179482684313658,0.7299072,348.0703125,1.9998653289340784,vector_bfloat16,1.9651274948954942,0.23310559040622872,3.9299903439765793,0.46617978823412554,187.95579833984374,19.109414108015883,15036.4638671875,21.106499999999997,19.339,28.162,1.8839925537940818,1.7232701126629382,2.581007660228034,3.7677313883027557,3.446308150702933,5.161667733403314,193.726318359375,141.4091796875,211.7939453125,"[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(15036.464), 'mean_duration_us': np.float64(187.9558), 'median_duration_us': np.float64(193.7265), 'std_dev_duration_us': np.float64(18.989619966181525), 'min_duration_us': np.float64(141.409), 'max_duration_us': np.float64(211.794)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'mean_duration_us': np.float64(187.96)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 91238400, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_12']",0.712748610775998,84.75434881712516 -aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((29491200, 115200, 14400, 120, 1), (), ())","('', '', '[2., 2., 2.]')",16233,10,89.644,8.964400000000001,0.311834429002173,,,,,,,,,1476.82578125,29.202630242023886,14768.2578125,8.8935,8.462,9.394,,,,,,,1479.277587890625,1430.48486328125,1511.56494140625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(14768.257999999998), 'mean_duration_us': np.float64(1476.8257999999998), 'median_duration_us': np.float64(1479.2775000000001), 'std_dev_duration_us': np.float64(27.70397874241174), 'min_duration_us': np.float64(1430.485), 'max_duration_us': np.float64(1511.565)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(1476.83)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.7000352830568803,85.45438410018204 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16267,60,1903.483,31.724716666666666,2.833410020115409,0.626688768,478.12646484375,1.249997702212922,vector_bf16,2.1359021307850927,0.15045958358168715,2.6698727556330506,0.1880741337530221,235.86919759114582,16.57849384939928,14152.15185546875,30.991,29.534,48.593,2.135899005467487,1.7784935087307843,2.5324364588417225,2.669868848993225,2.223112799314078,3.1655397545523827,234.7265625,197.97216796875,281.89697265625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(3840.8520000000003), 'mean_duration_us': np.float64(64.0142), 'median_duration_us': np.float64(61.6105), 'std_dev_duration_us': np.float64(6.60053405112041), 'min_duration_us': np.float64(53.398), 'max_duration_us': np.float64(97.223)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10311.298999999999), 'mean_duration_us': np.float64(171.8549833333333), 'median_duration_us': np.float64(173.136), 'std_dev_duration_us': np.float64(12.893305696486665), 'min_duration_us': np.float64(144.574), 'max_duration_us': np.float64(211.113)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.85)}]","{'op_shape': (1, 128, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (125337600, 979200, 57600, 240, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.6708310320545483,86.12521513223659 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",16284,10,81.792,8.1792,0.2903759249279759,0.2506752,956.25,0.25,vector_bf16,0.7374241374611621,0.020176188168316452,0.1843560343652905,0.005044047042079107,1360.63681640625,36.685556845731355,13606.3681640625,8.167000000000002,7.772,8.853,0.737490059194964,0.7046222096561455,0.7816591851836063,0.18437251479874098,0.17615555241403633,0.19541479629590153,1359.61962890625,1282.78515625,1423.033203125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(13606.367), 'mean_duration_us': np.float64(1360.6367), 'median_duration_us': np.float64(1359.6195), 'std_dev_duration_us': np.float64(34.80297067794641), 'min_duration_us': np.float64(1282.785), 'max_duration_us': np.float64(1423.033)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1360.64)}]","{'input_shape': (1, 256, 17, 240, 240), 'output_shape': (1, 256, 17, 240, 240), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 256, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.6449601510236106,86.7701752832602 -triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5,triton,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (128,), (1, 24, 7425, 1), (1, 24, 7425, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (178200, 1, 24, 178200), (22809600, 950400, 128, 2, 1), (), ())","('', '', '', '', '', '178200', '128')",8852,160,3541.497,22.13435625,2.4503502851809738,0.1824768,87.017822265625,1.999859718033247,vector_bfloat16,1.1371204512615098,0.06969034651303442,2.2740813850296813,0.13937091672719626,80.52618713378907,4.722485689939179,12884.18994140625,21.7925,18.388,38.938,1.1383089495869982,0.9392732401445583,1.4191602904097937,2.2764582149557757,1.8784147171916703,2.838121498222911,80.158203125,64.294921875,97.14404296875,"[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(12884.190999999999), 'mean_duration_us': np.float64(80.52619374999999), 'median_duration_us': np.float64(80.158), 'std_dev_duration_us': np.float64(4.7077055272405195), 'min_duration_us': np.float64(64.295), 'max_duration_us': np.float64(97.144)}]","[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack...', 'stream': 0, 'mean_duration_us': np.float64(80.53)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.neg, aten.pow, aten.rsqrt, aten.stack, aten.transpose, aten.unbind, aten.view', 'xnumel': 178200, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5']",0.6107279319674955,87.38090321522769 -triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8,triton,python3,CPU,thread 416 (python3),"((1, 24, 7431, 128), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 951168, 128, 1), (22828032, 3072, 128, 1), ())","('', '', '22828032')",8862,480,8773.778,18.278704166666667,3.486732812179859,0.0,130.623046875,0.0,vector_bfloat16,5.568541021673587,0.6030641754204771,0.0,0.0,24.869404093424478,2.5455756263902543,11937.31396484375,19.038,13.32,37.435,5.40160707893166,3.820268528143598,7.321749248694926,0.0,0.0,0.0,25.35693359375,18.70703125,35.85302734375,"[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'count': 480, 'total_duration_us': np.float64(11937.310000000001), 'mean_duration_us': np.float64(24.869395833333336), 'median_duration_us': np.float64(25.357), 'std_dev_duration_us': np.float64(2.5429265222343016), 'min_duration_us': np.float64(18.707), 'max_duration_us': np.float64(35.853)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'mean_duration_us': np.float64(24.87)}]","{'fused_ops': '', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8']",0.5658447371663018,87.94674795239399 -triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",9562,152,3587.546,23.60227631578947,3.6469713520055573,0.045656064,130.6640625,0.33322869955156953,vector_bfloat16,1.7714266022942287,0.11599889408312304,0.5902901830335614,0.03865416062473934,77.69896175986842,5.519513208278738,11810.2421875,22.874,20.65,54.861,1.7282622928202316,1.2392030278004724,1.9989665859288177,0.5759065963204997,0.41293801343431896,0.6661130358761007,79.27685546875,68.541015625,110.56396484375,"[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(11810.244), 'mean_duration_us': np.float64(77.69897368421053), 'median_duration_us': np.float64(79.277), 'std_dev_duration_us': np.float64(5.5013074868704575), 'min_duration_us': np.float64(68.541), 'max_duration_us': np.float64(110.564)}]","[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'mean_duration_us': np.float64(77.7)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.slice, aten.split, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29']",0.5598213640135064,88.5065693164075 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240),)","('c10::BFloat16',)","((125337600, 979200, 57600, 240, 1),)","('',)",16271,60,549.828,9.1638,0.5570538969146489,0.1253376,478.125,0.25,vector_bf16,2.7956763404112555,0.3039088826952816,0.6989190851028136,0.07597722067382039,181.23169759114583,17.872211160860086,10873.90185546875,9.113499999999998,8.333,12.318,2.6957932117137,2.3847601089761308,3.468732455423201,0.6739483029284248,0.5961900272440326,0.8671831138558002,185.97509765625,144.5341796875,210.23095703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10873.901), 'mean_duration_us': np.float64(181.23168333333334), 'median_duration_us': np.float64(185.97500000000002), 'std_dev_duration_us': np.float64(17.72266507563283), 'min_duration_us': np.float64(144.534), 'max_duration_us': np.float64(210.231)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(181.23)}]","{'op_shape': (1, 128, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (125337600, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.5154375729331345,89.02200688934063 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((250675200, 979200, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16286,10,697.227,69.7227,5.159371905140735,64.1728512,717.25,85.32589752527012,matrix_bf16,0.7266293293589625,0.01119099823956174,62.000299695738576,0.9548819689943228,1035.260546875,15.841530677576912,10352.60546875,68.96199999999999,63.054,79.198,0.7247524405104127,0.7121759022297188,0.7442172592551075,61.8401524701809,60.767048053619774,63.50100559973869,1037.740478515625,1010.580078125,1056.046875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2186.359), 'mean_duration_us': np.float64(218.6359), 'median_duration_us': np.float64(221.6085), 'std_dev_duration_us': np.float64(14.933358854926103), 'min_duration_us': np.float64(181.348), 'max_duration_us': np.float64(243.04)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(8166.246999999999), 'mean_duration_us': np.float64(816.6247), 'median_duration_us': np.float64(821.4995), 'std_dev_duration_us': np.float64(12.913326426990064), 'min_duration_us': np.float64(789.332), 'max_duration_us': np.float64(830.233)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(218.64)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(816.62)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 17, 240, 240), 'filter_shape': (128, 256, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (250675200, 979200, 57600, 240, 1), 'weight_stride': (256, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.49072742307887673,89.51273431241951 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24074,5,392.264,78.4528,3.7425533663529746,458.6471424,284.6826171875,1536.4478671766462,matrix_bf16,0.1512225383029339,0.003055193043968672,232.3455464445815,4.694144836218585,1974.61630859375,38.92279256154899,9873.08154296875,78.116,74.18,83.044,0.1500848843291918,0.14907312365521128,0.15660458730735702,230.5976004230404,229.0430828934098,240.61478415846756,1988.9501953125,1906.14697265625,2002.44921875,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.833999999999996), 'mean_duration_us': np.float64(5.166799999999999), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.21052353787640943), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.367)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(602.692), 'mean_duration_us': np.float64(120.5384), 'median_duration_us': np.float64(121.78), 'std_dev_duration_us': np.float64(2.112858594416579), 'min_duration_us': np.float64(117.093), 'max_duration_us': np.float64(122.662)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(605.4540000000001), 'mean_duration_us': np.float64(121.09080000000002), 'median_duration_us': np.float64(121.86), 'std_dev_duration_us': np.float64(2.0797206927854526), 'min_duration_us': np.float64(117.053), 'max_duration_us': np.float64(122.982)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(611.342), 'mean_duration_us': np.float64(122.2684), 'median_duration_us': np.float64(121.019), 'std_dev_duration_us': np.float64(8.790825344641997), 'min_duration_us': np.float64(109.201), 'max_duration_us': np.float64(136.241)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(919.682), 'mean_duration_us': np.float64(183.9364), 'median_duration_us': np.float64(184.353), 'std_dev_duration_us': np.float64(0.5806870413570518), 'min_duration_us': np.float64(183.152), 'max_duration_us': np.float64(184.513)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(7108.077), 'mean_duration_us': np.float64(1421.6154000000001), 'median_duration_us': np.float64(1432.568), 'std_dev_duration_us': np.float64(30.52483036218219), 'min_duration_us': np.float64(1363.064), 'max_duration_us': np.float64(1451.756)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.17)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(120.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.09)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(122.27)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(183.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1421.62)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 11, 242, 242), 'filter_shape': (128, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (82458112, 644204, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.4679973440554256,89.98073165647493 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((33177600, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16130,50,425.146,8.50292,4.866729442126113,0.041913344,143.224609375,0.2790838799416345,vector_bf16,0.8280689388405905,0.04926900605223346,0.23110069231078406,0.013750185369925182,181.9982421875,10.907357150483445,9099.912109375,7.4965,6.961,35.293,0.824045511146023,0.7248614995416184,0.9396002572950779,0.22997781849911952,0.20229715971238618,0.2622272854000684,182.25,159.8359375,207.18701171875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(9099.913), 'mean_duration_us': np.float64(181.99826000000002), 'median_duration_us': np.float64(182.25), 'std_dev_duration_us': np.float64(10.797747462892435), 'min_duration_us': np.float64(159.836), 'max_duration_us': np.float64(207.187)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.0)}]","{'input_shape': (1, 256, 9, 120, 120), 'output_shape': (1, 256, 11, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 11, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (33177600, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.43134807301963607,90.41207972949456 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '7431', '3072')",9541,156,3138.954,20.1215,2.563558898446932,0.045656064,130.658203125,0.3332436432127001,vector_bfloat16,2.353956664478194,0.09467496004773462,0.7844410948355292,0.03154982860732389,58.29872796474359,2.421970207712263,9094.6015625,19.7045,17.806,47.361,2.3767225275134862,2.095617024825979,2.4927714524520255,0.7920276739742913,0.6983510521315688,0.8307002405117272,57.64453125,54.9609375,65.376953125,"[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(9094.601), 'mean_duration_us': np.float64(58.29872435897436), 'median_duration_us': np.float64(57.6445), 'std_dev_duration_us': np.float64(2.414204855491438), 'min_duration_us': np.float64(54.961), 'max_duration_us': np.float64(65.377)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(58.3)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.unsqueeze', 'xnumel': 7431, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27']",0.4310963459552778,90.84317607544985 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 18432), (1, 18432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (18432, 1))","('', '', '')",8845,160,5070.261,31.689131250000003,7.651621165110255,0.113246208,108.041015625,0.9996203698682141,matrix_bf16,2.0844419423001033,0.17565890712633075,2.083650625330848,0.17559222171226907,54.699826049804685,4.2111945588866115,8751.97216796875,29.929000000000002,25.928,75.122,2.0390047752243188,1.740335548864736,2.743093262963751,2.0382307075727883,1.7396748650509688,2.742051902106831,55.56103515625,41.2998046875,65.09619140625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(8751.971), 'mean_duration_us': np.float64(54.69981875), 'median_duration_us': np.float64(55.561), 'std_dev_duration_us': np.float64(4.198013704229471), 'min_duration_us': np.float64(41.3), 'max_duration_us': np.float64(65.096)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(54.7)}]","{'M': 1, 'N': 18432, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG64_4_1']",0.41485525183100824,91.25803132728086 -triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7,triton,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (1, 24, 7425, 64, 2), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178200, 1, 24, 178200), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (3072, 1), (1,), (178200, 1, 24, 178200), (1,), (22809600, 950400, 128, 2, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",8859,80,2456.91,30.711374999999997,3.2756189805434,0.159796224,304.7412109375,0.5000753072375063,vector_bfloat16,2.9829037957164335,0.23215757372810789,1.491676532102819,0.11609627000959759,107.70609130859376,7.575080293499654,8616.4873046875,30.145,27.2,47.06,2.9022430615695827,2.6848828380479604,3.68614298630708,1.4513400906923297,1.3426436101335413,1.8433490863988915,110.1025390625,86.68798828125,119.01611328125,"[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(8616.487000000001), 'mean_duration_us': np.float64(107.70608750000001), 'median_duration_us': np.float64(110.10249999999999), 'std_dev_duration_us': np.float64(7.527556552749621), 'min_duration_us': np.float64(86.688), 'max_duration_us': np.float64(119.016)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split...', 'stream': 0, 'mean_duration_us': np.float64(107.71)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.cat, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7']",0.40843308708949516,91.66646441437035 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16099,20,160.768,8.0384,1.878942294847934,0.083826688,286.44921875,0.2790838799416345,vector_bf16,0.7378654890664265,0.03647105947326449,0.20592636356369,0.010178484783380758,408.019287109375,20.21189608764834,8160.3857421875,7.486,7.151,15.813,0.7436249409716154,0.6839321757569289,0.8004666508536948,0.20753373374772732,0.1908744452271676,0.22339733868413483,403.9189453125,375.23583984375,439.171875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(8160.385999999999), 'mean_duration_us': np.float64(408.01929999999993), 'median_duration_us': np.float64(403.919), 'std_dev_duration_us': np.float64(19.700116299402907), 'min_duration_us': np.float64(375.236), 'max_duration_us': np.float64(439.172)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(408.02)}]","{'input_shape': (1, 512, 9, 120, 120), 'output_shape': (1, 512, 11, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 11, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.386813259587762,92.05327767395812 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 14336))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",356,64,2311.045,36.110078125,6.747564172621177,41.221619712,124.33984375,316.165750369137,matrix_bf16,1.0763768489146515,0.010466715531330686,340.31349411706805,3.3092169698634617,121.13964080810547,1.1772421975752645,7752.93701171875,35.943,28.022,60.68,1.0746869267971833,1.0567177494914637,1.0988069530836562,339.7791986227332,334.09796019635434,347.4051248325192,121.31884765625,118.65576171875,123.3818359375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(7752.939), 'mean_duration_us': np.float64(121.139671875), 'median_duration_us': np.float64(121.319), 'std_dev_duration_us': np.float64(1.1680273174069968), 'min_duration_us': np.float64(118.656), 'max_duration_us': np.float64(123.382)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(121.14)}]","{'M': 351, 'N': 14336, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.3674996417605165,92.42077731571864 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (129, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((57600, 7430400, 240, 1), (57600, 7430400, 240, 1), ())","('', '', 'False')",24640,1,772123.309,772123.309,,0.0222912,85.0341796875,0.25,vector_bf16,0.013468645387413594,,0.0033671613468533985,,6620.17578125,,6620.17578125,772123.309,772123.309,772123.309,0.013468645387413594,0.013468645387413594,0.013468645387413594,0.0033671613468533985,0.0033671613468533985,0.0033671613468533985,6620.17578125,6620.17578125,6620.17578125,"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6620.176), 'mean_duration_us': np.float64(6620.176), 'median_duration_us': np.float64(6620.176), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6620.176), 'max_duration_us': np.float64(6620.176)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(6620.18)}]","{'op_shape': (129, 3, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (57600, 7430400, 240, 1), 'stride_output': (57600, 7430400, 240, 1)}",True,diffusers/image_processor.py(190): pt_to_numpy,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(190): pt_to_numpy', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy DtoH (Device -> Host)']",0.31380523591557846,92.73458255163422 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",8904,76,1936.309,25.47775,1.743135857202952,0.0456192,130.59375,0.3331389088298636,vector_bfloat16,1.8654743872815345,0.11631104198509508,0.6214621018290287,0.03874773361177902,73.8177425986842,6.743495096271407,5610.1484375,25.197499999999998,23.004,35.683,1.8771867271047804,1.1840590689414952,2.0143793960480663,0.6253639379375895,0.394456146217274,0.6710681539688126,72.9482421875,67.97998046875,115.65087890625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5610.146000000001), 'mean_duration_us': np.float64(73.81771052631579), 'median_duration_us': np.float64(72.948), 'std_dev_duration_us': np.float64(6.698992855991566), 'min_duration_us': np.float64(67.98), 'max_duration_us': np.float64(115.651)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(73.82)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16']",0.2659285813735131,93.00051113300773 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '7425', '3072')",8878,76,1867.926,24.577973684210527,3.853821898578724,0.0456192,130.6640625,0.3329596412556054,vector_bfloat16,1.893023289314993,0.04588473870047322,0.6303003552988261,0.015277766136816763,72.4171078330592,1.6808137308604874,5503.7001953125,23.686,21.291,52.248,1.8833913092505334,1.832925752508361,2.0394884367981505,0.6270932946719826,0.6102903010033445,0.6790673382612676,72.7470703125,67.17919921875,74.75,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5503.700000000001), 'mean_duration_us': np.float64(72.41710526315791), 'median_duration_us': np.float64(72.747), 'std_dev_duration_us': np.float64(1.6697369126124988), 'min_duration_us': np.float64(67.179), 'max_duration_us': np.float64(74.75)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(72.42)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13']",0.26088279152499344,93.26139392453273 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (1, 128, 17, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (125337600, 979200, 57600, 240, 1), ())","('', '', '1')",16293,30,262.001,8.733366666666665,0.5771002711734813,0.1253376,717.1875,0.16666666666666666,vector_bf16,4.343486980745721,0.35200250597983146,0.7239144967909533,0.05866708432997192,174.19246419270834,13.554415174253906,5225.77392578125,8.557500000000001,7.952,9.725,4.292406210332841,3.6968944969587576,5.1644359866139995,0.7154010350554733,0.6161490828264595,0.8607393311023331,175.199462890625,145.6162109375,203.4208984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(5225.774), 'mean_duration_us': np.float64(174.1924666666667), 'median_duration_us': np.float64(175.1995), 'std_dev_duration_us': np.float64(13.326603204951446), 'min_duration_us': np.float64(145.616), 'max_duration_us': np.float64(203.421)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(174.19)}]","{'shape_in1': (1, 128, 17, 240, 240), 'shape_in2': (1, 128, 17, 240, 240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (125337600, 979200, 57600, 240, 1), 'stride_input2': (125337600, 979200, 57600, 240, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.24770871254896315,93.50910263708168 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24043,1,86.408,86.408,,1834.5885696,571.052734375,3063.8151166807465,matrix_bf16,0.11513990038974717,,352.7673673472228,,5200.56201171875,,5200.56201171875,86.408,86.408,86.408,0.11513990038974717,0.11513990038974717,0.11513990038974717,352.7673673472228,352.7673673472228,352.7673673472228,5200.56201171875,5200.56201171875,5200.56201171875,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.823), 'mean_duration_us': np.float64(231.823), 'median_duration_us': np.float64(231.823), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.823), 'max_duration_us': np.float64(231.823)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(238.113), 'mean_duration_us': np.float64(238.113), 'median_duration_us': np.float64(238.113), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(238.113), 'max_duration_us': np.float64(238.113)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(289.149), 'mean_duration_us': np.float64(289.149), 'median_duration_us': np.float64(289.149), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(289.149), 'max_duration_us': np.float64(289.149)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(421.745), 'mean_duration_us': np.float64(421.745), 'median_duration_us': np.float64(421.745), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(421.745), 'max_duration_us': np.float64(421.745)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4014.525), 'mean_duration_us': np.float64(4014.525), 'median_duration_us': np.float64(4014.525), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4014.525), 'max_duration_us': np.float64(4014.525)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.21)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.82)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(238.11)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(289.15)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(421.74)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4014.52)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 11, 242, 242), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (164916224, 644204, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.2465136339133363,93.75561627099502 -triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21,triton,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (), ())","('', '', '', '178344', '128')",9521,320,6911.375,21.598046875,1.6822098004835409,0.068484096,43.546875,1.4997981700753498,vector_bfloat16,3.008920451931564,0.34338231431520994,4.512773387709254,0.5150041666461904,15.365415954589844,1.6736543542812599,4916.93310546875,21.3765,18.167,30.285,2.8785730287191797,2.499831644363656,3.713023186849837,4.317278560901284,3.7492429257130637,5.568785381084729,15.86279296875,12.2978515625,18.26611328125,"[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(4916.939), 'mean_duration_us': np.float64(15.365434375000001), 'median_duration_us': np.float64(15.863), 'std_dev_duration_us': np.float64(1.6710358301644401), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(18.266)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'mean_duration_us': np.float64(15.37)}]","{'fused_ops': 'aten._to_copy, aten.addmm, aten.mean, aten.pow, aten.transpose, aten.view', 'xnumel': 178344, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21']",0.23306924228700807,93.98868551328202 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((250675200, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16252,10,346.94599999999997,34.694599999999994,1.4990474160464566,1.253377536,956.2529296875,1.249997702212922,vector_bf16,2.0709930659711335,0.027118545096077237,2.5887365737628114,0.033898119057454,484.24150390625,6.429982929902523,4842.4150390625,34.476,33.349,38.628,2.080236614391215,2.013878225952321,2.0961822617898527,2.600290988048207,2.5173431549770373,2.620223010656802,482.014404296875,478.34765625,497.89697265625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1702.721), 'mean_duration_us': np.float64(170.2721), 'median_duration_us': np.float64(170.913), 'std_dev_duration_us': np.float64(1.7133133076002158), 'min_duration_us': np.float64(167.448), 'max_duration_us': np.float64(172.015)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3139.6940000000004), 'mean_duration_us': np.float64(313.96940000000006), 'median_duration_us': np.float64(313.004), 'std_dev_duration_us': np.float64(5.32169548546326), 'min_duration_us': np.float64(306.614), 'max_duration_us': np.float64(326.043)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(170.27)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(313.97)}]","{'op_shape': (1, 256, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.22953698571539013,94.2182224989974 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 9216), (1, 9216))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (9216, 1))","('', '', '')",9511,160,7025.695,43.91059375,11.163824688550523,0.056623104,54.0234375,0.9995661605206074,matrix_bf16,1.940142204882262,0.27967358583293916,1.939300494598148,0.27955225239006154,29.782489013671874,4.091631975479052,4765.1982421875,42.358000000000004,36.724,151.636,1.7676802936336298,1.608764576087861,2.4382515844559807,1.7669134041353072,1.6080666305017057,2.4371937746579517,32.04638671875,23.23291015625,35.2119140625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(4765.2), 'mean_duration_us': np.float64(29.7825), 'median_duration_us': np.float64(32.046499999999995), 'std_dev_duration_us': np.float64(4.07881045618695), 'min_duration_us': np.float64(23.233), 'max_duration_us': np.float64(35.212)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(29.78)}]","{'M': 1, 'N': 9216, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.22587680568986376,94.44409930468727 -triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), ())","('', '', '', '', '22828032')",9542,156,2798.304,17.937846153846156,1.841251713632021,0.022828032,130.658203125,0.16662182160635006,vector_bfloat16,4.7445735940702525,0.467815379809313,0.790549494989373,0.07794825075929424,29.14972393329327,2.8026065809675935,4547.35693359375,17.6115,15.493,34.331,4.5601552850316915,3.8471796674756282,5.7099380278388265,0.7598213803998051,0.6410240842417014,0.9514002754578755,30.0439453125,23.994140625,35.61181640625,"[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(4547.359), 'mean_duration_us': np.float64(29.149737179487182), 'median_duration_us': np.float64(30.044), 'std_dev_duration_us': np.float64(2.7936151105786897), 'min_duration_us': np.float64(23.994), 'max_duration_us': np.float64(35.612)}]","[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'mean_duration_us': np.float64(29.15)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.slice, aten.split, aten.unsqueeze', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28']",0.2155508346742554,94.65965013936153 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24058,1,89.744,89.744,,917.2942848,442.802734375,1975.597556403414,matrix_bf16,0.11085623959576964,,219.00731605747387,,4188.41845703125,,4188.41845703125,89.744,89.744,89.744,0.11085623959576964,0.11085623959576964,0.11085623959576964,219.00731605747387,219.00731605747387,219.00731605747387,4188.41845703125,4188.41845703125,4188.41845703125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(110.203), 'mean_duration_us': np.float64(110.203), 'median_duration_us': np.float64(110.203), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(110.203), 'max_duration_us': np.float64(110.203)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(121.139), 'mean_duration_us': np.float64(121.139), 'median_duration_us': np.float64(121.139), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(121.139), 'max_duration_us': np.float64(121.139)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(137.964), 'mean_duration_us': np.float64(137.964), 'median_duration_us': np.float64(137.964), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(137.964), 'max_duration_us': np.float64(137.964)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(424.83), 'mean_duration_us': np.float64(424.83), 'median_duration_us': np.float64(424.83), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(424.83), 'max_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3388.955), 'mean_duration_us': np.float64(3388.955), 'median_duration_us': np.float64(3388.955), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3388.955), 'max_duration_us': np.float64(3388.955)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.33)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(110.2)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(137.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(3388.96)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 11, 242, 242), 'filter_shape': (128, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (164916224, 644204, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.19853666812661036,94.85818680748814 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((9216000, 18000, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",15965,70,524.355,7.490785714285715,0.35011811228010475,0.013776896,43.85546875,0.299590273447938,vector_bf16,0.7820931964563087,0.09462854668341117,0.2343075145881174,0.028349792176864123,59.625376674107144,6.965243076949578,4173.7763671875,7.461,6.84,8.202,0.7593362682296552,0.6317848365578125,0.9646710166755439,0.22748976023785916,0.18927659194461588,0.28900605367312654,60.569091796875,47.669921875,72.787109375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(4173.776), 'mean_duration_us': np.float64(59.62537142857143), 'median_duration_us': np.float64(60.569), 'std_dev_duration_us': np.float64(6.915321565028997), 'min_duration_us': np.float64(47.67), 'max_duration_us': np.float64(72.787)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(59.63)}]","{'input_shape': (1, 512, 5, 60, 60), 'output_shape': (1, 512, 7, 62, 62), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 7, 62, 62), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (9216000, 18000, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.19784261337496334,95.0560294208631 -aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((7372800, 14400, 3600, 60, 1), (), ())","('', '', '[2., 2., 2.]')",16089,10,91.544,9.154399999999999,0.7308313682983845,,,,,,,,,397.7623046875,9.699321350901494,3977.623046875,8.708,8.612,10.535,,,,,,,397.570068359375,382.1669921875,415.296875,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3977.623), 'mean_duration_us': np.float64(397.7623), 'median_duration_us': np.float64(397.57000000000005), 'std_dev_duration_us': np.float64(9.20156966011779), 'min_duration_us': np.float64(382.167), 'max_duration_us': np.float64(415.297)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(397.76)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.18854468217340456,95.2445741030365 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 14336), (14336, 4096))","('c10::BFloat16', 'c10::BFloat16')","((14336, 1), (1, 14336))","('', '')",376,32,1045.624,32.67575,8.311147647936863,41.221619712,124.33984375,316.165750369137,matrix_bf16,1.1373599105898429,0.008981247215309414,359.5942495714122,2.839562765079043,114.64051818847656,0.8912301955518536,3668.49658203125,30.6405,27.361,65.027,1.1358157505382471,1.125408433881389,1.1715930904655347,359.10603905000943,355.8156019698647,370.417608574332,114.78955078125,111.2841796875,115.85107421875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(3668.496), 'mean_duration_us': np.float64(114.6405), 'median_duration_us': np.float64(114.7895), 'std_dev_duration_us': np.float64(0.8772184733576919), 'min_duration_us': np.float64(111.284), 'max_duration_us': np.float64(115.851)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(114.64)}]","{'M': 351, 'N': 4096, 'K': 14336, 'bias': False, 'stride_A': (14336, 1), 'stride_B': (1, 14336), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.17389167197648717,95.41846577501299 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((6, 12288), (12288, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",8882,80,2422.421,30.2802625,8.23693202032387,0.452984832,72.17578125,5.985387238188017,matrix_bf16,1.6603226727831604,0.10654213684846953,9.93767413695055,0.6376959462221112,45.75550537109375,2.739651795895817,3660.4404296875,28.5175,25.578,85.888,1.6558032321465674,1.5126313582386697,1.9928808745226616,9.910623534640537,9.05368442768474,11.928163753596914,45.70703125,37.97607421875,50.033203125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(3660.44), 'mean_duration_us': np.float64(45.7555), 'median_duration_us': np.float64(45.707), 'std_dev_duration_us': np.float64(2.722449365920329), 'min_duration_us': np.float64(37.976), 'max_duration_us': np.float64(50.033)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]","{'M': 6, 'N': 3072, 'K': 12288, 'bias': False, 'stride_A': (12288, 1), 'stride_B': (1, 12288), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.17350979952017528,95.59197557453317 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((9840640, 19220, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23765,7,545.579,77.93985714285714,4.604490215306917,152.8823808,42.81640625,3405.2367484718548,matrix_bf16,0.08794618092250528,0.0023742941706903237,299.4775671650693,8.085033761717206,510.81619698660717,13.800335108151545,3575.71337890625,77.585,72.057,84.745,0.08806079306451164,0.08459768538201089,0.09111808436601615,299.86784864285045,288.0751470984837,310.27864933351697,509.83251953125,492.72607421875,530.703125,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(66.21100000000001), 'mean_duration_us': np.float64(9.458714285714288), 'median_duration_us': np.float64(9.533), 'std_dev_duration_us': np.float64(0.6017806231238647), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(10.455)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(90.72800000000001), 'mean_duration_us': np.float64(12.961142857142859), 'median_duration_us': np.float64(13.098), 'std_dev_duration_us': np.float64(0.5008011948215517), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(13.699)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(97.979), 'mean_duration_us': np.float64(13.997), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.6984055309877533), 'min_duration_us': np.float64(12.497), 'max_duration_us': np.float64(14.902)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(100.50399999999999), 'mean_duration_us': np.float64(14.357714285714284), 'median_duration_us': np.float64(14.341), 'std_dev_duration_us': np.float64(0.3663034317087854), 'min_duration_us': np.float64(13.7), 'max_duration_us': np.float64(14.821)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(129.225), 'mean_duration_us': np.float64(18.460714285714285), 'median_duration_us': np.float64(18.547), 'std_dev_duration_us': np.float64(0.45106404812421497), 'min_duration_us': np.float64(17.705), 'max_duration_us': np.float64(19.188)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(3091.066), 'mean_duration_us': np.float64(441.5808571428571), 'median_duration_us': np.float64(442.336), 'std_dev_duration_us': np.float64(14.279286921257372), 'min_duration_us': np.float64(420.664), 'max_duration_us': np.float64(462.647)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.46)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.0)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.36)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(18.46)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(441.58)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 5, 62, 62), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (9840640, 19220, 3844, 62, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_32x32_half'], ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.16949362335848717,95.76146919789166 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16123,50,1574.76,31.4952,2.381015415356076,0.165889536,126.5654296875,1.2499826392907571,vector_bf16,2.0058305952859965,0.06389510478764683,2.507253421465741,0.07986777172022225,66.230859375,2.1482493381519303,3311.54296875,30.951,28.602,43.815,2.0133872881605615,1.8405340898877927,2.110210251907982,2.5166991563693992,2.300635659382555,2.6377261801383534,65.91552734375,62.89111328125,72.10595703125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(1023.592), 'mean_duration_us': np.float64(20.47184), 'median_duration_us': np.float64(20.409), 'std_dev_duration_us': np.float64(0.5652406340665894), 'min_duration_us': np.float64(19.348), 'max_duration_us': np.float64(22.072)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2287.949), 'mean_duration_us': np.float64(45.75898), 'median_duration_us': np.float64(45.5865), 'std_dev_duration_us': np.float64(1.7036678020083613), 'min_duration_us': np.float64(42.782), 'max_duration_us': np.float64(50.034)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.47)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]","{'op_shape': (1, 256, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33177600, 129600, 14400, 120, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.15697159061793892,95.9184407885096 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 7, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((26672128, 104188, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23930,5,378.78200000000004,75.75640000000001,3.8130114476618138,254.803968,89.404296875,2717.99016930639,matrix_bf16,0.14189575770812562,0.005365093116590351,385.67127451696695,14.582270348305917,661.45712890625,25.81166366349123,3307.28564453125,75.241,72.257,81.14,0.1453281035856996,0.13336102435439526,0.1455267129839476,395.0003568698722,362.4739531638764,395.5401752618422,645.07275390625,644.1923828125,702.9580078125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(28.237000000000002), 'mean_duration_us': np.float64(5.6474), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.30903760289000437), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.168)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(130.58700000000002), 'mean_duration_us': np.float64(26.117400000000004), 'median_duration_us': np.float64(26.037), 'std_dev_duration_us': np.float64(0.3254293164421424), 'min_duration_us': np.float64(25.757), 'max_duration_us': np.float64(26.518)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(168.36599999999999), 'mean_duration_us': np.float64(33.673199999999994), 'median_duration_us': np.float64(33.93), 'std_dev_duration_us': np.float64(1.4436774431984447), 'min_duration_us': np.float64(31.045), 'max_duration_us': np.float64(35.292)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(220.32399999999998), 'mean_duration_us': np.float64(44.0648), 'median_duration_us': np.float64(44.265), 'std_dev_duration_us': np.float64(0.9964507815241054), 'min_duration_us': np.float64(42.302), 'max_duration_us': np.float64(45.226)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(335.37299999999993), 'mean_duration_us': np.float64(67.07459999999999), 'median_duration_us': np.float64(66.578), 'std_dev_duration_us': np.float64(2.3191535179888367), 'min_duration_us': np.float64(64.735), 'max_duration_us': np.float64(71.425)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(2424.399), 'mean_duration_us': np.float64(484.8798), 'median_duration_us': np.float64(472.902), 'std_dev_duration_us': np.float64(19.36392630021093), 'min_duration_us': np.float64(468.335), 'max_duration_us': np.float64(518.73)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.12)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(33.67)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(44.06)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(67.07)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(484.88)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 7, 122, 122), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (26672128, 104188, 14884, 122, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x16_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.15676978772403122,96.07521057623363 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240),)","('c10::BFloat16',)","((250675200, 979200, 57600, 240, 1),)","('',)",16256,10,103.605,10.3605,0.245652080073514,0.2506752,956.25,0.25,vector_bf16,3.1295506988112995,0.06741744990702156,0.7823876747028248,0.016854362476755407,320.531494140625,6.902544584904398,3205.31494140625,10.31,10.045,10.867,3.1375249994533245,3.0395081776105553,3.234309840751842,0.784381249863331,0.7598770444026387,0.8085774601879604,319.593994140625,310.02001953125,329.88916015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3205.315), 'mean_duration_us': np.float64(320.5315), 'median_duration_us': np.float64(319.594), 'std_dev_duration_us': np.float64(6.548297232869021), 'min_duration_us': np.float64(310.02), 'max_duration_us': np.float64(329.889)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(320.53)}]","{'op_shape': (1, 256, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.15193623924919356,96.22714681548283 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8855,240,7156.78,29.819916666666664,3.971826802873247,0.113246208,18.0703125,5.976653696498055,matrix_bf16,1.503070726682521,0.12511074273580028,8.983333214725105,0.7477435830435376,12.679276529947916,0.8926095073379748,3043.0263671875,29.413,24.527,73.659,1.482888173334862,1.3139331146475248,2.1502576942428107,8.86270908265505,7.852923206609331,12.851345596719677,12.77783203125,8.81201171875,14.4208984375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(3043.026), 'mean_duration_us': np.float64(12.679274999999999), 'median_duration_us': np.float64(12.778), 'std_dev_duration_us': np.float64(0.8907307764087119), 'min_duration_us': np.float64(8.812), 'max_duration_us': np.float64(14.421)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.68)}]","{'M': 6, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.14424354255927246,96.37139035804209 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 16, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (235929600, 921600, 57600, 240, 1)), ())","('', '2')",16235,10,261.889,26.1889,1.1551666979271857,,,,,,,,,281.219921875,4.5396044607664345,2812.19921875,25.698,24.917,28.232,,,,,,,282.0576171875,271.841796875,288.26611328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(207.33700000000002), 'mean_duration_us': np.float64(20.733700000000002), 'median_duration_us': np.float64(20.628999999999998), 'std_dev_duration_us': np.float64(0.577282781659041), 'min_duration_us': np.float64(19.828), 'max_duration_us': np.float64(21.791)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2604.862), 'mean_duration_us': np.float64(260.4862), 'median_duration_us': np.float64(260.7265), 'std_dev_duration_us': np.float64(4.294674884086099), 'min_duration_us': np.float64(251.293), 'max_duration_us': np.float64(268.077)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(260.49)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.13330202526961024,96.5046923833117 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",16140,10,79.287,7.928700000000001,0.4193322866971572,0.0663552,253.125,0.25,vector_bf16,0.9479352462482238,0.031726224481554856,0.23698381156205595,0.007931556120388714,280.287548828125,9.588244494036497,2802.87548828125,7.771,7.571,8.893,0.9535048925755291,0.8937902817605429,0.9886127465476509,0.23837622314388227,0.22344757044013572,0.24715318663691271,278.37255859375,268.47802734375,296.9609375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2802.8759999999997), 'mean_duration_us': np.float64(280.2876), 'median_duration_us': np.float64(278.3725), 'std_dev_duration_us': np.float64(9.096211367377077), 'min_duration_us': np.float64(268.478), 'max_duration_us': np.float64(296.961)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(280.29)}]","{'input_shape': (1, 512, 9, 120, 120), 'output_shape': (1, 512, 9, 120, 120), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 512, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.13286006790532906,96.63755245121703 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 12288), (6, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",8880,80,1893.74,23.67175,4.318981392159821,0.452984832,72.17578125,5.985387238188017,matrix_bf16,2.257313967034688,0.1305521799538513,13.510898210872986,0.7814053518134069,33.6279541015625,1.7664908669493384,2690.236328125,22.6485,19.919,53.51,2.221437569486672,2.0625748202323444,2.726312355167804,13.29616407883693,12.34530900682662,16.318035177935695,34.06884765625,27.759765625,36.69287109375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2690.236), 'mean_duration_us': np.float64(33.62795), 'median_duration_us': np.float64(34.069), 'std_dev_duration_us': np.float64(1.7554012497147198), 'min_duration_us': np.float64(27.76), 'max_duration_us': np.float64(36.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(33.63)}]","{'M': 6, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.12752082021854172,96.76507327143557 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",182,64,2787.938,43.56153125,6.084797042352934,11.777605632,37.484375,299.6448520216757,matrix_bf16,0.9802229946642199,0.013374295611789131,293.718774184404,4.007538829488711,40.10546112060547,0.53788759861266,2566.74951171875,41.722,36.745,65.016,0.9772918007065443,0.9563290172383069,1.0317361014085953,292.8404570047095,286.55906685440704,309.1544114319991,40.218505859375,38.09619140625,41.10009765625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(2566.749), 'mean_duration_us': np.float64(40.105453125), 'median_duration_us': np.float64(40.218500000000006), 'std_dev_duration_us': np.float64(0.5336704838219316), 'min_duration_us': np.float64(38.096), 'max_duration_us': np.float64(41.1)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(40.11)}]","{'M': 351, 'N': 4096, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.12166737903581981,96.88674065047138 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((66355200, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",24072,6,44.865,7.4775,0.31006047797163727,0.082458112,283.8388671875,0.27705220350179427,vector_bf16,0.7375156783045141,0.026878527093035665,0.20433034379138607,0.007446755158008229,404.0126953125,15.147103670447086,2424.076171875,7.396,7.1,7.871,0.7407227236788883,0.6904848668985126,0.7680803212145345,0.20521886277908663,0.19130035385887603,0.21279834545885273,401.8359375,387.494140625,431.0400390625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(2424.076), 'mean_duration_us': np.float64(404.0126666666667), 'median_duration_us': np.float64(401.836), 'std_dev_duration_us': np.float64(13.827378429124671), 'min_duration_us': np.float64(387.494), 'max_duration_us': np.float64(431.04)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(404.01)}]","{'input_shape': (1, 128, 9, 240, 240), 'output_shape': (1, 128, 11, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 128, 11, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (66355200, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.11490447083701699,97.0016451213084 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23899,1,83.394,83.394,,1019.215872,185.55859375,5238.237584994632,matrix_bf16,0.08146885451308501,,426.7532157169014,,2388.302734375,,2388.302734375,83.394,83.394,83.394,0.08146885451308501,0.08146885451308501,0.08146885451308501,426.7532157169014,426.7532157169014,426.7532157169014,2388.302734375,2388.302734375,2388.302734375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.9), 'mean_duration_us': np.float64(13.9), 'median_duration_us': np.float64(13.9), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.9), 'max_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(43.864), 'mean_duration_us': np.float64(43.864), 'median_duration_us': np.float64(43.864), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(43.864), 'max_duration_us': np.float64(43.864)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(59.087), 'mean_duration_us': np.float64(59.087), 'median_duration_us': np.float64(59.087), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(59.087), 'max_duration_us': np.float64(59.087)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(70.344), 'mean_duration_us': np.float64(70.344), 'median_duration_us': np.float64(70.344), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(70.344), 'max_duration_us': np.float64(70.344)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.591), 'mean_duration_us': np.float64(129.591), 'median_duration_us': np.float64(129.591), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.591), 'max_duration_us': np.float64(129.591)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2071.517), 'mean_duration_us': np.float64(2071.517), 'median_duration_us': np.float64(2071.517), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2071.517), 'max_duration_us': np.float64(2071.517)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(43.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.09)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(70.34)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(129.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2071.52)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 122, 122), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (53344256, 104188, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x16_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.11320876178560581,97.114853883094 -triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9,triton,python3,CPU,thread 416 (python3),"((7425, 3072), (6, 3072), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (22828032, 3072, 128, 1), ())","('', '', '', '22828032')",8864,80,1336.365,16.7045625,1.8153047855384328,0.0,130.623046875,0.0,vector_bfloat16,4.6336591356763535,0.3652614805348405,0.0,0.0,29.719598388671876,2.0641929601593563,2377.56787109375,16.229,14.402,24.276,4.5079384661619555,4.258035417225781,5.85483202638225,0.0,0.0,0.0,30.3837890625,23.39404296875,32.1669921875,"[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2377.568), 'mean_duration_us': np.float64(29.719600000000003), 'median_duration_us': np.float64(30.384), 'std_dev_duration_us': np.float64(2.0512508964044356), 'min_duration_us': np.float64(23.394), 'max_duration_us': np.float64(32.167)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'mean_duration_us': np.float64(29.72)}]","{'fused_ops': '', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9']",0.11269991482809223,97.2275537979221 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((2621440, 5120, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23426,10,788.43,78.84299999999999,4.911654665747129,38.2205952,21.13671875,1724.4871557937536,matrix_bf16,0.0954598986082207,0.0077853806680127854,164.6193690432506,13.42578896495304,233.757177734375,21.54917892698669,2337.57177734375,78.126,72.938,86.849,0.09887065632634129,0.08039468346206777,0.09992395842845285,170.50117691967398,138.63959902444037,172.31758286593592,224.166748046875,221.80322265625,275.68310546875,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.857), 'mean_duration_us': np.float64(4.4857), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.17267370963757053), 'min_duration_us': np.float64(4.365), 'max_duration_us': np.float64(4.846)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(51.626000000000005), 'mean_duration_us': np.float64(5.1626), 'median_duration_us': np.float64(5.167), 'std_dev_duration_us': np.float64(0.17233989671576339), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(58.315), 'mean_duration_us': np.float64(5.8315), 'median_duration_us': np.float64(5.8075), 'std_dev_duration_us': np.float64(0.33862139625251086), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.489)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(63.684), 'mean_duration_us': np.float64(6.368399999999999), 'median_duration_us': np.float64(5.7475000000000005), 'std_dev_duration_us': np.float64(1.1478168146529306), 'min_duration_us': np.float64(5.206), 'max_duration_us': np.float64(8.131)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.341), 'mean_duration_us': np.float64(12.834100000000001), 'median_duration_us': np.float64(12.777999999999999), 'std_dev_duration_us': np.float64(0.3268839090564112), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(13.579)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1990.749), 'mean_duration_us': np.float64(199.0749), 'median_duration_us': np.float64(189.5805), 'std_dev_duration_us': np.float64(19.490014086449502), 'min_duration_us': np.float64(188.359), 'max_duration_us': np.float64(238.514)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.16)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.37)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(199.07)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 5, 32, 32), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (2621440, 5120, 1024, 32, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_16x32_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.11080404619111918,97.33835784411322 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120),)","('c10::BFloat16',)","((33177600, 129600, 14400, 120, 1),)","('',)",16127,50,468.35200000000003,9.367040000000001,1.0387629998204202,0.0331776,126.5625,0.25,vector_bf16,2.8518739414365593,0.14464197850722255,0.7129684853591398,0.03616049462680564,46.65314453125,2.3934584387965505,2332.6572265625,9.248999999999999,8.393,16.194,2.8473798554736574,2.5250694389475736,3.17027562025405,0.7118449638684143,0.6312673597368934,0.7925689050635125,46.60791015625,41.86083984375,52.55712890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2332.658), 'mean_duration_us': np.float64(46.65316), 'median_duration_us': np.float64(46.608000000000004), 'std_dev_duration_us': np.float64(2.369370678977859), 'min_duration_us': np.float64(41.861), 'max_duration_us': np.float64(52.557)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(46.65)}]","{'op_shape': (1, 256, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33177600, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.11057108987420428,97.44892893398742 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((66355200, 129600, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16142,10,688.514,68.8514,6.9471440686883055,33.9738624,190.09375,170.44221601183625,matrix_bf16,1.0571178530469054,0.027421118046080408,180.17750945898925,4.673716125296095,188.670263671875,4.821601122779749,1886.70263671875,66.6445,65.297,88.392,1.0493593854187786,1.0202672731071643,1.1074634769770841,178.85513904359522,173.89661495273845,188.75852916814745,189.9599609375,179.98583984375,195.3681640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(751.748), 'mean_duration_us': np.float64(75.1748), 'median_duration_us': np.float64(76.4325), 'std_dev_duration_us': np.float64(4.115885877912555), 'min_duration_us': np.float64(68.381), 'max_duration_us': np.float64(81.64)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO16_SVW4_TSGRA0_TSGRB0_TT4_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW4_VWB2_VFLRP1_WSGRA1_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1134.955), 'mean_duration_us': np.float64(113.49549999999999), 'median_duration_us': np.float64(112.84649999999999), 'std_dev_duration_us': np.float64(2.4135129272494074), 'min_duration_us': np.float64(110.323), 'max_duration_us': np.float64(117.854)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(75.17)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(113.5)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 9, 120, 120), 'filter_shape': (256, 512, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (66355200, 129600, 14400, 120, 1), 'weight_stride': (512, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO16_SVW4_TSGRA0_TSGRB0_TT4_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW4_VWB2_VFLRP1_WSGRA1_WSGRB0_WG64_4_1_WGM32']]",0.08943224252366921,97.53836117651109 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",15620,100,3241.161,32.41161,4.479189566159928,0.011523072,8.794921875,1.249500333111259,vector_bf16,0.5700504274956146,0.08625859267639838,0.7122781990459862,0.10778014028286816,16.73724609375,3.7796122821716116,1673.724609375,31.337,28.943,61.851,0.6139901470043236,0.3197601143128026,0.6291036876956898,0.7671808932089333,0.3995403693495412,0.786065267337286,15.02001953125,14.6591796875,28.8408203125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(522.8009999999999), 'mean_duration_us': np.float64(5.228009999999999), 'median_duration_us': np.float64(5.0665), 'std_dev_duration_us': np.float64(0.4639569483260273), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(7.089)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1150.926), 'mean_duration_us': np.float64(11.50926), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(3.376708283580327), 'min_duration_us': np.float64(9.733), 'max_duration_us': np.float64(22.393)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.51)}]","{'op_shape': (1, 512, 5, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.07933679758023893,97.61769797409133 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((2304000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",15626,100,776.227,7.76227,1.0823184510087314,0.003670016,11.39453125,0.30716489544052106,vector_bf16,0.7855980880558768,0.06998940715260207,0.24130815457595667,0.021498288929973065,15.3385302734375,1.4763561330175836,1533.85302734375,7.541,6.86,15.193,0.8094464643544652,0.6137338734888387,0.8621206192439137,0.2486335385881388,0.18851750107850512,0.264813189867174,14.760986328125,13.85888671875,19.4677734375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1533.8520000000003), 'mean_duration_us': np.float64(15.338520000000003), 'median_duration_us': np.float64(14.761), 'std_dev_duration_us': np.float64(1.4689585322942238), 'min_duration_us': np.float64(13.859), 'max_duration_us': np.float64(19.468)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(15.34)}]","{'input_shape': (1, 512, 5, 30, 30), 'output_shape': (1, 512, 7, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 7, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.07270669647000617,97.69040467056134 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",24041,2,16.253999999999998,8.126999999999999,1.0267190462828664,0.164916224,567.677734375,0.27705220350179427,vector_bf16,0.796860237906245,0.10672780783080185,0.22077188479488918,0.02956917433443968,753.759033203125,100.95503002861471,1507.51806640625,8.126999999999999,7.401,8.853,0.796860237906245,0.7213922812479103,0.8723281945645797,0.22077188479488918,0.19986332110891966,0.24168044848085868,753.759033203125,682.373046875,825.14501953125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(1507.518), 'mean_duration_us': np.float64(753.759), 'median_duration_us': np.float64(753.759), 'std_dev_duration_us': np.float64(71.38599999999997), 'min_duration_us': np.float64(682.373), 'max_duration_us': np.float64(825.145)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(753.76)}]","{'input_shape': (1, 256, 9, 240, 240), 'output_shape': (1, 256, 11, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 11, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.07145838390204905,97.76186305446339 -aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 32, 351, 128), (1, 32, 351, 128), (1, 32, 351, 351), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((1437696, 128, 4096, 1), (1437696, 44928, 128, 1), (1437696, 44928, 128, 1), (123552, 0, 352, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '0.088388347648318447')",295,32,1611.075,50.34609375,15.434850184460293,2.018525184,10.96875,175.5,matrix_bf16,0.2561012219125127,0.00462953362664329,44.94576444564598,0.8124831514759007,44.925689697265625,0.8824982727758616,1437.6220703125,44.706999999999994,40.38,97.635,0.2570435215007252,0.2322976229425745,0.26007454112243433,45.11113802337727,40.76823282642182,45.643081966987225,44.74560546875,44.22412109375,49.51220703125,"[{'name': 'attn_fwd', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(1437.6219999999998), 'mean_duration_us': np.float64(44.925687499999995), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(0.8685557494160925), 'min_duration_us': np.float64(44.224), 'max_duration_us': np.float64(49.512)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(44.93)}]","{'B': 1, 'N_Q': 351, 'H_Q': 32, 'N_KV': 351, 'H_KV': 32, 'd_h_qk': 128, 'd_h_v': 128, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.0681452196797522,97.83000827414314 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",15974,60,1904.895,31.74825,2.5145599178600775,0.046083072,35.162109375,1.2498750208298617,vector_bf16,1.5513392651977331,0.11690062109366006,1.9389801964031994,0.14611116622446219,23.897591145833335,1.770591998505488,1433.85546875,30.7805,29.153,39.949,1.521430429800156,1.349647081432759,1.7667303442208704,1.9015978901376553,1.6868901740187319,2.208192125783809,24.234130859375,20.869140625,27.318359375,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(445.928), 'mean_duration_us': np.float64(7.432133333333334), 'median_duration_us': np.float64(7.4704999999999995), 'std_dev_duration_us': np.float64(0.4628981337424275), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.451)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(987.925), 'mean_duration_us': np.float64(16.465416666666666), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(1.3029620650869138), 'min_duration_us': np.float64(14.14), 'max_duration_us': np.float64(18.867)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(7.43)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(16.47)}]","{'op_shape': (1, 512, 5, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (9216000, 18000, 3600, 60, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.06796667769975404,97.8979749518429 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (1, 256, 9, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', '1')",16149,30,268.5,8.95,1.1513915418998963,0.0331776,189.84375,0.16666666666666666,vector_bf16,4.178886400632432,0.11493919079233095,0.696481066772072,0.019156531798721812,47.671142578125,1.3206365016932746,1430.13427734375,8.914,7.692,14.372,4.195325076262957,3.985047982483578,4.355251140928126,0.6992208460438263,0.664174663747263,0.7258751901546876,47.449462890625,45.70703125,49.953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(1430.1350000000002), 'mean_duration_us': np.float64(47.67116666666667), 'median_duration_us': np.float64(47.4495), 'std_dev_duration_us': np.float64(1.2984185016994922), 'min_duration_us': np.float64(45.707), 'max_duration_us': np.float64(49.953)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(47.67)}]","{'shape_in1': (1, 256, 9, 120, 120), 'shape_in2': (1, 256, 9, 120, 120), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (33177600, 129600, 14400, 120, 1), 'stride_input2': (33177600, 129600, 14400, 120, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.06779028822223704,97.96576524006514 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16108,10,350.14,35.013999999999996,1.7298015942747773,0.331779072,253.130859375,1.2499826392907571,vector_bf16,2.004737707052307,0.06301325376758718,2.505887330146943,0.07876547325470686,132.519189453125,4.220332799620465,1325.19189453125,34.667,33.68,39.719,2.0290679428963987,1.9001680712255788,2.0888756664681267,2.536299702561908,2.3751771007665767,2.6110583187220686,130.8125,127.06689453125,139.68603515625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(411.72300000000007), 'mean_duration_us': np.float64(41.17230000000001), 'median_duration_us': np.float64(41.321), 'std_dev_duration_us': np.float64(0.6129716225079271), 'min_duration_us': np.float64(40.298), 'max_duration_us': np.float64(42.142)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(913.469), 'mean_duration_us': np.float64(91.3469), 'median_duration_us': np.float64(90.45400000000001), 'std_dev_duration_us': np.float64(3.6463250389947413), 'min_duration_us': np.float64(86.047), 'max_duration_us': np.float64(97.544)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(41.17)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(91.35)}]","{'op_shape': (1, 512, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.0628158781334159,98.02858111819856 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23914,1,80.239,80.239,,509.607936,143.65234375,3383.167912984364,matrix_bf16,0.11735168531033857,,397.02045627657606,,1283.5810546875,,1283.5810546875,80.239,80.239,80.239,0.11735168531033857,0.11735168531033857,0.11735168531033857,397.02045627657606,397.02045627657606,397.02045627657606,1283.5810546875,1283.5810546875,1283.5810546875,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.693), 'mean_duration_us': np.float64(9.693), 'median_duration_us': np.float64(9.693), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.693), 'max_duration_us': np.float64(9.693)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.719), 'mean_duration_us': np.float64(26.719), 'median_duration_us': np.float64(26.719), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.719), 'max_duration_us': np.float64(26.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.848), 'mean_duration_us': np.float64(32.848), 'median_duration_us': np.float64(32.848), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.848), 'max_duration_us': np.float64(32.848)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(46.107), 'mean_duration_us': np.float64(46.107), 'median_duration_us': np.float64(46.107), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(46.107), 'max_duration_us': np.float64(46.107)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(135.921), 'mean_duration_us': np.float64(135.921), 'median_duration_us': np.float64(135.921), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(135.921), 'max_duration_us': np.float64(135.921)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1032.293), 'mean_duration_us': np.float64(1032.293), 'median_duration_us': np.float64(1032.293), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1032.293), 'max_duration_us': np.float64(1032.293)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.72)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(32.85)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(46.11)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(135.92)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1032.29)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 122, 122), 'filter_shape': (256, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (53344256, 104188, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x16_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.06084346835982709,98.08942458655838 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60),)","('c10::BFloat16',)","((9216000, 18000, 3600, 60, 1),)","('',)",15978,60,565.67,9.427833333333332,1.2140260819618398,0.009216,35.15625,0.25,vector_bf16,1.8904501294617297,0.30838185239712307,0.47261253236543244,0.07709546309928077,20.029386393229167,3.3221468251065898,1201.76318359375,9.203,8.313,17.416,1.9580589718680137,1.3900954134521553,2.384180888018695,0.4895147429670034,0.3475238533630388,0.5960452220046738,18.8271484375,15.4619140625,26.51904296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(1201.764), 'mean_duration_us': np.float64(20.0294), 'median_duration_us': np.float64(18.826999999999998), 'std_dev_duration_us': np.float64(3.2943422874174244), 'min_duration_us': np.float64(15.462), 'max_duration_us': np.float64(26.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(20.03)}]","{'op_shape': (1, 512, 5, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (9216000, 18000, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.05696519122806236,98.14638977778644 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24164,1,78.086,78.086,,10.7495424,160.262451171875,63.96733873117673,matrix_bf16,0.14172650572859058,,9.065867399126812,,1185.7158203125,,1185.7158203125,78.086,78.086,78.086,0.14172650572859058,0.14172650572859058,0.14172650572859058,9.065867399126812,9.065867399126812,9.065867399126812,1185.7158203125,1185.7158203125,1185.7158203125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.647), 'mean_duration_us': np.float64(5.647), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.647)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.248), 'mean_duration_us': np.float64(6.248), 'median_duration_us': np.float64(6.248), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.248), 'max_duration_us': np.float64(6.248)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.814), 'mean_duration_us': np.float64(9.814), 'median_duration_us': np.float64(9.814), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.814), 'max_duration_us': np.float64(9.814)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(184.593), 'mean_duration_us': np.float64(184.593), 'median_duration_us': np.float64(184.593), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(184.593), 'max_duration_us': np.float64(184.593)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(974.007), 'mean_duration_us': np.float64(974.007), 'median_duration_us': np.float64(974.007), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(974.007), 'max_duration_us': np.float64(974.007)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(6.25)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.81)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(184.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(974.01)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 11, 242, 242), 'filter_shape': (3, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (82458112, 644204, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['batched_transpose_4x256_half'], ['batched_transpose_256x4_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.05620452462543859,98.20259430241188 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 1024))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",194,64,2174.061,33.969703125,10.079637492977184,2.944401408,11.427734375,245.7179969236028,matrix_bf16,0.6610638340444953,0.020826275883205406,162.4352811400504,5.117390793399572,18.144737243652344,0.5846290263867382,1161.26318359375,30.811,27.211,73.289,0.6692539394038561,0.6167753073462515,0.6957015649610205,164.4477374235458,151.5527930730604,170.94639499883772,17.90478515625,17.22412109375,19.42822265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(1161.262), 'mean_duration_us': np.float64(18.14471875), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.5800629941208434), 'min_duration_us': np.float64(17.224), 'max_duration_us': np.float64(19.428)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(18.14)}]","{'M': 351, 'N': 1024, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0550454367571046,98.25763973916898 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120),)","('c10::BFloat16',)","((66355200, 129600, 14400, 120, 1),)","('',)",16112,10,104.346,10.4346,0.40849376440229207,0.0663552,253.125,0.25,vector_bf16,2.500627576236184,0.08554728700233341,0.625156894059046,0.021386821750583353,106.256689453125,3.7388532278256914,1062.56689453125,10.4455,9.935,11.296,2.5054903080122424,2.317502497921596,2.623021200086858,0.6263725770030606,0.579375624480399,0.6557553000217144,105.9365234375,101.18896484375,114.52880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1062.567), 'mean_duration_us': np.float64(106.2567), 'median_duration_us': np.float64(105.9365), 'std_dev_duration_us': np.float64(3.547052806204047), 'min_duration_us': np.float64(101.189), 'max_duration_us': np.float64(114.529)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(106.26)}]","{'op_shape': (1, 512, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.05036709991279169,98.30800683908177 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (6, 3072), (3072, 3072), (), (), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",8861,80,1944.337,24.3042125,2.671565893134728,0.11326464,18.076171875,5.975688816855754,matrix_bf16,1.5882308538959182,0.12805099913234252,9.490773352211102,0.7651929235023447,11.99677734375,0.7928533757608454,959.7421875,23.439999999999998,21.251,35.763,1.577273719881354,1.4383001785912781,2.1315844006369775,9.42529692901548,8.594834292489534,12.73768506507056,12.01708984375,8.89208984375,13.17822265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(959.742), 'mean_duration_us': np.float64(11.996775), 'median_duration_us': np.float64(12.017), 'std_dev_duration_us': np.float64(0.7878753228620631), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(13.178)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.0)}]","{'M': 6, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.04549307050419506,98.35349990958596 -aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 1, 2700, 512), (1, 1, 2700, 512), (1, 1, 2700, 512), (1, 1, 2700, 2700), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', '')","((1382400, 512, 512, 1), (1382400, 512, 512, 1), (1382400, 512, 512, 1), (7300800, 7300800, 2704, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '')",23557,1,41.391,41.391,,14.92992,10.546875,1350.0,matrix_bf16,0.013146792539569399,,17.748169928418687,,841.208984375,,841.208984375,41.391,41.391,41.391,0.013146792539569399,0.013146792539569399,0.013146792539569399,17.748169928418687,17.748169928418687,17.748169928418687,841.208984375,841.208984375,841.208984375,"[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(841.209), 'mean_duration_us': np.float64(841.209), 'median_duration_us': np.float64(841.209), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(841.209), 'max_duration_us': np.float64(841.209)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(841.21)}]","{'B': 1, 'N_Q': 2700, 'H_Q': 1, 'N_KV': 2700, 'H_KV': 1, 'd_h_qk': 512, 'd_h_v': 512, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.03987443725342562,98.3933743468394 -triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6,triton,python3,CPU,thread 416 (python3),"((6, 3072), (3072,), (1, 24, 6, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (144, 1, 24, 144), (), ())","('', '', '', '144', '128')",8856,160,3118.262,19.489137500000002,2.0953007213882966,5.5296e-05,0.041015625,1.2857142857142858,vector_bfloat16,0.008310775202526745,0.0010242538789658852,0.010685282403248673,0.0013168978443847098,5.227825927734375,0.44083111616836695,836.4521484375,19.259,15.994,30.916,0.008134501662356852,0.007064515880654475,0.014317357607282182,0.01045864499445881,0.009082948989412898,0.018408031209362807,5.287109375,3.00390625,6.087890625,"[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(836.449), 'mean_duration_us': np.float64(5.2278062499999995), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.43945555089330424), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]","{'fused_ops': 'aten._to_copy, aten.addmm, aten.mean, aten.pow, aten.transpose, aten.view', 'xnumel': 144, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6']",0.03964895683222492,98.43302330367162 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30),)","('c10::BFloat16',)","((2304000, 4500, 900, 30, 1),)","('',)",15624,100,969.5,9.695,1.5266958247844078,0.002304,8.7890625,0.25,vector_bf16,1.223421991947327,0.16275653924656786,0.30585549798683176,0.040689134811641964,7.666044921875,1.0174137084075794,766.6044921875,9.394,8.232,17.876,1.2078905632524068,0.9353470439565885,1.565168587776764,0.3019726408131017,0.23383676098914713,0.391292146944191,7.6298828125,5.88818359375,9.85302734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(766.604), 'mean_duration_us': np.float64(7.666040000000001), 'median_duration_us': np.float64(7.630000000000001), 'std_dev_duration_us': np.float64(1.012318496521722), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(9.853)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.67)}]","{'op_shape': (1, 512, 5, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.03633808398353707,98.46936138765516 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 8, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (58982400, 115200, 14400, 120, 1)), ())","('', '2')",16091,10,259.815,25.9815,2.671228025958599,,,,,,,,,72.501708984375,2.7954535278924006,725.01708984375,25.213,24.486,33.389,,,,,,,72.02490234375,68.25927734375,76.7919921875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.589), 'mean_duration_us': np.float64(13.4589), 'median_duration_us': np.float64(13.018), 'std_dev_duration_us': np.float64(1.186606796710688), 'min_duration_us': np.float64(12.177), 'max_duration_us': np.float64(15.983)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(590.428), 'mean_duration_us': np.float64(59.0428), 'median_duration_us': np.float64(58.646), 'std_dev_duration_us': np.float64(2.601411878192303), 'min_duration_us': np.float64(55.481), 'max_duration_us': np.float64(63.734)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(59.04)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.03436678517897083,98.50372817283413 -aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((14745600, 57600, 14400, 120, 1), (), ())","('', '', '[2., 2., 2.]')",24031,1,8.723,8.723,,,,,,,,,,686.5791015625,,686.5791015625,8.723,8.723,8.723,,,,,,,686.5791015625,686.5791015625,686.5791015625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(686.579), 'mean_duration_us': np.float64(686.579), 'median_duration_us': np.float64(686.579), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(686.579), 'max_duration_us': np.float64(686.579)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(686.58)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.032544772836809066,98.53627294567094 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",24065,6,191.335,31.889166666666668,3.5089671652306285,0.331776768,253.12646484375,1.2499956597473394,vector_bf16,2.334513274376343,0.05817819152488088,2.9181314605929782,0.07272248689805057,113.753662109375,2.8280491391961675,682.52197265625,30.556,29.794,38.938,2.329496848667892,2.269116222910527,2.4093795725759266,2.91186095022997,2.836385430100435,3.0117140084038083,113.967041015625,110.162109375,116.9716796875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(206.863), 'mean_duration_us': np.float64(34.47716666666667), 'median_duration_us': np.float64(34.67100000000001), 'std_dev_duration_us': np.float64(0.5376580129495795), 'min_duration_us': np.float64(33.73), 'max_duration_us': np.float64(35.131)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(475.659), 'mean_duration_us': np.float64(79.2765), 'median_duration_us': np.float64(79.3965), 'std_dev_duration_us': np.float64(2.7204514178104104), 'min_duration_us': np.float64(75.271), 'max_duration_us': np.float64(82.281)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(34.48)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(79.28)}]","{'op_shape': (1, 128, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 518400, 57600, 240, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.03235245946996893,98.5686254051409 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",24082,1,7.611,7.611,,0.1327104,506.25,0.25,vector_bf16,0.790228802449268,,0.197557200612317,,671.7568359375,,671.7568359375,7.611,7.611,7.611,0.790228802449268,0.790228802449268,0.790228802449268,0.197557200612317,0.197557200612317,0.197557200612317,671.7568359375,671.7568359375,671.7568359375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(671.757), 'mean_duration_us': np.float64(671.757), 'median_duration_us': np.float64(671.757), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(671.757), 'max_duration_us': np.float64(671.757)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(671.76)}]","{'input_shape': (1, 256, 9, 240, 240), 'output_shape': (1, 256, 9, 240, 240), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 256, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.031842177510801234,98.6004675826517 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 4, 351, 128), (1, 8, 4, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 179712, 44928, 128, 1), (359424, 44928, 0, 128, 1), ())","('', '', 'False')",259,64,508.173,7.940203125,1.715991269631171,0.001437696,5.484375,0.25,vector_bf16,0.5987374395746305,0.10328030218298506,0.14968435989365764,0.025820075545746262,9.871139526367188,1.5825210598707937,631.7529296875,7.912000000000001,5.668,12.579,0.5511301415714474,0.4528803211566561,0.7977245754538066,0.13778253539286187,0.11322008028916404,0.19943114386345168,10.4345703125,7.208984375,12.6982421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(631.752), 'mean_duration_us': np.float64(9.871125), 'median_duration_us': np.float64(10.4345), 'std_dev_duration_us': np.float64(1.5701190788838277), 'min_duration_us': np.float64(7.209), 'max_duration_us': np.float64(12.698)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}]","{'op_shape': (1, 8, 4, 351, 128), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1437696, 179712, 44928, 128, 1), 'stride_output': (359424, 44928, 0, 128, 1)}",True,transformers/integrations/sdpa_attention.py(16): repeat_kv,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'transformers/integrations/sdpa_attention.py(16): repeat_kv', 'aten::reshape', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.029945938550820683,98.63041352120253 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((18432000, 72000, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23928,5,38.018,7.6036,0.4024211724052303,0.026672128,86.029296875,0.29567280405021906,vector_bf16,0.7687604760681077,0.04037298663064846,0.22730156560203874,0.011937194164965838,117.5978515625,6.0791423956177555,587.9892578125,7.581,7.211,8.223,0.7449125574591449,0.7301771757043032,0.8141230804972525,0.2202503846361653,0.21589353299396083,0.24071405405262486,121.09912109375,110.80419921875,123.54296875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(587.989), 'mean_duration_us': np.float64(117.5978), 'median_duration_us': np.float64(121.099), 'std_dev_duration_us': np.float64(5.437447540896374), 'min_duration_us': np.float64(110.804), 'max_duration_us': np.float64(123.543)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(117.6)}]","{'input_shape': (1, 256, 5, 120, 120), 'output_shape': (1, 256, 7, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 7, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (18432000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.027871481643473535,98.658285002846 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240),)","('c10::BFloat16',)","((66355200, 518400, 57600, 240, 1),)","('',)",24069,6,55.162,9.193666666666667,0.34701047054327727,0.0663552,253.125,0.25,vector_bf16,2.7463134384310677,0.09326596692744069,0.6865783596077669,0.02331649173186017,96.74283854166667,3.415178432280567,580.45703125,9.123000000000001,8.784,9.804,2.783530407769806,2.5731073745000117,2.813483009844415,0.6958826019424516,0.6432768436250029,0.7033707524611037,95.361083984375,94.3388671875,103.15185546875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(580.457), 'mean_duration_us': np.float64(96.74283333333334), 'median_duration_us': np.float64(95.361), 'std_dev_duration_us': np.float64(3.117643256086595), 'min_duration_us': np.float64(94.339), 'max_duration_us': np.float64(103.152)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(96.74)}]","{'op_shape': (1, 128, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.02751444397385314,98.68579944681986 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 7, 32, 32), (512, 16, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((114688, 7168, 1024, 32, 1), (432, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15613,10,806.038,80.6038,12.65775993698025,1.990656,5.03515625,377.03646237393326,matrix_bf16,0.09447383996775557,0.0030013311841405417,35.62008240832367,1.1316112920809172,55.936865234375,1.788120279677389,559.36865234375,76.404,72.698,115.271,0.0947603648473376,0.08972852790294339,0.09985884737998929,35.7281127353034,33.83092673454654,37.65042655288968,55.716796875,52.8720703125,58.84130859375,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(46.74), 'mean_duration_us': np.float64(4.674), 'median_duration_us': np.float64(4.666), 'std_dev_duration_us': np.float64(0.153935051239151), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(4.926)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(47.017999999999994), 'mean_duration_us': np.float64(4.7017999999999995), 'median_duration_us': np.float64(4.666), 'std_dev_duration_us': np.float64(0.30422156399571676), 'min_duration_us': np.float64(4.365), 'max_duration_us': np.float64(5.527)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(69.654), 'mean_duration_us': np.float64(6.9654), 'median_duration_us': np.float64(6.8294999999999995), 'std_dev_duration_us': np.float64(0.5495414816007977), 'min_duration_us': np.float64(6.368), 'max_duration_us': np.float64(8.491)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(81.269), 'mean_duration_us': np.float64(8.126900000000001), 'median_duration_us': np.float64(8.151), 'std_dev_duration_us': np.float64(0.3319751346110128), 'min_duration_us': np.float64(7.73), 'max_duration_us': np.float64(8.932)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(138.397), 'mean_duration_us': np.float64(13.839699999999999), 'median_duration_us': np.float64(13.819500000000001), 'std_dev_duration_us': np.float64(0.46108199921489024), 'min_duration_us': np.float64(13.259), 'max_duration_us': np.float64(14.661)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(176.29100000000003), 'mean_duration_us': np.float64(17.6291), 'median_duration_us': np.float64(17.625), 'std_dev_duration_us': np.float64(1.221462357176839), 'min_duration_us': np.float64(15.021), 'max_duration_us': np.float64(19.387)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.67)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.7)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.97)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.13)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.84)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(17.63)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 7, 32, 32), 'filter_shape': (512, 16, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (114688, 7168, 1024, 32, 1), 'weight_stride': (432, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.02651482645063031,98.7123142732705 -aten::pow,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), ())","('float', 'Scalar')","((1437696, 4096, 1), ())","('', '2')",163,65,717.817,11.043338461538461,2.022270995045878,0.001437696,10.96875,0.125,vector_fp32,1.6925581091770174,0.7261904311245445,0.2115697636471272,0.09077380389056806,8.57967998798077,4.26215138489593,557.67919921875,10.536,9.705,23.996,2.26101087195239,0.7419431543404309,2.587631688893771,0.28262635899404875,0.09274289429255388,0.3234539611117214,5.0869140625,4.44482421875,15.501953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(557.6830000000001), 'mean_duration_us': np.float64(8.579738461538463), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(4.22916112531851), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(15.502)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(8.58)}]","{'op_shape': (1, 351, 4096), 'dtype_in_out': ('float', None), 'stride_input': (1437696, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::pow', 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)']",0.026434744100255193,98.73874901737075 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",8906,76,1720.263,22.63503947368421,1.5723738015352409,3.6864e-05,0.181640625,0.1935483870967742,vector_bfloat16,0.02670014917914858,0.0014673615389841225,0.005167770808867468,0.00028400545915821713,7.155408357319079,0.40602366553147473,543.81103515625,22.418,19.87,28.913,0.02679259327602768,0.023081081183431957,0.029904191352345906,0.005185663214715034,0.004467306035502959,0.005787908003679853,7.10888671875,6.369140625,8.251953125,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(543.8090000000001), 'mean_duration_us': np.float64(7.155381578947369), 'median_duration_us': np.float64(7.109), 'std_dev_duration_us': np.float64(0.40333442331282093), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(8.252)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.16)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17']",0.025777374471540125,98.7645263918423 -aten::mean,reduce,python3,CPU,thread 416 (python3),"((1, 351, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1437696, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",166,65,777.96,11.968615384615385,1.458472356743389,0.001437696,5.484378814697266,0.24999982611078692,vector_fp32,0.6919169018549214,0.047366540534525166,0.17297910514684478,0.011841626897100832,8.351059194711539,0.5903942556171845,542.81884765625,11.608,10.866,18.918,0.7072792351669469,0.5765709024330542,0.784546617639222,0.1768196858035071,0.14414262534880307,0.19613651798561155,8.130859375,7.330078125,9.97412109375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(542.82), 'mean_duration_us': np.float64(8.351076923076924), 'median_duration_us': np.float64(8.131), 'std_dev_duration_us': np.float64(0.5858520765699322), 'min_duration_us': np.float64(7.33), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::mean', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)']",0.025730343449585722,98.79025673529188 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (0, 1, 7488), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",8871,4,130.372,32.593,2.9724337951696547,0.0456192,130.59375,0.3331389088298636,vector_bfloat16,1.0194455802710278,0.023332354575925914,0.3396169882229173,0.007772915143855435,134.3785400390625,3.0942233298319066,537.51416015625,31.421,30.595,36.935,1.021326341240276,0.9891192300578768,1.0460104085456823,0.3402435428799825,0.32951410100411593,0.3484667661275884,134.078125,130.9140625,138.44384765625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(537.5139999999999), 'mean_duration_us': np.float64(134.37849999999997), 'median_duration_us': np.float64(134.07799999999997), 'std_dev_duration_us': np.float64(2.6797598306564714), 'min_duration_us': np.float64(130.914), 'max_duration_us': np.float64(138.444)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(134.38)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10']",0.025478894127483043,98.81573562941936 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((132710400, 518400, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24084,1,66.258,66.258,,33.9738624,379.75,85.31928900592494,matrix_bf16,0.7448041472389053,,63.54616029108764,,534.6328125,,534.6328125,66.258,66.258,66.258,0.7448041472389053,0.7448041472389053,0.7448041472389053,63.54616029108764,63.54616029108764,63.54616029108764,534.6328125,534.6328125,534.6328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(116.853), 'mean_duration_us': np.float64(116.853), 'median_duration_us': np.float64(116.853), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(116.853), 'max_duration_us': np.float64(116.853)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(417.78), 'mean_duration_us': np.float64(417.78), 'median_duration_us': np.float64(417.78), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(417.78), 'max_duration_us': np.float64(417.78)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(116.85)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(417.78)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 9, 240, 240), 'filter_shape': (128, 256, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (132710400, 518400, 57600, 240, 1), 'weight_stride': (256, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.025342314373273916,98.84107794379264 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 18432), (18432,), (6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '6', '3072')",8883,76,1761.41,23.176447368421055,2.177326981383285,3.6864e-05,0.251953125,0.13953488372093023,vector_bfloat16,0.03777591634349677,0.001579996363437218,0.005271058094441411,0.0002204646088517043,7.006386204769737,0.30879622514314475,532.4853515625,22.6735,20.17,35.663,0.0381273494468325,0.03265330211225105,0.04046557594794705,0.005320095271651046,0.004556274713337356,0.005646359434597263,6.92919921875,6.52880859375,8.0908203125,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(532.4809999999999), 'mean_duration_us': np.float64(7.006328947368419), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.3067740634476049), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(8.091)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.01)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15']",0.025240521836583228,98.86631846562922 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (256, 3072), (3072, 3072), (), (), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",8725,24,668.274,27.84475,7.524095139876493,4.83262464,21.005859375,219.40306834030685,matrix_bf16,1.0173253780029214,0.0181598812824082,223.20430943430344,3.9843336740560575,21.65789794921875,0.39598337966075176,519.78955078125,25.732999999999997,19.929,44.266,1.022039095161793,0.9629779591836735,1.0434098841163,224.23851344224823,211.28031898898473,228.9273301117202,21.55126953125,21.10986328125,22.873046875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(519.79), 'mean_duration_us': np.float64(21.657916666666665), 'median_duration_us': np.float64(21.551499999999997), 'std_dev_duration_us': np.float64(0.3876544763775542), 'min_duration_us': np.float64(21.11), 'max_duration_us': np.float64(22.873)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.66)}]","{'M': 256, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.024638723804183384,98.89095718943341 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 12288), (12288, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",8770,8,244.043,30.505375,2.7774034604541793,19.327352832,79.5,231.8490566037736,matrix_bf16,1.3119716879275822,0.01678364748497695,304.17939813687036,3.8912728357622064,63.54852294921875,0.8220496203003191,508.38818359375,30.12,27.04,35.613,1.3125027304351495,1.2774606418245487,1.3331012916464946,304.30251984126636,296.1780446554727,309.0782768255118,63.513671875,62.5322265625,65.255859375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(508.38800000000003), 'mean_duration_us': np.float64(63.548500000000004), 'median_duration_us': np.float64(63.5135), 'std_dev_duration_us': np.float64(0.7690328341494929), 'min_duration_us': np.float64(62.532), 'max_duration_us': np.float64(65.256)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(63.55)}]","{'M': 256, 'N': 3072, 'K': 12288, 'bias': False, 'stride_A': (12288, 1), 'stride_B': (1, 12288), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.024098283665091185,98.9150554730985 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((36864000, 72000, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23897,2,14.771999999999998,7.385999999999999,0.14849242404917465,0.053344256,172.05859375,0.29567280405021906,vector_bf16,0.7802294466673749,0.10494345073787381,0.2306926282986936,0.031028924346373176,233.345947265625,31.385804555762075,466.69189453125,7.385999999999999,7.281,7.491,0.7802294466673749,0.706023221009508,0.854435672325242,0.2306926282986936,0.20875186548044877,0.25263339111693844,233.345947265625,211.15283203125,255.5390625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(466.692), 'mean_duration_us': np.float64(233.346), 'median_duration_us': np.float64(233.346), 'std_dev_duration_us': np.float64(22.192999999999998), 'min_duration_us': np.float64(211.153), 'max_duration_us': np.float64(255.539)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(233.35)}]","{'input_shape': (1, 512, 5, 120, 120), 'output_shape': (1, 512, 7, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 7, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.022121823483607694,98.9371772965821 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 12288), (256, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",8768,8,306.316,38.2895,5.666549769102383,19.327352832,79.5,231.8490566037736,matrix_bf16,1.431574856201874,0.013719983350255592,331.9092798680873,3.1809651963762526,58.2354736328125,0.5537596988904987,465.8837890625,38.262,31.567,45.708,1.4258211264016567,1.4195022076477288,1.4542159285860305,330.57528304195387,329.1102476900998,337.15859114085174,58.4658203125,57.32421875,58.72607421875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(465.884), 'mean_duration_us': np.float64(58.2355), 'median_duration_us': np.float64(58.465999999999994), 'std_dev_duration_us': np.float64(0.518025819819823), 'min_duration_us': np.float64(57.324), 'max_duration_us': np.float64(58.726)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(58.24)}]","{'M': 256, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.022083518197517863,98.95926081477963 -triton_poi_fused_addmm_gelu_view_14,triton,python3,CPU,thread 416 (python3),"((1, 6, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((73728, 12288, 1), (1,), ())","('', '', '73728')",8881,80,1636.46,20.455750000000002,1.8270902335459485,0.000589824,0.3046875,1.8461538461538463,vector_bfloat16,0.05662598419539163,0.0014636801071524757,0.10454027851456915,0.0027021786593584176,5.645831298828125,0.1473221720033376,451.66650390625,20.095,18.287,29.033,0.056576863294422824,0.05247926082771896,0.05997354940421632,0.10444959377431906,0.09688478922040424,0.11072039890009167,5.64697265625,5.3271484375,6.087890625,"[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(451.668), 'mean_duration_us': np.float64(5.64585), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.1464002305326054), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 73728, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_14']",0.021409599759404475,98.98067041453903 -aten::cat,other,python3,CPU,thread 416 (python3),"(((0,), (1, 8, 351, 128)), ())","('TensorList', 'Scalar')","(((1,), (359424, 128, 1024, 1)), ())","('', '-2')",249,64,634.271,9.910484375,2.934297985280066,,,,,,,,,7.05194091796875,0.5375223212185637,451.32421875,10.065,6.76,20.49,,,,,,,6.84912109375,6.12890625,8.01123046875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(451.324), 'mean_duration_us': np.float64(7.0519375), 'median_duration_us': np.float64(6.849), 'std_dev_duration_us': np.float64(0.5332750191915518), 'min_duration_us': np.float64(6.129), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/cache_utils.py(910): update', 'transformers/cache_utils.py(102): update', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.021393374982637724,99.00206378952167 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4096,), (1, 351, 4096))","('c10::BFloat16', 'c10::BFloat16')","((1,), (1437696, 4096, 1))","('', '')",174,65,533.169,8.2026,1.34126374410479,0.001437696,5.4921875,0.2496443812233286,vector_bf16,0.9081972025444593,0.21461262434690526,0.22672632865796963,0.053576835807797846,6.7468900240384615,1.7591905227172244,438.5478515625,7.781,7.07,13.56,1.0496024604431786,0.5868144110652271,1.2083170625960453,0.26202735676782063,0.14649492054331062,0.3016495654133798,5.48681640625,4.76611328125,9.81396484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(438.54699999999997), 'mean_duration_us': np.float64(6.746876923076923), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(1.7456149589334042), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(9.814)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.75)}]","{'shape_in1': (4096,), 'shape_in2': (1, 351, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1,), 'stride_input2': (1437696, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.02078775799422288,99.0228515475159 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 1))","('float', 'float')","((1437696, 4096, 1), (351, 1, 1))","('', '')",169,65,595.232,9.157415384615383,2.217930855072948,0.001437696,10.970088958740234,0.1249847430733553,vector_fp32,1.7525208435236848,0.25176938016329525,0.21903836735850768,0.03146733129344737,6.6999098557692305,0.9702103970057914,435.494140625,8.532,7.602,21.913,1.719693894152858,1.2994697256329637,2.1597072475247527,0.21493549952551283,0.1624138897898395,0.2699304554455446,6.68896484375,5.326171875,8.85205078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(435.495), 'mean_duration_us': np.float64(6.699923076923077), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.9627103295894487), 'min_duration_us': np.float64(5.326), 'max_duration_us': np.float64(8.852)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.7)}]","{'shape_in1': (1, 351, 4096), 'shape_in2': (1, 351, 1), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (1437696, 4096, 1), 'stride_input2': (351, 1, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.02064300798866046,99.04349455550457 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((2937600, 979200, 240, 1), ())","('', '')",24177,76,494.229,6.5030131578947366,1.4590684104904839,0.0001728,0.6591873168945312,0.2499971065149709,vector_bf16,0.12640171501154668,0.006092935769228045,0.031600063011416636,0.0015232163124885847,5.4808349609375,0.26325786271629587,416.54345703125,6.269,5.599,18.467,0.12686807528230865,0.10992343407361391,0.14262911677581863,0.031716651729700666,0.02748054045659264,0.03565686649874056,5.4482421875,4.84619140625,6.2880859375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(416.541), 'mean_duration_us': np.float64(5.480802631578947), 'median_duration_us': np.float64(5.448), 'std_dev_duration_us': np.float64(0.26152769903300077), 'min_duration_us': np.float64(4.846), 'max_duration_us': np.float64(6.288)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.48)}]","{'shape_in1': (1, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2937600, 979200, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})']",0.01974472009836892,99.06323927560294 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (1, 512, 5, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', '1')",16005,30,261.576,8.7192,1.3822386240418487,0.009216,52.734375,0.16666666666666666,vector_bf16,4.067775731673674,0.11750178652520014,0.6779626219456122,0.01958363108753333,13.604671223958333,0.3944050019152468,408.14013671875,8.376999999999999,7.922,15.823,4.066007524698881,3.771604875774329,4.354618472660155,0.6776679207831469,0.6286008126290548,0.7257697454433591,13.599609375,12.6982421875,14.6611328125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(408.1389999999999), 'mean_duration_us': np.float64(13.60463333333333), 'median_duration_us': np.float64(13.599499999999999), 'std_dev_duration_us': np.float64(0.387789761196565), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(13.6)}]","{'shape_in1': (1, 512, 5, 60, 60), 'shape_in2': (1, 512, 5, 60, 60), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (9216000, 18000, 3600, 60, 1), 'stride_input2': (9216000, 18000, 3600, 60, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0193463914134106,99.08258566701635 -aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((1843200, 3600, 900, 30, 1), (), ())","('', '', '[1., 2., 2.]')",15955,10,99.345,9.9345,2.0011575122635614,,,,,,,,,40.4791015625,1.1539596188284338,404.791015625,9.2985,9.013,15.593,,,,,,,40.55908203125,38.73681640625,42.98291015625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(404.791), 'mean_duration_us': np.float64(40.4791), 'median_duration_us': np.float64(40.559), 'std_dev_duration_us': np.float64(1.0947686011208024), 'min_duration_us': np.float64(38.737), 'max_duration_us': np.float64(42.983)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(40.48)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.019187638569126513,99.10177330558547 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 14336),)","('c10::BFloat16',)","((5031936, 14336, 1),)","('',)",358,32,399.31,12.4784375,1.9920329207264778,0.005031936,19.1953125,0.25,vector_bf16,1.6580723883371564,0.05299788777482993,0.4145180970842891,0.013249471943707482,12.150711059570312,0.37123387869406144,388.82275390625,11.777000000000001,11.106,18.848,1.6475467510791366,1.5509093537002898,1.8680210138215436,0.41188668776978415,0.38772733842507245,0.4670052534553859,12.216796875,10.77490234375,12.97802734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(388.824), 'mean_duration_us': np.float64(12.15075), 'median_duration_us': np.float64(12.217), 'std_dev_duration_us': np.float64(0.3653646295141334), 'min_duration_us': np.float64(10.775), 'max_duration_us': np.float64(12.978)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(12.15)}]","{'op_shape': (1, 351, 14336), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (5031936, 14336, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'nn.Module: SiLUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(102): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.018430721486953825,99.12020402707242 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((4500, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 4500), (1, 512))","('', '')",15714,30,1153.906,38.46353333333333,9.789135838487882,2.359296,9.2890625,242.22035323801515,matrix_bf16,0.778965648179547,0.10807222918021557,188.68133446232932,26.17729352725155,12.748746744791667,1.8363837130001566,382.46240234375,34.1005,27.081,59.569,0.8009088769080001,0.5902156880288774,0.9499099916190475,193.99643107611774,142.96225244097283,230.08753371428568,12.177490234375,10.25390625,16.5029296875,"[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB2_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB0_LBSPPM0_LPA16_LPB0_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(382.4630000000001), 'mean_duration_us': np.float64(12.74876666666667), 'median_duration_us': np.float64(12.1775), 'std_dev_duration_us': np.float64(1.8054999618449796), 'min_duration_us': np.float64(10.254), 'max_duration_us': np.float64(16.503)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.75)}]","{'M': 4500, 'N': 512, 'K': 512, 'bias': False, 'stride_A': (1, 4500), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, True)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB2_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB0_LBSPPM0_LPA16_LPB0_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.018129232268460676,99.13833325934088 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (1, 256, 8, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((29491200, 115200, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', 'False')",16232,10,59.369,5.9369,0.2615120349896813,0.0294912,112.5,0.25,vector_bf16,3.0965166336703627,0.12042900229641432,0.7741291584175907,0.03010725057410358,38.147509765625,1.4737842299728579,381.47509765625,5.9190000000000005,5.468,6.369,3.095178750724677,2.915663895727733,3.3162470027865094,0.7737946876811692,0.7289159739319333,0.8290617506966274,38.115478515625,35.57177734375,40.458984375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(381.476), 'mean_duration_us': np.float64(38.1476), 'median_duration_us': np.float64(38.1155), 'std_dev_duration_us': np.float64(1.3980922859382354), 'min_duration_us': np.float64(35.572), 'max_duration_us': np.float64(40.459)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(38.15)}]","{'op_shape': (1, 256, 8, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (29491200, 115200, 14400, 120, 1), 'stride_output': (33177600, 129600, 14400, 120, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.018082432698385966,99.15641569203927 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 768), (768, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",7316,48,1524.324,31.75675,6.495863847684891,0.090892032,1.35205078125,64.11105092091007,matrix_bf16,0.18091577072173395,0.004553766926750253,11.59870018913678,0.29194678332284263,7.841481526692708,0.20665183970822962,376.39111328125,31.316499999999998,23.064,56.664,0.1806000462772905,0.16088585050146836,0.18927685423728813,11.57845876320209,10.314560953953565,12.134738040156455,7.85009765625,7.490234375,8.81201171875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(376.39), 'mean_duration_us': np.float64(7.841458333333333), 'median_duration_us': np.float64(7.85), 'std_dev_duration_us': np.float64(0.20446117788932164), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(8.812)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]","{'M': 77, 'N': 768, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(300): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.01784144500124558,99.17425713704053 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 14336), (1, 351, 14336))","('c10::BFloat16', 'c10::BFloat16')","((5031936, 14336, 1), (5031936, 14336, 1))","('', '')",368,32,353.325,11.04140625,2.026749023394521,0.005031936,28.79296875,0.16666666666666666,vector_bf16,2.5968684407497764,0.061371197065949575,0.4328114067916294,0.010228532844324937,11.632553100585938,0.2792152437804258,372.24169921875,10.550999999999998,9.625,20.23,2.608082907373039,2.4552267141041932,2.69187764771441,0.4346804845621731,0.40920445235069886,0.44864627461906836,11.576171875,11.2158203125,12.296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(372.242), 'mean_duration_us': np.float64(11.6325625), 'median_duration_us': np.float64(11.576), 'std_dev_duration_us': np.float64(0.27485666008621656), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(12.297)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(11.63)}]","{'shape_in1': (1, 351, 14336), 'shape_in2': (1, 351, 14336), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (5031936, 14336, 1), 'stride_input2': (5031936, 14336, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(182): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.017644757193879177,99.1919018942344 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 32, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 128, 4096, 1), (1437696, 44928, 128, 1), ())","('', '', '1')",223,32,273.384,8.54325,0.8745665470170297,0.001437696,8.2265625,0.16666666666666666,vector_bf16,0.7618370149119468,0.08368992238991606,0.12697283581865781,0.013948320398319348,11.448394775390625,1.1922998197142467,366.3486328125,8.363,7.541,12.479,0.7516866915936734,0.6188534153501244,1.0205897428076256,0.12528111526561225,0.1031422358916874,0.17009829046793762,11.47607421875,8.4521484375,13.93896484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(366.34899999999993), 'mean_duration_us': np.float64(11.448406249999998), 'median_duration_us': np.float64(11.475999999999999), 'std_dev_duration_us': np.float64(1.1735182641147677), 'min_duration_us': np.float64(8.452), 'max_duration_us': np.float64(13.939)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]","{'shape_in1': (1, 32, 351, 128), 'shape_in2': (1, 32, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 128, 4096, 1), 'stride_input2': (1437696, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.017365417920273022,99.20926731215468 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",162,65,590.034,9.077446153846154,0.9947568803288257,0.001437696,8.2265625,0.16666666666666666,vector_fp32,1.7237160382398424,0.2614321775705723,0.2872860063733071,0.04357202959509538,5.313363882211538,2.1009148460708174,345.36865234375,8.883,8.062,15.263,1.7371099752212389,0.5836083528129232,1.9063783800582714,0.2895183292035398,0.09726805880215389,0.31772973000971194,4.9658203125,4.52490234375,14.78076171875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(345.373), 'mean_duration_us': np.float64(5.313430769230769), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.0846667541783104), 'min_duration_us': np.float64(4.525), 'max_duration_us': np.float64(14.781)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(5.31)}]","{'op_shape': (1, 351, 4096), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (1437696, 4096, 1), 'stride_output': (1437696, 4096, 1)}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.01637093862877946,99.22563825078346 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', '1')",15651,50,427.149,8.54298,0.4447647160612689,0.002304,13.18359375,0.16666666666666666,vector_bf16,2.049290649189194,0.15217728677898917,0.3415484415315323,0.02536288112983155,6.78431640625,0.532550223901356,339.2158203125,8.452,8.042,10.966,2.0729101720413494,1.659333724065174,2.3318962194217936,0.34548502867355824,0.276555620677529,0.3886493699036323,6.6689453125,5.92822265625,8.3310546875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(339.217), 'mean_duration_us': np.float64(6.784339999999999), 'median_duration_us': np.float64(6.6690000000000005), 'std_dev_duration_us': np.float64(0.5272197116952286), 'min_duration_us': np.float64(5.928), 'max_duration_us': np.float64(8.331)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.78)}]","{'shape_in1': (1, 512, 5, 30, 30), 'shape_in2': (1, 512, 5, 30, 30), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2304000, 4500, 900, 30, 1), 'stride_input2': (2304000, 4500, 900, 30, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.01607928611517343,99.24171753689863 -aten::where,elementwise,python3,CPU,thread 416 (python3),"((4500, 4500), (), ())","('bool', 'float', 'float')","((4500, 1), (), ())","('', '', '')",15687,10,138.944,13.8944,1.9382917565045084,,,,,,,,,33.732958984375,2.197378221579753,337.32958984375,13.355,12.829,19.328,,,,,,,34.050048828125,29.8828125,37.1337890625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(337.33), 'mean_duration_us': np.float64(33.733), 'median_duration_us': np.float64(34.05), 'std_dev_duration_us': np.float64(2.0846242826946058), 'min_duration_us': np.float64(29.883), 'max_duration_us': np.float64(37.134)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(33.73)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::where', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})']",0.015989876254046527,99.25770741315269 -aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 24, 256, 128), (1, 24, 256, 128), (1, 24, 256, 128), (1, 24, 256, 256), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', '')","((786432, 128, 3072, 1), (786432, 128, 3072, 1), (786432, 128, 3072, 1), (1572864, 65536, 256, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '')",8729,8,500.084,62.5105,15.14021240651153,0.805306368,6.0,128.0,matrix_bf16,0.15138071586861124,0.01605549020256255,19.37673163118224,2.0551027459280062,41.996337890625,4.696939761735354,335.970703125,56.774,47.451,82.834,0.16225248813796841,0.13066129098597548,0.16377169515481216,20.768318481659957,16.72464524620486,20.962776979815956,38.77587890625,38.416015625,48.15087890625,"[{'name': 'attn_fwd', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(335.971), 'mean_duration_us': np.float64(41.996375), 'median_duration_us': np.float64(38.775999999999996), 'std_dev_duration_us': np.float64(4.393628197102597), 'min_duration_us': np.float64(38.416), 'max_duration_us': np.float64(48.151)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(42.0)}]","{'B': 1, 'N_Q': 256, 'H_Q': 24, 'N_KV': 256, 'H_KV': 24, 'd_h_qk': 128, 'd_h_v': 128, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_ops.py(840): __call__', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.015925463195926887,99.27363287634861 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 6, 3072), (1, 18432), (18432,), (6, 3072), (3072,), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '7431', '3072')",9518,4,145.447,36.36175,2.9388659235607624,0.045656064,174.3515625,0.24973114665949725,vector_bfloat16,2.235915906632433,0.03487208893599103,0.5583778431975269,0.008708646756397034,81.7803955078125,1.2703215423174574,327.12158203125,36.114000000000004,33.66,39.559,2.229153997388585,2.2068674376517743,2.278488194100787,0.5566891838484533,0.5511235357302842,0.5690094693629167,82.02099609375,80.23779296875,82.841796875,"[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(327.122), 'mean_duration_us': np.float64(81.7805), 'median_duration_us': np.float64(82.021), 'std_dev_duration_us': np.float64(1.1001921423096988), 'min_duration_us': np.float64(80.238), 'max_duration_us': np.float64(82.842)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(81.78)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7431, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19']",0.015506002954352244,99.28913887930297 -triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30,triton,python3,CPU,thread 416 (python3),"((1, 9216), (9216,), (7431, 3072), (3072,), (1, 7431, 3072), (1, 6144), (6144,), (1, 7425, 3072), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9216, 1), (1,), (3072, 1), (1,), (22828032, 3072, 1), (6144, 1), (1,), (22809600, 3072, 1), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '7425', '3072')",10411,4,134.381,33.59525,4.208170574410374,0.0456192,130.65234375,0.3329895057852722,vector_bfloat16,1.7391430528826213,0.02483007561898138,0.5791163856692735,0.008268154608975547,78.7860107421875,1.1400923770012072,315.14404296875,31.622500000000002,31.236,39.9,1.7488860568533675,1.7022938325577446,1.756506265266005,0.5823607037463563,0.5668459820047203,0.5848981531796612,78.3349609375,77.9951171875,80.47900390625,"[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(315.144), 'mean_duration_us': np.float64(78.786), 'median_duration_us': np.float64(78.33500000000001), 'std_dev_duration_us': np.float64(0.9873616358761349), 'min_duration_us': np.float64(77.995), 'max_duration_us': np.float64(80.479)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(78.79)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30']",0.014938251493455809,99.30407713079643 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((33177600, 129600, 120, 1), (), ())","('', '', '[2., 2.]')",16219,10,287.398,28.739800000000002,1.0247026452152403,,,,,,,,,31.23642578125,0.6900769421467635,312.3642578125,28.622500000000002,27.471,30.886,,,,,,,31.30517578125,30.203125,32.44580078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(98.69599999999998), 'mean_duration_us': np.float64(9.869599999999998), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.48515300679270235), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(10.575)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(213.668), 'mean_duration_us': np.float64(21.3668), 'median_duration_us': np.float64(21.211), 'std_dev_duration_us': np.float64(0.448329075568382), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.112)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(21.37)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.014806485938344379,99.31888361673478 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",173,65,459.434,7.068215384615385,0.8592739393724307,0.001437696,8.2265625,0.16666666666666666,vector_bf16,1.8643501341747815,0.12625387455996265,0.3107250223624636,0.02104231242666044,4.647265625,0.3059762548695673,302.072265625,6.82,5.879,10.425,1.8098973924802786,1.6443045837676842,2.1539147095830287,0.3016495654133798,0.27405076396128075,0.3589857849305048,4.76611328125,4.0048828125,5.24609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(302.069), 'mean_duration_us': np.float64(4.647215384615385), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.30359114673965415), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.246)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.65)}]","{'op_shape': (1, 351, 4096), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (1437696, 4096, 1), 'stride_output': (1437696, 4096, 1)}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.014318631666319307,99.3332022484011 -aten::le,elementwise,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500))","('int', 'int')","((0, 1), (1, 0))","('', '')",15679,10,124.634,12.4634,2.8076142185136472,,,,,,,,,28.9501953125,2.373956250174059,289.501953125,11.507,10.225,18.177,,,,,,,28.5615234375,26.078125,33.0078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(289.502), 'mean_duration_us': np.float64(28.950200000000002), 'median_duration_us': np.float64(28.561500000000002), 'std_dev_duration_us': np.float64(2.2521561579961547), 'min_duration_us': np.float64(26.078), 'max_duration_us': np.float64(33.008)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.95)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::le', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})']",0.013722781947227676,99.34692503034832 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', '1')",332,64,761.874,11.90428125,1.7543345907069132,0.001437696,8.2265625,0.16666666666666666,vector_bf16,1.9498266672252056,0.18037815730556883,0.32497111120420097,0.030063026217594813,4.460662841796875,0.4034041318322504,285.482421875,12.4985,9.494,15.814,1.8892533897978825,1.5953050792848111,2.3162984722695685,0.3148755649663138,0.2658841798808019,0.3860497453782615,4.56591796875,3.72412109375,5.4072265625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(285.48199999999997), 'mean_duration_us': np.float64(4.4606562499999995), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.40021659053059944), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]","{'shape_in1': (1, 351, 4096), 'shape_in2': (1, 351, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 4096, 1), 'stride_input2': (1437696, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(303): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.013532250759861208,99.36045728110818 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 32, 351, 64), (1, 32, 351, 64)), ())","('TensorList', 'Scalar')","(((718848, 64, 2048, 1), (1437696, 128, 4096, 1)), ())","('', '-1')",221,32,411.773,12.86790625,0.9777379871788657,,,,,,,,,8.52154541015625,0.17887395708911727,272.689453125,12.594000000000001,11.687,15.863,,,,,,,8.5322265625,8.2109375,8.89208984375,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(272.69), 'mean_duration_us': np.float64(8.5215625), 'median_duration_us': np.float64(8.532), 'std_dev_duration_us': np.float64(0.17609371395296866), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.012925846835055396,99.37338312794324 -triton_poi_fused_silu_24,triton,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (3072, 1), (3072, 1), ())","('', '', '', '', '3072')",9535,52,1206.872,23.209076923076925,2.1043035720586,1.2288e-05,0.029296875,0.4,vector_bfloat16,0.00596990870579159,0.0004166008589559358,0.002387963482316636,0.00016664034358237435,5.169762244591346,0.35059874796358426,268.82763671875,22.814,21.081,34.812,0.0058103583302548945,0.005364017392787109,0.006848215957331011,0.0023241433321019578,0.0021456069571148435,0.0027392863829324046,5.287109375,4.48583984375,5.72705078125,"[{'name': 'triton_poi_fused_silu_24', 'stream': 0, 'count': 52, 'total_duration_us': np.float64(268.82599999999996), 'mean_duration_us': np.float64(5.169730769230768), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.3472250497978229), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(5.727)}]","[{'name': 'triton_poi_fused_silu_24', 'stream': 0, 'mean_duration_us': np.float64(5.17)}]","{'fused_ops': 'aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_silu_24']",0.01274279154340314,99.38612591948664 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (2304000, 1, 460800, 15360, 512), ())","('', '', 'False')",15807,10,92.55799999999999,9.255799999999999,0.38963139275759384,0.002304,8.7890625,0.25,vector_bf16,0.35354580416689746,0.009836118042428581,0.08838645104172436,0.0024590295106071453,26.085595703125,0.7291111897753998,260.85595703125,9.204,8.893,10.195,0.35371643719427714,0.3378325726252483,0.366357421533803,0.08842910929856929,0.08445814315631207,0.09158935538345075,26.057373046875,25.15576171875,27.27978515625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(260.85699999999997), 'mean_duration_us': np.float64(26.085699999999996), 'median_duration_us': np.float64(26.0575), 'std_dev_duration_us': np.float64(0.6917326145267407), 'min_duration_us': np.float64(25.156), 'max_duration_us': np.float64(27.28)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.09)}]","{'op_shape': (1, 512, 5, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': (2304000, 1, 460800, 15360, 512)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.012364923204610023,99.39849084269126 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((132710400, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",24050,1,34.431,34.431,,0.663553536,506.2529296875,1.2499956597473394,vector_bf16,2.0430954133492696,,2.5538603991362834,,259.82373046875,,259.82373046875,34.431,34.431,34.431,2.0430954133492696,2.0430954133492696,2.0430954133492696,2.5538603991362834,2.5538603991362834,2.5538603991362834,259.82373046875,259.82373046875,259.82373046875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(69.983), 'mean_duration_us': np.float64(69.983), 'median_duration_us': np.float64(69.983), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(69.983), 'max_duration_us': np.float64(69.983)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(189.841), 'mean_duration_us': np.float64(189.841), 'median_duration_us': np.float64(189.841), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(189.841), 'max_duration_us': np.float64(189.841)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(69.98)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(189.84)}]","{'op_shape': (1, 256, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.012315994277242103,99.4108068369685 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((5529600, 10800, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23763,7,52.808,7.544,0.3749626648081112,0.00984064,29.31640625,0.3201199200532978,vector_bf16,0.8356853174485853,0.0652326927666893,0.2675195170113559,0.020882284393333953,36.985142299107146,2.997844621887172,258.89599609375,7.551,7.04,8.253,0.8661196213955535,0.7464873429218493,0.9017489263206141,0.2772621439577372,0.2389654685369411,0.28866779420190214,35.4921875,34.08984375,41.18017578125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(258.89599999999996), 'mean_duration_us': np.float64(36.985142857142854), 'median_duration_us': np.float64(35.492), 'std_dev_duration_us': np.float64(2.7754504616919613), 'min_duration_us': np.float64(34.09), 'max_duration_us': np.float64(41.18)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(36.99)}]","{'input_shape': (1, 512, 3, 60, 60), 'output_shape': (1, 512, 5, 62, 62), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 5, 62, 62), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (5529600, 10800, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.012272018420099697,99.42307885538861 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500), ())","('c10::BFloat16', 'float', 'Scalar')","((4500, 1), (4500, 1), ())","('', '', 'False')",15693,10,69.976,6.9976,0.2661762991369109,0.02025,115.87142944335938,0.16666666666666666,vector_bf16,4.834001105066538,0.10101105780939573,0.8056668508444231,0.016835176301565957,25.14443359375,0.5304924444151331,251.4443359375,6.980499999999999,6.66,7.501,4.856897590067218,4.659077291791492,4.956121656342741,0.8094829316778698,0.7765128819652487,0.8260202760571235,25.01611328125,24.51513671875,26.078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(251.44399999999996), 'mean_duration_us': np.float64(25.144399999999997), 'median_duration_us': np.float64(25.016), 'std_dev_duration_us': np.float64(0.5033279646512797), 'min_duration_us': np.float64(24.515), 'max_duration_us': np.float64(26.078)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(25.14)}]","{'op_shape': (4500, 4500), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (4500, 1), 'stride_output': (4500, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.011918799706494298,99.4349976550951 -aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 4500, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (1,), ())","('', '', '1')",15716,30,279.286,9.309533333333333,1.8282352284579553,0.002304,8.7900390625,0.24997222530829907,vector_bf16,1.1134019831507815,0.08297725352346684,0.27831957139087415,0.020742008713231903,8.324674479166667,0.6475289678986142,249.740234375,8.347000000000001,7.381,12.529,1.1171880307758837,0.9240938538209233,1.2783736389001763,0.2792659781408441,0.2309977970333382,0.319557903291345,8.2509765625,7.2099609375,9.97412109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(249.73699999999997), 'mean_duration_us': np.float64(8.324566666666666), 'median_duration_us': np.float64(8.251), 'std_dev_duration_us': np.float64(0.6366639450203608), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.32)}]","{'shape_in1': (1, 4500, 512), 'shape_in2': (512,), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2304000, 512, 1), 'stride_input2': (1,), 'stride_output': None}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.011838023000480088,99.44683567809558 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (1, 128, 9, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (66355200, 518400, 57600, 240, 1), ())","('', '', '1')",24091,3,25.788,8.596,0.6475932365304623,0.0663552,379.6875,0.16666666666666666,vector_bf16,4.913348540831429,0.0638827101568715,0.8188914234719048,0.01064711835947857,81.03971354166667,1.0603492885285808,243.119140625,8.252,8.193,9.343,4.937254068193791,4.840960729552579,4.961830824747914,0.8228756780322986,0.8068267882587632,0.8269718041246523,80.63818359375,80.23876953125,82.2421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(243.119), 'mean_duration_us': np.float64(81.03966666666666), 'median_duration_us': np.float64(80.638), 'std_dev_duration_us': np.float64(0.8656420866745228), 'min_duration_us': np.float64(80.239), 'max_duration_us': np.float64(82.242)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(81.04)}]","{'shape_in1': (1, 128, 9, 240, 240), 'shape_in2': (1, 128, 9, 240, 240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (66355200, 518400, 57600, 240, 1), 'stride_input2': (66355200, 518400, 57600, 240, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.011524174251611126,99.45835985234719 -aten::rsqrt,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 1),)","('float',)","((351, 1, 1),)","('',)",168,65,522.1659999999999,8.033323076923075,1.3787974618722594,3.51e-07,0.00267791748046875,0.125,vector_fp32,0.000811015823124428,0.00015998493776983827,0.00010137697789055351,1.9998117221229787e-05,3.5995192307692307,0.7070860071860678,233.96875,7.581,7.111,14.081,0.0007876707300369811,0.0006431205546857526,0.001016219119985863,9.845884125462266e-05,8.039006933571909e-05,0.00012702738999823292,3.56494140625,2.76318359375,4.3662109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(233.966), 'mean_duration_us': np.float64(3.599476923076923), 'median_duration_us': np.float64(3.565), 'std_dev_duration_us': np.float64(0.7015092105912641), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(4.366)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","{'op_shape': (1, 351, 1), 'dtype_in_out': ('float', None), 'stride_input': (351, 1, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::rsqrt', 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.011090433429059186,99.46945028577625 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4500), (1, 1, 4500, 4500), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), (20250000, 20250000, 4500, 1), ())","('', '', 'False')",15754,10,75.916,7.5916,0.22939107800144828,0.02025,77.24761962890625,0.25,vector_bf16,3.5745571973431325,0.19077837422303046,0.8936392993357831,0.047694593555757614,22.71689453125,1.1823191769798056,227.1689453125,7.607,7.171,7.882,3.492347054494783,3.320349872900863,3.888607594936709,0.8730867636236957,0.8300874682252157,0.9721518987341773,23.19384765625,20.830078125,24.39501953125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(227.16899999999998), 'mean_duration_us': np.float64(22.7169), 'median_duration_us': np.float64(23.194000000000003), 'std_dev_duration_us': np.float64(1.1216505204385192), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(24.395)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.72)}]","{'op_shape': (1, 1, 4500, 4500), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (20268000, 20268000, 4504, 1), 'stride_output': (20250000, 20250000, 4500, 1)}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.010768113541393317,99.48021839931764 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 128, 4096, 1), (44928, 44928, 128, 1))","('', '')",215,32,448.726,14.0226875,0.740545458842942,0.001437696,5.570068359375,0.24615384615384617,vector_bf16,0.8305715382853068,0.027080094686426973,0.20444837865484478,0.006665869461274335,7.0394287109375,0.23301198720589594,225.26171875,13.835,12.889,16.244,0.8356954264292016,0.7756715336229816,0.8784336285525446,0.20570964342872655,0.19093453135334934,0.2162298162590879,6.989013671875,6.64892578125,7.52978515625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(225.261), 'mean_duration_us': np.float64(7.03940625), 'median_duration_us': np.float64(6.989000000000001), 'std_dev_duration_us': np.float64(0.22938693557161774), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.04)}]","{'shape_in1': (1, 32, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 128, 4096, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.010677708437183717,99.49089610775482 -triton_poi_fused_silu_0,triton,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), (1, 3072), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (3072, 1), (3072, 1), (3072, 1), ())","('', '', '', '', '', '3072')",8844,40,887.968,22.199199999999998,9.269308978199687,1.2288e-05,0.03515625,0.3333333333333333,vector_bfloat16,0.007085985103819509,0.0012804199879796997,0.002361995034606503,0.0004268066626599001,5.32086181640625,0.6771427092767259,212.83447265625,19.3385,17.356,51.336,0.0067186501735338605,0.006055299326275265,0.010959133691392073,0.0022395500578446205,0.0020184331087584216,0.003653044563797358,5.48681640625,3.36376953125,6.087890625,"[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(212.83599999999998), 'mean_duration_us': np.float64(5.3209), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.6685760914062063), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","{'fused_ops': 'aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_silu_0']",0.010088640258167204,99.50098474801298 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (3072, 16, 1, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((475200, 29700, 900, 30, 1), (64, 4, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 2, 2]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",8802,4,658.398,164.5995,4.092888181549397,2.9196288,44.7872314453125,62.168946598091566,matrix_bf16,0.8896826293271557,0.05974683496044974,55.310631871889626,3.7143977920611895,52.9669189453125,3.5973766299697525,211.86767578125,163.0775,161.61,170.633,0.8915369841641705,0.8147037157934861,0.9609528331867957,55.425915158725914,50.649271800432004,59.74142536967469,52.67626953125,48.87109375,57.64404296875,"[{'name': 'Im3d2Col', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.557000000000002), 'mean_duration_us': np.float64(6.8892500000000005), 'median_duration_us': np.float64(6.1080000000000005), 'std_dev_duration_us': np.float64(2.277268470668314), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(10.695)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(184.31099999999998), 'mean_duration_us': np.float64(46.077749999999995), 'median_duration_us': np.float64(46.5685), 'std_dev_duration_us': np.float64(1.0810030931963137), 'min_duration_us': np.float64(44.225), 'max_duration_us': np.float64(46.949)}]","[{'name': 'Im3d2Col', 'stream': 0, 'mean_duration_us': np.float64(6.89)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(46.08)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 33, 30, 30), 'filter_shape': (3072, 16, 1, 2, 2), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (475200, 29700, 900, 30, 1), 'weight_stride': (64, 4, 4, 2, 1), 'bias': False, 'stride': (1, 2, 2), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['Im3d2Col'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32']]",0.010042812785987221,99.51102756079896 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((9216000, 18000, 60, 1), (), ())","('', '', '[2., 2.]')",16075,10,274.438,27.4438,0.9373258416011656,,,,,,,,,20.66845703125,0.45238589520729844,206.6845703125,27.2405,26.159,29.744,,,,,,,20.60791015625,20.02783203125,21.30908203125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.91100000000001), 'mean_duration_us': np.float64(5.6911000000000005), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.10499185682708932), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(5.847)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(149.774), 'mean_duration_us': np.float64(14.9774), 'median_duration_us': np.float64(15.021), 'std_dev_duration_us': np.float64(0.4257833251784293), 'min_duration_us': np.float64(14.301), 'max_duration_us': np.float64(15.542)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(14.98)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.00979712661568899,99.52082468741466 -aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 12, 77, 64), (1, 12, 77, 64), (1, 12, 77, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((59136, 64, 768, 1), (59136, 64, 768, 1), (59136, 64, 768, 1), (), (), (), ())","('', '', '', '0.', 'True', 'False', '0.125')",7344,12,846.866,70.57216666666666,8.632247625074596,0.009106944,0.451171875,19.25,matrix_bf16,0.028048658484837938,0.0035276384230741096,0.5399366758331304,0.0679070396441766,17.1666259765625,2.6112065924067016,205.99951171875,67.36,66.298,96.773,0.029676861918488732,0.020647946125649987,0.030919205514424303,0.5712795919309082,0.39747296291876233,0.5951947061526679,15.94140625,15.30078125,22.912109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(40.326), 'mean_duration_us': np.float64(3.3605), 'median_duration_us': np.float64(2.062), 'std_dev_duration_us': np.float64(2.6652849284832567), 'min_duration_us': np.float64(1.801), 'max_duration_us': np.float64(9.493)}, {'name': 'attn_fwd', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(165.674), 'mean_duration_us': np.float64(13.806166666666668), 'median_duration_us': np.float64(13.6795), 'std_dev_duration_us': np.float64(0.4373817618003243), 'min_duration_us': np.float64(13.378), 'max_duration_us': np.float64(14.981)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}, {'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.81)}]","{'B': 1, 'N_Q': 77, 'H_Q': 12, 'N_KV': 77, 'H_KV': 12, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': True, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(300): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', ['aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)'], ['attn_fwd']]",0.00976465391696752,99.53058934133163 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((172800, 57600, 240, 1), (172800, 57600, 240, 1), ())","('', '', '1')",24181,40,242.27100000000002,6.056775,0.44975095601443443,0.0001728,0.98876953125,0.16666666666666666,vector_bf16,0.202243043137842,0.004947866473555995,0.033707173856307004,0.0008246444122593279,5.12955322265625,0.1278144411402751,205.18212890625,5.969,5.569,8.332,0.2038170858130159,0.1903510891976692,0.20874620526936688,0.033969514302169324,0.03172518153294487,0.03479103421156115,5.0869140625,4.966796875,5.44677734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(205.18399999999997), 'mean_duration_us': np.float64(5.129599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.12611756420102632), 'min_duration_us': np.float64(4.967), 'max_duration_us': np.float64(5.447)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.13)}]","{'shape_in1': (1, 3, 240, 240), 'shape_in2': (1, 3, 240, 240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (172800, 57600, 240, 1), 'stride_input2': (172800, 57600, 240, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.009725908872306262,99.54031525020395 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 1), (), ())","('float', 'double', 'Scalar')","((351, 1, 1), (), ())","('', '', '1')",167,65,577.346,8.882246153846154,0.8988201994623496,3.51e-07,0.002685546875,0.12464488636363637,vector_fp32,0.0010224754481700444,0.0003662162240220401,0.00012744633604676333,4.5646979627747184e-05,3.15517578125,1.1386083261282682,205.08642578125,8.653,7.932,13.159,0.001212099201345103,0.0006335458640008789,0.0014360478087649404,0.00015108196721311476,7.896825222454136e-05,0.000178996015936255,2.3232421875,1.9609375,4.44482421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(205.08299999999997), 'mean_duration_us': np.float64(3.1551230769230765), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(1.1297545207520807), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.16)}]","{'shape_in1': (1, 351, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (351, 1, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.009721372415464204,99.55003662261942 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 8, 351, 64), (1, 8, 351, 64)), ())","('TensorList', 'Scalar')","(((179712, 64, 512, 1), (359424, 128, 1024, 1)), ())","('', '-1')",230,32,307.449,9.60778125,2.1155782818732733,,,,,,,,,6.35845947265625,0.1797532206189524,203.470703125,9.123999999999999,8.353,19.76,,,,,,,6.388671875,6.087890625,6.72900390625,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(203.47), 'mean_duration_us': np.float64(6.3584375), 'median_duration_us': np.float64(6.3885000000000005), 'std_dev_duration_us': np.float64(0.17691522289998107), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.009644784988472507,99.55968140760788 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23921,5,161.34,32.268,2.996439804167604,0.092161536,70.3154296875,1.249968751302029,vector_bf16,1.8196259857468635,0.07598200275224626,2.2744756212407307,0.09497512910165266,40.5779296875,1.7379210572548163,202.8896484375,30.966,29.905,37.385,1.8242151765729195,1.7027269959631042,1.8956430126165935,2.280211966367063,2.1283555369522564,2.36949452939478,40.41796875,38.89501953125,43.3017578125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(63.48799999999999), 'mean_duration_us': np.float64(12.697599999999998), 'median_duration_us': np.float64(12.658), 'std_dev_duration_us': np.float64(0.31837122985596544), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.218)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(139.40200000000002), 'mean_duration_us': np.float64(27.8804), 'median_duration_us': np.float64(28.161), 'std_dev_duration_us': np.float64(1.3720892973855596), 'min_duration_us': np.float64(26.358), 'max_duration_us': np.float64(30.084)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(12.7)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(27.88)}]","{'op_shape': (1, 256, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (18432000, 72000, 14400, 120, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.009617242214788579,99.56929864982267 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240),)","('c10::BFloat16',)","((132710400, 518400, 57600, 240, 1),)","('',)",24054,1,10.546,10.546,,0.1327104,506.25,0.25,vector_bf16,2.6219584234922992,,0.6554896058730748,,202.4599609375,,202.4599609375,10.546,10.546,10.546,2.6219584234922992,2.6219584234922992,2.6219584234922992,0.6554896058730748,0.6554896058730748,0.6554896058730748,202.4599609375,202.4599609375,202.4599609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.46), 'mean_duration_us': np.float64(202.46), 'median_duration_us': np.float64(202.46), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.46), 'max_duration_us': np.float64(202.46)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.46)}]","{'op_shape': (1, 256, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.009596874449375254,99.57889552427204 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8757,20,579.851,28.99255,2.923976986643542,0.018874368,18.01171875,0.9993493819128172,matrix_bf16,1.887226115973594,0.07791908506895788,1.8859982525279375,0.07786838950287531,10.023876953125,0.41449718217519793,200.4775390625,28.2025,25.398,35.983,1.8748919900656542,1.7528377889155753,1.9979272462809918,1.8736721514254033,1.7516973609462092,1.996627358677686,10.074462890625,9.453125,10.77490234375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(200.47699999999998), 'mean_duration_us': np.float64(10.02385), 'median_duration_us': np.float64(10.0745), 'std_dev_duration_us': np.float64(0.4040388935486285), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.775)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(10.02)}]","{'M': 1, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.009502904986218325,99.58839842925826 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 6144), (1, 6144))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (6144, 1))","('', '', '')",8765,12,456.359,38.029916666666665,10.470274759426268,0.037748736,36.017578125,0.9995119570522206,matrix_bf16,2.2660357358354664,0.05920983918842227,2.2649298130751756,0.05918094224396699,16.677042643229168,0.43521086334175285,200.12451171875,32.7245,28.452,53.66,2.2610839588400373,2.1525982429032617,2.3748705844207683,2.259980452759588,2.1515476825114104,2.3737115455801527,16.703125,15.90283203125,17.544921875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(200.12500000000003), 'mean_duration_us': np.float64(16.677083333333336), 'median_duration_us': np.float64(16.703), 'std_dev_duration_us': np.float64(0.4166806247662062), 'min_duration_us': np.float64(15.903), 'max_duration_us': np.float64(17.545)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(16.68)}]","{'M': 1, 'N': 6144, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.00948617101531624,99.59788460027357 -triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",9540,4,106.08699999999999,26.521749999999997,1.633805654497092,0.045656064,130.6640625,0.33322869955156953,vector_bfloat16,2.7832908104064056,0.05782628163374851,0.9274723772255608,0.01926937662871679,49.2423095703125,1.0254499436432176,196.96923828125,26.084,25.057,28.862,2.785288445110521,2.712332533614298,2.850253817790283,0.9281380464401922,0.9038270429277064,0.9497863730941523,49.192626953125,48.06982421875,50.51416015625,"[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(196.969), 'mean_duration_us': np.float64(49.24225), 'median_duration_us': np.float64(49.192499999999995), 'std_dev_duration_us': np.float64(0.8879511177424136), 'min_duration_us': np.float64(48.07), 'max_duration_us': np.float64(50.514)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'mean_duration_us': np.float64(49.24)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.split, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26']",0.009336606810656121,99.60722120708422 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 8, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((359424, 128, 1024, 1), (359424, 44928, 128, 1), ())","('', '', '1')",232,32,253.965,7.93640625,1.2311671582577977,0.000359424,2.056640625,0.16666666666666666,vector_bf16,0.35531993179079213,0.01044808569923762,0.0592199886317987,0.001741347616539604,6.0743408203125,0.17698023169520577,194.37890625,7.631,6.6,12.118,0.3554075953952792,0.3386445416347186,0.3792051268137718,0.05923459923254655,0.05644075693911977,0.06320085446896197,6.06787109375,5.68701171875,6.3681640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(194.37900000000002), 'mean_duration_us': np.float64(6.074343750000001), 'median_duration_us': np.float64(6.068), 'std_dev_duration_us': np.float64(0.17418714960047285), 'min_duration_us': np.float64(5.687), 'max_duration_us': np.float64(6.368)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}]","{'shape_in1': (1, 8, 351, 128), 'shape_in2': (1, 8, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (359424, 128, 1024, 1), 'stride_input2': (359424, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.009213821588476927,99.6164350286727 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2937600, 979200, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",24184,36,205.996,5.722111111111111,1.2457159909701452,0.0001728,0.6591796875,0.25,vector_bf16,0.13413030987096974,0.0053303296294913765,0.033532577467742436,0.0013325824073728441,5.162204318576389,0.23417343393297987,185.83935546875,5.4030000000000005,5.117,11.477,0.13484259859020767,0.10922666666666668,0.14145873888278207,0.03371064964755192,0.02730666666666667,0.03536468472069552,5.1259765625,4.88623046875,6.328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 36, 'total_duration_us': np.float64(185.84), 'mean_duration_us': np.float64(5.162222222222223), 'median_duration_us': np.float64(5.126), 'std_dev_duration_us': np.float64(0.23083376788299786), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.16)}]","{'op_shape': (1, 3, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2937600, 979200, 240, 1), 'stride_output': (172800, 57600, 240, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.008809035396075065,99.62524406406877 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((36864000, 72000, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",23938,1,7.802,7.802,,0.036864,140.625,0.25,vector_bf16,0.8066917265918002,,0.20167293164795005,,182.791015625,,182.791015625,7.802,7.802,7.802,0.8066917265918002,0.8066917265918002,0.8066917265918002,0.20167293164795005,0.20167293164795005,0.20167293164795005,182.791015625,182.791015625,182.791015625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(182.791), 'mean_duration_us': np.float64(182.791), 'median_duration_us': np.float64(182.791), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(182.791), 'max_duration_us': np.float64(182.791)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.79)}]","{'input_shape': (1, 512, 5, 120, 120), 'output_shape': (1, 512, 5, 120, 120), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 512, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.008664539987580306,99.63390860405634 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 4500), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4500, 4500, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",15701,10,391.722,39.1722,2.09307385865329,0.011523072,8.794921875,1.249500333111259,vector_bf16,0.522348305962933,0.036923707309992886,0.6526743823007867,0.04613618458353874,17.736328125,1.2795679686855788,177.36328125,38.572500000000005,37.496,44.836,0.5256550308680521,0.46046641421849477,0.5814231902475064,0.6568061361712405,0.5753529379525563,0.7264884698928703,17.544189453125,15.861328125,20.02783203125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(61.56), 'mean_duration_us': np.float64(6.156000000000001), 'median_duration_us': np.float64(6.088), 'std_dev_duration_us': np.float64(0.5113282702921871), 'min_duration_us': np.float64(5.286), 'max_duration_us': np.float64(7.129)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(115.80299999999998), 'mean_duration_us': np.float64(11.580299999999998), 'median_duration_us': np.float64(11.536000000000001), 'std_dev_duration_us': np.float64(1.026855398778231), 'min_duration_us': np.float64(9.694), 'max_duration_us': np.float64(13.379)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.58)}]","{'op_shape': (1, 512, 4500), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (4500, 4500, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.00840725807810926,99.64231586213445 -aten::neg,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 64),)","('c10::BFloat16',)","((1437696, 128, 4096, 1),)","('',)",220,32,306.006,9.5626875,1.2968399418114098,0.000718848,2.7421875,0.25,vector_bf16,0.5276864595464045,0.017043813348026016,0.13192161488660115,0.004260953337006503,5.4546661376953125,0.17955712635322646,174.54931640625,9.249,8.433,15.924,0.5279070207082026,0.48181989985272455,0.5608383634285714,0.13197675517705065,0.12045497496318115,0.14020959085714285,5.44677734375,5.126953125,5.9677734375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(174.54999999999998), 'mean_duration_us': np.float64(5.4546874999999995), 'median_duration_us': np.float64(5.447), 'std_dev_duration_us': np.float64(0.17679409589618653), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]","{'op_shape': (1, 32, 351, 64), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (1437696, 128, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(138): rotate_half,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::neg', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.008273872359839953,99.65058973449429 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8766,8,181.851,22.731375,1.4241725354444539,4.831838208,21.0,219.42857142857142,matrix_bf16,1.0240073277948698,0.019970737826024786,224.69646507041716,4.382150471539155,21.510986328125,0.41850110365772064,172.087890625,22.744,20.791,25.237,1.0227870482106778,0.9940519895077919,1.0571297845288326,224.42870086451444,218.12340798342407,231.9644784337553,21.531005859375,20.830078125,22.15185546875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(172.088), 'mean_duration_us': np.float64(21.511), 'median_duration_us': np.float64(21.531), 'std_dev_duration_us': np.float64(0.391523307096781), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.152)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.51)}]","{'M': 256, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.008157197467284757,99.65874693196157 -aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((3686400, 7200, 3600, 60, 1), (), ())","('', '', '[2., 2., 2.]')",23887,1,8.472,8.472,,,,,,,,,,170.73291015625,,170.73291015625,8.472,8.472,8.472,,,,,,,170.73291015625,170.73291015625,170.73291015625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(170.733), 'mean_duration_us': np.float64(170.733), 'median_duration_us': np.float64(170.733), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(170.733), 'max_duration_us': np.float64(170.733)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(170.73)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.008092969570668875,99.66683990153224 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 128, 1024, 1), (44928, 44928, 128, 1))","('', '')",224,32,228.349,7.13590625,0.45208030683789485,0.000359424,1.456787109375,0.23529411764705882,vector_bf16,0.29794120018477027,0.02798009687290115,0.07010381180818125,0.006583552205388514,5.1719207763671875,0.4977407381986989,165.50146484375,7.061,6.479,7.992,0.296790990040014,0.23983643790248388,0.3598374161490683,0.06983317412706214,0.05643210303587857,0.08466762732919254,5.14697265625,4.2451171875,6.369140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(165.5), 'mean_duration_us': np.float64(5.171875), 'median_duration_us': np.float64(5.147), 'std_dev_duration_us': np.float64(0.4898999100581669), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(6.369)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.17)}]","{'shape_in1': (1, 8, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (359424, 128, 1024, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.007844992026761645,99.674684893559 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 4500, 512), (1, 4500, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (4500, 1, 4500), ())","('', '', '1')",15797,10,142.512,14.2512,0.3789522983759875,0.002304,13.18359375,0.16666666666666666,vector_bf16,0.866632001790552,0.013100851859139626,0.14443866696509197,0.0021834753098566033,15.9546875,0.24112172126375578,159.546875,14.241,13.65,14.902,0.8649292662887628,0.8458784583208844,0.8849019191098331,0.1441548777147938,0.1409797430534807,0.14748365318497217,15.98291015625,15.6220703125,16.3427734375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(159.547), 'mean_duration_us': np.float64(15.954699999999999), 'median_duration_us': np.float64(15.983), 'std_dev_duration_us': np.float64(0.22880430502942894), 'min_duration_us': np.float64(15.622), 'max_duration_us': np.float64(16.343)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(15.95)}]","{'shape_in1': (1, 4500, 512), 'shape_in2': (1, 4500, 512), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2304000, 512, 1), 'stride_input2': (4500, 1, 4500), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.007562736459471306,99.68224763001848 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (117964800, 460800, 57600, 240, 1)), ())","('', '2')",24033,1,27.211,27.211,,,,,,,,,,158.67431640625,,158.67431640625,27.211,27.211,27.211,,,,,,,158.67431640625,158.67431640625,158.67431640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.558), 'mean_duration_us': np.float64(26.558), 'median_duration_us': np.float64(26.558), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.558), 'max_duration_us': np.float64(26.558)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(132.116), 'mean_duration_us': np.float64(132.116), 'median_duration_us': np.float64(132.116), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(132.116), 'max_duration_us': np.float64(132.116)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.56)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(132.12)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.007521376008569474,99.68976900602705 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23418,10,316.748,31.674799999999998,1.337243001269568,0.006915072,5.279296875,1.2491675915649278,vector_bf16,0.3659939535869764,0.06756550586031682,0.45718778552956935,0.08440064022839798,15.753125,3.8272314794361426,157.53125,31.822000000000003,29.874,34.17,0.4035390297725771,0.22326119952737297,0.4188106284447728,0.5040878779234579,0.27889065490350534,0.5231646640561507,13.718017578125,13.2177734375,24.794921875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(55.06999999999999), 'mean_duration_us': np.float64(5.507), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(1.9236527753209518), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(11.135)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(102.462), 'mean_duration_us': np.float64(10.2462), 'median_duration_us': np.float64(9.053), 'std_dev_duration_us': np.float64(2.999576996844722), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(19.027)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.51)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.25)}]","{'op_shape': (1, 512, 3, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.007467193123532436,99.69723619915058 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((475200, 29700, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15598,10,1019.914,101.9914,39.2052860642258,0.002304,0.275146484375,7.985803016858918,matrix_bf16,0.01836508175951614,0.0006520163690589507,0.14665992532000466,0.005206874287072375,15.7283203125,0.5794745470816367,157.283203125,89.1875,85.797,213.097,0.0186630107655767,0.016989349204980016,0.018956450946422843,0.14903912767541289,0.13567359613559907,0.1513824831568816,15.4599609375,15.2197265625,16.98193359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(47.061), 'mean_duration_us': np.float64(4.7061), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.21281938351569393), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(5.167)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(53.59000000000001), 'mean_duration_us': np.float64(5.359000000000001), 'median_duration_us': np.float64(5.367), 'std_dev_duration_us': np.float64(0.1893995776130454), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.688)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL2_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU16_SUM0_SUS128_SPO0_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.633), 'mean_duration_us': np.float64(5.6633000000000004), 'median_duration_us': np.float64(5.587), 'std_dev_duration_us': np.float64(0.2747045867836939), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(6.288)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.71)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.36)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.66)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 5, 30, 30), 'filter_shape': (16, 16, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (475200, 29700, 900, 30, 1), 'weight_stride': (16, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', ['aten::miopen_convolution', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['aten::miopen_convolution', 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL2_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU16_SUM0_SUS128_SPO0_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16']]",0.007455435368043835,99.70469163451862 -aten::where,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (), ())","('bool', 'c10::BFloat16', 'c10::BFloat16')","((123201, 123201, 351, 1), (), ())","('', '', '')",280,32,446.696,13.95925,1.3376534099538981,,,,,,,,,4.8874053955078125,0.15500533287165916,156.39697265625,13.7105,12.599,20.571,,,,,,,4.88623046875,4.60595703125,5.2470703125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(156.39600000000002), 'mean_duration_us': np.float64(4.8873750000000005), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.15261302164297783), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::where', 'aten::where', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.007413426851878852,99.71210506137051 -triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1), (1, 7425, 1), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((0, 1, 7488), (7456, 1, 7456), (7456, 1, 7456), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",8850,4,110.124,27.531,2.6237424924459862,6.144e-06,87.087890625,6.728116800107649e-05,vector_bfloat16,2.376026446449097,0.1668847412996888,0.0001598618345185425,1.1228200316200539e-05,38.575927734375,2.7097272122605083,154.3037109375,26.965,24.987,31.207,2.376362755125996,2.2240170892961197,2.5273631862482775,0.00015988446175913313,0.00014963446742219738,0.00017004394713370633,38.555908203125,36.1318359375,41.06005859375,"[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(154.304), 'mean_duration_us': np.float64(38.576), 'median_duration_us': np.float64(38.556), 'std_dev_duration_us': np.float64(2.346681167095354), 'min_duration_us': np.float64(36.132), 'max_duration_us': np.float64(41.06)}]","[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(38.58)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4']",0.007314203431052802,99.71941926480156 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",222,32,245.71,7.6784375,0.35801035644598406,0.001437696,5.570068359375,0.24615384615384617,vector_bf16,1.229998791966302,0.11853194266220045,0.30276893340708977,0.029177093578387797,4.7911376953125,0.4589674339754898,153.31640625,7.692,6.97,8.633,1.230642340557995,1.019833806803649,1.4439438338966684,0.3029273453681219,0.25103601398243675,0.3554323283437953,4.74609375,4.044921875,5.72705078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(153.316), 'mean_duration_us': np.float64(4.791125), 'median_duration_us': np.float64(4.746), 'std_dev_duration_us': np.float64(0.45170425543158216), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(5.727)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.79)}]","{'shape_in1': (1, 32, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 44928, 128, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.007267403860978094,99.72668666866254 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 4, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (7372800, 14400, 3600, 60, 1)), ())","('', '2')",15957,10,269.491,26.949099999999998,1.7547678827190292,,,,,,,,,15.17275390625,0.32528595041515274,151.7275390625,26.139,25.588,31.106,,,,,,,15.06103515625,14.7802734375,15.7021484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.82599999999999), 'mean_duration_us': np.float64(5.082599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.08492961791978107), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.207)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.902), 'mean_duration_us': np.float64(10.0902), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.2913725450347027), 'min_duration_us': np.float64(9.734), 'max_duration_us': np.float64(10.655)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.08)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.09)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.007192089419324731,99.73387875808186 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120),)","('c10::BFloat16',)","((18432000, 72000, 14400, 120, 1),)","('',)",23925,5,45.308,9.0616,0.362999035811392,0.018432,70.3125,0.25,vector_bf16,2.4536168048092937,0.17738158283104108,0.6134042012023234,0.04434539570776027,30.171875,2.1300137500140033,150.859375,9.054,8.683,9.544,2.356571214533196,2.300700045710803,2.6597196455937007,0.589142803633299,0.5751750114277008,0.6649299113984252,31.2861328125,27.72021484375,32.0458984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(150.859), 'mean_duration_us': np.float64(30.1718), 'median_duration_us': np.float64(31.286), 'std_dev_duration_us': np.float64(1.9051704805607295), 'min_duration_us': np.float64(27.72), 'max_duration_us': np.float64(32.046)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(30.17)}]","{'op_shape': (1, 256, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (18432000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.007150937275114627,99.74102969535697 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",231,32,251.614,7.8629375,1.1720413385173527,0.000359424,1.456787109375,0.23529411764705882,vector_bf16,0.34780146454729505,0.011605865440599236,0.0818356387170106,0.0027307918683762925,4.3968048095703125,0.14804499906876914,140.69775390625,7.5815,6.74,13.109,0.3498575817490494,0.32043700665778957,0.37031563636363635,0.08231943099977634,0.07539694274300932,0.08713309090909091,4.3662109375,4.125,4.76708984375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(140.697), 'mean_duration_us': np.float64(4.39678125), 'median_duration_us': np.float64(4.366), 'std_dev_duration_us': np.float64(0.14578424434223852), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.767)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.4)}]","{'shape_in1': (1, 8, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (359424, 44928, 128, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.006669262768277462,99.74769895812526 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 351, 351), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), (123201, 123201, 351, 1), ())","('', '', 'False')",290,32,207.449,6.48278125,0.8496979628221978,0.000123201,0.4699745178222656,0.25,vector_bf16,0.11543131976609389,0.004881216178096082,0.028857829941523472,0.0012203040445240205,4.276641845703125,0.18087827426542186,136.8525390625,6.3445,5.819,10.886,0.11500257429352778,0.10699274801229725,0.1242934226600985,0.028750643573381945,0.02674818700307431,0.031073355665024626,4.28515625,3.96484375,4.60595703125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(136.852), 'mean_duration_us': np.float64(4.276625), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.1780245330705855), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.28)}]","{'op_shape': (1, 1, 351, 351), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (123552, 123552, 352, 1), 'stride_output': (123201, 123201, 351, 1)}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.006486994413016174,99.75418595253826 -aten::neg,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 64),)","('c10::BFloat16',)","((359424, 128, 1024, 1),)","('',)",229,32,248.001,7.75003125,0.9561580542977124,0.000179712,0.685546875,0.25,vector_bf16,0.17266842365452623,0.006498707416741959,0.043167105913631564,0.0016246768541854904,4.1689300537109375,0.15816634330533075,133.40576171875,7.5265,6.96,12.158,0.1742661818181818,0.15883058625525948,0.18504282352941176,0.043566545454545455,0.03970764656381487,0.04626070588235295,4.125,3.884765625,4.52587890625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(133.406), 'mean_duration_us': np.float64(4.1689375), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.1556189130335706), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.17)}]","{'op_shape': (1, 8, 351, 64), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (359424, 128, 1024, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(138): rotate_half,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::neg', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.00632361253113815,99.7605095650694 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",7302,25,282.74,11.3096,1.062251265002777,5.9136e-05,0.33837890625,0.16666666666666666,vector_bf16,0.06696871528946978,0.004092702257238866,0.01116145254824496,0.0006821170428731442,5.31740234375,0.32771737589226274,132.93505859375,11.226,9.574,12.99,0.06762173534338359,0.059455340206185564,0.07507626490339911,0.011270289223897263,0.009909223367697593,0.012512710817233184,5.2470703125,4.72607421875,5.9677734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 25, 'total_duration_us': np.float64(132.935), 'mean_duration_us': np.float64(5.3174), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.3211545422378454), 'min_duration_us': np.float64(4.726), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","{'shape_in1': (1, 77, 768), 'shape_in2': (1, 77, 768), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (59136, 768, 1), 'stride_input2': (59136, 768, 1), 'stride_output': None}",True,transformers/models/clip/modeling_clip.py(234): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.006301300569935371,99.76681086563933 -triton_red_fused_native_layer_norm_1,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (), ())","('c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar')","((0, 1, 7488), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (), ())","('', '', '', '', '178200', '128')",8846,4,126.999,31.74975,1.7506923154379037,0.0,43.505859375,0.0,vector_bfloat16,1.4196437581264647,0.014764517716361579,0.0,0.0,32.1368408203125,0.33101828646015685,128.54736328125,31.2015,30.305,34.291,1.4138001840690495,1.4094273714699492,1.4415472928978106,0.0,0.0,0.0,32.26708984375,31.64599609375,32.3671875,"[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(128.547), 'mean_duration_us': np.float64(32.13675), 'median_duration_us': np.float64(32.266999999999996), 'std_dev_duration_us': np.float64(0.2866098175220092), 'min_duration_us': np.float64(31.646), 'max_duration_us': np.float64(32.367)}]","[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'mean_duration_us': np.float64(32.14)}]","{'fused_ops': 'aten.native_layer_norm', 'xnumel': 178200, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_native_layer_norm', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_native_layer_norm_1']",0.00609331791083976,99.77290418355017 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((512,), (4500, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",15794,10,414.63599999999997,41.4636,2.094029990234144,2.3616,9.2900390625,242.43140964995268,matrix_bf16,0.7612129422393321,0.020453315955345892,184.54192663086928,4.958526219070381,12.805810546875,0.36069397961349864,128.05810546875,40.896,39.919,46.75,0.7659476402095992,0.7090381695276683,0.7819930611476953,185.6897661340679,171.89312293421474,189.57968015051742,12.718017578125,12.45703125,13.73876953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.058), 'mean_duration_us': np.float64(12.8058), 'median_duration_us': np.float64(12.718), 'std_dev_duration_us': np.float64(0.3422799439055698), 'min_duration_us': np.float64(12.457), 'max_duration_us': np.float64(13.739)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(12.81)}]","{'M': 4500, 'N': 512, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.006070126432494134,99.77897430998266 -triton_poi_fused_convolution_13,triton,python3,CPU,thread 416 (python3),"((1, 3072, 33, 15, 15), (3072,), (1, 3072, 33, 15, 15), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22809600, 7425, 225, 15, 1), (1,), (23003136, 7488, 225, 15, 1), ())","('', '', '', '22809600')",8805,4,114.218,28.5545,1.3348988725742508,0.0,130.5234375,0.0,vector_bfloat16,4.369735222624342,0.058180651481740626,0.0,0.0,31.324951171875,0.41248052917149597,125.2998046875,28.437,27.41,29.934,4.349751224884022,4.324836026476987,4.4546024142523395,0.0,0.0,0.0,31.46484375,30.72412109375,31.64599609375,"[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(125.3), 'mean_duration_us': np.float64(31.325), 'median_duration_us': np.float64(31.465), 'std_dev_duration_us': np.float64(0.3572960956965524), 'min_duration_us': np.float64(30.724), 'max_duration_us': np.float64(31.646)}]","[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'mean_duration_us': np.float64(31.32)}]","{'fused_ops': 'aten.convolution', 'xnumel': 22809600, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_convolution', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_convolution_13']",0.005939379265653369,99.78491368924831 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((36864000, 72000, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23940,1,68.021,68.021,,18.874368,105.71875,170.26308010641444,matrix_bf16,0.9034553182060567,,153.82508521628395,,122.7001953125,,122.7001953125,68.021,68.021,68.021,0.9034553182060567,0.9034553182060567,0.9034553182060567,153.82508521628395,153.82508521628395,153.82508521628395,122.7001953125,122.7001953125,122.7001953125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(40.98), 'mean_duration_us': np.float64(40.98), 'median_duration_us': np.float64(40.98), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(40.98), 'max_duration_us': np.float64(40.98)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC1_NTD1_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT2_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGMn2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(81.72), 'mean_duration_us': np.float64(81.72), 'median_duration_us': np.float64(81.72), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(81.72), 'max_duration_us': np.float64(81.72)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(40.98)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(81.72)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 5, 120, 120), 'filter_shape': (256, 512, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (36864000, 72000, 14400, 120, 1), 'weight_stride': (512, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC1_NTD1_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT2_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGMn2']]",0.005816154284902753,99.79072984353321 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23772,6,185.085,30.8475,2.0122074197259083,0.027651072,21.099609375,1.2497917245209664,vector_bf16,1.114613440442963,0.06900000895541585,1.393034653905458,0.08623564018435133,19.91455078125,1.2612885205196425,119.4873046875,30.591,28.632,34.341,1.1347295854278623,1.0209564027849756,1.1878949798657719,1.4181756454368493,1.275982863297357,1.4846213154362418,19.507568359375,18.625,21.67041015625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(36.448), 'mean_duration_us': np.float64(6.074666666666666), 'median_duration_us': np.float64(6.0485), 'std_dev_duration_us': np.float64(0.2942950144932046), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.449)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.038), 'mean_duration_us': np.float64(13.839666666666666), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8712071446498181), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(15.262)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.84)}]","{'op_shape': (1, 512, 3, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (5529600, 10800, 3600, 60, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.00566385894806221,99.79639370248128 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', '1')",10434,4,56.205,14.05125,0.4287123161281942,0.0004752,4.5318603515625,0.1,vector_fp32,0.1594766784732344,0.004269637105907157,0.01594766784732344,0.00042696371059071364,29.813232421875,0.7855962782338508,119.2529296875,14.0765,13.54,14.512,0.15849119111451043,0.15547721063982747,0.16544712102408923,0.015849119111451045,0.015547721063982747,0.01654471210240892,29.9833984375,28.72216796875,30.56396484375,"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(119.25300000000001), 'mean_duration_us': np.float64(29.813250000000004), 'median_duration_us': np.float64(29.9835), 'std_dev_duration_us': np.float64(0.6804231679624079), 'min_duration_us': np.float64(28.722), 'max_duration_us': np.float64(30.564)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(29.81)}]","{'shape_in1': (1, 16, 33, 30, 30), 'shape_in2': (1, 16, 33, 30, 30), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (475200, 29700, 900, 30, 1), 'stride_input2': (475200, 29700, 900, 30, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::add', 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)']",0.00565274925783676,99.80204645173912 -aten::layer_norm,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), (), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((59136, 768, 1), (), (1,), (1,), (), ())","('', '[768]', '', '', '1.0000000000000001e-05', 'True')",7303,25,548.183,21.927319999999998,3.0013883831764705,0.000300288,0.234375,1.221875,vector_bf16,0.052216829114861606,0.0029769326519793384,0.06380243807472152,0.0036374395841372465,4.7198046875,0.2444226349748887,117.9951171875,21.011,19.639,33.89,0.052445189121600504,0.046482866642039156,0.06391320380952381,0.06408146545795561,0.05679625267824159,0.0780939459047619,4.68603515625,3.84521484375,5.287109375,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 25, 'total_duration_us': np.float64(117.994), 'mean_duration_us': np.float64(4.71976), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.23948549517663897), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.72)}]","{'op_shape': (1, 77, 768), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (59136, 768, 1), 'stride_output': None, 'num_channels': 768, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,torch/nn/functional.py(2880): layer_norm,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/normalization.py(228): forward', 'torch/nn/functional.py(2880): layer_norm', 'aten::layer_norm', 'aten::native_layer_norm', 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)']",0.005593127253626845,99.80763957899275 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",8723,4,287.01800000000003,71.75450000000001,6.129838415488616,6.442450944,27.5,223.4181818181818,matrix_bf16,1.0019885272195925,0.011884306386974484,223.86245495407917,2.655170125148043,28.7816162109375,0.3376165906830312,115.12646484375,72.7485,63.585,77.936,0.9970271728498881,0.9942723469593912,1.0196274162192027,222.7539981814441,222.13851998976364,227.8033034636648,28.921875,28.28076171875,29.001953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.127), 'mean_duration_us': np.float64(28.78175), 'median_duration_us': np.float64(28.922), 'std_dev_duration_us': np.float64(0.29231864035671795), 'min_duration_us': np.float64(28.281), 'max_duration_us': np.float64(29.002)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(28.78)}]","{'M': 256, 'N': 3072, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.005457149274304932,99.81309672826706 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((2304000, 4500, 30, 1), (), ())","('', '', '[2., 2.]')",15941,10,310.78,31.077999999999996,3.7270490859242638,,,,,,,,,11.4830078125,0.4077479987454964,114.830078125,29.8445,28.622,40.65,,,,,,,11.33447265625,11.13525390625,12.537109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.617), 'mean_duration_us': np.float64(4.4616999999999996), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.213733502287311), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.087)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(70.213), 'mean_duration_us': np.float64(7.021299999999999), 'median_duration_us': np.float64(6.949), 'std_dev_duration_us': np.float64(0.20199259887431512), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.45)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(7.02)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.005443100145207332,99.81853982841227 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((1382400, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23424,10,75.732,7.5732,0.35573954267444335,0.00262144,7.63671875,0.3273657289002558,vector_bf16,0.7076539965155456,0.06178449865927964,0.23166166637849067,0.02022612743833192,11.400146484375,1.0742672872655885,114.00146484375,7.6065000000000005,6.99,8.001,0.7379154100589864,0.6057595626639087,0.7572833690432212,0.24156821608069123,0.19830492076977063,0.24790862209087552,10.85546875,10.57421875,13.21923828125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(114.00099999999999), 'mean_duration_us': np.float64(11.400099999999998), 'median_duration_us': np.float64(10.8555), 'std_dev_duration_us': np.float64(1.0190769794279526), 'min_duration_us': np.float64(10.574), 'max_duration_us': np.float64(13.219)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(11.4)}]","{'input_shape': (1, 512, 3, 30, 30), 'output_shape': (1, 512, 5, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 5, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.005403822761222771,99.8239436511735 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (1, 512, 4, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7372800, 14400, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', 'False')",16088,10,64.809,6.4809,2.0716897799729677,0.0073728,28.125,0.25,vector_bf16,2.6257999435642825,0.05310636454549985,0.6564499858910706,0.013276591136374962,11.23544921875,0.2268741028729728,112.3544921875,5.7490000000000006,5.579,12.338,2.634138894733294,2.556419944129349,2.7068515036077625,0.6585347236833236,0.6391049860323372,0.6767128759019406,11.19580078125,10.89501953125,11.5361328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(112.355), 'mean_duration_us': np.float64(11.2355), 'median_duration_us': np.float64(11.196), 'std_dev_duration_us': np.float64(0.2151749288369813), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(11.536)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.24)}]","{'op_shape': (1, 512, 4, 60, 60), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (7372800, 14400, 3600, 60, 1), 'stride_output': (9216000, 18000, 3600, 60, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.005325754042201016,99.8292694052157 -triton_poi_fused_cat_slice_20,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (22828032, 3072, 1), ())","('', '', '22828032')",9519,4,88.833,22.20825,1.8151432220810202,0.0,130.623046875,0.0,vector_bfloat16,4.891225828046335,0.14185672170069666,0.0,0.0,28.020751953125,0.8238069732058474,112.0830078125,21.6525,20.841,24.687,4.920384972057894,4.7030859301187045,5.021047437950847,0.0,0.0,0.0,27.840576171875,27.27880859375,29.123046875,"[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(112.083), 'mean_duration_us': np.float64(28.02075), 'median_duration_us': np.float64(27.8405), 'std_dev_duration_us': np.float64(0.7133667973069681), 'min_duration_us': np.float64(27.279), 'max_duration_us': np.float64(29.123)}]","[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'mean_duration_us': np.float64(28.02)}]","{'fused_ops': 'aten.cat, aten.slice', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_slice', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_slice_20']",0.00531288531768987,99.83458229053339 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",7411,12,396.267,33.02225,2.6232116029089934,0.36339072,5.0654296875,68.41599190283401,matrix_bf16,0.5882212782379445,0.01929912788756603,40.24374220900187,1.3203689772874743,9.0390625,0.3101109126738394,108.46875,32.6485,29.854,36.875,0.5946616741462067,0.5390182559833507,0.6110851875737319,40.684368283312594,36.877468636836625,41.807999244986235,8.93212890625,8.69189453125,9.85400390625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(108.469), 'mean_duration_us': np.float64(9.039083333333332), 'median_duration_us': np.float64(8.931999999999999), 'std_dev_duration_us': np.float64(0.2969294131420611), 'min_duration_us': np.float64(8.692), 'max_duration_us': np.float64(9.854)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.04)}]","{'M': 77, 'N': 768, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.005141564636338244,99.83972385516972 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4504), ())","('c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), ())","('', '0.')",15750,10,86.337,8.633700000000001,0.9340877962542447,,,,,,,,,10.009765625,0.43111397138173235,100.09765625,8.453,7.671,11.127,,,,,,,10.013427734375,9.453125,10.5751953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.09799999999998), 'mean_duration_us': np.float64(10.009799999999998), 'median_duration_us': np.float64(10.0135), 'std_dev_duration_us': np.float64(0.40890972108767476), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.575)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]",,False,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0047447635337859225,99.8444686187035 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",7400,12,420.436,35.03633333333333,3.351654118988616,0.363568128,5.06982421875,68.39006067610516,matrix_bf16,0.6489723356417577,0.033584758408361205,44.38325741165351,2.296863665340159,8.214558919270834,0.4854992416870445,98.57470703125,36.6695,30.806,39.819,0.657096929199102,0.548454214296509,0.6772012569509236,44.93889885800897,37.50881699380384,46.31383505280836,8.091064453125,7.85009765625,9.69287109375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(98.574), 'mean_duration_us': np.float64(8.2145), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.4649102960070183), 'min_duration_us': np.float64(7.85), 'max_duration_us': np.float64(9.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]","{'M': 77, 'N': 3072, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.004672573692508467,99.849141192396 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (1, 256, 5, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', '1')",23947,3,25.498,8.499333333333334,0.4262866797512364,0.018432,105.46875,0.16666666666666666,vector_bf16,3.7162673445179872,0.14551911553469862,0.6193778907529978,0.024253185922449755,29.7900390625,1.1931431850768015,89.3701171875,8.683,8.012,8.803,3.7923182640144666,3.548480541455161,3.8080032280843334,0.632053044002411,0.5914134235758601,0.6346672046807222,29.162109375,29.0419921875,31.166015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.37), 'mean_duration_us': np.float64(29.790000000000003), 'median_duration_us': np.float64(29.162), 'std_dev_duration_us': np.float64(0.9742114760153464), 'min_duration_us': np.float64(29.042), 'max_duration_us': np.float64(31.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(29.79)}]","{'shape_in1': (1, 256, 5, 120, 120), 'shape_in2': (1, 256, 5, 120, 120), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (18432000, 72000, 14400, 120, 1), 'stride_input2': (18432000, 72000, 14400, 120, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.004236263754091889,99.8533774561501 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 352), ())","('c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), ())","('', '0.')",286,32,172.528,5.3915,0.45871236331503473,,,,,,,,,2.7806549072265625,0.14340866108737566,88.98095703125,5.223,4.717,6.43,,,,,,,2.76318359375,2.60302734375,3.36376953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(88.97999999999999), 'mean_duration_us': np.float64(2.7806249999999997), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.14124264361374722), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.78)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.004217817039280048,99.85759527318938 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 64), (7425, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (64, 1))","('', '', '')",10412,4,183.944,45.986,4.000609370250154,2.9196288,44.7872314453125,62.168946598091566,matrix_bf16,2.1745453125474734,0.03673918317195276,135.1891914108942,2.284036316674645,21.6011962890625,0.36163358406667456,86.40478515625,45.608000000000004,41.532,51.196,2.165133479341412,2.143331264607568,2.2245830268995026,134.60406765491643,133.24864693140793,138.29998340233607,21.69140625,21.11083984375,21.9111328125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(86.405), 'mean_duration_us': np.float64(21.60125), 'median_duration_us': np.float64(21.691499999999998), 'std_dev_duration_us': np.float64(0.3130737732548036), 'min_duration_us': np.float64(21.111), 'max_duration_us': np.float64(21.911)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.6)}]","{'M': 7425, 'N': 64, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.004095703027551978,99.86169097621692 -aten::sigmoid,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",7403,12,101.761,8.480083333333333,1.3476461268943467,0.000236544,0.90234375,0.25,vector_bf16,0.14114164673452692,0.0075676801717640746,0.03528541168363173,0.0018919200429410189,6.72265625,0.38600629713516427,80.671875,8.077,7.541,12.569,0.14103243831188492,0.12238795225162635,0.14949609998457028,0.03525810957797122,0.030596988062906585,0.03737402499614257,6.708984375,6.3291015625,7.73095703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(80.67099999999999), 'mean_duration_us': np.float64(6.722583333333333), 'median_duration_us': np.float64(6.709), 'std_dev_duration_us': np.float64(0.3695933482295854), 'min_duration_us': np.float64(6.329), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.72)}]","{'op_shape': (1, 77, 3072), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::sigmoid', 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0038239553755998776,99.86551493159251 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60),)","('c10::BFloat16',)","((5529600, 10800, 3600, 60, 1),)","('',)",23776,6,55.482,9.247,0.6862495173040196,0.0055296,21.09375,0.25,vector_bf16,1.7229887363259582,0.40565225068878874,0.43074718408148954,0.10141306267219719,13.412353515625,2.9502668769184965,80.47412109375,9.489,8.343,10.135,1.5905173123821301,1.3273113924050635,2.2265167461292705,0.39762932809553253,0.33182784810126587,0.5566291865323176,13.99951171875,9.93408203125,16.6640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.474), 'mean_duration_us': np.float64(13.412333333333335), 'median_duration_us': np.float64(13.999500000000001), 'std_dev_duration_us': np.float64(2.693267820985421), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(16.664)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(13.41)}]","{'op_shape': (1, 512, 3, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (5529600, 10800, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0038145815744721544,99.86932951316699 -triton_poi_fused_addmm_silu_view_10,triton,python3,CPU,thread 416 (python3),"((1, 256, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 12288, 1), (1,), ())","('', '', '3145728')",8769,8,175.383,21.922875,2.21974525163201,0.012582912,12.0234375,0.9980506822612085,vector_bfloat16,1.2689848480038175,0.06566213629943483,1.2665111933293463,0.06553413993237935,9.95880126953125,0.5239840543537515,79.67041015625,21.6725,19.529,26.049,1.27688115502905,1.1744432760518535,1.3508493996023858,1.2743921079432234,1.1721539129406413,1.348216164905305,9.8740234375,9.3330078125,10.73486328125,"[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(79.67099999999999), 'mean_duration_us': np.float64(9.958874999999999), 'median_duration_us': np.float64(9.873999999999999), 'std_dev_duration_us': np.float64(0.4902161353678597), 'min_duration_us': np.float64(9.333), 'max_duration_us': np.float64(10.735)}]","[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'mean_duration_us': np.float64(9.96)}]","{'fused_ops': 'aten.addmm, aten.silu, aten.view', 'xnumel': 3145728, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_silu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_silu_view_10']",0.0037764845950740487,99.87310599776207 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",7402,12,183.302,15.275166666666665,2.7142145300531264,0.000236544,0.9023513793945312,0.24999788624622696,vector_bf16,0.14551973000242957,0.009329217672864494,0.03637962490772905,0.0023322846985470666,6.528645833333333,0.4531159275466089,78.34375,14.151,13.75,23.104,0.14766957208867632,0.12304176976315957,0.15542066345845365,0.03691708088505391,0.030760182360784812,0.03885483734359961,6.408447265625,6.087890625,7.68994140625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(78.34400000000001), 'mean_duration_us': np.float64(6.528666666666667), 'median_duration_us': np.float64(6.4085), 'std_dev_duration_us': np.float64(0.4338206874837678), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.69)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.003713599119360408,99.87681959688143 -triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",8801,4,118.126,29.5315,1.6449005035766355,0.002359296,4.541015625,0.49548387096774194,vector_bfloat16,0.24737637234986534,0.008942471956551123,0.12257100255786875,0.004430850621052429,19.2677001953125,0.7119972658310234,77.07080078125,29.323500000000003,28.092,31.387,0.2492027157042075,0.23491982366119826,0.25618023432984816,0.12347592623279441,0.11639898359470983,0.12693317417117636,19.107421875,18.5869140625,20.26904296875,"[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(77.071), 'mean_duration_us': np.float64(19.26775), 'median_duration_us': np.float64(19.1075), 'std_dev_duration_us': np.float64(0.6165555023677911), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(20.269)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.27)}]","{'fused_ops': 'aten.add, aten.addmm, aten.div, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12']",0.0036532596143234327,99.88047285649576 -triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (3072,), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (1,), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '256', '3072')",8767,4,120.53,30.1325,1.7644182232868337,0.002359296,4.546875,0.4948453608247423,vector_bfloat16,0.24810598640880147,0.006757780371793374,0.12277409636724197,0.0033440562664544472,19.2274169921875,0.5314483833154173,76.90966796875,30.060000000000002,28.122,32.288,0.25008368827155925,0.23900572066382725,0.2532508484282602,0.1237527529591221,0.11827087208106916,0.12532000746965452,19.067626953125,18.826171875,19.9482421875,"[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(76.90899999999999), 'mean_duration_us': np.float64(19.227249999999998), 'median_duration_us': np.float64(19.067500000000003), 'std_dev_duration_us': np.float64(0.4602180868892483), 'min_duration_us': np.float64(18.826), 'max_duration_us': np.float64(19.948)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.23)}]","{'fused_ops': 'aten.add, aten.addmm, aten.div, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9']",0.0036456217022934364,99.88411847819805 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((36864000, 72000, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23906,1,33.369,33.369,,0.184323072,140.630859375,1.249968751302029,vector_bf16,1.9973708393650793,,2.4966511339682538,,73.828125,,73.828125,33.369,33.369,33.369,1.9973708393650793,1.9973708393650793,1.9973708393650793,2.4966511339682538,2.4966511339682538,2.4966511339682538,73.828125,73.828125,73.828125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.71), 'mean_duration_us': np.float64(20.71), 'median_duration_us': np.float64(20.71), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.71), 'max_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(53.118), 'mean_duration_us': np.float64(53.118), 'median_duration_us': np.float64(53.118), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(53.118), 'max_duration_us': np.float64(53.118)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(53.12)}]","{'op_shape': (1, 512, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.003499552421016739,99.88761803061907 -aten::index,other,python3,CPU,thread 416 (python3),"((1, 256, 3072), ())","('c10::BFloat16', '')","((786432, 3072, 1), ())","('', '')",8826,4,612.491,153.12275,20.39973230829269,,,,,,,,,18.3406982421875,0.962001831388019,73.36279296875,153.7185,128.932,176.122,,,,,,,18.501220703125,17.05859375,19.3017578125,"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.845999999999999), 'mean_duration_us': np.float64(1.7114999999999998), 'median_duration_us': np.float64(1.7215), 'std_dev_duration_us': np.float64(0.27234215611983387), 'min_duration_us': np.float64(1.401), 'max_duration_us': np.float64(2.002)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.088999999999999), 'mean_duration_us': np.float64(2.2722499999999997), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.8777059231314325), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.765)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.012999999999998), 'mean_duration_us': np.float64(2.7532499999999995), 'median_duration_us': np.float64(2.643), 'std_dev_duration_us': np.float64(0.21467460841934716), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.124)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.335), 'mean_duration_us': np.float64(3.33375), 'median_duration_us': np.float64(3.404), 'std_dev_duration_us': np.float64(0.14568866634024752), 'min_duration_us': np.float64(3.083), 'max_duration_us': np.float64(3.444)}, {'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536000000000001), 'mean_duration_us': np.float64(3.3840000000000003), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.404)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.545), 'mean_duration_us': np.float64(4.88625), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.20625272725469596), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.33)}, {'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'aten::index', ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)'], ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})'], ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})'], ['aten::nonzero', 'Memcpy DtoD (Device -> Device)'], ['void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)'], ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})']]",0.003477495056881627,99.89109552567595 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 256), (256, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (3072, 1))","('', '', '')",8755,12,431.968,35.99733333333334,6.150257279664047,0.001572864,1.50634765625,0.9957860615883306,matrix_bf16,0.27985082309786186,0.01022192222582133,0.2786715489648725,0.010178847675112845,5.6510009765625,0.20468343430239708,67.81201171875,34.576,28.141,45.557,0.27672341764813324,0.26644073470060126,0.2942919359534207,0.2755573222090974,0.265317969854213,0.293051807860262,5.7080078125,5.3671875,5.92822265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.81099999999999), 'mean_duration_us': np.float64(5.650916666666666), 'median_duration_us': np.float64(5.708), 'std_dev_duration_us': np.float64(0.19595554697147227), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","{'M': 1, 'N': 3072, 'K': 256, 'bias': False, 'stride_A': (256, 1), 'stride_B': (1, 256), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0032143805600422203,99.89430990623599 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 3, 13, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (1555200, 518400, 57600, 240, 1)), ())","('', '2')",24594,1,104.415,104.415,,,,,,,,,,67.77099609375,,67.77099609375,104.415,104.415,104.415,,,,,,,67.77099609375,67.77099609375,67.77099609375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.688), 'mean_duration_us': np.float64(5.688), 'median_duration_us': np.float64(5.688), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(5.688)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.727), 'mean_duration_us': np.float64(5.727), 'median_duration_us': np.float64(5.727), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(5.727)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.888), 'mean_duration_us': np.float64(5.888), 'median_duration_us': np.float64(5.888), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.208), 'mean_duration_us': np.float64(6.208), 'median_duration_us': np.float64(6.208), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(6.208)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.288), 'mean_duration_us': np.float64(6.288), 'median_duration_us': np.float64(6.288), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(6.288)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.328), 'mean_duration_us': np.float64(6.328), 'median_duration_us': np.float64(6.328), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.328), 'max_duration_us': np.float64(6.328)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.369), 'mean_duration_us': np.float64(6.369), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(6.369)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.011), 'mean_duration_us': np.float64(8.011), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.011), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.81)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.89)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.21)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.33)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.37)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.01)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0032124363642527663,99.89752234260024 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30),)","('c10::BFloat16',)","((1382400, 2700, 900, 30, 1),)","('',)",23422,10,94.32,9.431999999999999,0.6764787916524466,0.0013824,5.2734375,0.25,vector_bf16,0.8695253285713485,0.06056836956587955,0.2173813321428371,0.015142092391469887,6.388623046875,0.46857604295754646,63.88623046875,9.314,8.633,10.756,0.8821257781071701,0.766938967899228,0.9655231307016797,0.22053144452679252,0.191734741974807,0.24138078267541993,6.2685546875,5.72705078125,7.2099609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(63.886), 'mean_duration_us': np.float64(6.3886), 'median_duration_us': np.float64(6.2684999999999995), 'std_dev_duration_us': np.float64(0.4445501546507435), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(7.21)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(6.39)}]","{'op_shape': (1, 512, 3, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.003028293248765933,99.900550635849 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '-inf')",274,32,292.695,9.14671875,0.9814487065089363,,,,,,,,,1.94549560546875,0.08448160107434809,62.255859375,8.993500000000001,8.252,14.031,,,,,,,1.94140625,1.8017578125,2.162109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(62.259), 'mean_duration_us': np.float64(1.94559375), 'median_duration_us': np.float64(1.9415), 'std_dev_duration_us': np.float64(0.08307220480363749), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.162)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.95)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.002951011466135147,99.90350164731514 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",7404,12,87.418,7.284833333333334,0.24314374100083005,0.000236544,1.353515625,0.16666666666666666,vector_bf16,0.2782672329167705,0.01820344400621297,0.04637787215279509,0.0030339073343688253,5.120198567708333,0.3315673742872191,61.4423828125,7.265499999999999,6.83,7.611,0.277947674233891,0.2495195014164306,0.3135885933757687,0.04632461237231515,0.041586583569405096,0.052264765562628115,5.10693359375,4.52587890625,5.68798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.442), 'mean_duration_us': np.float64(5.120166666666667), 'median_duration_us': np.float64(5.106999999999999), 'std_dev_duration_us': np.float64(0.31744863976537824), 'min_duration_us': np.float64(4.526), 'max_duration_us': np.float64(5.688)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (1, 77, 3072), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.002912451582977648,99.90641409889811 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '0.')",278,32,173.37800000000001,5.4180625000000004,0.5015904342286418,,,,,,,,,1.8853912353515625,0.10690437015342119,60.33251953125,5.273,4.867,7.311,,,,,,,1.88134765625,1.68212890625,2.0419921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(60.334), 'mean_duration_us': np.float64(1.8854375), 'median_duration_us': np.float64(1.8815), 'std_dev_duration_us': np.float64(0.10526631034547564), 'min_duration_us': np.float64(1.682), 'max_duration_us': np.float64(2.042)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::where', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.002859842570722548,99.90927394146884 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 4500, 512), ())","('c10::BFloat16', 'double')","((2304000, 512, 1), ())","('', '')",15798,10,105.898,10.5898,0.3741927013956551,0.002304,8.789070129394531,0.2499997829862995,vector_bf16,1.5538426134001333,0.1266760153837485,0.3884603161448978,0.031668976355506244,5.96787109375,0.5024323533781808,59.6787109375,10.6005,10.095,11.337,1.5445090965801156,1.3534875858013624,1.7300077345554536,0.3861269389653944,0.338371602724991,0.432501558203483,5.968017578125,5.3271484375,6.80908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(59.678999999999995), 'mean_duration_us': np.float64(5.967899999999999), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.4766303494323458), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.809)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]","{'shape_in1': (1, 4500, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2304000, 512, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0028288511640311366,99.91210279263287 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 5, 32, 32), (512, 16, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((81920, 5120, 1024, 32, 1), (432, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23411,1,76.653,76.653,,1.1943936,3.21484375,354.31348724179827,matrix_bf16,0.059645301724435835,,21.13313485157411,,56.517578125,,56.517578125,76.653,76.653,76.653,0.059645301724435835,0.059645301724435835,0.059645301724435835,21.13313485157411,21.13313485157411,21.13313485157411,56.517578125,56.517578125,56.517578125,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.486), 'mean_duration_us': np.float64(4.486), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(4.486)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.291), 'mean_duration_us': np.float64(8.291), 'median_duration_us': np.float64(8.291), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.291), 'max_duration_us': np.float64(8.291)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.664), 'mean_duration_us': np.float64(16.664), 'median_duration_us': np.float64(16.664), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.664), 'max_duration_us': np.float64(16.664)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.904), 'mean_duration_us': np.float64(16.904), 'median_duration_us': np.float64(16.904), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.904), 'max_duration_us': np.float64(16.904)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.61)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.57)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.29)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.66)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(16.9)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 5, 32, 32), 'filter_shape': (512, 16, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (81920, 5120, 1024, 32, 1), 'weight_stride': (432, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.0026790092171153804,99.91478180184998 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120),)","('c10::BFloat16',)","((36864000, 72000, 14400, 120, 1),)","('',)",23910,1,10.216,10.216,,0.036864,140.625,0.25,vector_bf16,2.623671943146079,,0.6559179857865197,,56.2021484375,,56.2021484375,10.216,10.216,10.216,2.623671943146079,2.623671943146079,2.623671943146079,0.6559179857865197,0.6559179857865197,0.6559179857865197,56.2021484375,56.2021484375,56.2021484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(56.202), 'mean_duration_us': np.float64(56.202), 'median_duration_us': np.float64(56.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(56.202), 'max_duration_us': np.float64(56.202)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(56.2)}]","{'op_shape': (1, 512, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0026640574256869623,99.91744585927567 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((), (1, 16, 33, 30, 30))","('float', 'c10::BFloat16')","((), (475200, 29700, 900, 30, 1))","('', '')",10433,4,70.905,17.72625,1.3672659763191637,0.0004752,2.7191200256347656,0.16666643284731644,vector_fp32,0.20851280370248568,0.004700497547749346,0.034752085196086004,0.000783415158890937,13.67919921875,0.307546133080185,54.716796875,17.8315,15.954,19.288,0.20788238374007562,0.20453486258713088,0.21375158474266054,0.03464701534975538,0.03408909594031315,0.0356252141445201,13.718994140625,13.3388671875,13.93994140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(54.717), 'mean_duration_us': np.float64(13.67925), 'median_duration_us': np.float64(13.719000000000001), 'std_dev_duration_us': np.float64(0.26632721884929417), 'min_duration_us': np.float64(13.339), 'max_duration_us': np.float64(13.94)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.68)}]","{'shape_in1': (), 'shape_in2': (1, 16, 33, 30, 30), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (), 'stride_input2': (475200, 29700, 900, 30, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})']",0.002593649763883173,99.92003950903955 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 4096), (4096, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",8761,4,149.041,37.26025,1.1281103300061852,0.025165824,24.013671875,0.9994306628710858,matrix_bf16,1.8836103211463935,0.01746044514912491,1.8825379118541588,0.01745050426941411,13.368896484375,0.12458063350205915,53.4755859375,37.5655,35.773,38.137,1.887815051541091,1.8596814886404616,1.89912969286293,1.8867402483397258,1.8586227029210243,1.8980484478161597,13.33837890625,13.2587890625,13.5400390625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(53.476), 'mean_duration_us': np.float64(13.369), 'median_duration_us': np.float64(13.3385), 'std_dev_duration_us': np.float64(0.10779842299403042), 'min_duration_us': np.float64(13.259), 'max_duration_us': np.float64(13.54)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(13.37)}]","{'M': 1, 'N': 3072, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0025348146960642278,99.92257432373562 -triton_poi_fused_addmm_silu_4,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), ())","('', '', '3072')",8756,20,380.685,19.03425,3.5172065302333024,1.2288e-05,0.017578125,0.6666666666666666,vector_bfloat16,0.007611346059008757,0.0010170857401483736,0.005074230706005838,0.0006780571600989158,2.4708251953125,0.3904354518977978,49.41650390625,17.826999999999998,15.243,26.94,0.008072869118905047,0.0053521531263292215,0.00885289305816135,0.005381912745936699,0.0035681020842194813,0.0059019287054409,2.283203125,2.08203125,3.44384765625,"[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(49.415), 'mean_duration_us': np.float64(2.47075), 'median_duration_us': np.float64(2.283), 'std_dev_duration_us': np.float64(0.3805816436718934), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(3.444)}]","[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'mean_duration_us': np.float64(2.47)}]","{'fused_ops': 'aten.addmm, aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_silu_4']",0.002342408748472216,99.92491673248409 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (1, 512, 4, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', 'False')",15954,10,61.2,6.12,0.2774951451026766,0.0018432,7.03125,0.25,vector_bf16,1.5027582498115497,0.07674218856873587,0.3756895624528874,0.019185547142183967,4.918505859375,0.26837691894912835,49.18505859375,6.103999999999999,5.719,6.559,1.5276967037358058,1.3434909155618826,1.573355673648015,0.38192417593395145,0.33587272889047065,0.39333891841200375,4.826171875,4.68603515625,5.48779296875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(49.184000000000005), 'mean_duration_us': np.float64(4.9184), 'median_duration_us': np.float64(4.8260000000000005), 'std_dev_duration_us': np.float64(0.25466613437989755), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.488)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.92)}]","{'op_shape': (1, 512, 4, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1843200, 3600, 900, 30, 1), 'stride_output': (2304000, 4500, 900, 30, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.002331437929374584,99.92724817041346 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((72000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",15611,10,104.58500000000001,10.4585,2.5761808187918622,0.000114688,0.3560791015625,0.30716489544052106,vector_bf16,0.07974401877274273,0.0034605898065232375,0.024494563188336472,0.0010629717060832433,4.690087890625,0.202737951359435,46.90087890625,9.644,9.274,17.757,0.07934093029170627,0.07398162229102168,0.08630632595936795,0.02437074855720563,0.022724557275541797,0.026510273589164787,4.7060546875,4.326171875,5.046875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(46.901), 'mean_duration_us': np.float64(4.6901), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.19239358097400241), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.047)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]","{'input_shape': (1, 16, 5, 30, 30), 'output_shape': (1, 16, 7, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 16, 7, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (72000, 4500, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.0022231647400523863,99.92947133515352 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '0')",15686,11,55.721,5.065545454545454,0.2860176091209646,,,,,,,,,4.223499644886363,0.8120007401551401,46.45849609375,5.087,4.707,5.698,,,,,,,4.40576171875,1.8818359375,4.88720703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(46.459), 'mean_duration_us': np.float64(4.223545454545455), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.7741596456964116), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.887)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.22)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0022021951997518493,99.93167353035328 -triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16,triton,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",8811,4,66.999,16.74975,0.9864712785141445,0.0,0.0,,,0.0,0.0,0.0,0.0,11.446044921875,0.038334483806650256,45.7841796875,16.384,16.034,18.197,0.0,0.0,0.0,0.0,0.0,0.0,11.43603515625,11.416015625,11.49609375,"[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.78399999999999), 'mean_duration_us': np.float64(11.445999999999998), 'median_duration_us': np.float64(11.436), 'std_dev_duration_us': np.float64(0.033166247903553964), 'min_duration_us': np.float64(11.416), 'max_duration_us': np.float64(11.496)}]","[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]","{'fused_ops': 'aten.cat, aten.clone, aten.expand, aten.sin, aten.unsqueeze, aten.view', 'xnumel': 950400, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16']",0.0021702316951657113,99.93384376204844 -triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15,triton,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",8810,4,87.991,21.99775,2.091984922667147,0.0,0.0,,,0.0,0.0,0.0,0.0,11.295654296875,0.0980764883845896,45.1826171875,22.423000000000002,19.339,23.806,0.0,0.0,0.0,0.0,0.0,0.0,11.29541015625,11.17578125,11.416015625,"[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.183), 'mean_duration_us': np.float64(11.29575), 'median_duration_us': np.float64(11.2955), 'std_dev_duration_us': np.float64(0.0848539185895384), 'min_duration_us': np.float64(11.176), 'max_duration_us': np.float64(11.416)}]","[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'mean_duration_us': np.float64(11.3)}]","{'fused_ops': 'aten.cat, aten.clone, aten.cos, aten.expand, aten.unsqueeze, aten.view', 'xnumel': 950400, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15']",0.0021417168235870563,99.93598547887203 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '-inf')",15683,11,106.539,9.685363636363636,2.433095816967645,,,,,,,,,4.055841619318182,0.7697365198769237,44.6142578125,8.552,7.862,14.953,,,,,,,4.2451171875,1.8017578125,4.64599609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(44.614), 'mean_duration_us': np.float64(4.055818181818181), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.733827180321438), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.06)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0021147758247903404,99.93810025469682 -aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '6', '1', '')",15658,10,122.231,12.223099999999999,2.564487839272742,,,,,,,,,4.449560546875,0.20212210188296303,44.49560546875,11.081,10.455,17.546,,,,,,,4.42578125,4.1650390625,4.80615234375,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.496), 'mean_duration_us': np.float64(4.4496), 'median_duration_us': np.float64(4.426), 'std_dev_duration_us': np.float64(0.19173794616611492), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.002109151544113706,99.94020940624094 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((5, 900), (5, 900), ())","('int', 'int', 'Scalar')","((900, 1), (1, 0), ())","('', '', 'False')",15669,10,96.916,9.6916,0.8569727339108674,4.5e-06,0.034332275390625,0.125,,0.008286666591879384,0.0006870143417483529,0.001035833323984923,8.587679271854412e-05,4.369287109375,0.3361100771303973,43.69287109375,9.479,9.184,12.108,0.008172024041874143,0.0074270172257479596,0.009879137076242796,0.0010215030052342679,0.0009283771532184949,0.0012348921345303496,4.4052734375,3.64404296875,4.84716796875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(43.693000000000005), 'mean_duration_us': np.float64(4.369300000000001), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.31885766417008077), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(4.847)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]","{'op_shape': (5, 900), 'dtype_in_out': ('int', 'int'), 'stride_input': (900, 1), 'stride_output': (1, 0)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::repeat_interleave', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.00207110085509154,99.94228050709603 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 4, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (29491200, 57600, 14400, 120, 1)), ())","('', '2')",23889,1,25.248,25.248,,,,,,,,,,42.6611328125,,42.6611328125,25.248,25.248,25.248,,,,,,,42.6611328125,42.6611328125,42.6611328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.456), 'mean_duration_us': np.float64(11.456), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.456), 'max_duration_us': np.float64(11.456)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(31.205), 'mean_duration_us': np.float64(31.205), 'median_duration_us': np.float64(31.205), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(31.205), 'max_duration_us': np.float64(31.205)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(31.2)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0020221950729115905,99.94430270216894 -triton_poi_fused_silu_18,triton,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), ())","('', '', '3072')",9510,8,195.319,24.414875,3.5100225655562785,1.2288e-05,0.017578125,0.6666666666666666,vector_bfloat16,0.0037142269266815663,0.0002438981145842082,0.002476151284454378,0.00016259874305613888,4.98150634765625,0.3302784986302354,39.85205078125,24.0205,19.95,31.246,0.0037172806199717375,0.0033840193635141192,0.003967287020493957,0.0024781870799811586,0.002256012909009413,0.0026448580136626382,4.966552734375,4.64599609375,5.44677734375,"[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(39.852), 'mean_duration_us': np.float64(4.9815), 'median_duration_us': np.float64(4.9665), 'std_dev_duration_us': np.float64(0.3089826046883546), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.447)}]","[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'mean_duration_us': np.float64(4.98)}]","{'fused_ops': 'aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_silu_18']",0.0018890408065219786,99.94619174297546 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2700, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 2700), (1, 512))","('', '')",23512,3,112.537,37.51233333333334,13.078013852773418,1.4155776,5.7734375,233.82949932341,matrix_bf16,0.4937179551143691,0.06505753033299232,115.44582225137076,15.212369744981157,12.417317708333334,1.770000157041956,37.251953125,30.876,29.083,52.578,0.5284444047395789,0.418665584655906,0.5340438759476224,123.56589058051318,97.89636404403323,124.87521212956582,11.4560546875,11.3359375,14.4599609375,"[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB2048_LBSPPM0_LPA16_LPB32_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.252), 'mean_duration_us': np.float64(12.417333333333334), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(1.44521401721529), 'min_duration_us': np.float64(11.336), 'max_duration_us': np.float64(14.46)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.42)}]","{'M': 2700, 'N': 512, 'K': 512, 'bias': False, 'stride_A': (1, 2700), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, True)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB2048_LBSPPM0_LPA16_LPB32_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.0017657926805833932,99.94795753565604 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 768), (768, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768), (3072, 1))","('', '', '')",8822,4,100.73,25.1825,1.4581507695251072,0.004718592,4.50732421875,0.9983750406239844,matrix_bf16,0.6030240207262196,0.012640305184470336,0.602044131189778,0.012619765202045177,7.8402099609375,0.1648879704515517,31.36083984375,25.403,23.315,26.609,0.6036086511765286,0.5870575604075692,0.6178212201442522,0.6026278116393552,0.586103615720524,0.6168172857598774,7.830078125,7.64990234375,8.05078125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(31.361), 'mean_duration_us': np.float64(7.84025), 'median_duration_us': np.float64(7.83), 'std_dev_duration_us': np.float64(0.1428467272988779), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(8.051)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]","{'M': 1, 'N': 3072, 'K': 768, 'bias': False, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0014865459877291144,99.94944408164378 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', '1')",23449,5,42.485,8.497,0.2733678839951766,0.0013824,7.91015625,0.16666666666666666,vector_bf16,1.3812113325818098,0.0842420361751385,0.230201888763635,0.014040339362523085,6.02421875,0.39087327315214687,30.12109375,8.433,8.293,8.973,1.3991377316530762,1.240012497262574,1.4582308524336853,0.2331896219421794,0.20666874954376235,0.24303847540561424,5.92822265625,5.68798828125,6.68896484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(30.121), 'mean_duration_us': np.float64(6.0241999999999996), 'median_duration_us': np.float64(5.928), 'std_dev_duration_us': np.float64(0.3496423315332399), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(6.689)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.02)}]","{'shape_in1': (1, 512, 3, 30, 30), 'shape_in2': (1, 512, 3, 30, 30), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1382400, 2700, 900, 30, 1), 'stride_input2': (1382400, 2700, 900, 30, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.001427780355474078,99.95087186199925 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((18432000, 72000, 120, 1), (), ())","('', '', '[2., 2.]')",24017,1,27.841,27.841,,,,,,,,,,29.44189453125,,29.44189453125,27.841,27.841,27.841,,,,,,,29.44189453125,29.44189453125,29.44189453125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.309), 'mean_duration_us': np.float64(20.309), 'median_duration_us': np.float64(20.309), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.309), 'max_duration_us': np.float64(20.309)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.13)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.31)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.0013955853990082426,99.95226744739826 -aten::where,elementwise,python3,CPU,thread 416 (python3),"((2700, 2700), (), ())","('bool', 'float', 'float')","((2700, 1), (), ())","('', '', '')",23485,1,13.109,13.109,,,,,,,,,,28.9619140625,,28.9619140625,13.109,13.109,13.109,,,,,,,28.9619140625,28.9619140625,28.9619140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(28.962), 'mean_duration_us': np.float64(28.962), 'median_duration_us': np.float64(28.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(28.962), 'max_duration_us': np.float64(28.962)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.96)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::where', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})']",0.00137283367923404,99.9536402810775 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",8771,4,141.57,35.3925,14.702319306830473,0.001572864,4.541015625,0.3303225806451613,vector_bfloat16,0.6851827154488181,0.06909820745429199,0.22633132278051282,0.022824698204256425,6.99951171875,0.6636223025908732,27.998046875,29.168,25.909,57.325,0.6631096959926885,0.6323686401660074,0.7821428296438884,0.21904010603113322,0.20888564113870695,0.25835943792107796,7.190185546875,6.087890625,7.52978515625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.998), 'mean_duration_us': np.float64(6.9995), 'median_duration_us': np.float64(7.1899999999999995), 'std_dev_duration_us': np.float64(0.5746923089793354), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.53)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.0)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11']",0.001327145078181877,99.95496742615568 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",8873,4,107.22,26.805,0.9492010675650702,3.6864e-05,0.181640625,0.1935483870967742,vector_bfloat16,0.027263880261753002,0.0007167436078113684,0.005276880050661871,0.00013872456925381293,6.9896240234375,0.18656449590027488,27.95849609375,26.735,25.718,28.032,0.02740628600167764,0.026270896551724137,0.027972052491932593,0.005304442451937607,0.005084689655172414,0.0054139456435998564,6.94970703125,6.80908203125,7.25,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.958), 'mean_duration_us': np.float64(6.9895), 'median_duration_us': np.float64(6.9495000000000005), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.25)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(6.99)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11']",0.0013252703179563324,99.95629269647364 -aten::clamp,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '0', '1')",24635,1,15.483,15.483,,,,,,,,,,27.64111328125,,27.64111328125,15.483,15.483,15.483,,,,,,,27.64111328125,27.64111328125,27.64111328125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.641), 'mean_duration_us': np.float64(27.641), 'median_duration_us': np.float64(27.641), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.641), 'max_duration_us': np.float64(27.641)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(27.64)}]",,False,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::clamp', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0013102259457760355,99.95760292241941 -triton_per_fused_native_layer_norm_2,triton,python3,CPU,thread 416 (python3),"((1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1), (1, 7425, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (7456, 1, 7456), (7456, 1, 7456), (), ())","('', '', '', '', '', '7425', '24')",8847,4,104.506,26.1265,2.8952933645257204,0.0,0.0,,,0.0,0.0,0.0,0.0,6.5887451171875,0.43476345613526435,26.35498046875,25.458,23.485,30.105,0.0,0.0,0.0,0.0,0.0,0.0,6.468505859375,6.2080078125,7.2099609375,"[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(26.355), 'mean_duration_us': np.float64(6.58875), 'median_duration_us': np.float64(6.468500000000001), 'std_dev_duration_us': np.float64(0.37655104235680975), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(7.21)}]","[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'mean_duration_us': np.float64(6.59)}]","{'fused_ops': 'aten.native_layer_norm', 'xnumel': 7425, 'rnumel': 24}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused_native_layer_norm', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused_native_layer_norm_2']",0.001249261520663879,99.95885218394008 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (1, 512, 3, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', '1')",23803,3,24.928,8.309333333333333,0.035641735835019395,0.0055296,31.640625,0.16666666666666666,vector_bf16,3.964083768595541,0.2087833368924987,0.6606806280992569,0.03479722281541643,8.384602864583334,0.4286879502189478,25.15380859375,8.313,8.272,8.343,3.8525670352100696,3.8347381229189006,4.204946147657652,0.642094505868345,0.6391230204864835,0.7008243579429421,8.61181640625,7.89013671875,8.65185546875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(25.153999999999996), 'mean_duration_us': np.float64(8.384666666666666), 'median_duration_us': np.float64(8.612), 'std_dev_duration_us': np.float64(0.3501631365838246), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.652)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(8.38)}]","{'shape_in1': (1, 512, 3, 60, 60), 'shape_in2': (1, 512, 3, 60, 60), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (5529600, 10800, 3600, 60, 1), 'stride_input2': (5529600, 10800, 3600, 60, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0011923243582584477,99.96004450829834 -triton_red_fused_addmm_native_layer_norm_view_0,triton,python3,CPU,thread 416 (python3),"((256, 3072), (3072,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '256', '3072')",8724,4,195.07,48.7675,13.383424736093023,0.0,3.017578125,0.0,vector_bfloat16,0.552064744817549,0.03412372272570506,0.0,0.0,5.74755859375,0.346767475313975,22.990234375,43.454499999999996,39.599,68.562,0.5467207495711939,0.5163505721115538,0.5984669080162541,0.0,0.0,0.0,5.78759765625,5.287109375,6.1279296875,"[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.99), 'mean_duration_us': np.float64(5.7475), 'median_duration_us': np.float64(5.7875), 'std_dev_duration_us': np.float64(0.30036685902409416), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.128)}]","[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]","{'fused_ops': 'aten.addmm, aten.native_layer_norm, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_addmm_native_layer_norm_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_addmm_native_layer_norm_view_0']",0.0010897680303647629,99.9611342763287 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '', '1')",24634,1,10.766,10.766,,0.0222912,85.03418731689453,0.2499999775696259,vector_bf16,3.946778049278119,,0.9866944237918217,,22.591796875,,22.591796875,10.766,10.766,10.766,3.946778049278119,3.946778049278119,3.946778049278119,0.9866944237918217,0.9866944237918217,0.9866944237918217,22.591796875,22.591796875,22.591796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.592), 'mean_duration_us': np.float64(22.592), 'median_duration_us': np.float64(22.592), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.592), 'max_duration_us': np.float64(22.592)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(22.59)}]","{'shape_in1': (129, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (57600, 7430400, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.001070881556981498,99.96220515788569 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), ())","('c10::BFloat16', 'double')","((57600, 7430400, 240, 1), ())","('', '')",24633,1,16.134,16.134,,0.0222912,85.03418731689453,0.2499999775696259,vector_bf16,3.9748705248906204,,0.9937175420648222,,22.43212890625,,22.43212890625,16.134,16.134,16.134,3.9748705248906204,3.9748705248906204,3.9748705248906204,0.9937175420648222,0.9937175420648222,0.9937175420648222,22.43212890625,22.43212890625,22.43212890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.432), 'mean_duration_us': np.float64(22.432), 'median_duration_us': np.float64(22.432), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.432), 'max_duration_us': np.float64(22.432)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(22.43)}]","{'shape_in1': (129, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (57600, 7430400, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.00106331308051541,99.96326847096621 -triton_poi_fused__to_copy_cat_slice_3,triton,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '256')",8754,12,190.804,15.900333333333334,4.325386274570448,0.0,0.00048828125,0.0,vector_bfloat16,0.00027737682601958554,2.6973625899397195e-05,0.0,0.0,1.8617757161458333,0.18005556047818996,22.34130859375,13.525500000000001,12.258,23.445,0.00027510269361937824,0.00022834843205574913,0.0003277824320100031,0.0,0.0,0.0,1.861328125,1.56201171875,2.2421875,"[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.342), 'mean_duration_us': np.float64(1.8618333333333332), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.17237596184567677), 'min_duration_us': np.float64(1.562), 'max_duration_us': np.float64(2.242)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'mean_duration_us': np.float64(1.86)}]","{'fused_ops': 'aten._to_copy, aten.cat, aten.slice', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_cat_slice', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_cat_slice_3']",0.0010590080755530484,99.96432747904177 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '6', '3072')",8849,4,108.431,27.10775,1.6010570206377206,3.6864e-05,0.140625,0.25,vector_bfloat16,0.027122606428067145,0.0002951317347994232,0.006780651607016786,7.37829336998558e-05,5.4371337890625,0.059814453125000076,21.74853515625,26.499499999999998,25.969,29.463,0.027270172295466858,0.02667990882586801,0.027270172295466858,0.0068175430738667145,0.006669977206467003,0.0068175430738667145,5.4072265625,5.4072265625,5.52685546875,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.748), 'mean_duration_us': np.float64(5.437), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.05196152422706637), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.527)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3']",0.0010309098173578476,99.96535838885913 -triton_red_fused__to_copy_mul_sum_unsqueeze_5,triton,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256), (1, 4096, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((1048576, 4096, 1), (256, 1), (8192, 1, 4096), (), ())","('', '', '', '8192', '128')",8758,4,109.063,27.26575,2.826843395615208,0.002097152,2.00048828125,0.9997559189650964,vector_bfloat16,0.38593002023742,0.007783255073664616,0.38583582203868005,0.007781355328711315,5.43701171875,0.10999305125165447,21.748046875,26.855,24.807,30.546,0.3865704980368063,0.3768104439961407,0.3937686408799267,0.38647614350958226,0.37671847171300765,0.39367252942254816,5.427001953125,5.3271484375,5.56689453125,"[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.747999999999998), 'mean_duration_us': np.float64(5.436999999999999), 'median_duration_us': np.float64(5.427), 'std_dev_duration_us': np.float64(0.09539392014169465), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.567)}]","[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]","{'fused_ops': 'aten._to_copy, aten.mul, aten.sum, aten.unsqueeze', 'xnumel': 8192, 'rnumel': 128}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__to_copy_mul_sum_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__to_copy_mul_sum_unsqueeze_5']",0.0010308866721698779,99.9663892755313 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('c10::BFloat16', 'float', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",8714,5,58.946,11.7892,3.6696312757550995,0.0004752,2.7191162109375,0.16666666666666666,vector_bf16,0.6834939752189207,0.06414232990346092,0.1139156625364868,0.010690388317243478,4.2052734375,0.44987235908125317,21.0263671875,9.945,8.582,16.304,0.7048838242394978,0.569461439438268,0.7191203940886699,0.11748063737324965,0.09491023990637801,0.11985339901477832,4.044921875,3.96484375,5.0068359375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(21.027), 'mean_duration_us': np.float64(4.2054), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.4023936381206839), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.21)}]","{'op_shape': (1, 16, 33, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (475200, 29700, 900, 30, 1), 'stride_output': (475200, 29700, 900, 30, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.0009966780843506798,99.96738595361565 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 1, 460800, 15360, 512), ())","('', '', 'False')",23605,1,8.733,8.733,,0.0013824,5.2734375,0.25,vector_bf16,0.2696081516046091,,0.06740203790115228,,20.509765625,,20.509765625,8.733,8.733,8.733,0.2696081516046091,0.2696081516046091,0.2696081516046091,0.06740203790115228,0.06740203790115228,0.06740203790115228,20.509765625,20.509765625,20.509765625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.51), 'mean_duration_us': np.float64(20.51), 'median_duration_us': np.float64(20.51), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.51), 'max_duration_us': np.float64(20.51)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.51)}]","{'op_shape': (1, 512, 3, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': (1382400, 1, 460800, 15360, 512)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0009721904754787507,99.96835814409113 -aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((921600, 1800, 900, 30, 1), (), ())","('', '', '[1., 2., 2.]')",23753,1,8.683,8.683,,,,,,,,,,20.18896484375,,20.18896484375,8.683,8.683,8.683,,,,,,,20.18896484375,20.18896484375,20.18896484375,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.189), 'mean_duration_us': np.float64(20.189), 'median_duration_us': np.float64(20.189), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.189), 'max_duration_us': np.float64(20.189)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.19)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.000956984086982666,99.96931512817811 -aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 2700, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (1,), ())","('', '', '1')",23514,3,27.481,9.160333333333334,1.861493575958116,0.0013824,5.2744140625,0.24995371227550453,vector_bf16,0.838959693432371,0.1285371762053959,0.20970108982294036,0.032128344357949326,6.68896484375,0.9474872133303112,20.06689453125,8.182,7.992,11.307,0.7800769939393939,0.7504119485888432,0.9863901377688757,0.1949831404958678,0.18756825228567645,0.24655187668727685,7.08984375,5.60693359375,7.3701171875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.067), 'mean_duration_us': np.float64(6.689), 'median_duration_us': np.float64(7.09), 'std_dev_duration_us': np.float64(0.7735817129862019), 'min_duration_us': np.float64(5.607), 'max_duration_us': np.float64(7.37)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.69)}]","{'shape_in1': (1, 2700, 512), 'shape_in2': (512,), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1382400, 512, 1), 'stride_input2': (1,), 'stride_output': None}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.0009511977899902442,99.9702663259681 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1555200, 518400, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",24562,4,21.833,5.45825,0.30354612499585587,0.0001728,0.6591796875,0.25,vector_bf16,0.13918134795507703,0.0016063428511871143,0.03479533698876926,0.00040158571279677856,4.9666748046875,0.056854021444259904,19.86669921875,5.398,5.168,5.869,0.13860769744594267,0.13805125804564075,0.14145873888278207,0.03465192436148567,0.03451281451141019,0.03536468472069552,4.98681640625,4.88623046875,5.0068359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.867), 'mean_duration_us': np.float64(4.96675), 'median_duration_us': np.float64(4.987), 'std_dev_duration_us': np.float64(0.049398254017728016), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]","{'op_shape': (1, 3, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1555200, 518400, 240, 1), 'stride_output': (172800, 57600, 240, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0009417082629226723,99.97120803423103 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((1555200, 518400, 240, 1), ())","('', '')",24558,4,24.305999999999997,6.076499999999999,0.16760568804985918,0.0001728,0.6591873168945312,0.2499971065149709,vector_bf16,0.13917722334307966,0.0009275068197403422,0.034793903128557783,0.00023187402120798762,4.966552734375,0.03309163842745591,19.8662109375,6.074,5.909,6.249,0.1391657475422729,0.13805285586112737,0.14032454242664552,0.03479103421156115,0.03451281451141019,0.035080729579698655,4.966796875,4.92578125,5.0068359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.866999999999997), 'mean_duration_us': np.float64(4.966749999999999), 'median_duration_us': np.float64(4.967), 'std_dev_duration_us': np.float64(0.02863891583143451), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]","{'shape_in1': (1, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (1555200, 518400, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})']",0.0009416851177347026,99.97214971934876 -triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), ())","('', '', '', '', '', '786432')",8809,4,102.731,25.68275,2.7150337474882345,0.001572864,4.529296875,0.3311772315653299,vector_bfloat16,1.0187083492000564,0.03145074450221282,0.337373010860562,0.010415770494911379,4.66552734375,0.1483710960296656,18.662109375,25.387500000000003,22.773,29.183,1.0312331515408668,0.9719787125012491,1.0403883812172425,0.34152094022569457,0.3218972191465974,0.34455294384426144,4.60546875,4.56494140625,4.88623046875,"[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.662), 'mean_duration_us': np.float64(4.6655), 'median_duration_us': np.float64(4.6055), 'std_dev_duration_us': np.float64(0.12837542599734572), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.886)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'mean_duration_us': np.float64(4.67)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.split, aten.unsqueeze, aten.view', 'xnumel': 786432, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14']",0.0008846090842014534,99.97303432843296 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (1, 256, 4, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((14745600, 57600, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', 'False')",24030,1,5.878,5.878,,0.0147456,56.25,0.25,vector_bf16,3.173329354279409,,0.7933323385698523,,18.5869140625,,18.5869140625,5.878,5.878,5.878,3.173329354279409,3.173329354279409,3.173329354279409,0.7933323385698523,0.7933323385698523,0.7933323385698523,18.5869140625,18.5869140625,18.5869140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(18.587), 'mean_duration_us': np.float64(18.587), 'median_duration_us': np.float64(18.587), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(18.587)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(18.59)}]","{'op_shape': (1, 256, 4, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (14745600, 57600, 14400, 120, 1), 'stride_output': (18432000, 72000, 14400, 120, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0008810447252541216,99.9739153731582 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((5529600, 10800, 60, 1), (), ())","('', '', '[2., 2.]')",23873,1,26.82,26.82,,,,,,,,,,18.46484375,,18.46484375,26.82,26.82,26.82,,,,,,,18.46484375,18.46484375,18.46484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.218), 'mean_duration_us': np.float64(13.218), 'median_duration_us': np.float64(13.218), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.218), 'max_duration_us': np.float64(13.218)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(13.22)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.0008752584282616997,99.97479063158647 -triton_poi_fused_addmm_clone_permute_view_31,triton,python3,CPU,thread 416 (python3),"((7425, 64), (64,), (1, 16, 33, 1, 15, 2, 15, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1), (1,), (475200, 29700, 900, 900, 60, 30, 2, 1), ())","('', '', '', '475200')",10413,4,114.78,28.695,1.2848234638787273,0.0,2.71923828125,0.0,vector_bfloat16,0.6208310618269924,0.018353194911004008,0.0,0.0,4.595703125,0.13275863452711426,18.3828125,28.197,27.811,30.575,0.6137628454066637,0.6084734546212358,0.6473251018734065,0.0,0.0,0.0,4.64599609375,4.40478515625,4.68603515625,"[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.383000000000003), 'mean_duration_us': np.float64(4.595750000000001), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.11487030730349758), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(4.686)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]","{'fused_ops': 'aten.addmm, aten.clone, aten.permute, aten.view', 'xnumel': 475200, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_clone_permute_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_clone_permute_view_31']",0.0008713700366827922,99.97566200162315 -triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1,triton,python3,CPU,thread 416 (python3),"((1, 256), (1, 24, 256, 256), (1, 24, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1), (1572864, 65536, 256, 1), (1572864, 65536, 256, 1), ())","('', '', '', '1572864')",8728,4,131.815,32.95375,2.281149911046329,0.0,9.00048828125,0.0,vector_bfloat16,2.178712378705549,0.07557592568513834,0.0,0.0,4.335693359375,0.15054089193657735,17.3427734375,32.953500000000005,30.735,35.173,2.1833347712206237,2.1043441924877517,2.243835779893197,0.0,0.0,0.0,4.325927734375,4.2060546875,4.48486328125,"[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.343), 'mean_duration_us': np.float64(4.33575), 'median_duration_us': np.float64(4.3260000000000005), 'std_dev_duration_us': np.float64(0.13048060200658163), 'min_duration_us': np.float64(4.206), 'max_duration_us': np.float64(4.485)}]","[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_cop...', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]","{'fused_ops': 'aten._scaled_dot_product_efficient_attention, aten._to_copy, aten.bitwise_and, aten.clone, aten.expand, aten.fill, aten.lift_fresh, aten.repeat, aten.scalar_tensor, aten.select, aten.transpose, aten.unsqueeze, aten.view, aten.where', 'xnumel': 1572864, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1']",0.0008220707863073579,99.97648407240946 -triton_per_fused__to_copy_div_mul_sum_unsqueeze_7,triton,python3,CPU,thread 416 (python3),"((1, 4096, 2), (1, 1), (1, 4096), (), ())","('float', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((8192, 1, 4096), (1, 1), (4096, 1), (), ())","('', '', '', '4096', '2')",8760,4,80.35900000000001,20.089750000000002,2.45601688037087,2.4576e-05,0.0078125,3.0,vector_bfloat16,0.0018962719219206546,0.0001336466931292521,0.005688815765761963,0.0004009400793877561,4.33544921875,0.29147214306464797,17.341796875,19.7945,17.596,23.174,0.0018596418783100956,0.0017785663097635957,0.0020872376212988306,0.005578925634930287,0.005335698929290787,0.006261712863896492,4.405517578125,3.9248046875,4.60595703125,"[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.342), 'mean_duration_us': np.float64(4.3355), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.25236927309004953), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.606)}]","[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]","{'fused_ops': 'aten._to_copy, aten.div, aten.mul, aten.sum, aten.unsqueeze', 'xnumel': 4096, 'rnumel': 2}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_div_mul_sum_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7']",0.0008220244959314186,99.9773060969054 -aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 2, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (3686400, 7200, 3600, 60, 1)), ())","('', '2')",23755,1,25.658,25.658,,,,,,,,,,15.822265625,,15.822265625,25.658,25.658,25.658,,,,,,,15.822265625,15.822265625,15.822265625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.332), 'mean_duration_us': np.float64(8.332), 'median_duration_us': np.float64(8.332), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.332), 'max_duration_us': np.float64(8.332)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.33)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0007499966709697514,99.97805609357637 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((475200, 29700, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23396,1,89.533,89.533,,0.0013824,0.165283203125,7.976366322008863,matrix_bf16,0.011066377003180148,,0.08826947683481949,,15.6611328125,,15.6611328125,89.533,89.533,89.533,0.011066377003180148,0.011066377003180148,0.011066377003180148,0.08826947683481949,0.08826947683481949,0.08826947683481949,15.6611328125,15.6611328125,15.6611328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR0_DTVA0_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SPO1_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.768), 'mean_duration_us': np.float64(5.768), 'median_duration_us': np.float64(5.768), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(5.768)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.77)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 3, 30, 30), 'filter_shape': (16, 16, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (475200, 29700, 900, 30, 1), 'weight_stride': (16, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', ['aten::miopen_convolution', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['aten::miopen_convolution', 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR0_DTVA0_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SPO1_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16']]",0.0007423587589397545,99.97879845233531 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 2700), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2700, 2700, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23499,1,40.139,40.139,,0.006915072,5.279296875,1.2491675915649278,vector_bf16,0.3543651333729253,,0.44266144019004156,,15.62158203125,,15.62158203125,40.139,40.139,40.139,0.3543651333729253,0.3543651333729253,0.3543651333729253,0.44266144019004156,0.44266144019004156,0.44266144019004156,15.62158203125,15.62158203125,15.62158203125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.488), 'mean_duration_us': np.float64(5.488), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.488), 'max_duration_us': np.float64(5.488)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.134), 'mean_duration_us': np.float64(10.134), 'median_duration_us': np.float64(10.134), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.134), 'max_duration_us': np.float64(10.134)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.49)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.13)}]","{'op_shape': (1, 512, 2700), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2700, 2700, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.0007404839987142099,99.97953893633402 -aten::nonzero,other,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",10416,1,127.97,127.97,,,,,,,,,,14.5361328125,,14.5361328125,127.97,127.97,127.97,,,,,,,14.5361328125,14.5361328125,14.5361328125,"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.881), 'mean_duration_us': np.float64(1.881), 'median_duration_us': np.float64(1.881), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(1.881)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.962), 'mean_duration_us': np.float64(1.962), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(1.962)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.284), 'mean_duration_us': np.float64(3.284), 'median_duration_us': np.float64(3.284), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.284), 'max_duration_us': np.float64(3.284)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.324), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.324)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::nonzero', ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})'], ['void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)'], ['Memcpy DtoD (Device -> Device)'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})']]",0.0006890322458575947,99.98022796857988 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",12145,3,119.156,39.71866666666667,1.1365713058727702,0.0004752,2.7191162109375,0.16666666666666666,vector_fp32,0.632147440062655,0.016996500050284122,0.10535790667710916,0.00283275000838068,4.512532552083333,0.12232135644087852,13.53759765625,39.208,38.927,41.021,0.6356000435397844,0.613689710982659,0.6471525656655215,0.10593334058996408,0.10228161849710984,0.10785876094425358,4.48583984375,4.40576171875,4.64599609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.538), 'mean_duration_us': np.float64(4.512666666666667), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","{'op_shape': (1, 16, 33, 30, 30), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (475200, 29700, 900, 30, 1), 'stride_output': (475200, 29700, 900, 30, 1)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.0006417003364595839,99.98086966891634 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",10481,6,119.807,19.967833333333335,6.4283491945185025,1.536e-06,0.0004901885986328125,2.9883268482490273,vector_bfloat16,0.0002332364906786265,1.225297684470494e-05,0.0006969868670863236,3.661589967600538e-05,2.2089029947916665,0.11725194218808946,13.25341796875,19.629,13.77,27.17,0.0002357283544803103,0.00021762910895182963,0.000246874296435272,0.0007044333705870751,0.0006503469092412653,0.0007377410881801125,2.18212890625,2.08203125,2.36181640625,"[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(13.253000000000002), 'mean_duration_us': np.float64(2.2088333333333336), 'median_duration_us': np.float64(2.182), 'std_dev_duration_us': np.float64(0.10705203822855923), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.21)}]","{'fused_ops': 'aten._to_copy, aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/1', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2']",0.0006282298370612258,99.9814978987534 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 2700, 512), (1, 2700, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (2700, 1, 2700), ())","('', '', '1')",23595,1,13.79,13.79,,0.0013824,7.91015625,0.16666666666666666,vector_bf16,0.6573381007661946,,0.1095563501276991,,12.6181640625,,12.6181640625,13.79,13.79,13.79,0.6573381007661946,0.6573381007661946,0.6573381007661946,0.1095563501276991,0.1095563501276991,0.1095563501276991,12.6181640625,12.6181640625,12.6181640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.618), 'mean_duration_us': np.float64(12.618), 'median_duration_us': np.float64(12.618), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.618), 'max_duration_us': np.float64(12.618)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.62)}]","{'shape_in1': (1, 2700, 512), 'shape_in2': (1, 2700, 512), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1382400, 512, 1), 'stride_input2': (2700, 1, 2700), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.0005981179475126624,99.98209601670092 -aten::le,elementwise,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700))","('int', 'int')","((0, 1), (1, 0))","('', '')",23477,1,10.736,10.736,,,,,,,,,,12.537109375,,12.537109375,10.736,10.736,10.736,,,,,,,12.537109375,12.537109375,12.537109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.537), 'mean_duration_us': np.float64(12.537), 'median_duration_us': np.float64(12.537), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.537), 'max_duration_us': np.float64(12.537)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.54)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::le', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})']",0.0005942758463096943,99.98269029254723 -aten::cos,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",147,1,16.845,16.845,,,,,,,,,,12.09716796875,,12.09716796875,16.845,16.845,16.845,,,,,,,12.09716796875,12.09716796875,12.09716796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.097), 'mean_duration_us': np.float64(12.097), 'median_duration_us': np.float64(12.097), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.097), 'max_duration_us': np.float64(12.097)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(12.1)}]",,False,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::cos', 'void at::native::vectorized_elementwise_kernel<4, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.000573422031949006,99.98326371457918 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((512,), (2700, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",23592,1,42.643,42.643,,1.41696,5.7744140625,234.01826484018264,matrix_bf16,0.5021852256104968,,117.52051512574415,,12.05712890625,,12.05712890625,42.643,42.643,42.643,0.5021852256104968,0.5021852256104968,0.5021852256104968,117.52051512574415,117.52051512574415,117.52051512574415,12.05712890625,12.05712890625,12.05712890625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.057), 'mean_duration_us': np.float64(12.057), 'median_duration_us': np.float64(12.057), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.057), 'max_duration_us': np.float64(12.057)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.06)}]","{'M': 2700, 'N': 512, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.0005715241265354916,99.98383523870572 -triton_poi_fused_add_addmm_silu_8,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (3072, 1), ())","('', '', '', '', '', '', '3072')",8764,4,115.021,28.75525,4.793401393234938,1.536e-05,0.041015625,0.3571428571428571,vector_bfloat16,0.014748919431173384,0.0008462290311069907,0.0052674712254190655,0.00030222465396678234,2.9234619140625,0.17329026350422627,11.69384765625,26.995,25.408,35.623,0.014919185316700043,0.013592651851851852,0.015564655239441597,0.0053282804702500155,0.004854518518518518,0.005558805442657713,2.88330078125,2.76318359375,3.1640625,"[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.693999999999999), 'mean_duration_us': np.float64(2.9234999999999998), 'median_duration_us': np.float64(2.8834999999999997), 'std_dev_duration_us': np.float64(0.1500674848193306), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.164)}]","[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'mean_duration_us': np.float64(2.92)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_8']",0.0005543041066860442,99.98438954281241 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2700), (1, 1, 2700, 2700), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), (7290000, 7290000, 2700, 1), ())","('', '', 'False')",23552,1,7.391,7.391,,0.00729,27.80914306640625,0.25,vector_bf16,2.5998989986939485,,0.6499747496734871,,11.2158203125,,11.2158203125,7.391,7.391,7.391,2.5998989986939485,2.5998989986939485,2.5998989986939485,0.6499747496734871,0.6499747496734871,0.6499747496734871,11.2158203125,11.2158203125,11.2158203125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.216), 'mean_duration_us': np.float64(11.216), 'median_duration_us': np.float64(11.216), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(11.216)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.22)}]","{'op_shape': (1, 1, 2700, 2700), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (7300800, 7300800, 2704, 1), 'stride_output': (7290000, 7290000, 2700, 1)}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0005316449676637202,99.98492118778007 -triton_poi_fused_add_addmm_17,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",10553,3,74.961,24.987,2.9250770930011396,3.072e-06,0.041015625,0.07142857142857142,vector_bfloat16,0.012204518933368316,0.0001403398434262342,0.0008717513523834513,1.00242745304454e-05,3.5242513020833335,0.040528324222577586,10.57275390625,24.537,22.313,28.111,0.012204570320077593,0.012064153403643335,0.012344833076384022,0.0008717550228626854,0.0008617252431173812,0.0008817737911702874,3.52392578125,3.48388671875,3.56494140625,"[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.573), 'mean_duration_us': np.float64(3.5243333333333333), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0330689515339624), 'min_duration_us': np.float64(3.484), 'max_duration_us': np.float64(3.565)}]","[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]","{'fused_ops': 'aten.add, aten.addmm', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/1', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_17']",0.0005011627551076419,99.98542235053519 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((1382400, 2700, 30, 1), (), ())","('', '', '[2., 2.]')",23739,1,28.592,28.592,,,,,,,,,,10.5341796875,,10.5341796875,28.592,28.592,28.592,,,,,,,10.5341796875,10.5341796875,10.5341796875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.245), 'mean_duration_us': np.float64(4.245), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.245)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.289), 'mean_duration_us': np.float64(6.289), 'median_duration_us': np.float64(6.289), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(6.289)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.24)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.0004993342852580365,99.98592168482044 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700), ())","('c10::BFloat16', 'float', 'Scalar')","((2700, 1), (2700, 1), ())","('', '', 'False')",23491,1,6.54,6.54,,0.00729,41.713714599609375,0.16666666666666666,vector_bf16,4.367815105563411,,0.7279691842605686,,10.01416015625,,10.01416015625,6.54,6.54,6.54,4.367815105563411,4.367815105563411,4.367815105563411,0.7279691842605686,0.7279691842605686,0.7279691842605686,10.01416015625,10.01416015625,10.01416015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.014), 'mean_duration_us': np.float64(10.014), 'median_duration_us': np.float64(10.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.014), 'max_duration_us': np.float64(10.014)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]","{'op_shape': (2700, 2700), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (2700, 1), 'stride_output': (2700, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.00047468466007031943,99.98639636948052 -aten::sin,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",149,1,12.108,12.108,,,,,,,,,,9.212890625,,9.212890625,12.108,12.108,12.108,,,,,,,9.212890625,9.212890625,9.212890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.213), 'mean_duration_us': np.float64(9.213), 'median_duration_us': np.float64(9.213), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.213), 'max_duration_us': np.float64(9.213)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(9.21)}]",,False,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::sin', 'void at::native::vectorized_elementwise_kernel<4, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.00043670340661206236,99.98683307288712 -triton_per_fused__to_copy_any_sum_unsqueeze_6,triton,python3,CPU,thread 416 (python3),"((1, 256), (1, 1), (256,), (), ())","('c10::BFloat16', 'float', 'bool', 'Scalar', 'Scalar')","((256, 1), (1, 1), (1,), (), ())","('', '', '', '1', '256')",8759,4,85.898,21.4745,1.5295176799675563,2.56e-07,0.00048828125,0.5,vector_bfloat16,0.0002452685614352615,7.593514035416293e-05,0.00012263428071763075,3.7967570177081464e-05,2.29248046875,0.9005283959186826,9.169921875,21.482,19.599,23.335,0.00025963160527421516,0.00014202573479615334,0.00031978530039646237,0.00012981580263710758,7.101286739807667e-05,0.00015989265019823119,1.98193359375,1.60107421875,3.60498046875,"[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.17), 'mean_duration_us': np.float64(2.2925), 'median_duration_us': np.float64(1.982), 'std_dev_duration_us': np.float64(0.779879638149375), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.605)}]","[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'mean_duration_us': np.float64(2.29)}]","{'fused_ops': 'aten._to_copy, aten.any, aten.sum, aten.unsqueeze', 'xnumel': 1, 'rnumel': 256}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_any_sum_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_any_sum_unsqueeze_6']",0.00043466663007072986,99.9872677395172 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128), ())","('float', 'double')","((44928, 128, 1), ())","('', '')",148,2,26.779,13.3895,5.2545104909972356,4.4928e-05,0.34278106689453125,0.12499721783258029,vector_fp32,0.08327604552156585,0.005457428614938392,0.01040927400229504,0.0006821633933872109,4.325439453125,0.28346419304402126,8.65087890625,13.3895,9.674,17.105,0.08327604552156585,0.07941706074010141,0.0871350303030303,0.01040927400229504,0.009926911640953717,0.010891636363636364,4.325439453125,4.125,4.52587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.651), 'mean_duration_us': np.float64(4.3255), 'median_duration_us': np.float64(4.3255), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]","{'shape_in1': (1, 351, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (44928, 128, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.00041006329525895217,99.98767780281246 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 2700, 512), ())","('c10::BFloat16', 'double')","((1382400, 512, 1), ())","('', '')",23596,1,10.365,10.365,,0.0013824,5.273445129394531,0.24999963831070846,vector_bf16,0.6451681868626445,,0.16129181336523674,,8.57080078125,,8.57080078125,10.365,10.365,10.365,0.6451681868626445,0.6451681868626445,0.6451681868626445,0.16129181336523674,0.16129181336523674,0.16129181336523674,8.57080078125,8.57080078125,8.57080078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.571), 'mean_duration_us': np.float64(8.571), 'median_duration_us': np.float64(8.571), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.571), 'max_duration_us': np.float64(8.571)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.57)}]","{'shape_in1': (1, 2700, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (1382400, 512, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.00040626748443192337,99.98808407029689 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351), (1, 351), ())","('long int', 'long int', 'Scalar')","((351, 1), (351, 1), ())","('', '', 'False')",15,2,86.509,43.2545,37.234121776940036,3.51e-07,0.0053558349609375,0.0625,,0.0013532306674602038,0.00021888653106099558,8.457691671626274e-05,1.368040819131224e-05,4.205078125,0.6801759565124506,8.41015625,43.2545,16.926,69.583,0.0013532306674602038,0.001198454517036574,0.0015080068178838337,8.457691671626274e-05,7.490340731478587e-05,9.425042611773962e-05,4.205078125,3.72412109375,4.68603515625,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.41), 'mean_duration_us': np.float64(4.205), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.48099999999999987), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(4.686)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.2)}]","{'op_shape': (1, 351), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (351, 1), 'stride_output': (351, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.0003986527175898962,99.98848272301449 -aten::sub,elementwise,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",10432,4,88.112,22.028,0.8249173695993242,,,,,,,,,2.011962890625,0.06005859375000001,8.0478515625,22.1635,20.921,22.864,,,,,,,2.001953125,1.9619140625,2.08203125,"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.047999999999998), 'mean_duration_us': np.float64(2.0119999999999996), 'median_duration_us': np.float64(2.002), 'std_dev_duration_us': np.float64(0.05196152422706626), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::unrolled_elementwise_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::sub', 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)']",0.0003814789881163882,99.9888642020026 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('c10::BFloat16', 'float', 'Scalar')","((0,), (0,), ())","('', '', 'False')",10445,3,42.423,14.141,1.0069314773111429,1e-09,5.7220458984375e-06,0.16666666666666666,vector_bf16,2.364906950017053e-06,3.4176105987712203e-07,3.941511583361755e-07,5.696017664618699e-08,2.576171875,0.40562243773792883,7.728515625,14.191,13.11,15.122,2.539367637941723e-06,1.971126082771896e-06,2.58422712933754e-06,4.232279396569539e-07,3.2852101379531603e-07,4.307045215562566e-07,2.36279296875,2.32177734375,3.0439453125,"[{'name': 'void at::native::unrolled_elementwise_kernel, 4, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(7.729), 'mean_duration_us': np.float64(2.5763333333333334), 'median_duration_us': np.float64(2.363), 'std_dev_duration_us': np.float64(0.3311136092374069), 'min_duration_us': np.float64(2.322), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::unrolled_elementwise_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::unrolled_elementwise_kernel, 4, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)']",0.0003663420351842126,99.98923054403778 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351), (1, 351), ())","('bool', 'long int', 'Scalar')","((351, 1), (351, 1), ())","('', '', 'False')",43,1,14.191,14.191,,3.51e-07,,,,,,4.588293866087956e-05,,7.64990234375,,7.64990234375,14.191,14.191,14.191,,,,4.588293866087956e-05,4.588293866087956e-05,4.588293866087956e-05,7.64990234375,7.64990234375,7.64990234375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.65), 'mean_duration_us': np.float64(7.65), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(7.65)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.65)}]","{'op_shape': (1, 351), 'dtype_in_out': ('bool', 'long int'), 'stride_input': (351, 1), 'stride_output': (351, 1)}",True,transformers/masking_utils.py(776): _preprocess_mask_arguments,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(776): _preprocess_mask_arguments', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1})']",0.00036261565992109287,99.9895931596977 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 351, 64), (1, 351, 64)), ())","('TensorList', 'Scalar')","(((22464, 1, 351), (22464, 1, 351)), ())","('', '-1')",146,1,23.995,23.995,,,,,,,,,,7.490234375,,7.490234375,23.995,23.995,23.995,,,,,,,7.490234375,7.490234375,7.490234375,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 3, 64, 64>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 3, 64, 64>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.00035504718345500514,99.98994820688117 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128), (1, 351, 128), ())","('c10::BFloat16', 'float', 'Scalar')","((44928, 128, 1), (44928, 128, 1), ())","('', '', 'False')",154,2,23.695,11.8475,7.279664312315507,4.4928e-05,0.257080078125,0.16666666666666666,vector_bf16,0.07224303389411016,0.006015314059006786,0.012040505649018362,0.0010025523431677961,3.744384765625,0.31177608565012327,7.48876953125,11.8475,6.7,16.995,0.07224303389411016,0.0679895645320197,0.07649650325620064,0.012040505649018362,0.01133159408866995,0.012749417209366773,3.744384765625,3.52392578125,3.96484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.489), 'mean_duration_us': np.float64(3.7445), 'median_duration_us': np.float64(3.7445), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.965)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.74)}]","{'op_shape': (1, 351, 128), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (44928, 128, 1), 'stride_output': (44928, 128, 1)}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.00035497774789109603,99.99030318462906 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351), (1, 1, 351), ())","('float', 'long int', 'Scalar')","((351, 351, 1), (351, 351, 1), ())","('', '', 'False')",130,1,12.228,12.228,,3.51e-07,0.004016876220703125,0.08333333333333333,vector_fp32,0.0005652802096985584,,4.7106684141546534e-05,,7.451171875,,7.451171875,12.228,12.228,12.228,0.0005652802096985584,0.0005652802096985584,0.0005652802096985584,4.7106684141546534e-05,4.7106684141546534e-05,4.7106684141546534e-05,7.451171875,7.451171875,7.451171875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.451), 'mean_duration_us': np.float64(7.451), 'median_duration_us': np.float64(7.451), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.451), 'max_duration_us': np.float64(7.451)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.45)}]","{'op_shape': (1, 1, 351), 'dtype_in_out': ('float', 'long int'), 'stride_input': (351, 351, 1), 'stride_output': (351, 351, 1)}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})']",0.0003531955684174301,99.99065638019748 -aten::normal_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (), (), ())","('float', 'Scalar', 'Scalar', '')","((475200, 29700, 900, 30, 1), (), (), ())","('', '0.', '1.', '')",8691,1,15.973,15.973,,,,,,,,,,7.25,,7.25,15.973,15.973,15.973,,,,,,,7.25,7.25,7.25,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.25), 'mean_duration_us': np.float64(7.25), 'median_duration_us': np.float64(7.25), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.25), 'max_duration_us': np.float64(7.25)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(7.25)}]",,False,diffusers/utils/torch_utils.py(152): randn_tensor,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(387): prepare_latents', 'diffusers/utils/torch_utils.py(152): randn_tensor', 'aten::randn', 'aten::normal_', 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})']",0.0003436597509739189,99.99100003994845 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (1, 512, 2, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 7200, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', 'False')",23886,1,5.539,5.539,,0.0036864,14.0625,0.25,vector_bf16,2.056591446472351,,0.5141478616180878,,7.169921875,,7.169921875,5.539,5.539,5.539,2.056591446472351,2.056591446472351,2.056591446472351,0.5141478616180878,0.5141478616180878,0.5141478616180878,7.169921875,7.169921875,7.169921875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.17), 'mean_duration_us': np.float64(7.17), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.17), 'max_duration_us': np.float64(7.17)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.17)}]","{'op_shape': (1, 512, 2, 60, 60), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (3686400, 7200, 3600, 60, 1), 'stride_output': (5529600, 10800, 3600, 60, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.00033986394014689017,99.99133990388859 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2704), ())","('c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), ())","('', '0.')",23548,1,8.152,8.152,,,,,,,,,,7.0888671875,,7.0888671875,8.152,8.152,8.152,,,,,,,7.0888671875,7.0888671875,7.0888671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.089), 'mean_duration_us': np.float64(7.089), 'median_duration_us': np.float64(7.089), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(7.089)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]",,False,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0003360218389439221,99.99167592572753 -aten::all,reduce,python3,CPU,thread 416 (python3),"((1, 351),)","('bool',)","((351, 1),)","('',)",44,1,25.728,25.728,,,,,,,,,,6.96923828125,,6.96923828125,25.728,25.728,25.728,,,,,,,6.96923828125,6.96923828125,6.96923828125,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, bool, 4, 4> >(at::native::ReduceOp, unsigned int, bool, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.969), 'mean_duration_us': np.float64(6.969), 'median_duration_us': np.float64(6.969), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.969), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(233): _ignore_causal_mask_sdpa', 'aten::all', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, bool, 4, 4> >(at::native::ReduceOp, unsigned int, bool, 4, 4>)']",0.00033035126789134864,99.99200627699543 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((351,), (), ())","('long int', 'long int', 'Scalar')","((1,), (), ())","('', '', '1')",37,3,42.713,14.237666666666668,8.485826378929357,3.51e-07,0.00536346435546875,0.06241109530583215,,0.002498265902290507,0.0002632304295773652,0.0001559195113271636,1.642849942774808e-05,2.26904296875,0.2545641079483555,6.80712890625,11.577,7.401,23.735,0.0026502420616658995,0.0021943135835397216,0.0026502420616658995,0.00016540450989415556,0.00013694951419317966,0.00016540450989415556,2.1220703125,2.1220703125,2.56298828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.807), 'mean_duration_us': np.float64(2.269), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.2078893936688451), 'min_duration_us': np.float64(2.122), 'max_duration_us': np.float64(2.563)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.27)}]","{'shape_in1': (351,), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(372): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0003226670654854124,99.99232894406092 -aten::bmm,GEMM,python3,CPU,thread 416 (python3),"((1, 64, 1), (1, 1, 351))","('float', 'float')","((64, 1, 1), (351, 351, 1))","('', '')",142,1,102.082,102.082,,4.4928e-05,0.08727645874023438,0.4909305476637965,matrix_fp32,0.013519784173699775,,0.00663727504869076,,6.76904296875,,6.76904296875,102.082,102.082,102.082,0.013519784173699775,0.013519784173699775,0.013519784173699775,0.00663727504869076,0.00663727504869076,0.00663727504869076,6.76904296875,6.76904296875,6.76904296875,"[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA4_GRVWB4_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB8_LPM0_LRVW4_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.769), 'mean_duration_us': np.float64(6.769), 'median_duration_us': np.float64(6.769), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.769), 'max_duration_us': np.float64(6.769)}]","[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_S...', 'stream': 0, 'mean_duration_us': np.float64(6.77)}]","{'B': 1, 'M': 64, 'N': 351, 'K': 1, 'bias': False, 'stride_A': (64, 1, 1), 'stride_B': (351, 351, 1), 'dtype_A_B': ('float', 'float'), 'transpose': (False, False)}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::matmul', 'aten::bmm', 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA4_GRVWB4_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB8_LPM0_LRVW4_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_1']",0.00032086174082377676,99.99264980580173 -aten::le,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 351, 1))","('long int', 'long int')","((351, 351, 351, 1), (351, 351, 1, 1))","('', '')",95,1,16.714,16.714,,,,,,,,,,6.52783203125,,6.52783203125,16.714,16.714,16.714,,,,,,,6.52783203125,6.52783203125,6.52783203125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.528), 'mean_duration_us': np.float64(6.528), 'median_duration_us': np.float64(6.528), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",,False,transformers/masking_utils.py(74): causal_mask_function,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'transformers/masking_utils.py(74): causal_mask_function', 'aten::le', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})']",0.0003094280179667512,99.9929592338197 -aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '351', '1', '')",35,3,31.167,10.389000000000001,5.012205003788254,,,,,,,,,2.0421549479166665,0.3822298351596716,6.12646484375,7.832,7.171,16.164,,,,,,,1.841796875,1.8017578125,2.48291015625,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.127000000000001), 'mean_duration_us': np.float64(2.0423333333333336), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.3120259960679915), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.483)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.0002904026734556681,99.99324963649316 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('c10::BFloat16', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",8676,1,8.673,8.673,,2.56e-07,0.00244140625,0.1,vector_bf16,0.00042329081220733085,,4.232908122073309e-05,,6.0478515625,,6.0478515625,8.673,8.673,8.673,0.00042329081220733085,0.00042329081220733085,0.00042329081220733085,4.232908122073309e-05,4.232908122073309e-05,4.232908122073309e-05,6.0478515625,6.0478515625,6.0478515625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}]","{'op_shape': (1, 256), 'dtype_in_out': ('c10::BFloat16', 'long int'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.00028667629819254843,99.99353631279135 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",10545,3,48.212,16.070666666666668,0.4472631589269735,1.536e-06,0.0004901885986328125,2.9883268482490273,vector_bfloat16,0.00025804302222858384,2.1514189340863932e-05,0.0007711168913289977,6.42914296256168e-05,2.0016276041666665,0.17475103197716266,6.0048828125,15.854,15.773,16.585,0.0002675831215048297,0.00023340842572062084,0.000273137519460301,0.0007996258261311642,0.00069750066518847,0.0008162241826673587,1.9208984375,1.8818359375,2.2021484375,"[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.005), 'mean_duration_us': np.float64(2.0016666666666665), 'median_duration_us': np.float64(1.921), 'std_dev_duration_us': np.float64(0.14254901691075328), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(2.202)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.0)}]","{'fused_ops': 'aten._to_copy, aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/1', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2']",0.000284639521651216,99.993820952313 -aten::argmax,reduce,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",8650,1,19.019,19.019,,,,,,,,,,5.72802734375,,5.72802734375,19.019,19.019,19.019,,,,,,,5.72802734375,5.72802734375,5.72802734375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::argmax', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)']",0.0002715162000724032,99.99409246851307 -aten::gather,other,python3,CPU,thread 416 (python3),"((128320, 4096), (), (351, 4096), (), (351, 4096))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((4096, 1), (), (1, 0), (), (4096, 1))","('', '0', '', 'False', '')",29,1,39.849,39.849,,,,,,,,,,5.64794921875,,5.64794921875,39.849,39.849,39.849,,,,,,,5.64794921875,5.64794921875,5.64794921875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.648), 'mean_duration_us': np.float64(5.648), 'median_duration_us': np.float64(5.648), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.648), 'max_duration_us': np.float64(5.648)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0002677203892453745,99.99436018890232 -aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",51,3,29.072,9.690666666666667,2.456177789438976,,,,,,,,,1.80126953125,0.04028542252408849,5.40380859375,9.474,7.35,12.248,,,,,,,1.80078125,1.76123046875,1.841796875,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.404), 'mean_duration_us': np.float64(1.8013333333333332), 'median_duration_us': np.float64(1.801), 'std_dev_duration_us': np.float64(0.0330689515339625), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.842)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.00025614779526053074,99.99461633669758 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",8649,1,12.149,12.149,,7.7e-08,0.000881195068359375,0.08333333333333333,,0.0001734511457378552,,1.4454262144821266e-05,,5.3271484375,,5.3271484375,12.149,12.149,12.149,0.0001734511457378552,0.0001734511457378552,0.0001734511457378552,1.4454262144821266e-05,1.4454262144821266e-05,1.4454262144821266e-05,5.3271484375,5.3271484375,5.3271484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.33)}]","{'op_shape': (1, 77), 'dtype_in_out': ('int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.00025251400074928986,99.99486885069832 -"aten::index->void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}) (Synthetic Op)",elementwise,python3,CPU,thread 416 (python3),"((1, 351), ())","('bool', '')","((351, 1), ())","('', '')",487006,1,73.61,73.61,,,,,,,,,,5.287109375,,5.287109375,73.61,73.61,73.61,,,,,,,5.287109375,5.287109375,5.287109375,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.287), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",,False,Not found,"['void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.00025061609533577546,99.99511946679365 -aten::_local_scalar_dense,other,python3,CPU,thread 416 (python3),"((1,),)","('long int',)","((1,),)","('',)",10426,1,22.884,22.884,,,,,,,,,,5.2470703125,,5.2470703125,22.884,22.884,22.884,,,,,,,5.2470703125,5.2470703125,5.2470703125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::item', 'aten::_local_scalar_dense', 'Memcpy DtoD (Device -> Device)']",0.00024871818992226106,99.99536818498358 -aten::index,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",8652,1,26.87,26.87,,,,,,,,,,5.20703125,,5.20703125,26.87,26.87,26.87,,,,,,,5.20703125,5.20703125,5.20703125,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",,False,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::index', 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.0002468202845087467,99.99561500526808 -aten::bitwise_and,elementwise,python3,CPU,thread 416 (python3),"((), (1, 1, 351, 351))","('bool', 'bool')","((), (123201, 123201, 351, 1))","('', '')",98,1,19.669,19.669,,,,,,,,,,4.80615234375,,4.80615234375,19.669,19.669,19.669,,,,,,,4.80615234375,4.80615234375,4.80615234375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.806), 'mean_duration_us': np.float64(4.806), 'median_duration_us': np.float64(4.806), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",,False,transformers/masking_utils.py(51): and_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'aten::__and__', 'aten::bitwise_and', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.00022781808518563336,99.99584282335326 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), ())","('c10::BFloat16', 'double')","((475200, 29700, 900, 30, 1), ())","('', '')",15594,1,29.745,29.745,,0.0004752,1.8127517700195312,0.2499989478158762,vector_bf16,0.4056324668125456,,0.10140768990309472,,4.68603515625,,4.68603515625,29.745,29.745,29.745,0.4056324668125456,0.4056324668125456,0.4056324668125456,0.10140768990309472,0.10140768990309472,0.10140768990309472,4.68603515625,4.68603515625,4.68603515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]","{'shape_in1': (1, 16, 33, 30, 30), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (475200, 29700, 900, 30, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.00022212436894509022,99.9960649477222 -triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",8753,2,47.049,23.5245,10.990560699982508,1.536e-06,0.0,,,0.0,0.0,0.000662979914179152,4.838247361330896e-05,2.322998046875,0.16952608865361077,4.64599609375,23.5245,15.753,31.296,0.0,0.0,0.0,0.000662979914179152,0.0006287683389966021,0.0006971914893617021,2.322998046875,2.203125,2.44287109375,"[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.646), 'mean_duration_us': np.float64(2.323), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.443)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'mean_duration_us': np.float64(2.32)}]","{'fused_ops': 'aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2']",0.00022022646353157585,99.99628517418573 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((3, 900), (3, 900), ())","('int', 'int', 'Scalar')","((900, 1), (1, 0), ())","('', '', 'False')",23467,1,9.674,9.674,,2.7e-06,0.020599365234375,0.125,,0.0046895791370719815,,0.0005861973921339977,,4.60595703125,,4.60595703125,9.674,9.674,9.674,0.0046895791370719815,0.0046895791370719815,0.0046895791370719815,0.0005861973921339977,0.0005861973921339977,0.0005861973921339977,4.60595703125,4.60595703125,4.60595703125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","{'op_shape': (3, 900), 'dtype_in_out': ('int', 'int'), 'stride_input': (900, 1), 'stride_output': (1, 0)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::repeat_interleave', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.0002183285581180615,99.99650350274385 -aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((43200, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23409,1,10.035,10.035,,8.192e-05,0.2386474609375,0.3273657289002558,vector_bf16,0.05481779013798267,,0.01794546582522195,,4.56494140625,,4.56494140625,10.035,10.035,10.035,0.05481779013798267,0.05481779013798267,0.05481779013798267,0.01794546582522195,0.01794546582522195,0.01794546582522195,4.56494140625,4.56494140625,4.56494140625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.565), 'mean_duration_us': np.float64(4.565), 'median_duration_us': np.float64(4.565), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.565)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.57)}]","{'input_shape': (1, 16, 3, 30, 30), 'output_shape': (1, 16, 5, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 16, 5, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (43200, 2700, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.00021638436232860776,99.99671988710618 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (1, 512, 2, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((921600, 1800, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', 'False')",23752,1,5.929,5.929,,0.0009216,3.515625,0.25,vector_bf16,0.8219648557430593,,0.20549121393576483,,4.48486328125,,4.48486328125,5.929,5.929,5.929,0.8219648557430593,0.8219648557430593,0.8219648557430593,0.20549121393576483,0.20549121393576483,0.20549121393576483,4.48486328125,4.48486328125,4.48486328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.485), 'mean_duration_us': np.float64(4.485), 'median_duration_us': np.float64(4.485), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.485), 'max_duration_us': np.float64(4.485)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}]","{'op_shape': (1, 512, 2, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (921600, 1800, 900, 30, 1), 'stride_output': (1382400, 2700, 900, 30, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.000212588551501579,99.99693247565769 -aten::bitwise_and,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 1, 351))","('bool', 'bool')","((123201, 123201, 351, 1), (351, 351, 351, 1))","('', '')",114,1,9.114,9.114,,,,,,,,,,4.44482421875,,4.44482421875,9.114,9.114,9.114,,,,,,,4.44482421875,4.44482421875,4.44482421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.445), 'mean_duration_us': np.float64(4.445), 'median_duration_us': np.float64(4.445), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.44)}]",,False,transformers/masking_utils.py(51): and_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'aten::__and__', 'aten::bitwise_and', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.00021069064608806464,99.99714316630377 -aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '4', '1', '')",23456,1,11.257,11.257,,,,,,,,,,4.40576171875,,4.40576171875,11.257,11.257,11.257,,,,,,,4.40576171875,4.40576171875,4.40576171875,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.406), 'mean_duration_us': np.float64(4.406), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.406)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.00020883903105048965,99.99735200533482 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1437696, 1437696, 1437696, 1437696, 4096, 1), ())","('', '', 'False')",7234,1,20.07,20.07,,0.001048576,4.0,0.25,vector_bf16,1.0267672235237868,,0.2566918058809467,,4.0849609375,,4.0849609375,20.07,20.07,20.07,1.0267672235237868,1.0267672235237868,1.0267672235237868,0.2566918058809467,0.2566918058809467,0.2566918058809467,4.0849609375,4.0849609375,4.0849609375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.08)}]","{'op_shape': (1, 1, 1, 1, 256, 4096), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1048576, 1048576, 4096, 1048576, 4096, 1), 'stride_output': (1437696, 1437696, 1437696, 1437696, 4096, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.000193632642554405,99.99754563797737 -aten::gather,other,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",7285,1,23.495,23.495,,,,,,,,,,4.044921875,,4.044921875,23.495,23.495,23.495,,,,,,,4.044921875,4.044921875,4.044921875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.045), 'mean_duration_us': np.float64(4.045), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.045)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(4.04)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.00019173473714089064,99.99773737271451 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",8682,1,31.206,31.206,,4e-09,3.0517578125e-05,0.125,vector_fp32,8.23730517848165e-06,,1.0296631473102062e-06,,3.884765625,,3.884765625,31.206,31.206,31.206,8.23730517848165e-06,8.23730517848165e-06,8.23730517848165e-06,1.0296631473102062e-06,1.0296631473102062e-06,1.0296631473102062e-06,3.884765625,3.884765625,3.884765625,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.885), 'mean_duration_us': np.float64(3.885), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(3.885)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.88)}]","{'op_shape': (4,), 'dtype_in_out': ('float', 'float'), 'stride_input': (1,), 'stride_output': (1,)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00018414311548683315,99.99792151583 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('bool', 'Scalar')","((), ())","('', '1.')",94,1,11.246,11.246,,,,,,,,,,3.76513671875,,3.76513671875,11.246,11.246,11.246,,,,,,,3.76513671875,3.76513671875,3.76513671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.765), 'mean_duration_us': np.float64(3.765), 'median_duration_us': np.float64(3.765), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::F...', 'stream': 0, 'mean_duration_us': np.float64(3.76)}]",,False,transformers/masking_utils.py(51): and_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'aten::new_ones', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<16, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.00017847254443425974,99.99809998837443 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",7273,1,38.568,38.568,,7.7e-08,0.0011749267578125,0.0625,,0.0003344116633532141,,2.0900728959575882e-05,,3.68408203125,,3.68408203125,38.568,38.568,38.568,0.0003344116633532141,0.0003344116633532141,0.0003344116633532141,2.0900728959575882e-05,2.0900728959575882e-05,2.0900728959575882e-05,3.68408203125,3.68408203125,3.68408203125,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.684), 'mean_duration_us': np.float64(3.684), 'median_duration_us': np.float64(3.684), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(3.684)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.68)}]","{'op_shape': (1, 77), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00017463044323129162,99.99827461881766 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",8697,1,20.56,20.56,,1e-09,3.814697265625e-06,0.25,vector_bf16,1.0976818973603108e-06,,2.744204743400777e-07,,3.64404296875,,3.64404296875,20.56,20.56,20.56,1.0976818973603108e-06,1.0976818973603108e-06,1.0976818973603108e-06,2.744204743400777e-07,2.744204743400777e-07,2.744204743400777e-07,3.64404296875,3.64404296875,3.64404296875,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.644), 'mean_duration_us': np.float64(3.644), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(3.644)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.64)}]","{'op_shape': (1,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00017273253781777728,99.99844735135548 -aten::_local_scalar_dense,other,python3,CPU,thread 416 (python3),"((),)","('bool',)","((),)","('',)",48,1,27.36,27.36,,,,,,,,,,3.52392578125,,3.52392578125,27.36,27.36,27.36,,,,,,,3.52392578125,3.52392578125,3.52392578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",,False,transformers/masking_utils.py(233): _ignore_causal_mask_sdpa,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(233): _ignore_causal_mask_sdpa', 'aten::is_nonzero', 'aten::item', 'aten::_local_scalar_dense', 'Memcpy DtoD (Device -> Device)']",0.00016703882157723414,99.99861439017705 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 1, 351), ())","('long int', 'long int', 'Scalar')","((351, 351, 351, 1), (0, 0, 0, 0), ())","('', '', 'False')",111,1,12.128,12.128,,3.51e-07,0.0053558349609375,0.0625,,0.0016307341556784346,,0.00010192088472990217,,3.44384765625,,3.44384765625,12.128,12.128,12.128,0.0016307341556784346,0.0016307341556784346,0.0016307341556784346,0.00010192088472990217,0.00010192088472990217,0.00010192088472990217,3.44384765625,3.44384765625,3.44384765625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.444), 'mean_duration_us': np.float64(3.444), 'median_duration_us': np.float64(3.444), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.444), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]","{'op_shape': (1, 1, 1, 351), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (351, 351, 351, 1), 'stride_output': (0, 0, 0, 0)}",True,transformers/masking_utils.py(153): inner_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'transformers/masking_utils.py(153): inner_mask', 'aten::index', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})']",0.0001632430107502054,99.9987776331878 -aten::gather,other,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",7298,1,10.436,10.436,,,,,,,,,,3.36376953125,,3.36376953125,10.436,10.436,10.436,,,,,,,3.36376953125,3.36376953125,3.36376953125,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.364), 'mean_duration_us': np.float64(3.364), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.00015944719992317668,99.99893708038772 -aten::eq,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",10415,1,43.915,43.915,,,,,,,,,,3.00390625,,3.00390625,43.915,43.915,43.915,,,,,,,3.00390625,3.00390625,3.00390625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.004), 'mean_duration_us': np.float64(3.004), 'median_duration_us': np.float64(3.004), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(3.004)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::eq', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.00014238919638951704,99.9990794695841 -triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",8817,1,23.615,23.615,,1.536e-06,0.0004901885986328125,2.9883268482490273,vector_bfloat16,0.0001711661788617886,,0.0005115004878048781,,3.0029296875,,3.0029296875,23.615,23.615,23.615,0.0001711661788617886,0.0001711661788617886,0.0001711661788617886,0.0005115004878048781,0.0005115004878048781,0.0005115004878048781,3.0029296875,3.0029296875,3.0029296875,"[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.003), 'mean_duration_us': np.float64(3.003), 'median_duration_us': np.float64(3.003), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.003)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]","{'fused_ops': 'aten._to_copy, aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17']",0.0001423429060135777,99.99922181249012 -aten::cat,other,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",8688,1,15.092,15.092,,,,,,,,,,2.962890625,,2.962890625,15.092,15.092,15.092,,,,,,,2.962890625,2.962890625,2.962890625,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.963), 'mean_duration_us': np.float64(2.963), 'median_duration_us': np.float64(2.963), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(2.963)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(2.96)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0001404450006000633,99.99936225749072 -triton_poi_fused_add_addmm_18,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",8825,1,26.659,26.659,,3.072e-06,0.041015625,0.07142857142857142,vector_bfloat16,0.01579350618612157,,0.0011281075847229694,,2.72314453125,,2.72314453125,26.659,26.659,26.659,0.01579350618612157,0.01579350618612157,0.01579350618612157,0.0011281075847229694,0.0011281075847229694,0.0011281075847229694,2.72314453125,2.72314453125,2.72314453125,"[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]","{'fused_ops': 'aten.add, aten.addmm', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_18']",0.00012908071330694677,99.99949133820402 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1,), ())","('c10::BFloat16', 'double')","((1,), ())","('', '')",8701,1,11.617,11.617,,1e-09,1.1444091796875e-05,0.08333333333333333,vector_bf16,5.080835228447385e-06,,4.234029357039487e-07,,2.36181640625,,2.36181640625,11.617,11.617,11.617,5.080835228447385e-06,5.080835228447385e-06,5.080835228447385e-06,4.234029357039487e-07,4.234029357039487e-07,4.234029357039487e-07,2.36181640625,2.36181640625,2.36181640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.362), 'mean_duration_us': np.float64(2.362), 'median_duration_us': np.float64(2.362), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.36)}]","{'shape_in1': (1,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.00011195327420937808,99.99960329147824 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",8687,1,9.244,9.244,,,,,,,,,,2.203125,,2.203125,9.244,9.244,9.244,,,,,,,2.203125,2.203125,2.203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.203), 'mean_duration_us': np.float64(2.203), 'median_duration_us': np.float64(2.203), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.203)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.00010443108811922966,99.99970772256636 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",8670,1,10.987,10.987,,7.68e-07,0.0029296875,0.25,vector_bf16,0.00139500133037694,,0.000348750332594235,,2.2021484375,,2.2021484375,10.987,10.987,10.987,0.00139500133037694,0.00139500133037694,0.00139500133037694,0.000348750332594235,0.000348750332594235,0.000348750332594235,2.2021484375,2.2021484375,2.2021484375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]","{'op_shape': (1, 1, 1, 768), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (768, 768, 768, 1), 'stride_output': (768, 768, 768, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0001043847977432903,99.9998121073641 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",8683,1,15.674,15.674,,4e-09,3.814697265625e-05,0.1,vector_fp32,1.9212007504690427e-05,,1.921200750469043e-06,,2.08203125,,2.08203125,15.674,15.674,15.674,1.9212007504690427e-05,1.9212007504690427e-05,1.9212007504690427e-05,1.921200750469043e-06,1.921200750469043e-06,1.921200750469043e-06,2.08203125,2.08203125,2.08203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.082), 'mean_duration_us': np.float64(2.082), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.08)}]","{'shape_in1': (4,), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",9.869108150274719e-05,99.9999107984456 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 256), (1, 1, 1, 256), ())","('long int', 'long int', 'Scalar')","((256, 256, 256, 1), (351, 351, 351, 1), ())","('', '', 'False')",7248,1,7.32,7.32,,2.56e-07,0.00390625,0.0625,,0.0021765978204462896,,0.0001360373637778931,,1.8818359375,,1.8818359375,7.32,7.32,7.32,0.0021765978204462896,0.0021765978204462896,0.0021765978204462896,0.0001360373637778931,0.0001360373637778931,0.0001360373637778931,1.8818359375,1.8818359375,1.8818359375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.882), 'mean_duration_us': np.float64(1.882), 'median_duration_us': np.float64(1.882), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(1.882)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.88)}]","{'op_shape': (1, 1, 1, 256), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (256, 256, 256, 1), 'stride_output': (351, 351, 351, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",8.920155443517533e-05,100.00000000000003 +aiter::fmha_v3_fwd,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 7431, 24, 128), (1, 7431, 24, 128), (1, 7431, 24, 128), (), (), (), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '', '', '', '')","((22828032, 3072, 128, 1), (22828032, 3072, 128, 1), (22828032, 3072, 128, 1), (), (), (), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '0.', '0.088388347648318447', 'False', '-1', '-1', 'True', 'False', '2', '', '', '', '', '', '', '')",8865,240,11343.861,47.266087500000005,5.285876719245019,678.540423168,174.1640625,3715.5,,0.13671275212329018,0.007019000963599997,507.9562305140847,26.079098080255772,1339.5328959147134,72.59150793277318,321487.89501953125,46.209,41.932,94.611,0.1397833595693527,0.11993747980959539,0.14732978112447664,519.36507247993,445.6277062325517,547.403801767993,1306.480712890625,1239.56103515625,1522.662109375,"[{'name': 'aiter::fmha_fwd_hd128_bf16_rtz', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(321487.896), 'mean_duration_us': np.float64(1339.5329), 'median_duration_us': np.float64(1306.4805000000001), 'std_dev_duration_us': np.float64(72.44012259887472), 'min_duration_us': np.float64(1239.561), 'max_duration_us': np.float64(1522.662)}]","[{'name': 'aiter::fmha_fwd_hd128_bf16_rtz', 'stream': 0, 'mean_duration_us': np.float64(1339.53)}]","{'B': 1, 'N_Q': 7431, 'H_Q': 24, 'N_KV': 7431, 'H_KV': 24, 'd_h_qk': 128, 'd_h_v': 128, 'dropout': 0.0, 'causal': False, 'flash_impl': True}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_ops.py(840): __call__', 'aiter::fmha_v3_fwd', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', 'aiter::fmha_fwd_hd128_bf16_rtz']",15.23888979271854,15.23888979271854 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7431, 15360), (15360, 3072), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((15360, 1), (1, 15360), (3072, 1))","('', '', '')",9539,160,5512.889,34.45555625,3.033314858082256,701.27714304,351.24609375,1904.0496446802122,matrix_bf16,0.30573069403779546,0.014837754018409713,582.1264193504992,28.251820266605336,1207.4557647705078,57.53356458370716,193192.92236328125,34.386,28.432,52.979,0.29550921283242176,0.2887118588299957,0.3345351970465984,562.6642116933019,549.721712220217,636.9716230696006,1246.35107421875,1100.955078125,1275.69482421875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(193192.92099999997), 'mean_duration_us': np.float64(1207.45575625), 'median_duration_us': np.float64(1246.351), 'std_dev_duration_us': np.float64(57.35348854611493), 'min_duration_us': np.float64(1100.955), 'max_duration_us': np.float64(1275.695)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1207.46)}]","{'M': 7431, 'N': 3072, 'K': 15360, 'bias': False, 'stride_A': (15360, 1), 'stride_B': (1, 15360), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",9.157563000773058,24.396452793491598 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16276,50,3989.842,79.79684,4.6734198349248945,866.3334912,511.5654296875,1615.0426749999522,matrix_bf16,0.14041879738583984,0.002815463026887009,226.7823501503031,4.547092938307056,3821.61697265625,76.71330912242925,191080.8486328125,78.9625,72.959,95.532,0.14041729213378512,0.13560797724565474,0.1454916944058098,226.7799191039981,219.01267032215492,234.9752953234347,3820.15087890625,3686.9130859375,3955.6318359375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(259.779), 'mean_duration_us': np.float64(5.19558), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(1.0004229523556527), 'min_duration_us': np.float64(4.366), 'max_duration_us': np.float64(11.816)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(10498.952), 'mean_duration_us': np.float64(209.97904), 'median_duration_us': np.float64(214.5575), 'std_dev_duration_us': np.float64(19.349372106567177), 'min_duration_us': np.float64(179.947), 'max_duration_us': np.float64(244.122)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(11850.718), 'mean_duration_us': np.float64(237.01436), 'median_duration_us': np.float64(236.5905), 'std_dev_duration_us': np.float64(6.365469421056075), 'min_duration_us': np.float64(219.525), 'max_duration_us': np.float64(248.408)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(12304.837000000001), 'mean_duration_us': np.float64(246.09674000000004), 'median_duration_us': np.float64(240.156), 'std_dev_duration_us': np.float64(17.29478605222973), 'min_duration_us': np.float64(215.68), 'max_duration_us': np.float64(294.397)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(17144.065), 'mean_duration_us': np.float64(342.88129999999995), 'median_duration_us': np.float64(360.83500000000004), 'std_dev_duration_us': np.float64(24.678367399202077), 'min_duration_us': np.float64(312.904), 'max_duration_us': np.float64(369.668)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(139022.499), 'mean_duration_us': np.float64(2780.4499800000003), 'median_duration_us': np.float64(2781.092), 'std_dev_duration_us': np.float64(63.67474031968724), 'min_duration_us': np.float64(2670.527), 'max_duration_us': np.float64(2930.994)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.2)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.98)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(237.01)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(246.1)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(342.88)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2780.45)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 19, 242, 242), 'filter_shape': (128, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (142427648, 1112716, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",9.057448317416927,33.453901110908525 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7431, 3072), (3072, 12288), (7431, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",9537,160,4792.07,29.9504375,7.644694694832572,561.021714432,289.705078125,1846.8160912565986,matrix_bf16,0.30119010525745527,0.008604641409019943,556.2427329167369,15.891190213670846,1009.4202178955078,29.21286359684354,161507.23486328125,28.903,23.615,96.313,0.3025098533578273,0.27670723168463385,0.3228666522131738,558.6800649449094,511.02736804224946,596.2753286374372,1004.19140625,940.876953125,1097.8310546875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(161507.23799999998), 'mean_duration_us': np.float64(1009.4202374999999), 'median_duration_us': np.float64(1004.1915), 'std_dev_duration_us': np.float64(29.121434685959308), 'min_duration_us': np.float64(940.877), 'max_duration_us': np.float64(1097.831)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1009.42)}]","{'M': 7431, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1']",7.655625580113146,41.10952669102167 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 19, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((284855296, 1112716, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16245,10,851.855,85.1855,4.375053707606856,3465.3339648,1024.818359375,3224.766584017366,matrix_bf16,0.10664031034759139,0.00041940503995421244,343.89010931815403,1.3524833580128082,10077.0046875,39.66313516513159,100770.046875,83.309,80.84,92.447,0.10664705315475578,0.10585398500263651,0.10735447379738569,343.9118532973803,341.35439362157763,346.1931197465772,10076.227294921875,10009.8291015625,10151.71923828125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.512), 'mean_duration_us': np.float64(5.6512), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.069073019494479), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(11.856)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4136.057), 'mean_duration_us': np.float64(413.60569999999996), 'median_duration_us': np.float64(415.7165), 'std_dev_duration_us': np.float64(16.783204271234982), 'min_duration_us': np.float64(379.804), 'max_duration_us': np.float64(437.409)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(4484.494), 'mean_duration_us': np.float64(448.44939999999997), 'median_duration_us': np.float64(449.026), 'std_dev_duration_us': np.float64(2.4529009030126034), 'min_duration_us': np.float64(442.256), 'max_duration_us': np.float64(451.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(5357.794000000001), 'mean_duration_us': np.float64(535.7794000000001), 'median_duration_us': np.float64(535.4145), 'std_dev_duration_us': np.float64(1.8377387300701893), 'min_duration_us': np.float64(533.352), 'max_duration_us': np.float64(539.681)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(7224.526), 'mean_duration_us': np.float64(722.4526), 'median_duration_us': np.float64(722.553), 'std_dev_duration_us': np.float64(1.0228248334881278), 'min_duration_us': np.float64(720.429), 'max_duration_us': np.float64(723.914)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(79510.663), 'mean_duration_us': np.float64(7951.0663), 'median_duration_us': np.float64(7951.6545), 'std_dev_duration_us': np.float64(43.127390136779646), 'min_duration_us': np.float64(7868.292), 'max_duration_us': np.float64(8023.562)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(413.61)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(448.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(535.78)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(722.45)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(7951.07)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 19, 242, 242), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (284855296, 1112716, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",4.776614182135576,45.886140873157245 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 19, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((284855296, 1112716, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16260,10,800.2570000000001,80.0257,6.121166629001375,1732.6669824,784.068359375,2107.4693044840737,matrix_bf16,0.10085296458425237,0.0011612908331801054,212.54452712753127,2.4473847845058123,8152.997607421875,94.45440830871685,81529.97607421875,77.6505,76.433,96.483,0.10117379150016818,0.09892535724232875,0.10247278481319881,213.22066000487615,208.48215382332907,215.95824853881825,8126.16943359375,8023.1572265625,8310.86474609375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.385000000000005), 'mean_duration_us': np.float64(5.038500000000001), 'median_duration_us': np.float64(5.0265), 'std_dev_duration_us': np.float64(0.08560519844028162), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.207)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1999.924), 'mean_duration_us': np.float64(199.9924), 'median_duration_us': np.float64(193.3865), 'std_dev_duration_us': np.float64(18.92179609973641), 'min_duration_us': np.float64(177.303), 'max_duration_us': np.float64(230.181)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2352.646), 'mean_duration_us': np.float64(235.26460000000003), 'median_duration_us': np.float64(238.3735), 'std_dev_duration_us': np.float64(6.350920062479137), 'min_duration_us': np.float64(225.775), 'max_duration_us': np.float64(243.681)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2429.52), 'mean_duration_us': np.float64(242.952), 'median_duration_us': np.float64(241.21699999999998), 'std_dev_duration_us': np.float64(6.450974639540913), 'min_duration_us': np.float64(236.39), 'max_duration_us': np.float64(257.262)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(6880.575), 'mean_duration_us': np.float64(688.0575), 'median_duration_us': np.float64(721.2909999999999), 'std_dev_duration_us': np.float64(42.31107712939958), 'min_duration_us': np.float64(634.902), 'max_duration_us': np.float64(723.795)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67816.927), 'mean_duration_us': np.float64(6781.6927), 'median_duration_us': np.float64(6761.807000000001), 'std_dev_duration_us': np.float64(73.52589039250037), 'min_duration_us': np.float64(6714.697), 'max_duration_us': np.float64(6961.744)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.04)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(199.99)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(235.26)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(242.95)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(688.06)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(6781.69)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 19, 242, 242), 'filter_shape': (128, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (284855296, 1112716, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",3.8646130676942545,49.7507539408515 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7431, 3072), (3072, 3072), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",9520,320,11256.682999999999,35.177134374999994,9.428809262595857,140.255428608,105.08203125,1272.8912679826028,matrix_bf16,0.43626116717929675,0.012184683825149784,555.3130302624253,15.509777644162014,252.77703704833985,7.451328398150328,80888.65185546875,34.230999999999995,28.232,161.29,0.43837516485944705,0.36960194152851344,0.46564719534480625,558.0039194500241,470.4630840010613,592.7182489149932,251.35205078125,236.630859375,298.1220703125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(80888.65), 'mean_duration_us': np.float64(252.77703125), 'median_duration_us': np.float64(251.352), 'std_dev_duration_us': np.float64(7.439677096001779), 'min_duration_us': np.float64(236.631), 'max_duration_us': np.float64(298.122)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(252.78)}]","{'M': 7431, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",3.8342135744556716,53.58496751530718 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 12288), (7425, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",8875,80,2000.052,25.00065,5.070851682640873,560.5687296,289.529296875,1846.4452674397426,matrix_bf16,0.3025589960428053,0.010581083772321654,558.6586263645576,19.53739205578678,1004.6925109863281,36.9064864035743,80375.40087890625,24.311,21.191,64.486,0.3058533118342575,0.2707305152775909,0.3180661008096943,564.7414001671366,499.88907868583067,587.2916465730721,992.614013671875,954.498046875,1121.38623046875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(80375.40100000001), 'mean_duration_us': np.float64(1004.6925125000001), 'median_duration_us': np.float64(992.614), 'std_dev_duration_us': np.float64(36.675073389154164), 'min_duration_us': np.float64(954.498), 'max_duration_us': np.float64(1121.386)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(1004.69)}]","{'M': 7425, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1']",3.8098848977340607,57.394852413041235 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 12288), (12288, 3072), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",8877,80,2404.302,30.053775,7.303010896285575,560.5687296,289.529296875,1846.4452674397426,matrix_bf16,0.3337977483088363,0.010331168727461508,616.3392726468932,19.075937603942798,910.4198913574219,29.694066302401396,72833.59130859375,29.033,25.478,91.456,0.3363766071422527,0.2963851478642718,0.346543745032391,621.1009943352501,547.2589536134129,639.8740579759032,902.54052734375,876.06103515625,1024.32080078125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(72833.59099999999), 'mean_duration_us': np.float64(910.4198874999998), 'median_duration_us': np.float64(902.5405), 'std_dev_duration_us': np.float64(29.507910684676464), 'min_duration_us': np.float64(876.061), 'max_duration_us': np.float64(1024.321)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(910.42)}]","{'M': 7425, 'N': 3072, 'K': 12288, 'bias': False, 'stride_A': (12288, 1), 'stride_B': (1, 12288), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",3.4523945951126205,60.84724700815386 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 3072), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8851,240,7973.796,33.22415,7.790864100027969,140.1421824,105.01171875,1272.715098761299,matrix_bf16,0.42535100150554706,0.022625503217407618,541.3506418893498,28.795819561867024,259.62062581380206,14.086526150668012,62308.9501953125,30.11,25.258,102.852,0.43372591410672456,0.3688598431137783,0.472534503535979,552.0095196076746,469.4534916576296,601.4017973359149,253.87646484375,233.02587890625,298.52197265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(62308.951), 'mean_duration_us': np.float64(259.6206291666667), 'median_duration_us': np.float64(253.8765), 'std_dev_duration_us': np.float64(14.057132431615726), 'min_duration_us': np.float64(233.026), 'max_duration_us': np.float64(298.522)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(259.62)}]","{'M': 7425, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",2.953514704087598,63.80076171224145 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 11, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((41913344, 163724, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16132,50,3918.451,78.36902,4.7933404205571435,458.6471424,146.599609375,2983.6368723271025,matrix_bf16,0.13470407943452864,0.002341337792543414,401.90805825373866,6.985701768405475,1141.511875,19.821049310902435,57075.59375,76.874,72.598,91.406,0.13462904760224562,0.1306102749551004,0.13895815630815297,401.6841905123407,389.69363226081873,414.60067887159823,1141.81103515625,1106.23828125,1176.94287109375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(284.251), 'mean_duration_us': np.float64(5.68502), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.2562962730903437), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(6.328)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2293.155), 'mean_duration_us': np.float64(45.8631), 'median_duration_us': np.float64(45.647000000000006), 'std_dev_duration_us': np.float64(0.7717818927650476), 'min_duration_us': np.float64(44.746), 'max_duration_us': np.float64(49.032)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2980.0209999999997), 'mean_duration_us': np.float64(59.60041999999999), 'median_duration_us': np.float64(59.4275), 'std_dev_duration_us': np.float64(1.4246100110556579), 'min_duration_us': np.float64(57.084), 'max_duration_us': np.float64(62.932)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(3725.125), 'mean_duration_us': np.float64(74.5025), 'median_duration_us': np.float64(73.549), 'std_dev_duration_us': np.float64(4.626893023401341), 'min_duration_us': np.float64(66.658), 'max_duration_us': np.float64(92.376)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(5527.164999999999), 'mean_duration_us': np.float64(110.54329999999999), 'median_duration_us': np.float64(110.483), 'std_dev_duration_us': np.float64(0.8136805331332437), 'min_duration_us': np.float64(108.441), 'max_duration_us': np.float64(112.446)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(42265.876), 'mean_duration_us': np.float64(845.31752), 'median_duration_us': np.float64(843.492), 'std_dev_duration_us': np.float64(18.263799995882565), 'min_duration_us': np.float64(814.89), 'max_duration_us': np.float64(884.273)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(45.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.6)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(74.5)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(110.54)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(845.32)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 11, 122, 122), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (41913344, 163724, 14884, 122, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",2.7054476902073854,66.50620940244883 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16101,10,874.301,87.43010000000001,3.996066105837366,1834.5885696,299.94921875,5832.987354630341,matrix_bf16,0.06489794240066861,0.0006912762170342854,378.54887736462825,4.0322054325176895,4846.8685546875,51.832171123411534,48468.685546875,86.3335,82.613,94.31,0.06498734068058426,0.06353017272671413,0.06601126161214645,379.0703364009019,370.57069415240494,385.04285424684554,4839.705810546875,4764.634765625,4950.71142578125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(154.176), 'mean_duration_us': np.float64(15.417599999999998), 'median_duration_us': np.float64(15.3615), 'std_dev_duration_us': np.float64(0.2204292176640837), 'min_duration_us': np.float64(15.181), 'max_duration_us': np.float64(15.902)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1104.153), 'mean_duration_us': np.float64(110.4153), 'median_duration_us': np.float64(110.684), 'std_dev_duration_us': np.float64(1.8032592187480978), 'min_duration_us': np.float64(106.077), 'max_duration_us': np.float64(112.887)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1168.2030000000002), 'mean_duration_us': np.float64(116.82030000000002), 'median_duration_us': np.float64(117.253), 'std_dev_duration_us': np.float64(1.4732819180319825), 'min_duration_us': np.float64(113.688), 'max_duration_us': np.float64(118.575)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1350.437), 'mean_duration_us': np.float64(135.0437), 'median_duration_us': np.float64(135.18), 'std_dev_duration_us': np.float64(5.218896589318471), 'min_duration_us': np.float64(127.428), 'max_duration_us': np.float64(144.173)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1926.133), 'mean_duration_us': np.float64(192.6133), 'median_duration_us': np.float64(192.7255), 'std_dev_duration_us': np.float64(0.6498398341129935), 'min_duration_us': np.float64(191.284), 'max_duration_us': np.float64(193.526)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(42765.581999999995), 'mean_duration_us': np.float64(4276.5581999999995), 'median_duration_us': np.float64(4272.6685), 'std_dev_duration_us': np.float64(45.89578744677992), 'min_duration_us': np.float64(4200.241), 'max_duration_us': np.float64(4375.661)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.42)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(110.42)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(116.82)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(135.04)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(192.61)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4276.56)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 11, 122, 122), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (83826688, 163724, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",2.2974705078767763,68.80367991032561 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((13776896, 26908, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15967,70,5477.071,78.24387142857142,5.3537215606012944,254.803968,57.35546875,4236.736361778928,matrix_bf16,0.09783072634000399,0.0028117242507438352,414.4829955839384,11.912534372422018,615.2607770647321,18.013305998583167,43068.25439453125,77.0595,72.338,102.152,0.0976753858954719,0.08707333284130545,0.10356088484110622,413.8248590741344,368.9067553900381,438.76016646431486,615.72900390625,580.736328125,690.7001953125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(991.0010000000001), 'mean_duration_us': np.float64(14.157157142857145), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.8864840766552241), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(15.822)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1184.9680000000003), 'mean_duration_us': np.float64(16.92811428571429), 'median_duration_us': np.float64(17.245), 'std_dev_duration_us': np.float64(1.3201695079783953), 'min_duration_us': np.float64(14.18), 'max_duration_us': np.float64(19.387)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1536.7740000000003), 'mean_duration_us': np.float64(21.95391428571429), 'median_duration_us': np.float64(21.992), 'std_dev_duration_us': np.float64(0.8931553175257314), 'min_duration_us': np.float64(20.509), 'max_duration_us': np.float64(23.554)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1584.885), 'mean_duration_us': np.float64(22.641214285714284), 'median_duration_us': np.float64(22.5325), 'std_dev_duration_us': np.float64(1.2201986828013724), 'min_duration_us': np.float64(19.508), 'max_duration_us': np.float64(25.797)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(1747.1659999999997), 'mean_duration_us': np.float64(24.95951428571428), 'median_duration_us': np.float64(24.976), 'std_dev_duration_us': np.float64(0.4623428765647894), 'min_duration_us': np.float64(23.915), 'max_duration_us': np.float64(25.878)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(36023.46), 'mean_duration_us': np.float64(514.6208571428572), 'median_duration_us': np.float64(513.7625), 'std_dev_duration_us': np.float64(19.46001120634365), 'min_duration_us': np.float64(479.151), 'max_duration_us': np.float64(598.088)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.16)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.93)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(21.95)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.64)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(24.96)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(514.62)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 62, 62), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (13776896, 26908, 3844, 62, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['batched_transpose_32x16_half'], ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",2.0414839639394664,70.84516387426508 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (7431, 3072), (3072, 3072), (), (), (7431, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",9527,160,6761.297,42.25810625,9.75039884854056,140.27825664,105.087890625,1273.0274602732088,matrix_bf16,0.41395263894935147,0.02238309389279187,526.9730766350855,28.49429317139764,266.93495788574216,13.759746043159826,42709.59326171875,41.852,33.921,133.618,0.4014789469650569,0.3837525727588242,0.47459170773459397,511.0937242080887,488.5275630724757,604.1682763640952,274.466796875,232.18408203125,287.14501953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(42709.591), 'mean_duration_us': np.float64(266.93494375), 'median_duration_us': np.float64(274.467), 'std_dev_duration_us': np.float64(13.71668299883707), 'min_duration_us': np.float64(232.184), 'max_duration_us': np.float64(287.145)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(266.93)}]","{'M': 7431, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",2.0244830206363624,72.86964689490145 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((125337600, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16274,60,462.069,7.70115,1.1481258985031038,0.142427648,510.7216796875,0.26595618562122,vector_bf16,0.7838312785748368,0.09666518608536541,0.20846477702036748,0.025708704173629218,692.0326985677083,72.95844708347023,41521.9619140625,7.5065,6.76,16.044,0.7514577394990287,0.6857336134840059,1.026522544603338,0.1998548340527061,0.18237509619446218,0.27301002041689243,712.657958984375,521.69384765625,780.9599609375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(41521.96300000001), 'mean_duration_us': np.float64(692.0327166666668), 'median_duration_us': np.float64(712.658), 'std_dev_duration_us': np.float64(72.34788857575403), 'min_duration_us': np.float64(521.694), 'max_duration_us': np.float64(780.96)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(692.03)}]","{'input_shape': (1, 128, 17, 240, 240), 'output_shape': (1, 128, 19, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 128, 19, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (125337600, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",1.9681879516720648,74.83783484657351 +triton_poi_fused_addmm_cat_gelu_slice_view_25,triton,python3,CPU,thread 416 (python3),"((1, 7431, 24, 128), (7431, 12288), (12288,), (1, 7431, 15360), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 128, 1), (12288, 1), (1,), (114140160, 15360, 1), ())","('', '', '', '', '114140160')",9538,160,4101.407,25.633793750000002,2.703069659872682,0.91312128,653.138671875,1.3332854874449398,vector_bfloat16,4.091406793050248,0.16754211734136887,5.455013300407538,0.22338147358704402,167.68397216796876,7.21141663148745,26829.435546875,25.358,21.452,48.572,4.119588740712893,3.409701591872753,4.371336820983346,5.4925878822340755,4.546105648961851,5.828239944150793,166.24609375,156.671875,200.85791015625,"[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(26829.435999999998), 'mean_duration_us': np.float64(167.68397499999998), 'median_duration_us': np.float64(166.246), 'std_dev_duration_us': np.float64(7.188836548731304), 'min_duration_us': np.float64(156.672), 'max_duration_us': np.float64(200.858)}]","[{'name': 'triton_poi_fused_addmm_cat_gelu_slice_view_25', 'stream': 0, 'mean_duration_us': np.float64(167.68)}]","{'fused_ops': 'aten.addmm, aten.cat, aten.gelu, aten.slice, aten.view', 'xnumel': 114140160, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_cat_gelu_slice_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_cat_gelu_slice_view_25']",1.2717455861746667,76.10958043274817 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 11, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((83826688, 163724, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16116,10,827.941,82.7941,5.741154151291261,917.2942848,229.91796875,3804.835284323553,matrix_bf16,0.09397070389896388,0.0020009664859535667,357.5430498874986,7.613347888505033,2566.5841796875,54.01344552258528,25665.841796875,84.255,74.802,95.061,0.09387920128981073,0.09185037295287894,0.09718717881595605,357.19489753158507,349.47553988939154,369.7812071428121,2568.050048828125,2480.640625,2624.77392578125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(94.812), 'mean_duration_us': np.float64(9.4812), 'median_duration_us': np.float64(9.3125), 'std_dev_duration_us': np.float64(0.4950209692528186), 'min_duration_us': np.float64(8.972), 'max_duration_us': np.float64(10.615)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(485.51099999999997), 'mean_duration_us': np.float64(48.5511), 'median_duration_us': np.float64(48.531), 'std_dev_duration_us': np.float64(0.7159562067612792), 'min_duration_us': np.float64(47.189), 'max_duration_us': np.float64(49.633)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(596.274), 'mean_duration_us': np.float64(59.6274), 'median_duration_us': np.float64(59.186499999999995), 'std_dev_duration_us': np.float64(2.106466339631375), 'min_duration_us': np.float64(56.042), 'max_duration_us': np.float64(62.932)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(772.2969999999999), 'mean_duration_us': np.float64(77.2297), 'median_duration_us': np.float64(76.95349999999999), 'std_dev_duration_us': np.float64(4.776871717976106), 'min_duration_us': np.float64(68.501), 'max_duration_us': np.float64(85.406)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2167.893), 'mean_duration_us': np.float64(216.7893), 'median_duration_us': np.float64(217.042), 'std_dev_duration_us': np.float64(1.0544313206653126), 'min_duration_us': np.float64(214.598), 'max_duration_us': np.float64(218.403)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(21549.053000000004), 'mean_duration_us': np.float64(2154.9053000000004), 'median_duration_us': np.float64(2156.604), 'std_dev_duration_us': np.float64(45.69621782390749), 'min_duration_us': np.float64(2076.445), 'max_duration_us': np.float64(2205.356)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.48)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(48.55)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.63)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(77.23)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2154.91)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 11, 122, 122), 'filter_shape': (256, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (83826688, 163724, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",1.2165899265232547,77.32617035927143 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((3670016, 7168, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15628,100,7950.537,79.50537,7.138073697731232,63.700992,24.89453125,2440.294994508081,matrix_bf16,0.10552178126518877,0.007005568970964542,257.50427463301673,17.0956548935259,248.611943359375,18.835214182166514,24861.1943359375,77.64500000000001,71.056,101.44,0.1086339268471194,0.08154627887721824,0.11150610561883527,265.0988279187825,198.99697616483573,272.10779139873307,240.29150390625,234.10205078125,320.1103515625,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(496.76199999999994), 'mean_duration_us': np.float64(4.967619999999999), 'median_duration_us': np.float64(4.887), 'std_dev_duration_us': np.float64(0.22438590775714945), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.767)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(605.4789999999999), 'mean_duration_us': np.float64(6.05479), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.2873086248270316), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(6.809)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(731.9480000000001), 'mean_duration_us': np.float64(7.319480000000001), 'median_duration_us': np.float64(7.289), 'std_dev_duration_us': np.float64(0.4345492947871392), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(8.411)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(763.6749999999998), 'mean_duration_us': np.float64(7.636749999999998), 'median_duration_us': np.float64(7.57), 'std_dev_duration_us': np.float64(0.49094399629692986), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.372)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1294.3890000000001), 'mean_duration_us': np.float64(12.943890000000001), 'median_duration_us': np.float64(12.818), 'std_dev_duration_us': np.float64(0.5245689639122774), 'min_duration_us': np.float64(12.218), 'max_duration_us': np.float64(15.101)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(20968.936999999998), 'mean_duration_us': np.float64(209.68936999999997), 'median_duration_us': np.float64(201.819), 'std_dev_duration_us': np.float64(17.316049904441257), 'min_duration_us': np.float64(196.571), 'max_duration_us': np.float64(275.408)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.32)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.64)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(209.69)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 32, 32), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (3670016, 7168, 1024, 32, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",1.1784487269036783,78.50461908617511 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16243,20,148.691,7.43455,0.31294685524946,0.284855296,1021.443359375,0.26595618562122,vector_bf16,0.908679631279201,0.0780387641432326,0.24166896868671292,0.020754892042128183,1187.0187744140626,101.97322723391864,23740.37548828125,7.391,6.98,8.333,0.9068447149482133,0.8168137523588936,0.9965992607129973,0.24118096133838932,0.21723666994032714,0.26505173797215653,1186.641845703125,1074.7158203125,1311.26708984375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(23740.376000000004), 'mean_duration_us': np.float64(1187.0188000000003), 'median_duration_us': np.float64(1186.642), 'std_dev_duration_us': np.float64(99.39126225911411), 'min_duration_us': np.float64(1074.716), 'max_duration_us': np.float64(1311.267)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1187.02)}]","{'input_shape': (1, 256, 17, 240, 240), 'output_shape': (1, 256, 19, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 19, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",1.1253206459972487,79.62993973217236 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 19, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((142427648, 1112716, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16366,10,848.62,84.862,4.205663218935997,20.3046912,277.281982421875,69.83527141167883,matrix_bf16,0.1307241703155456,0.009243006872590666,9.129157914052655,0.6454878936073826,2233.801171875,151.6748699935203,22338.01171875,85.8825,77.945,92.448,0.1269450126248617,0.12135707718705067,0.14623632530921743,8.865239411016208,8.47500442308574,10.212453468215758,2290.57763671875,1988.228515625,2395.83251953125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.868), 'mean_duration_us': np.float64(5.0868), 'median_duration_us': np.float64(5.1265), 'std_dev_duration_us': np.float64(0.12902774895347116), 'min_duration_us': np.float64(4.847), 'max_duration_us': np.float64(5.247)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(67.61), 'mean_duration_us': np.float64(6.761), 'median_duration_us': np.float64(6.7285), 'std_dev_duration_us': np.float64(0.28540567618742285), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(88.96000000000001), 'mean_duration_us': np.float64(8.896), 'median_duration_us': np.float64(8.992), 'std_dev_duration_us': np.float64(0.3516822429409821), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(9.413)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(120.88999999999999), 'mean_duration_us': np.float64(12.088999999999999), 'median_duration_us': np.float64(12.578), 'std_dev_duration_us': np.float64(1.3635438386791976), 'min_duration_us': np.float64(9.774), 'max_duration_us': np.float64(13.819)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3541.25), 'mean_duration_us': np.float64(354.125), 'median_duration_us': np.float64(363.59900000000005), 'std_dev_duration_us': np.float64(19.5954072884439), 'min_duration_us': np.float64(314.626), 'max_duration_us': np.float64(368.547)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(18468.433), 'mean_duration_us': np.float64(1846.8433), 'median_duration_us': np.float64(1894.7145), 'std_dev_duration_us': np.float64(127.35508833890387), 'min_duration_us': np.float64(1639.595), 'max_duration_us': np.float64(1996.765)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.09)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(6.76)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(8.9)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.09)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(354.12)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1846.84)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 19, 242, 242), 'filter_shape': (3, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (142427648, 1112716, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['batched_transpose_4x256_half'], ['batched_transpose_256x4_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",1.0588470173964277,80.68878674956879 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (7425, 3072), (3072, 3072), (), (), (7425, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",8860,80,2984.279,37.3034875,4.402219819774329,140.164992,105.017578125,1272.8512246833677,matrix_bf16,0.41679834117082637,0.013199277685953581,530.5222790052825,16.80071676750187,264.46404418945315,8.391238658426342,21157.12353515625,36.269000000000005,30.686,58.657,0.4161519166517704,0.382641480754548,0.4468281125136462,529.6994767645367,487.04567739308374,568.7457102359523,264.6123046875,246.44580078125,287.7861328125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(21157.122), 'mean_duration_us': np.float64(264.464025), 'median_duration_us': np.float64(264.6125), 'std_dev_duration_us': np.float64(8.338616556382423), 'min_duration_us': np.float64(246.446), 'max_duration_us': np.float64(287.786)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(264.46)}]","{'M': 7425, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x160x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",1.0028715820344976,81.69165833160329 +triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22,triton,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), ())","('', '', '', '', '', '22809600')",9524,320,5719.904,17.8747,2.484506516538245,0.1824768,130.558837890625,1.3329119675972243,vector_bfloat16,2.5064777741006186,0.14062752710123103,3.340914221615166,0.1874441138468333,54.79553985595703,3.1640130472265944,17534.57275390625,17.731,14.352,42.193,2.5484860726363174,2.1493577329295874,2.7561042139037437,3.396907585471796,2.864904644869485,3.6736442906574394,53.718505859375,49.671875,63.69384765625,"[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(17534.569), 'mean_duration_us': np.float64(54.795528125), 'median_duration_us': np.float64(53.718500000000006), 'std_dev_duration_us': np.float64(3.159070109297827), 'min_duration_us': np.float64(49.672), 'max_duration_us': np.float64(63.694)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(54.8)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.neg, aten.pow, aten.rsqrt, aten.slice, aten.stack, aten.transpose, aten.unbind, aten.view', 'xnumel': 22809600, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_slice_stack_transpose_unbind_view_22']",0.8311585782816147,82.52281690988491 +triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23,triton,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (7431, 3072), (3072,), (1, 24, 7431, 1), (128,), (1, 24, 7425, 64, 2), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (178344, 1, 24, 178344), (1,), (22809600, 950400, 128, 2, 1), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",9526,160,3854.271,24.08919375,5.261794475327747,0.159796224,304.72900390625,0.5000953395771409,vector_bfloat16,3.0651079233980463,0.41141587274173846,1.5328461877923314,0.2057471605862055,105.94866638183593,12.854668591841357,16951.78662109375,23.1295,21.061,71.376,2.8255271001334172,2.5931334050301356,4.84013337692211,1.4130329346256358,1.2968139307573734,2.4205281447305165,113.08740234375,66.01708984375,123.22216796875,"[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(16951.782), 'mean_duration_us': np.float64(105.94863749999999), 'median_duration_us': np.float64(113.0875), 'std_dev_duration_us': np.float64(12.814423365141865), 'min_duration_us': np.float64(66.017), 'max_duration_us': np.float64(123.222)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice...', 'stream': 0, 'mean_duration_us': np.float64(105.95)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.cat, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.slice, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_slice_split_transpose_unsqueeze_view_23']",0.8035338565168504,83.32635076640176 +aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 1, 4500, 512), (1, 1, 4500, 512), (1, 1, 4500, 512), (1, 1, 4500, 4500), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', '')","((2304000, 512, 512, 1), (2304000, 512, 512, 1), (2304000, 512, 512, 1), (20268000, 20268000, 4504, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '')",15759,10,440.464,44.0464,4.535675576287763,41.472,17.578125,2250.0,matrix_bf16,0.012236119129099315,0.0004504971629313214,27.531268040473456,1.0136186165954741,1508.128369140625,53.426057449049196,15081.28369140625,42.0775,40.811,54.12,0.012142090365408744,0.01166650781141347,0.01329775029758015,27.31970332216968,26.249642575680312,29.91993816955534,1518.034912109375,1386.09912109375,1579.9072265625,"[{'name': 'attn_fwd', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(15081.283999999998), 'mean_duration_us': np.float64(1508.1283999999998), 'median_duration_us': np.float64(1518.035), 'std_dev_duration_us': np.float64(50.684445699247824), 'min_duration_us': np.float64(1386.099), 'max_duration_us': np.float64(1579.907)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1508.13)}]","{'B': 1, 'N_Q': 4500, 'H_Q': 1, 'N_KV': 4500, 'H_KV': 1, 'd_h_qk': 512, 'd_h_v': 512, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.7148699023087666,84.04122066871052 +triton_poi_fused_addmm_gelu_view_12,triton,python3,CPU,thread 416 (python3),"((1, 7425, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((91238400, 12288, 1), (1,), ())","('', '', '91238400')",8876,80,1726.359,21.5794875,1.7179482684313658,0.7299072,348.0703125,1.9998653289340784,vector_bfloat16,1.9651274948954942,0.23310559040622872,3.9299903439765793,0.46617978823412554,187.95579833984374,19.109414108015883,15036.4638671875,21.106499999999997,19.339,28.162,1.8839925537940818,1.7232701126629382,2.581007660228034,3.7677313883027557,3.446308150702933,5.161667733403314,193.726318359375,141.4091796875,211.7939453125,"[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(15036.464), 'mean_duration_us': np.float64(187.9558), 'median_duration_us': np.float64(193.7265), 'std_dev_duration_us': np.float64(18.989619966181525), 'min_duration_us': np.float64(141.409), 'max_duration_us': np.float64(211.794)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_12', 'stream': 0, 'mean_duration_us': np.float64(187.96)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 91238400, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_12']",0.7127453919543191,84.75396606066484 +aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((29491200, 115200, 14400, 120, 1), (), ())","('', '', '[2., 2., 2.]')",16233,10,89.644,8.964400000000001,0.311834429002173,,,,,,,,,1476.82578125,29.202630242023886,14768.2578125,8.8935,8.462,9.394,,,,,,,1479.277587890625,1430.48486328125,1511.56494140625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(14768.257999999998), 'mean_duration_us': np.float64(1476.8257999999998), 'median_duration_us': np.float64(1479.2775000000001), 'std_dev_duration_us': np.float64(27.70397874241174), 'min_duration_us': np.float64(1430.485), 'max_duration_us': np.float64(1511.565)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(1476.83)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.7000321216494625,85.4539981823143 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16267,60,1903.483,31.724716666666666,2.833410020115409,0.626688768,478.12646484375,1.249997702212922,vector_bf16,2.1359021307850927,0.15045958358168715,2.6698727556330506,0.1880741337530221,235.86919759114582,16.57849384939928,14152.15185546875,30.991,29.534,48.593,2.135899005467487,1.7784935087307843,2.5324364588417225,2.669868848993225,2.223112799314078,3.1655397545523827,234.7265625,197.97216796875,281.89697265625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(3840.8520000000003), 'mean_duration_us': np.float64(64.0142), 'median_duration_us': np.float64(61.6105), 'std_dev_duration_us': np.float64(6.60053405112041), 'min_duration_us': np.float64(53.398), 'max_duration_us': np.float64(97.223)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10311.298999999999), 'mean_duration_us': np.float64(171.8549833333333), 'median_duration_us': np.float64(173.136), 'std_dev_duration_us': np.float64(12.893305696486665), 'min_duration_us': np.float64(144.574), 'max_duration_us': np.float64(211.113)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.85)}]","{'op_shape': (1, 128, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (125337600, 979200, 57600, 240, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.6708280025355338,86.12482618484982 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((250675200, 979200, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",16284,10,81.792,8.1792,0.2903759249279759,0.2506752,956.25,0.25,vector_bf16,0.7374241374611621,0.020176188168316452,0.1843560343652905,0.005044047042079107,1360.63681640625,36.685556845731355,13606.3681640625,8.167000000000002,7.772,8.853,0.737490059194964,0.7046222096561455,0.7816591851836063,0.18437251479874098,0.17615555241403633,0.19541479629590153,1359.61962890625,1282.78515625,1423.033203125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(13606.367), 'mean_duration_us': np.float64(1360.6367), 'median_duration_us': np.float64(1359.6195), 'std_dev_duration_us': np.float64(34.80297067794641), 'min_duration_us': np.float64(1282.785), 'max_duration_us': np.float64(1423.033)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(1360.64)}]","{'input_shape': (1, 256, 17, 240, 240), 'output_shape': (1, 256, 17, 240, 240), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 256, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.6449572383392717,86.7697834231891 +triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5,triton,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (128,), (1, 24, 7425, 1), (1, 24, 7425, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (178200, 1, 24, 178200), (22809600, 950400, 128, 2, 1), (), ())","('', '', '', '', '', '178200', '128')",8852,160,3541.497,22.13435625,2.4503502851809738,0.1824768,87.017822265625,1.999859718033247,vector_bfloat16,1.1371204512615098,0.06969034651303442,2.2740813850296813,0.13937091672719626,80.52618713378907,4.722485689939179,12884.18994140625,21.7925,18.388,38.938,1.1383089495869982,0.9392732401445583,1.4191602904097937,2.2764582149557757,1.8784147171916703,2.838121498222911,80.158203125,64.294921875,97.14404296875,"[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(12884.190999999999), 'mean_duration_us': np.float64(80.52619374999999), 'median_duration_us': np.float64(80.158), 'std_dev_duration_us': np.float64(4.7077055272405195), 'min_duration_us': np.float64(64.295), 'max_duration_us': np.float64(97.144)}]","[{'name': 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack...', 'stream': 0, 'mean_duration_us': np.float64(80.53)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.neg, aten.pow, aten.rsqrt, aten.stack, aten.transpose, aten.unbind, aten.view', 'xnumel': 178200, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__to_copy_add_addmm_mean_mul_neg_pow_rsqrt_stack_transpose_unbind_view_5']",0.6107251738782089,87.3805085970673 +triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8,triton,python3,CPU,thread 416 (python3),"((1, 24, 7431, 128), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 951168, 128, 1), (22828032, 3072, 128, 1), ())","('', '', '22828032')",8862,480,8773.778,18.278704166666667,3.486732812179859,0.0,130.623046875,0.0,vector_bfloat16,5.568541021673587,0.6030641754204771,0.0,0.0,24.869404093424478,2.5455756263902543,11937.31396484375,19.038,13.32,37.435,5.40160707893166,3.820268528143598,7.321749248694926,0.0,0.0,0.0,25.35693359375,18.70703125,35.85302734375,"[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'count': 480, 'total_duration_us': np.float64(11937.310000000001), 'mean_duration_us': np.float64(24.869395833333336), 'median_duration_us': np.float64(25.357), 'std_dev_duration_us': np.float64(2.5429265222343016), 'min_duration_us': np.float64(18.707), 'max_duration_us': np.float64(35.853)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8', 'stream': 0, 'mean_duration_us': np.float64(24.87)}]","{'fused_ops': '', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_8']",0.5658421817726056,87.94635077883991 +triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",9562,152,3587.546,23.60227631578947,3.6469713520055573,0.045656064,130.6640625,0.33322869955156953,vector_bfloat16,1.7714266022942287,0.11599889408312304,0.5902901830335614,0.03865416062473934,77.69896175986842,5.519513208278738,11810.2421875,22.874,20.65,54.861,1.7282622928202316,1.2392030278004724,1.9989665859288177,0.5759065963204997,0.41293801343431896,0.6661130358761007,79.27685546875,68.541015625,110.56396484375,"[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(11810.244), 'mean_duration_us': np.float64(77.69897368421053), 'median_duration_us': np.float64(79.277), 'std_dev_duration_us': np.float64(5.5013074868704575), 'min_duration_us': np.float64(68.541), 'max_duration_us': np.float64(110.564)}]","[{'name': 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29', 'stream': 0, 'mean_duration_us': np.float64(77.7)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.slice, aten.split, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_cat_mul_slice_split_unsqueeze_view_29']",0.559818835821777,88.50616961466169 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240),)","('c10::BFloat16',)","((125337600, 979200, 57600, 240, 1),)","('',)",16271,60,549.828,9.1638,0.5570538969146489,0.1253376,478.125,0.25,vector_bf16,2.7956763404112555,0.3039088826952816,0.6989190851028136,0.07597722067382039,181.23169759114583,17.872211160860086,10873.90185546875,9.113499999999998,8.333,12.318,2.6957932117137,2.3847601089761308,3.468732455423201,0.6739483029284248,0.5961900272440326,0.8671831138558002,185.97509765625,144.5341796875,210.23095703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(10873.901), 'mean_duration_us': np.float64(181.23168333333334), 'median_duration_us': np.float64(185.97500000000002), 'std_dev_duration_us': np.float64(17.72266507563283), 'min_duration_us': np.float64(144.534), 'max_duration_us': np.float64(210.231)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(181.23)}]","{'op_shape': (1, 128, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (125337600, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.515435245181654,89.02160485984334 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((250675200, 979200, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16286,10,697.227,69.7227,5.159371905140735,64.1728512,717.25,85.32589752527012,matrix_bf16,0.7266293293589625,0.01119099823956174,62.000299695738576,0.9548819689943228,1035.260546875,15.841530677576912,10352.60546875,68.96199999999999,63.054,79.198,0.7247524405104127,0.7121759022297188,0.7442172592551075,61.8401524701809,60.767048053619774,63.50100559973869,1037.740478515625,1010.580078125,1056.046875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2186.359), 'mean_duration_us': np.float64(218.6359), 'median_duration_us': np.float64(221.6085), 'std_dev_duration_us': np.float64(14.933358854926103), 'min_duration_us': np.float64(181.348), 'max_duration_us': np.float64(243.04)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(8166.246999999999), 'mean_duration_us': np.float64(816.6247), 'median_duration_us': np.float64(821.4995), 'std_dev_duration_us': np.float64(12.913326426990064), 'min_duration_us': np.float64(789.332), 'max_duration_us': np.float64(830.233)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(218.64)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(816.62)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 17, 240, 240), 'filter_shape': (128, 256, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (250675200, 979200, 57600, 240, 1), 'weight_stride': (256, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.4907252069201301,89.51233006676347 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (128, 128, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24074,5,392.264,78.4528,3.7425533663529746,458.6471424,284.6826171875,1536.4478671766462,matrix_bf16,0.1512225383029339,0.003055193043968672,232.3455464445815,4.694144836218585,1974.61630859375,38.92279256154899,9873.08154296875,78.116,74.18,83.044,0.1500848843291918,0.14907312365521128,0.15660458730735702,230.5976004230404,229.0430828934098,240.61478415846756,1988.9501953125,1906.14697265625,2002.44921875,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.833999999999996), 'mean_duration_us': np.float64(5.166799999999999), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.21052353787640943), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.367)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(602.692), 'mean_duration_us': np.float64(120.5384), 'median_duration_us': np.float64(121.78), 'std_dev_duration_us': np.float64(2.112858594416579), 'min_duration_us': np.float64(117.093), 'max_duration_us': np.float64(122.662)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(605.4540000000001), 'mean_duration_us': np.float64(121.09080000000002), 'median_duration_us': np.float64(121.86), 'std_dev_duration_us': np.float64(2.0797206927854526), 'min_duration_us': np.float64(117.053), 'max_duration_us': np.float64(122.982)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(611.342), 'mean_duration_us': np.float64(122.2684), 'median_duration_us': np.float64(121.019), 'std_dev_duration_us': np.float64(8.790825344641997), 'min_duration_us': np.float64(109.201), 'max_duration_us': np.float64(136.241)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(919.682), 'mean_duration_us': np.float64(183.9364), 'median_duration_us': np.float64(184.353), 'std_dev_duration_us': np.float64(0.5806870413570518), 'min_duration_us': np.float64(183.152), 'max_duration_us': np.float64(184.513)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(7108.077), 'mean_duration_us': np.float64(1421.6154000000001), 'median_duration_us': np.float64(1432.568), 'std_dev_duration_us': np.float64(30.52483036218219), 'min_duration_us': np.float64(1363.064), 'max_duration_us': np.float64(1451.756)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.17)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(120.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.09)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(122.27)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(183.94)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1421.62)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 11, 242, 242), 'filter_shape': (128, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (82458112, 644204, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.467995230547277,89.98032529731074 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((33177600, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16130,50,425.146,8.50292,4.866729442126113,0.041913344,143.224609375,0.2790838799416345,vector_bf16,0.8280689388405905,0.04926900605223346,0.23110069231078406,0.013750185369925182,181.9982421875,10.907357150483445,9099.912109375,7.4965,6.961,35.293,0.824045511146023,0.7248614995416184,0.9396002572950779,0.22997781849911952,0.20229715971238618,0.2622272854000684,182.25,159.8359375,207.18701171875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(9099.913), 'mean_duration_us': np.float64(181.99826000000002), 'median_duration_us': np.float64(182.25), 'std_dev_duration_us': np.float64(10.797747462892435), 'min_duration_us': np.float64(159.836), 'max_duration_us': np.float64(207.187)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.0)}]","{'input_shape': (1, 256, 9, 120, 120), 'output_shape': (1, 256, 11, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 11, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (33177600, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.4313461250221126,90.41167142233286 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '7431', '3072')",9541,156,3138.954,20.1215,2.563558898446932,0.045656064,130.658203125,0.3332436432127001,vector_bfloat16,2.353956664478194,0.09467496004773462,0.7844410948355292,0.03154982860732389,58.29872796474359,2.421970207712263,9094.6015625,19.7045,17.806,47.361,2.3767225275134862,2.095617024825979,2.4927714524520255,0.7920276739742913,0.6983510521315688,0.8307002405117272,57.64453125,54.9609375,65.376953125,"[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(9094.601), 'mean_duration_us': np.float64(58.29872435897436), 'median_duration_us': np.float64(57.6445), 'std_dev_duration_us': np.float64(2.414204855491438), 'min_duration_us': np.float64(54.961), 'max_duration_us': np.float64(65.377)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(58.3)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.unsqueeze', 'xnumel': 7431, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_27']",0.43109439909457103,90.84276582142743 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 18432), (1, 18432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (18432, 1))","('', '', '')",8845,160,5070.261,31.689131250000003,7.651621165110255,0.113246208,108.041015625,0.9996203698682141,matrix_bf16,2.0844419423001033,0.17565890712633075,2.083650625330848,0.17559222171226907,54.699826049804685,4.2111945588866115,8751.97216796875,29.929000000000002,25.928,75.122,2.0390047752243188,1.740335548864736,2.743093262963751,2.0382307075727883,1.7396748650509688,2.742051902106831,55.56103515625,41.2998046875,65.09619140625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(8751.971), 'mean_duration_us': np.float64(54.69981875), 'median_duration_us': np.float64(55.561), 'std_dev_duration_us': np.float64(4.198013704229471), 'min_duration_us': np.float64(41.3), 'max_duration_us': np.float64(65.096)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(54.7)}]","{'M': 1, 'N': 18432, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT192x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG64_4_1']",0.414853378316198,91.25761919974363 +triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7,triton,python3,CPU,thread 416 (python3),"((7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (7425, 128), (1, 24, 7425, 64, 2), (7425, 128), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (7425, 3072), (3072,), (1, 24, 7425, 1), (128,), (1, 24, 7425, 64, 2), (6, 3072), (3072,), (1, 24, 6, 1), (128,), (1, 24, 7431, 128), (1, 24, 7431, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (178200, 1, 24, 178200), (1,), (128, 1), (22809600, 950400, 128, 2, 1), (128, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (3072, 1), (1,), (178200, 1, 24, 178200), (1,), (22809600, 950400, 128, 2, 1), (3072, 1), (1,), (144, 1, 24, 144), (1,), (22828032, 951168, 128, 1), (22828032, 951168, 128, 1), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '', '22828032')",8859,80,2456.91,30.711374999999997,3.2756189805434,0.159796224,304.7412109375,0.5000753072375063,vector_bfloat16,2.9829037957164335,0.23215757372810789,1.491676532102819,0.11609627000959759,107.70609130859376,7.575080293499654,8616.4873046875,30.145,27.2,47.06,2.9022430615695827,2.6848828380479604,3.68614298630708,1.4513400906923297,1.3426436101335413,1.8433490863988915,110.1025390625,86.68798828125,119.01611328125,"[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(8616.487000000001), 'mean_duration_us': np.float64(107.70608750000001), 'median_duration_us': np.float64(110.10249999999999), 'std_dev_duration_us': np.float64(7.527556552749621), 'min_duration_us': np.float64(86.688), 'max_duration_us': np.float64(119.016)}]","[{'name': 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split...', 'stream': 0, 'mean_duration_us': np.float64(107.71)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.cat, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_add_addmm_cat_mean_mul_pow_rsqrt_split_transpose_unsqueeze_view_7']",0.40843124257762203,91.66605044232125 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",16099,20,160.768,8.0384,1.878942294847934,0.083826688,286.44921875,0.2790838799416345,vector_bf16,0.7378654890664265,0.03647105947326449,0.20592636356369,0.010178484783380758,408.019287109375,20.21189608764834,8160.3857421875,7.486,7.151,15.813,0.7436249409716154,0.6839321757569289,0.8004666508536948,0.20753373374772732,0.1908744452271676,0.22339733868413483,403.9189453125,375.23583984375,439.171875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(8160.385999999999), 'mean_duration_us': np.float64(408.01929999999993), 'median_duration_us': np.float64(403.919), 'std_dev_duration_us': np.float64(19.700116299402907), 'min_duration_us': np.float64(375.236), 'max_duration_us': np.float64(439.172)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(408.02)}]","{'input_shape': (1, 512, 9, 120, 120), 'output_shape': (1, 512, 11, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 11, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.38681151271251474,92.05286195503376 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 14336))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",356,64,2311.045,36.110078125,6.747564172621177,41.221619712,124.33984375,316.165750369137,matrix_bf16,1.0763768489146515,0.010466715531330686,340.31349411706805,3.3092169698634617,121.13964080810547,1.1772421975752645,7752.93701171875,35.943,28.022,60.68,1.0746869267971833,1.0567177494914637,1.0988069530836562,339.7791986227332,334.09796019635434,347.4051248325192,121.31884765625,118.65576171875,123.3818359375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(7752.939), 'mean_duration_us': np.float64(121.139671875), 'median_duration_us': np.float64(121.319), 'std_dev_duration_us': np.float64(1.1680273174069968), 'min_duration_us': np.float64(118.656), 'max_duration_us': np.float64(123.382)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(121.14)}]","{'M': 351, 'N': 14336, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT96x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT3_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.36749798210689383,92.42035993714066 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (129, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((57600, 7430400, 240, 1), (57600, 7430400, 240, 1), ())","('', '', 'False')",24640,1,772123.309,772123.309,,0.0222912,85.0341796875,0.25,vector_bf16,0.013468645387413594,,0.0033671613468533985,,6620.17578125,,6620.17578125,772123.309,772123.309,772123.309,0.013468645387413594,0.013468645387413594,0.013468645387413594,0.0033671613468533985,0.0033671613468533985,0.0033671613468533985,6620.17578125,6620.17578125,6620.17578125,"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6620.176), 'mean_duration_us': np.float64(6620.176), 'median_duration_us': np.float64(6620.176), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6620.176), 'max_duration_us': np.float64(6620.176)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(6620.18)}]","{'op_shape': (129, 3, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (57600, 7430400, 240, 1), 'stride_output': (57600, 7430400, 240, 1)}",True,diffusers/image_processor.py(190): pt_to_numpy,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(190): pt_to_numpy', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy DtoH (Device -> Host)']",0.3138038187495804,92.73416375589024 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",8904,76,1936.309,25.47775,1.743135857202952,0.0456192,130.59375,0.3331389088298636,vector_bfloat16,1.8654743872815345,0.11631104198509508,0.6214621018290287,0.03874773361177902,73.8177425986842,6.743495096271407,5610.1484375,25.197499999999998,23.004,35.683,1.8771867271047804,1.1840590689414952,2.0143793960480663,0.6253639379375895,0.394456146217274,0.6710681539688126,72.9482421875,67.97998046875,115.65087890625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5610.146000000001), 'mean_duration_us': np.float64(73.81771052631579), 'median_duration_us': np.float64(72.948), 'std_dev_duration_us': np.float64(6.698992855991566), 'min_duration_us': np.float64(67.98), 'max_duration_us': np.float64(115.651)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(73.82)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16']",0.2659273804217753,93.00009113631201 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '7425', '3072')",8878,76,1867.926,24.577973684210527,3.853821898578724,0.0456192,130.6640625,0.3329596412556054,vector_bfloat16,1.893023289314993,0.04588473870047322,0.6303003552988261,0.015277766136816763,72.4171078330592,1.6808137308604874,5503.7001953125,23.686,21.291,52.248,1.8833913092505334,1.832925752508361,2.0394884367981505,0.6270932946719826,0.6102903010033445,0.6790673382612676,72.7470703125,67.17919921875,74.75,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(5503.700000000001), 'mean_duration_us': np.float64(72.41710526315791), 'median_duration_us': np.float64(72.747), 'std_dev_duration_us': np.float64(1.6697369126124988), 'min_duration_us': np.float64(67.179), 'max_duration_us': np.float64(74.75)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(72.42)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_13']",0.26088161336038906,93.26097274967239 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 17, 240, 240), (1, 128, 17, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((125337600, 979200, 57600, 240, 1), (125337600, 979200, 57600, 240, 1), ())","('', '', '1')",16293,30,262.001,8.733366666666665,0.5771002711734813,0.1253376,717.1875,0.16666666666666666,vector_bf16,4.343486980745721,0.35200250597983146,0.7239144967909533,0.05866708432997192,174.19246419270834,13.554415174253906,5225.77392578125,8.557500000000001,7.952,9.725,4.292406210332841,3.6968944969587576,5.1644359866139995,0.7154010350554733,0.6161490828264595,0.8607393311023331,175.199462890625,145.6162109375,203.4208984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(5225.774), 'mean_duration_us': np.float64(174.1924666666667), 'median_duration_us': np.float64(175.1995), 'std_dev_duration_us': np.float64(13.326603204951446), 'min_duration_us': np.float64(145.616), 'max_duration_us': np.float64(203.421)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(174.19)}]","{'shape_in1': (1, 128, 17, 240, 240), 'shape_in2': (1, 128, 17, 240, 240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (125337600, 979200, 57600, 240, 1), 'stride_input2': (125337600, 979200, 57600, 240, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.24770759387940425,93.50868034355179 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24043,1,86.408,86.408,,1834.5885696,571.052734375,3063.8151166807465,matrix_bf16,0.11513990038974717,,352.7673673472228,,5200.56201171875,,5200.56201171875,86.408,86.408,86.408,0.11513990038974717,0.11513990038974717,0.11513990038974717,352.7673673472228,352.7673673472228,352.7673673472228,5200.56201171875,5200.56201171875,5200.56201171875,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.823), 'mean_duration_us': np.float64(231.823), 'median_duration_us': np.float64(231.823), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.823), 'max_duration_us': np.float64(231.823)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(238.113), 'mean_duration_us': np.float64(238.113), 'median_duration_us': np.float64(238.113), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(238.113), 'max_duration_us': np.float64(238.113)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(289.149), 'mean_duration_us': np.float64(289.149), 'median_duration_us': np.float64(289.149), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(289.149), 'max_duration_us': np.float64(289.149)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(421.745), 'mean_duration_us': np.float64(421.745), 'median_duration_us': np.float64(421.745), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(421.745), 'max_duration_us': np.float64(421.745)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4014.525), 'mean_duration_us': np.float64(4014.525), 'median_duration_us': np.float64(4014.525), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4014.525), 'max_duration_us': np.float64(4014.525)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.21)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.82)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(238.11)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(289.15)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(421.74)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(4014.52)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 11, 242, 242), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (164916224, 644204, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.2465125206408346,93.75519286419262 +triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21,triton,python3,CPU,thread 416 (python3),"((7431, 3072), (3072,), (1, 24, 7431, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (178344, 1, 24, 178344), (), ())","('', '', '', '178344', '128')",9521,320,6911.375,21.598046875,1.6822098004835409,0.068484096,43.546875,1.4997981700753498,vector_bfloat16,3.008920451931564,0.34338231431520994,4.512773387709254,0.5150041666461904,15.365415954589844,1.6736543542812599,4916.93310546875,21.3765,18.167,30.285,2.8785730287191797,2.499831644363656,3.713023186849837,4.317278560901284,3.7492429257130637,5.568785381084729,15.86279296875,12.2978515625,18.26611328125,"[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'count': 320, 'total_duration_us': np.float64(4916.939), 'mean_duration_us': np.float64(15.365434375000001), 'median_duration_us': np.float64(15.863), 'std_dev_duration_us': np.float64(1.6710358301644401), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(18.266)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21', 'stream': 0, 'mean_duration_us': np.float64(15.37)}]","{'fused_ops': 'aten._to_copy, aten.addmm, aten.mean, aten.pow, aten.transpose, aten.view', 'xnumel': 178344, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_21']",0.2330681897303023,93.98826105392293 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((250675200, 979200, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16252,10,346.94599999999997,34.694599999999994,1.4990474160464566,1.253377536,956.2529296875,1.249997702212922,vector_bf16,2.0709930659711335,0.027118545096077237,2.5887365737628114,0.033898119057454,484.24150390625,6.429982929902523,4842.4150390625,34.476,33.349,38.628,2.080236614391215,2.013878225952321,2.0961822617898527,2.600290988048207,2.5173431549770373,2.620223010656802,482.014404296875,478.34765625,497.89697265625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1702.721), 'mean_duration_us': np.float64(170.2721), 'median_duration_us': np.float64(170.913), 'std_dev_duration_us': np.float64(1.7133133076002158), 'min_duration_us': np.float64(167.448), 'max_duration_us': np.float64(172.015)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3139.6940000000004), 'mean_duration_us': np.float64(313.96940000000006), 'median_duration_us': np.float64(313.004), 'std_dev_duration_us': np.float64(5.32169548546326), 'min_duration_us': np.float64(306.614), 'max_duration_us': np.float64(326.043)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(170.27)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(313.97)}]","{'op_shape': (1, 256, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.22953594911059766,94.21779700303352 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 9216), (1, 9216))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (9216, 1))","('', '', '')",9511,160,7025.695,43.91059375,11.163824688550523,0.056623104,54.0234375,0.9995661605206074,matrix_bf16,1.940142204882262,0.27967358583293916,1.939300494598148,0.27955225239006154,29.782489013671874,4.091631975479052,4765.1982421875,42.358000000000004,36.724,151.636,1.7676802936336298,1.608764576087861,2.4382515844559807,1.7669134041353072,1.6080666305017057,2.4371937746579517,32.04638671875,23.23291015625,35.2119140625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(4765.2), 'mean_duration_us': np.float64(29.7825), 'median_duration_us': np.float64(32.046499999999995), 'std_dev_duration_us': np.float64(4.07881045618695), 'min_duration_us': np.float64(23.233), 'max_duration_us': np.float64(35.212)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(29.78)}]","{'M': 1, 'N': 9216, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.22587578561469568,94.44367278864821 +triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (22828032, 3072, 1), ())","('', '', '', '', '22828032')",9542,156,2798.304,17.937846153846156,1.841251713632021,0.022828032,130.658203125,0.16662182160635006,vector_bfloat16,4.7445735940702525,0.467815379809313,0.790549494989373,0.07794825075929424,29.14972393329327,2.8026065809675935,4547.35693359375,17.6115,15.493,34.331,4.5601552850316915,3.8471796674756282,5.7099380278388265,0.7598213803998051,0.6410240842417014,0.9514002754578755,30.0439453125,23.994140625,35.61181640625,"[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'count': 156, 'total_duration_us': np.float64(4547.359), 'mean_duration_us': np.float64(29.149737179487182), 'median_duration_us': np.float64(30.044), 'std_dev_duration_us': np.float64(2.7936151105786897), 'min_duration_us': np.float64(23.994), 'max_duration_us': np.float64(35.612)}]","[{'name': 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28', 'stream': 0, 'mean_duration_us': np.float64(29.15)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.slice, aten.split, aten.unsqueeze', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_cat_slice_split_unsqueeze_28']",0.21554986123188158,94.65922264988009 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 11, 242, 242), (128, 256, 3, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((164916224, 644204, 58564, 242, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24058,1,89.744,89.744,,917.2942848,442.802734375,1975.597556403414,matrix_bf16,0.11085623959576964,,219.00731605747387,,4188.41845703125,,4188.41845703125,89.744,89.744,89.744,0.11085623959576964,0.11085623959576964,0.11085623959576964,219.00731605747387,219.00731605747387,219.00731605747387,4188.41845703125,4188.41845703125,4188.41845703125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(110.203), 'mean_duration_us': np.float64(110.203), 'median_duration_us': np.float64(110.203), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(110.203), 'max_duration_us': np.float64(110.203)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(121.139), 'mean_duration_us': np.float64(121.139), 'median_duration_us': np.float64(121.139), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(121.139), 'max_duration_us': np.float64(121.139)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(137.964), 'mean_duration_us': np.float64(137.964), 'median_duration_us': np.float64(137.964), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(137.964), 'max_duration_us': np.float64(137.964)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(424.83), 'mean_duration_us': np.float64(424.83), 'median_duration_us': np.float64(424.83), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(424.83), 'max_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3388.955), 'mean_duration_us': np.float64(3388.955), 'median_duration_us': np.float64(3388.955), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3388.955), 'max_duration_us': np.float64(3388.955)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.33)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(110.2)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(121.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(137.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(424.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(3388.96)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 11, 242, 242), 'filter_shape': (128, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (164916224, 644204, 58564, 242, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi64EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.19853577152138127,94.85775842140147 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((9216000, 18000, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",15965,70,524.355,7.490785714285715,0.35011811228010475,0.013776896,43.85546875,0.299590273447938,vector_bf16,0.7820931964563087,0.09462854668341117,0.2343075145881174,0.028349792176864123,59.625376674107144,6.965243076949578,4173.7763671875,7.461,6.84,8.202,0.7593362682296552,0.6317848365578125,0.9646710166755439,0.22748976023785916,0.18927659194461588,0.28900605367312654,60.569091796875,47.669921875,72.787109375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 70, 'total_duration_us': np.float64(4173.776), 'mean_duration_us': np.float64(59.62537142857143), 'median_duration_us': np.float64(60.569), 'std_dev_duration_us': np.float64(6.915321565028997), 'min_duration_us': np.float64(47.67), 'max_duration_us': np.float64(72.787)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(59.63)}]","{'input_shape': (1, 512, 5, 60, 60), 'output_shape': (1, 512, 7, 62, 62), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 7, 62, 62), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (9216000, 18000, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.19784171990413318,95.0556001413056 +aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((7372800, 14400, 3600, 60, 1), (), ())","('', '', '[2., 2., 2.]')",16089,10,91.544,9.154399999999999,0.7308313682983845,,,,,,,,,397.7623046875,9.699321350901494,3977.623046875,8.708,8.612,10.535,,,,,,,397.570068359375,382.1669921875,415.296875,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3977.623), 'mean_duration_us': np.float64(397.7623), 'median_duration_us': np.float64(397.57000000000005), 'std_dev_duration_us': np.float64(9.20156966011779), 'min_duration_us': np.float64(382.167), 'max_duration_us': np.float64(415.297)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(397.76)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.1885438306926703,95.24414397199827 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 14336), (14336, 4096))","('c10::BFloat16', 'c10::BFloat16')","((14336, 1), (1, 14336))","('', '')",376,32,1045.624,32.67575,8.311147647936863,41.221619712,124.33984375,316.165750369137,matrix_bf16,1.1373599105898429,0.008981247215309414,359.5942495714122,2.839562765079043,114.64051818847656,0.8912301955518536,3668.49658203125,30.6405,27.361,65.027,1.1358157505382471,1.125408433881389,1.1715930904655347,359.10603905000943,355.8156019698647,370.417608574332,114.78955078125,111.2841796875,115.85107421875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(3668.496), 'mean_duration_us': np.float64(114.6405), 'median_duration_us': np.float64(114.7895), 'std_dev_duration_us': np.float64(0.8772184733576919), 'min_duration_us': np.float64(111.284), 'max_duration_us': np.float64(115.851)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(114.64)}]","{'M': 351, 'N': 4096, 'K': 14336, 'bias': False, 'stride_A': (14336, 1), 'stride_B': (1, 14336), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.17389088666975336,95.41803485866802 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((6, 12288), (12288, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",8882,80,2422.421,30.2802625,8.23693202032387,0.452984832,72.17578125,5.985387238188017,matrix_bf16,1.6603226727831604,0.10654213684846953,9.93767413695055,0.6376959462221112,45.75550537109375,2.739651795895817,3660.4404296875,28.5175,25.578,85.888,1.6558032321465674,1.5126313582386697,1.9928808745226616,9.910623534640537,9.05368442768474,11.928163753596914,45.70703125,37.97607421875,50.033203125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(3660.44), 'mean_duration_us': np.float64(45.7555), 'median_duration_us': np.float64(45.707), 'std_dev_duration_us': np.float64(2.722449365920329), 'min_duration_us': np.float64(37.976), 'max_duration_us': np.float64(50.033)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]","{'M': 6, 'N': 3072, 'K': 12288, 'bias': False, 'stride_A': (12288, 1), 'stride_B': (1, 12288), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.17350901593800372,95.59154387460603 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 62, 62), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((9840640, 19220, 3844, 62, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23765,7,545.579,77.93985714285714,4.604490215306917,152.8823808,42.81640625,3405.2367484718548,matrix_bf16,0.08794618092250528,0.0023742941706903237,299.4775671650693,8.085033761717206,510.81619698660717,13.800335108151545,3575.71337890625,77.585,72.057,84.745,0.08806079306451164,0.08459768538201089,0.09111808436601615,299.86784864285045,288.0751470984837,310.27864933351697,509.83251953125,492.72607421875,530.703125,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(66.21100000000001), 'mean_duration_us': np.float64(9.458714285714288), 'median_duration_us': np.float64(9.533), 'std_dev_duration_us': np.float64(0.6017806231238647), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(10.455)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(90.72800000000001), 'mean_duration_us': np.float64(12.961142857142859), 'median_duration_us': np.float64(13.098), 'std_dev_duration_us': np.float64(0.5008011948215517), 'min_duration_us': np.float64(12.298), 'max_duration_us': np.float64(13.699)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(97.979), 'mean_duration_us': np.float64(13.997), 'median_duration_us': np.float64(14.26), 'std_dev_duration_us': np.float64(0.6984055309877533), 'min_duration_us': np.float64(12.497), 'max_duration_us': np.float64(14.902)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(100.50399999999999), 'mean_duration_us': np.float64(14.357714285714284), 'median_duration_us': np.float64(14.341), 'std_dev_duration_us': np.float64(0.3663034317087854), 'min_duration_us': np.float64(13.7), 'max_duration_us': np.float64(14.821)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(129.225), 'mean_duration_us': np.float64(18.460714285714285), 'median_duration_us': np.float64(18.547), 'std_dev_duration_us': np.float64(0.45106404812421497), 'min_duration_us': np.float64(17.705), 'max_duration_us': np.float64(19.188)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(3091.066), 'mean_duration_us': np.float64(441.5808571428571), 'median_duration_us': np.float64(442.336), 'std_dev_duration_us': np.float64(14.279286921257372), 'min_duration_us': np.float64(420.664), 'max_duration_us': np.float64(462.647)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.46)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.96)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.0)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.36)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(18.46)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(441.58)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 5, 62, 62), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (9840640, 19220, 3844, 62, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_32x32_half'], ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.169492857913643,95.76103673251967 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16123,50,1574.76,31.4952,2.381015415356076,0.165889536,126.5654296875,1.2499826392907571,vector_bf16,2.0058305952859965,0.06389510478764683,2.507253421465741,0.07986777172022225,66.230859375,2.1482493381519303,3311.54296875,30.951,28.602,43.815,2.0133872881605615,1.8405340898877927,2.110210251907982,2.5166991563693992,2.300635659382555,2.6377261801383534,65.91552734375,62.89111328125,72.10595703125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(1023.592), 'mean_duration_us': np.float64(20.47184), 'median_duration_us': np.float64(20.409), 'std_dev_duration_us': np.float64(0.5652406340665894), 'min_duration_us': np.float64(19.348), 'max_duration_us': np.float64(22.072)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2287.949), 'mean_duration_us': np.float64(45.75898), 'median_duration_us': np.float64(45.5865), 'std_dev_duration_us': np.float64(1.7036678020083613), 'min_duration_us': np.float64(42.782), 'max_duration_us': np.float64(50.034)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.47)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(45.76)}]","{'op_shape': (1, 256, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33177600, 129600, 14400, 120, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.1569708817234546,95.91800761424312 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 7, 122, 122), (256, 256, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((26672128, 104188, 14884, 122, 1), (6912, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23930,5,378.78200000000004,75.75640000000001,3.8130114476618138,254.803968,89.404296875,2717.99016930639,matrix_bf16,0.14189575770812562,0.005365093116590351,385.67127451696695,14.582270348305917,661.45712890625,25.81166366349123,3307.28564453125,75.241,72.257,81.14,0.1453281035856996,0.13336102435439526,0.1455267129839476,395.0003568698722,362.4739531638764,395.5401752618422,645.07275390625,644.1923828125,702.9580078125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(28.237000000000002), 'mean_duration_us': np.float64(5.6474), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.30903760289000437), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.168)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(130.58700000000002), 'mean_duration_us': np.float64(26.117400000000004), 'median_duration_us': np.float64(26.037), 'std_dev_duration_us': np.float64(0.3254293164421424), 'min_duration_us': np.float64(25.757), 'max_duration_us': np.float64(26.518)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(168.36599999999999), 'mean_duration_us': np.float64(33.673199999999994), 'median_duration_us': np.float64(33.93), 'std_dev_duration_us': np.float64(1.4436774431984447), 'min_duration_us': np.float64(31.045), 'max_duration_us': np.float64(35.292)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(220.32399999999998), 'mean_duration_us': np.float64(44.0648), 'median_duration_us': np.float64(44.265), 'std_dev_duration_us': np.float64(0.9964507815241054), 'min_duration_us': np.float64(42.302), 'max_duration_us': np.float64(45.226)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(335.37299999999993), 'mean_duration_us': np.float64(67.07459999999999), 'median_duration_us': np.float64(66.578), 'std_dev_duration_us': np.float64(2.3191535179888367), 'min_duration_us': np.float64(64.735), 'max_duration_us': np.float64(71.425)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(2424.399), 'mean_duration_us': np.float64(484.8798), 'median_duration_us': np.float64(472.902), 'std_dev_duration_us': np.float64(19.36392630021093), 'min_duration_us': np.float64(468.335), 'max_duration_us': np.float64(518.73)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.12)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(33.67)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(44.06)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(67.07)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(484.88)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 7, 122, 122), 'filter_shape': (256, 256, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (26672128, 104188, 14884, 122, 1), 'weight_stride': (6912, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x16_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.15676907974090262,96.07477669398402 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 17, 240, 240),)","('c10::BFloat16',)","((250675200, 979200, 57600, 240, 1),)","('',)",16256,10,103.605,10.3605,0.245652080073514,0.2506752,956.25,0.25,vector_bf16,3.1295506988112995,0.06741744990702156,0.7823876747028248,0.016854362476755407,320.531494140625,6.902544584904398,3205.31494140625,10.31,10.045,10.867,3.1375249994533245,3.0395081776105553,3.234309840751842,0.784381249863331,0.7598770444026387,0.8085774601879604,319.593994140625,310.02001953125,329.88916015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(3205.315), 'mean_duration_us': np.float64(320.5315), 'median_duration_us': np.float64(319.594), 'std_dev_duration_us': np.float64(6.548297232869021), 'min_duration_us': np.float64(310.02), 'max_duration_us': np.float64(329.889)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(320.53)}]","{'op_shape': (1, 256, 17, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (250675200, 979200, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.1519355530947019,96.22671224707872 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 3072), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8855,240,7156.78,29.819916666666664,3.971826802873247,0.113246208,18.0703125,5.976653696498055,matrix_bf16,1.503070726682521,0.12511074273580028,8.983333214725105,0.7477435830435376,12.679276529947916,0.8926095073379748,3043.0263671875,29.413,24.527,73.659,1.482888173334862,1.3139331146475248,2.1502576942428107,8.86270908265505,7.852923206609331,12.851345596719677,12.77783203125,8.81201171875,14.4208984375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 240, 'total_duration_us': np.float64(3043.026), 'mean_duration_us': np.float64(12.679274999999999), 'median_duration_us': np.float64(12.778), 'std_dev_duration_us': np.float64(0.8907307764087119), 'min_duration_us': np.float64(8.812), 'max_duration_us': np.float64(14.421)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.68)}]","{'M': 6, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.14424289114552738,96.37095513822425 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 16, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (235929600, 921600, 57600, 240, 1)), ())","('', '2')",16235,10,261.889,26.1889,1.1551666979271857,,,,,,,,,281.219921875,4.5396044607664345,2812.19921875,25.698,24.917,28.232,,,,,,,282.0576171875,271.841796875,288.26611328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(207.33700000000002), 'mean_duration_us': np.float64(20.733700000000002), 'median_duration_us': np.float64(20.628999999999998), 'std_dev_duration_us': np.float64(0.577282781659041), 'min_duration_us': np.float64(19.828), 'max_duration_us': np.float64(21.791)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2604.862), 'mean_duration_us': np.float64(260.4862), 'median_duration_us': np.float64(260.7265), 'std_dev_duration_us': np.float64(4.294674884086099), 'min_duration_us': np.float64(251.293), 'max_duration_us': np.float64(268.077)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(260.49)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.13330142326850872,96.50425656149275 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((66355200, 129600, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",16140,10,79.287,7.928700000000001,0.4193322866971572,0.0663552,253.125,0.25,vector_bf16,0.9479352462482238,0.031726224481554856,0.23698381156205595,0.007931556120388714,280.287548828125,9.588244494036497,2802.87548828125,7.771,7.571,8.893,0.9535048925755291,0.8937902817605429,0.9886127465476509,0.23837622314388227,0.22344757044013572,0.24715318663691271,278.37255859375,268.47802734375,296.9609375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(2802.8759999999997), 'mean_duration_us': np.float64(280.2876), 'median_duration_us': np.float64(278.3725), 'std_dev_duration_us': np.float64(9.096211367377077), 'min_duration_us': np.float64(268.478), 'max_duration_us': np.float64(296.961)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(280.29)}]","{'input_shape': (1, 512, 9, 120, 120), 'output_shape': (1, 512, 9, 120, 120), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 512, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.13285946790013736,96.63711602939289 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((6, 3072), (3072, 12288), (6, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",8880,80,1893.74,23.67175,4.318981392159821,0.452984832,72.17578125,5.985387238188017,matrix_bf16,2.257313967034688,0.1305521799538513,13.510898210872986,0.7814053518134069,33.6279541015625,1.7664908669493384,2690.236328125,22.6485,19.919,53.51,2.221437569486672,2.0625748202323444,2.726312355167804,13.29616407883693,12.34530900682662,16.318035177935695,34.06884765625,27.759765625,36.69287109375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2690.236), 'mean_duration_us': np.float64(33.62795), 'median_duration_us': np.float64(34.069), 'std_dev_duration_us': np.float64(1.7554012497147198), 'min_duration_us': np.float64(27.76), 'max_duration_us': np.float64(36.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(33.63)}]","{'M': 6, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.12752024432575929,96.76463627371865 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",182,64,2787.938,43.56153125,6.084797042352934,11.777605632,37.484375,299.6448520216757,matrix_bf16,0.9802229946642199,0.013374295611789131,293.718774184404,4.007538829488711,40.10546112060547,0.53788759861266,2566.74951171875,41.722,36.745,65.016,0.9772918007065443,0.9563290172383069,1.0317361014085953,292.8404570047095,286.55906685440704,309.1544114319991,40.218505859375,38.09619140625,41.10009765625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(2566.749), 'mean_duration_us': np.float64(40.105453125), 'median_duration_us': np.float64(40.218500000000006), 'std_dev_duration_us': np.float64(0.5336704838219316), 'min_duration_us': np.float64(38.096), 'max_duration_us': np.float64(41.1)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(40.11)}]","{'M': 351, 'N': 4096, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.12166682957757975,96.88630310329623 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((66355200, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",24072,6,44.865,7.4775,0.31006047797163727,0.082458112,283.8388671875,0.27705220350179427,vector_bf16,0.7375156783045141,0.026878527093035665,0.20433034379138607,0.007446755158008229,404.0126953125,15.147103670447086,2424.076171875,7.396,7.1,7.871,0.7407227236788883,0.6904848668985126,0.7680803212145345,0.20521886277908663,0.19130035385887603,0.21279834545885273,401.8359375,387.494140625,431.0400390625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(2424.076), 'mean_duration_us': np.float64(404.0126666666667), 'median_duration_us': np.float64(401.836), 'std_dev_duration_us': np.float64(13.827378429124671), 'min_duration_us': np.float64(387.494), 'max_duration_us': np.float64(431.04)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(404.01)}]","{'input_shape': (1, 128, 9, 240, 240), 'output_shape': (1, 128, 11, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 128, 11, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (66355200, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.11490395192053486,97.00120705521677 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23899,1,83.394,83.394,,1019.215872,185.55859375,5238.237584994632,matrix_bf16,0.08146885451308501,,426.7532157169014,,2388.302734375,,2388.302734375,83.394,83.394,83.394,0.08146885451308501,0.08146885451308501,0.08146885451308501,426.7532157169014,426.7532157169014,426.7532157169014,2388.302734375,2388.302734375,2388.302734375,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.9), 'mean_duration_us': np.float64(13.9), 'median_duration_us': np.float64(13.9), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.9), 'max_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(43.864), 'mean_duration_us': np.float64(43.864), 'median_duration_us': np.float64(43.864), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(43.864), 'max_duration_us': np.float64(43.864)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(59.087), 'mean_duration_us': np.float64(59.087), 'median_duration_us': np.float64(59.087), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(59.087), 'max_duration_us': np.float64(59.087)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(70.344), 'mean_duration_us': np.float64(70.344), 'median_duration_us': np.float64(70.344), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(70.344), 'max_duration_us': np.float64(70.344)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.591), 'mean_duration_us': np.float64(129.591), 'median_duration_us': np.float64(129.591), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.591), 'max_duration_us': np.float64(129.591)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2071.517), 'mean_duration_us': np.float64(2071.517), 'median_duration_us': np.float64(2071.517), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2071.517), 'max_duration_us': np.float64(2071.517)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.9)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(43.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(59.09)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(70.34)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(129.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2071.52)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 122, 122), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (53344256, 104188, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x16_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.11320825052706222,97.11441530574383 +triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9,triton,python3,CPU,thread 416 (python3),"((7425, 3072), (6, 3072), (1, 7431, 24, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (22828032, 3072, 128, 1), ())","('', '', '', '22828032')",8864,80,1336.365,16.7045625,1.8153047855384328,0.0,130.623046875,0.0,vector_bfloat16,4.6336591356763535,0.3652614805348405,0.0,0.0,29.719598388671876,2.0641929601593563,2377.56787109375,16.229,14.402,24.276,4.5079384661619555,4.258035417225781,5.85483202638225,0.0,0.0,0.0,30.3837890625,23.39404296875,32.1669921875,"[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(2377.568), 'mean_duration_us': np.float64(29.719600000000003), 'median_duration_us': np.float64(30.384), 'std_dev_duration_us': np.float64(2.0512508964044356), 'min_duration_us': np.float64(23.394), 'max_duration_us': np.float64(32.167)}]","[{'name': 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9', 'stream': 0, 'mean_duration_us': np.float64(29.72)}]","{'fused_ops': '', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_fmha_v3_fwd_permute_transpose_view_9']",0.11269940586753643,97.22711471161136 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 32, 32), (512, 512, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((2621440, 5120, 1024, 32, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23426,10,788.43,78.84299999999999,4.911654665747129,38.2205952,21.13671875,1724.4871557937536,matrix_bf16,0.0954598986082207,0.0077853806680127854,164.6193690432506,13.42578896495304,233.757177734375,21.54917892698669,2337.57177734375,78.126,72.938,86.849,0.09887065632634129,0.08039468346206777,0.09992395842845285,170.50117691967398,138.63959902444037,172.31758286593592,224.166748046875,221.80322265625,275.68310546875,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.857), 'mean_duration_us': np.float64(4.4857), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.17267370963757053), 'min_duration_us': np.float64(4.365), 'max_duration_us': np.float64(4.846)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(51.626000000000005), 'mean_duration_us': np.float64(5.1626), 'median_duration_us': np.float64(5.167), 'std_dev_duration_us': np.float64(0.17233989671576339), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(58.315), 'mean_duration_us': np.float64(5.8315), 'median_duration_us': np.float64(5.8075), 'std_dev_duration_us': np.float64(0.33862139625251086), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.489)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(63.684), 'mean_duration_us': np.float64(6.368399999999999), 'median_duration_us': np.float64(5.7475000000000005), 'std_dev_duration_us': np.float64(1.1478168146529306), 'min_duration_us': np.float64(5.206), 'max_duration_us': np.float64(8.131)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.341), 'mean_duration_us': np.float64(12.834100000000001), 'median_duration_us': np.float64(12.777999999999999), 'std_dev_duration_us': np.float64(0.3268839090564112), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(13.579)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1990.749), 'mean_duration_us': np.float64(199.0749), 'median_duration_us': np.float64(189.5805), 'std_dev_duration_us': np.float64(19.490014086449502), 'min_duration_us': np.float64(188.359), 'max_duration_us': np.float64(238.514)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.16)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.37)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(12.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(199.07)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 5, 32, 32), 'filter_shape': (512, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (2621440, 5120, 1024, 32, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_16x32_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.11080354579243638,97.3379182574038 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120),)","('c10::BFloat16',)","((33177600, 129600, 14400, 120, 1),)","('',)",16127,50,468.35200000000003,9.367040000000001,1.0387629998204202,0.0331776,126.5625,0.25,vector_bf16,2.8518739414365593,0.14464197850722255,0.7129684853591398,0.03616049462680564,46.65314453125,2.3934584387965505,2332.6572265625,9.248999999999999,8.393,16.194,2.8473798554736574,2.5250694389475736,3.17027562025405,0.7118449638684143,0.6312673597368934,0.7925689050635125,46.60791015625,41.86083984375,52.55712890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(2332.658), 'mean_duration_us': np.float64(46.65316), 'median_duration_us': np.float64(46.608000000000004), 'std_dev_duration_us': np.float64(2.369370678977859), 'min_duration_us': np.float64(41.861), 'max_duration_us': np.float64(52.557)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(46.65)}]","{'op_shape': (1, 256, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33177600, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.11057059052756821,97.44848884793137 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((66355200, 129600, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",16142,10,688.514,68.8514,6.9471440686883055,33.9738624,190.09375,170.44221601183625,matrix_bf16,1.0571178530469054,0.027421118046080408,180.17750945898925,4.673716125296095,188.670263671875,4.821601122779749,1886.70263671875,66.6445,65.297,88.392,1.0493593854187786,1.0202672731071643,1.1074634769770841,178.85513904359522,173.89661495273845,188.75852916814745,189.9599609375,179.98583984375,195.3681640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(751.748), 'mean_duration_us': np.float64(75.1748), 'median_duration_us': np.float64(76.4325), 'std_dev_duration_us': np.float64(4.115885877912555), 'min_duration_us': np.float64(68.381), 'max_duration_us': np.float64(81.64)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO16_SVW4_TSGRA0_TSGRB0_TT4_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW4_VWB2_VFLRP1_WSGRA1_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1134.955), 'mean_duration_us': np.float64(113.49549999999999), 'median_duration_us': np.float64(112.84649999999999), 'std_dev_duration_us': np.float64(2.4135129272494074), 'min_duration_us': np.float64(110.323), 'max_duration_us': np.float64(117.854)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(75.17)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(113.5)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 9, 120, 120), 'filter_shape': (256, 512, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (66355200, 129600, 14400, 120, 1), 'weight_stride': (512, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI16x16x16x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO16_SVW4_TSGRA0_TSGRB0_TT4_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW4_VWB2_VFLRP1_WSGRA1_WSGRB0_WG64_4_1_WGM32']]",0.08943183864151963,97.53792068657289 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",15620,100,3241.161,32.41161,4.479189566159928,0.011523072,8.794921875,1.249500333111259,vector_bf16,0.5700504274956146,0.08625859267639838,0.7122781990459862,0.10778014028286816,16.73724609375,3.7796122821716116,1673.724609375,31.337,28.943,61.851,0.6139901470043236,0.3197601143128026,0.6291036876956898,0.7671808932089333,0.3995403693495412,0.786065267337286,15.02001953125,14.6591796875,28.8408203125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(522.8009999999999), 'mean_duration_us': np.float64(5.228009999999999), 'median_duration_us': np.float64(5.0665), 'std_dev_duration_us': np.float64(0.4639569483260273), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(7.089)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1150.926), 'mean_duration_us': np.float64(11.50926), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(3.376708283580327), 'min_duration_us': np.float64(9.733), 'max_duration_us': np.float64(22.393)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.51)}]","{'op_shape': (1, 512, 5, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.07933643928981207,97.61725712586271 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((2304000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",15626,100,776.227,7.76227,1.0823184510087314,0.003670016,11.39453125,0.30716489544052106,vector_bf16,0.7855980880558768,0.06998940715260207,0.24130815457595667,0.021498288929973065,15.3385302734375,1.4763561330175836,1533.85302734375,7.541,6.86,15.193,0.8094464643544652,0.6137338734888387,0.8621206192439137,0.2486335385881388,0.18851750107850512,0.264813189867174,14.760986328125,13.85888671875,19.4677734375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(1533.8520000000003), 'mean_duration_us': np.float64(15.338520000000003), 'median_duration_us': np.float64(14.761), 'std_dev_duration_us': np.float64(1.4689585322942238), 'min_duration_us': np.float64(13.859), 'max_duration_us': np.float64(19.468)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(15.34)}]","{'input_shape': (1, 512, 5, 30, 30), 'output_shape': (1, 512, 7, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 7, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.0727063681215713,97.68996349398428 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",24041,2,16.253999999999998,8.126999999999999,1.0267190462828664,0.164916224,567.677734375,0.27705220350179427,vector_bf16,0.796860237906245,0.10672780783080185,0.22077188479488918,0.02956917433443968,753.759033203125,100.95503002861471,1507.51806640625,8.126999999999999,7.401,8.853,0.796860237906245,0.7213922812479103,0.8723281945645797,0.22077188479488918,0.19986332110891966,0.24168044848085868,753.759033203125,682.373046875,825.14501953125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(1507.518), 'mean_duration_us': np.float64(753.759), 'median_duration_us': np.float64(753.759), 'std_dev_duration_us': np.float64(71.38599999999997), 'min_duration_us': np.float64(682.373), 'max_duration_us': np.float64(825.145)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(753.76)}]","{'input_shape': (1, 256, 9, 240, 240), 'output_shape': (1, 256, 11, 242, 242), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 11, 242, 242), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.07145806119107946,97.76142155517536 +aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 32, 351, 128), (1, 32, 351, 128), (1, 32, 351, 351), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((1437696, 128, 4096, 1), (1437696, 44928, 128, 1), (1437696, 44928, 128, 1), (123552, 0, 352, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '0.088388347648318447')",295,32,1611.075,50.34609375,15.434850184460293,2.018525184,10.96875,175.5,matrix_bf16,0.2561012219125127,0.00462953362664329,44.94576444564598,0.8124831514759007,44.925689697265625,0.8824982727758616,1437.6220703125,44.706999999999994,40.38,97.635,0.2570435215007252,0.2322976229425745,0.26007454112243433,45.11113802337727,40.76823282642182,45.643081966987225,44.74560546875,44.22412109375,49.51220703125,"[{'name': 'attn_fwd', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(1437.6219999999998), 'mean_duration_us': np.float64(44.925687499999995), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(0.8685557494160925), 'min_duration_us': np.float64(44.224), 'max_duration_us': np.float64(49.512)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(44.93)}]","{'B': 1, 'N_Q': 351, 'H_Q': 32, 'N_KV': 351, 'H_KV': 32, 'd_h_qk': 128, 'd_h_v': 128, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.0681449119312598,97.82956646710662 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",15974,60,1904.895,31.74825,2.5145599178600775,0.046083072,35.162109375,1.2498750208298617,vector_bf16,1.5513392651977331,0.11690062109366006,1.9389801964031994,0.14611116622446219,23.897591145833335,1.770591998505488,1433.85546875,30.7805,29.153,39.949,1.521430429800156,1.349647081432759,1.7667303442208704,1.9015978901376553,1.6868901740187319,2.208192125783809,24.234130859375,20.869140625,27.318359375,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(445.928), 'mean_duration_us': np.float64(7.432133333333334), 'median_duration_us': np.float64(7.4704999999999995), 'std_dev_duration_us': np.float64(0.4628981337424275), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.451)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(987.925), 'mean_duration_us': np.float64(16.465416666666666), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(1.3029620650869138), 'min_duration_us': np.float64(14.14), 'max_duration_us': np.float64(18.867)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(7.43)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(16.47)}]","{'op_shape': (1, 512, 5, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (9216000, 18000, 3600, 60, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.06796637075756948,97.89753283786419 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 120, 120), (1, 256, 9, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33177600, 129600, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', '1')",16149,30,268.5,8.95,1.1513915418998963,0.0331776,189.84375,0.16666666666666666,vector_bf16,4.178886400632432,0.11493919079233095,0.696481066772072,0.019156531798721812,47.671142578125,1.3206365016932746,1430.13427734375,8.914,7.692,14.372,4.195325076262957,3.985047982483578,4.355251140928126,0.6992208460438263,0.664174663747263,0.7258751901546876,47.449462890625,45.70703125,49.953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(1430.1350000000002), 'mean_duration_us': np.float64(47.67116666666667), 'median_duration_us': np.float64(47.4495), 'std_dev_duration_us': np.float64(1.2984185016994922), 'min_duration_us': np.float64(45.707), 'max_duration_us': np.float64(49.953)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(47.67)}]","{'shape_in1': (1, 256, 9, 120, 120), 'shape_in2': (1, 256, 9, 120, 120), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (33177600, 129600, 14400, 120, 1), 'stride_input2': (33177600, 129600, 14400, 120, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.06778998207663949,97.96532281994082 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 129600, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",16108,10,350.14,35.013999999999996,1.7298015942747773,0.331779072,253.130859375,1.2499826392907571,vector_bf16,2.004737707052307,0.06301325376758718,2.505887330146943,0.07876547325470686,132.519189453125,4.220332799620465,1325.19189453125,34.667,33.68,39.719,2.0290679428963987,1.9001680712255788,2.0888756664681267,2.536299702561908,2.3751771007665767,2.6110583187220686,130.8125,127.06689453125,139.68603515625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(411.72300000000007), 'mean_duration_us': np.float64(41.17230000000001), 'median_duration_us': np.float64(41.321), 'std_dev_duration_us': np.float64(0.6129716225079271), 'min_duration_us': np.float64(40.298), 'max_duration_us': np.float64(42.142)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(913.469), 'mean_duration_us': np.float64(91.3469), 'median_duration_us': np.float64(90.45400000000001), 'std_dev_duration_us': np.float64(3.6463250389947413), 'min_duration_us': np.float64(86.047), 'max_duration_us': np.float64(97.544)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(41.17)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(91.35)}]","{'op_shape': (1, 512, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.06281559445259594,98.02813841439342 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 7, 122, 122), (256, 512, 3, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((53344256, 104188, 14884, 122, 1), (13824, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23914,1,80.239,80.239,,509.607936,143.65234375,3383.167912984364,matrix_bf16,0.11735168531033857,,397.02045627657606,,1283.5810546875,,1283.5810546875,80.239,80.239,80.239,0.11735168531033857,0.11735168531033857,0.11735168531033857,397.02045627657606,397.02045627657606,397.02045627657606,1283.5810546875,1283.5810546875,1283.5810546875,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.693), 'mean_duration_us': np.float64(9.693), 'median_duration_us': np.float64(9.693), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.693), 'max_duration_us': np.float64(9.693)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.719), 'mean_duration_us': np.float64(26.719), 'median_duration_us': np.float64(26.719), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.719), 'max_duration_us': np.float64(26.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.848), 'mean_duration_us': np.float64(32.848), 'median_duration_us': np.float64(32.848), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.848), 'max_duration_us': np.float64(32.848)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(46.107), 'mean_duration_us': np.float64(46.107), 'median_duration_us': np.float64(46.107), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(46.107), 'max_duration_us': np.float64(46.107)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(135.921), 'mean_duration_us': np.float64(135.921), 'median_duration_us': np.float64(135.921), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(135.921), 'max_duration_us': np.float64(135.921)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1032.293), 'mean_duration_us': np.float64(1032.293), 'median_duration_us': np.float64(1032.293), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1032.293), 'max_duration_us': np.float64(1032.293)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(26.72)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(32.85)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(46.11)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(135.92)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(1032.29)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 7, 122, 122), 'filter_shape': (256, 512, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (53344256, 104188, 14884, 122, 1), 'weight_stride': (13824, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x16_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_SV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_SX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9EEEENSE_IJLi10EEEENSE_IJLi11ELi13ELi15ELi17EEEENSE_IJLi12ELi14ELi16ELi18EEEENSE_IJLi19EEEENSE_IJLi20EEEENSE_IJLi22EEEENSE_IJLi21EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4ELi5EEEES1C_S1D_SI_S1E_S1F_NSE_IJLi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14ELi15EEEENSE_IJLi16ELi17EEEENSE_IJLi18EEEES1I_S1J_S1L_S1K_NSE_IJLi23ELi24EEEENSE_IJLi25EEEEEEENSE_IJLi23ELi25ELi24EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS20_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2I_']]",0.06084319358654515,98.08898160797997 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60),)","('c10::BFloat16',)","((9216000, 18000, 3600, 60, 1),)","('',)",15978,60,565.67,9.427833333333332,1.2140260819618398,0.009216,35.15625,0.25,vector_bf16,1.8904501294617297,0.30838185239712307,0.47261253236543244,0.07709546309928077,20.029386393229167,3.3221468251065898,1201.76318359375,9.203,8.313,17.416,1.9580589718680137,1.3900954134521553,2.384180888018695,0.4895147429670034,0.3475238533630388,0.5960452220046738,18.8271484375,15.4619140625,26.51904296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(1201.764), 'mean_duration_us': np.float64(20.0294), 'median_duration_us': np.float64(18.826999999999998), 'std_dev_duration_us': np.float64(3.2943422874174244), 'min_duration_us': np.float64(15.462), 'max_duration_us': np.float64(26.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(20.03)}]","{'op_shape': (1, 512, 5, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (9216000, 18000, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.056964933969346314,98.14594654194931 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 11, 242, 242), (3, 128, 3, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((82458112, 644204, 58564, 242, 1), (3456, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24164,1,78.086,78.086,,10.7495424,160.262451171875,63.96733873117673,matrix_bf16,0.14172650572859058,,9.065867399126812,,1185.7158203125,,1185.7158203125,78.086,78.086,78.086,0.14172650572859058,0.14172650572859058,0.14172650572859058,9.065867399126812,9.065867399126812,9.065867399126812,1185.7158203125,1185.7158203125,1185.7158203125,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.647), 'mean_duration_us': np.float64(5.647), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.647)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.248), 'mean_duration_us': np.float64(6.248), 'median_duration_us': np.float64(6.248), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.248), 'max_duration_us': np.float64(6.248)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.814), 'mean_duration_us': np.float64(9.814), 'median_duration_us': np.float64(9.814), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.814), 'max_duration_us': np.float64(9.814)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(184.593), 'mean_duration_us': np.float64(184.593), 'median_duration_us': np.float64(184.593), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(184.593), 'max_duration_us': np.float64(184.593)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(974.007), 'mean_duration_us': np.float64(974.007), 'median_duration_us': np.float64(974.007), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(974.007), 'max_duration_us': np.float64(974.007)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(5.65)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(6.25)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.81)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(184.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(974.01)}]","{'convNd': 'conv3d', 'input_shape': (1, 128, 11, 242, 242), 'filter_shape': (3, 128, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (82458112, 644204, 58564, 242, 1), 'weight_stride': (3456, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x32_half'], ['batched_transpose_4x256_half'], ['batched_transpose_256x4_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_16x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2O_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.05620427080194516,98.20215081275126 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((351, 4096), (4096, 1024))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",194,64,2174.061,33.969703125,10.079637492977184,2.944401408,11.427734375,245.7179969236028,matrix_bf16,0.6610638340444953,0.020826275883205406,162.4352811400504,5.117390793399572,18.144737243652344,0.5846290263867382,1161.26318359375,30.811,27.211,73.289,0.6692539394038561,0.6167753073462515,0.6957015649610205,164.4477374235458,151.5527930730604,170.94639499883772,17.90478515625,17.22412109375,19.42822265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(1161.262), 'mean_duration_us': np.float64(18.14471875), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.5800629941208434), 'min_duration_us': np.float64(17.224), 'max_duration_us': np.float64(19.428)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(18.14)}]","{'M': 351, 'N': 1024, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.055045188168131594,98.2571960009194 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 9, 120, 120),)","('c10::BFloat16',)","((66355200, 129600, 14400, 120, 1),)","('',)",16112,10,104.346,10.4346,0.40849376440229207,0.0663552,253.125,0.25,vector_bf16,2.500627576236184,0.08554728700233341,0.625156894059046,0.021386821750583353,106.256689453125,3.7388532278256914,1062.56689453125,10.4455,9.935,11.296,2.5054903080122424,2.317502497921596,2.623021200086858,0.6263725770030606,0.579375624480399,0.6557553000217144,105.9365234375,101.18896484375,114.52880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1062.567), 'mean_duration_us': np.float64(106.2567), 'median_duration_us': np.float64(105.9365), 'std_dev_duration_us': np.float64(3.547052806204047), 'min_duration_us': np.float64(101.189), 'max_duration_us': np.float64(114.529)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(106.26)}]","{'op_shape': (1, 512, 9, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 129600, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.05036687245150918,98.3075628733709 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (6, 3072), (3072, 3072), (), (), (6, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",8861,80,1944.337,24.3042125,2.671565893134728,0.11326464,18.076171875,5.975688816855754,matrix_bf16,1.5882308538959182,0.12805099913234252,9.490773352211102,0.7651929235023447,11.99677734375,0.7928533757608454,959.7421875,23.439999999999998,21.251,35.763,1.577273719881354,1.4383001785912781,2.1315844006369775,9.42529692901548,8.594834292489534,12.73768506507056,12.01708984375,8.89208984375,13.17822265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(959.742), 'mean_duration_us': np.float64(11.996775), 'median_duration_us': np.float64(12.017), 'std_dev_duration_us': np.float64(0.7878753228620631), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(13.178)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.0)}]","{'M': 6, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.04549286505436412,98.35305573842527 +aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 1, 2700, 512), (1, 1, 2700, 512), (1, 1, 2700, 512), (1, 1, 2700, 2700), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', '')","((1382400, 512, 512, 1), (1382400, 512, 512, 1), (1382400, 512, 512, 1), (7300800, 7300800, 2704, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '')",23557,1,41.391,41.391,,14.92992,10.546875,1350.0,matrix_bf16,0.013146792539569399,,17.748169928418687,,841.208984375,,841.208984375,41.391,41.391,41.391,0.013146792539569399,0.013146792539569399,0.013146792539569399,17.748169928418687,17.748169928418687,17.748169928418687,841.208984375,841.208984375,841.208984375,"[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(841.209), 'mean_duration_us': np.float64(841.209), 'median_duration_us': np.float64(841.209), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(841.209), 'max_duration_us': np.float64(841.209)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(841.21)}]","{'B': 1, 'N_Q': 2700, 'H_Q': 1, 'N_KV': 2700, 'H_KV': 1, 'd_h_qk': 512, 'd_h_v': 512, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.03987425717772834,98.392929995603 +triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6,triton,python3,CPU,thread 416 (python3),"((6, 3072), (3072,), (1, 24, 6, 1), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((3072, 1), (1,), (144, 1, 24, 144), (), ())","('', '', '', '144', '128')",8856,160,3118.262,19.489137500000002,2.0953007213882966,5.5296e-05,0.041015625,1.2857142857142858,vector_bfloat16,0.008310775202526745,0.0010242538789658852,0.010685282403248673,0.0013168978443847098,5.227825927734375,0.44083111616836695,836.4521484375,19.259,15.994,30.916,0.008134501662356852,0.007064515880654475,0.014317357607282182,0.01045864499445881,0.009082948989412898,0.018408031209362807,5.287109375,3.00390625,6.087890625,"[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'count': 160, 'total_duration_us': np.float64(836.449), 'mean_duration_us': np.float64(5.2278062499999995), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.43945555089330424), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]","{'fused_ops': 'aten._to_copy, aten.addmm, aten.mean, aten.pow, aten.transpose, aten.view', 'xnumel': 144, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_addmm_mean_pow_transpose_view_6']",0.03964877777481271,98.43257877337781 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30),)","('c10::BFloat16',)","((2304000, 4500, 900, 30, 1),)","('',)",15624,100,969.5,9.695,1.5266958247844078,0.002304,8.7890625,0.25,vector_bf16,1.223421991947327,0.16275653924656786,0.30585549798683176,0.040689134811641964,7.666044921875,1.0174137084075794,766.6044921875,9.394,8.232,17.876,1.2078905632524068,0.9353470439565885,1.565168587776764,0.3019726408131017,0.23383676098914713,0.391292146944191,7.6298828125,5.88818359375,9.85302734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 100, 'total_duration_us': np.float64(766.604), 'mean_duration_us': np.float64(7.666040000000001), 'median_duration_us': np.float64(7.630000000000001), 'std_dev_duration_us': np.float64(1.012318496521722), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(9.853)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.67)}]","{'op_shape': (1, 512, 5, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.03633791987825404,98.46891669325606 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 8, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (58982400, 115200, 14400, 120, 1)), ())","('', '2')",16091,10,259.815,25.9815,2.671228025958599,,,,,,,,,72.501708984375,2.7954535278924006,725.01708984375,25.213,24.486,33.389,,,,,,,72.02490234375,68.25927734375,76.7919921875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.589), 'mean_duration_us': np.float64(13.4589), 'median_duration_us': np.float64(13.018), 'std_dev_duration_us': np.float64(1.186606796710688), 'min_duration_us': np.float64(12.177), 'max_duration_us': np.float64(15.983)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(590.428), 'mean_duration_us': np.float64(59.0428), 'median_duration_us': np.float64(58.646), 'std_dev_duration_us': np.float64(2.601411878192303), 'min_duration_us': np.float64(55.481), 'max_duration_us': np.float64(63.734)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(59.04)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.034366629976208596,98.50328332323227 +aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((14745600, 57600, 14400, 120, 1), (), ())","('', '', '[2., 2., 2.]')",24031,1,8.723,8.723,,,,,,,,,,686.5791015625,,686.5791015625,8.723,8.723,8.723,,,,,,,686.5791015625,686.5791015625,686.5791015625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(686.579), 'mean_duration_us': np.float64(686.579), 'median_duration_us': np.float64(686.579), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(686.579), 'max_duration_us': np.float64(686.579)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(686.58)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.0325446258623797,98.53582794909465 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",24065,6,191.335,31.889166666666668,3.5089671652306285,0.331776768,253.12646484375,1.2499956597473394,vector_bf16,2.334513274376343,0.05817819152488088,2.9181314605929782,0.07272248689805057,113.753662109375,2.8280491391961675,682.52197265625,30.556,29.794,38.938,2.329496848667892,2.269116222910527,2.4093795725759266,2.91186095022997,2.836385430100435,3.0117140084038083,113.967041015625,110.162109375,116.9716796875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(206.863), 'mean_duration_us': np.float64(34.47716666666667), 'median_duration_us': np.float64(34.67100000000001), 'std_dev_duration_us': np.float64(0.5376580129495795), 'min_duration_us': np.float64(33.73), 'max_duration_us': np.float64(35.131)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(475.659), 'mean_duration_us': np.float64(79.2765), 'median_duration_us': np.float64(79.3965), 'std_dev_duration_us': np.float64(2.7204514178104104), 'min_duration_us': np.float64(75.271), 'max_duration_us': np.float64(82.281)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(34.48)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(79.28)}]","{'op_shape': (1, 128, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 518400, 57600, 240, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.032352313364039945,98.5681802624587 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), ())","('c10::BFloat16', 'ScalarList')","((132710400, 518400, 57600, 240, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",24082,1,7.611,7.611,,0.1327104,506.25,0.25,vector_bf16,0.790228802449268,,0.197557200612317,,671.7568359375,,671.7568359375,7.611,7.611,7.611,0.790228802449268,0.790228802449268,0.790228802449268,0.197557200612317,0.197557200612317,0.197557200612317,671.7568359375,671.7568359375,671.7568359375,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(671.757), 'mean_duration_us': np.float64(671.757), 'median_duration_us': np.float64(671.757), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(671.757), 'max_duration_us': np.float64(671.757)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(671.76)}]","{'input_shape': (1, 256, 9, 240, 240), 'output_shape': (1, 256, 9, 240, 240), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 256, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.03184203370934062,98.60002229616804 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 4, 351, 128), (1, 8, 4, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 179712, 44928, 128, 1), (359424, 44928, 0, 128, 1), ())","('', '', 'False')",259,64,508.173,7.940203125,1.715991269631171,0.001437696,5.484375,0.25,vector_bf16,0.5987374395746305,0.10328030218298506,0.14968435989365764,0.025820075545746262,9.871139526367188,1.5825210598707937,631.7529296875,7.912000000000001,5.668,12.579,0.5511301415714474,0.4528803211566561,0.7977245754538066,0.13778253539286187,0.11322008028916404,0.19943114386345168,10.4345703125,7.208984375,12.6982421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(631.752), 'mean_duration_us': np.float64(9.871125), 'median_duration_us': np.float64(10.4345), 'std_dev_duration_us': np.float64(1.5701190788838277), 'min_duration_us': np.float64(7.209), 'max_duration_us': np.float64(12.698)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}]","{'op_shape': (1, 8, 4, 351, 128), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1437696, 179712, 44928, 128, 1), 'stride_output': (359424, 44928, 0, 128, 1)}",True,transformers/integrations/sdpa_attention.py(16): repeat_kv,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'transformers/integrations/sdpa_attention.py(16): repeat_kv', 'aten::reshape', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.02994580331290545,98.62996809948093 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((18432000, 72000, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23928,5,38.018,7.6036,0.4024211724052303,0.026672128,86.029296875,0.29567280405021906,vector_bf16,0.7687604760681077,0.04037298663064846,0.22730156560203874,0.011937194164965838,117.5978515625,6.0791423956177555,587.9892578125,7.581,7.211,8.223,0.7449125574591449,0.7301771757043032,0.8141230804972525,0.2202503846361653,0.21589353299396083,0.24071405405262486,121.09912109375,110.80419921875,123.54296875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(587.989), 'mean_duration_us': np.float64(117.5978), 'median_duration_us': np.float64(121.099), 'std_dev_duration_us': np.float64(5.437447540896374), 'min_duration_us': np.float64(110.804), 'max_duration_us': np.float64(123.543)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(117.6)}]","{'input_shape': (1, 256, 5, 120, 120), 'output_shape': (1, 256, 7, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 256, 7, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (18432000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.027871355773948177,98.65783945525489 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240),)","('c10::BFloat16',)","((66355200, 518400, 57600, 240, 1),)","('',)",24069,6,55.162,9.193666666666667,0.34701047054327727,0.0663552,253.125,0.25,vector_bf16,2.7463134384310677,0.09326596692744069,0.6865783596077669,0.02331649173186017,96.74283854166667,3.415178432280567,580.45703125,9.123000000000001,8.784,9.804,2.783530407769806,2.5731073745000117,2.813483009844415,0.6958826019424516,0.6432768436250029,0.7033707524611037,95.361083984375,94.3388671875,103.15185546875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(580.457), 'mean_duration_us': np.float64(96.74283333333334), 'median_duration_us': np.float64(95.361), 'std_dev_duration_us': np.float64(3.117643256086595), 'min_duration_us': np.float64(94.339), 'max_duration_us': np.float64(103.152)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(96.74)}]","{'op_shape': (1, 128, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (66355200, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.027514319716734414,98.68535377497162 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 7, 32, 32), (512, 16, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((114688, 7168, 1024, 32, 1), (432, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15613,10,806.038,80.6038,12.65775993698025,1.990656,5.03515625,377.03646237393326,matrix_bf16,0.09447383996775557,0.0030013311841405417,35.62008240832367,1.1316112920809172,55.936865234375,1.788120279677389,559.36865234375,76.404,72.698,115.271,0.0947603648473376,0.08972852790294339,0.09985884737998929,35.7281127353034,33.83092673454654,37.65042655288968,55.716796875,52.8720703125,58.84130859375,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(46.74), 'mean_duration_us': np.float64(4.674), 'median_duration_us': np.float64(4.666), 'std_dev_duration_us': np.float64(0.153935051239151), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(4.926)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(47.017999999999994), 'mean_duration_us': np.float64(4.7017999999999995), 'median_duration_us': np.float64(4.666), 'std_dev_duration_us': np.float64(0.30422156399571676), 'min_duration_us': np.float64(4.365), 'max_duration_us': np.float64(5.527)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(69.654), 'mean_duration_us': np.float64(6.9654), 'median_duration_us': np.float64(6.8294999999999995), 'std_dev_duration_us': np.float64(0.5495414816007977), 'min_duration_us': np.float64(6.368), 'max_duration_us': np.float64(8.491)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(81.269), 'mean_duration_us': np.float64(8.126900000000001), 'median_duration_us': np.float64(8.151), 'std_dev_duration_us': np.float64(0.3319751346110128), 'min_duration_us': np.float64(7.73), 'max_duration_us': np.float64(8.932)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(138.397), 'mean_duration_us': np.float64(13.839699999999999), 'median_duration_us': np.float64(13.819500000000001), 'std_dev_duration_us': np.float64(0.46108199921489024), 'min_duration_us': np.float64(13.259), 'max_duration_us': np.float64(14.661)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(176.29100000000003), 'mean_duration_us': np.float64(17.6291), 'median_duration_us': np.float64(17.625), 'std_dev_duration_us': np.float64(1.221462357176839), 'min_duration_us': np.float64(15.021), 'max_duration_us': np.float64(19.387)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.67)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.7)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.97)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.13)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.84)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(17.63)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 7, 32, 32), 'filter_shape': (512, 16, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (114688, 7168, 1024, 32, 1), 'weight_stride': (432, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.026514706707852977,98.71186848167947 +aten::pow,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), ())","('float', 'Scalar')","((1437696, 4096, 1), ())","('', '2')",163,65,717.817,11.043338461538461,2.022270995045878,0.001437696,10.96875,0.125,vector_fp32,1.6925581091770174,0.7261904311245445,0.2115697636471272,0.09077380389056806,8.57967998798077,4.26215138489593,557.67919921875,10.536,9.705,23.996,2.26101087195239,0.7419431543404309,2.587631688893771,0.28262635899404875,0.09274289429255388,0.3234539611117214,5.0869140625,4.44482421875,15.501953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(557.6830000000001), 'mean_duration_us': np.float64(8.579738461538463), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(4.22916112531851), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(15.502)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(8.58)}]","{'op_shape': (1, 351, 4096), 'dtype_in_out': ('float', None), 'stride_input': (1437696, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::pow', 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)']",0.02643462471913525,98.7383031063986 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",8906,76,1720.263,22.63503947368421,1.5723738015352409,3.6864e-05,0.181640625,0.1935483870967742,vector_bfloat16,0.02670014917914858,0.0014673615389841225,0.005167770808867468,0.00028400545915821713,7.155408357319079,0.40602366553147473,543.81103515625,22.418,19.87,28.913,0.02679259327602768,0.023081081183431957,0.029904191352345906,0.005185663214715034,0.004467306035502959,0.005787908003679853,7.10888671875,6.369140625,8.251953125,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(543.8090000000001), 'mean_duration_us': np.float64(7.155381578947369), 'median_duration_us': np.float64(7.109), 'std_dev_duration_us': np.float64(0.40333442331282093), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(8.252)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.16)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_17']",0.02577725805914658,98.76408036445775 +aten::mean,reduce,python3,CPU,thread 416 (python3),"((1, 351, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1437696, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",166,65,777.96,11.968615384615385,1.458472356743389,0.001437696,5.484378814697266,0.24999982611078692,vector_fp32,0.6919169018549214,0.047366540534525166,0.17297910514684478,0.011841626897100832,8.351059194711539,0.5903942556171845,542.81884765625,11.608,10.866,18.918,0.7072792351669469,0.5765709024330542,0.784546617639222,0.1768196858035071,0.14414262534880307,0.19613651798561155,8.130859375,7.330078125,9.97412109375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(542.82), 'mean_duration_us': np.float64(8.351076923076924), 'median_duration_us': np.float64(8.131), 'std_dev_duration_us': np.float64(0.5858520765699322), 'min_duration_us': np.float64(7.33), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::mean', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)']",0.025730227249587505,98.78981059170734 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 3072), (3072,), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (0, 1, 7488), (1,), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",8871,4,130.372,32.593,2.9724337951696547,0.0456192,130.59375,0.3331389088298636,vector_bfloat16,1.0194455802710278,0.023332354575925914,0.3396169882229173,0.007772915143855435,134.3785400390625,3.0942233298319066,537.51416015625,31.421,30.595,36.935,1.021326341240276,0.9891192300578768,1.0460104085456823,0.3402435428799825,0.32951410100411593,0.3484667661275884,134.078125,130.9140625,138.44384765625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(537.5139999999999), 'mean_duration_us': np.float64(134.37849999999997), 'median_duration_us': np.float64(134.07799999999997), 'std_dev_duration_us': np.float64(2.6797598306564714), 'min_duration_us': np.float64(130.914), 'max_duration_us': np.float64(138.444)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(134.38)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_10']",0.025478779063047224,98.81528937077039 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (128, 256, 1, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((132710400, 518400, 57600, 240, 1), (256, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",24084,1,66.258,66.258,,33.9738624,379.75,85.31928900592494,matrix_bf16,0.7448041472389053,,63.54616029108764,,534.6328125,,534.6328125,66.258,66.258,66.258,0.7448041472389053,0.7448041472389053,0.7448041472389053,63.54616029108764,63.54616029108764,63.54616029108764,534.6328125,534.6328125,534.6328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(116.853), 'mean_duration_us': np.float64(116.853), 'median_duration_us': np.float64(116.853), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(116.853), 'max_duration_us': np.float64(116.853)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(417.78), 'mean_duration_us': np.float64(417.78), 'median_duration_us': np.float64(417.78), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(417.78), 'max_duration_us': np.float64(417.78)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(116.85)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(417.78)}]","{'convNd': 'conv3d', 'input_shape': (1, 256, 9, 240, 240), 'filter_shape': (128, 256, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (132710400, 518400, 57600, 240, 1), 'weight_stride': (256, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.025342199925641653,98.84063157069603 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 18432), (18432,), (6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '6', '3072')",8883,76,1761.41,23.176447368421055,2.177326981383285,3.6864e-05,0.251953125,0.13953488372093023,vector_bfloat16,0.03777591634349677,0.001579996363437218,0.005271058094441411,0.0002204646088517043,7.006386204769737,0.30879622514314475,532.4853515625,22.6735,20.17,35.663,0.0381273494468325,0.03265330211225105,0.04046557594794705,0.005320095271651046,0.004556274713337356,0.005646359434597263,6.92919921875,6.52880859375,8.0908203125,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(532.4809999999999), 'mean_duration_us': np.float64(7.006328947368419), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.3067740634476049), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(8.091)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.01)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_15']",0.025240407848653057,98.86587197854469 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (256, 3072), (3072, 3072), (), (), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (3072, 1), (1, 3072), (), (), (3072, 1))","('', '', '', '1', '1', '')",8725,24,668.274,27.84475,7.524095139876493,4.83262464,21.005859375,219.40306834030685,matrix_bf16,1.0173253780029214,0.0181598812824082,223.20430943430344,3.9843336740560575,21.65789794921875,0.39598337966075176,519.78955078125,25.732999999999997,19.929,44.266,1.022039095161793,0.9629779591836735,1.0434098841163,224.23851344224823,211.28031898898473,228.9273301117202,21.55126953125,21.10986328125,22.873046875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(519.79), 'mean_duration_us': np.float64(21.657916666666665), 'median_duration_us': np.float64(21.551499999999997), 'std_dev_duration_us': np.float64(0.3876544763775542), 'min_duration_us': np.float64(21.11), 'max_duration_us': np.float64(22.873)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.66)}]","{'M': 256, 'N': 3072, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.02463861253401446,98.89051059107871 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 12288), (12288, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((12288, 1), (1, 12288), (3072, 1))","('', '', '')",8770,8,244.043,30.505375,2.7774034604541793,19.327352832,79.5,231.8490566037736,matrix_bf16,1.3119716879275822,0.01678364748497695,304.17939813687036,3.8912728357622064,63.54852294921875,0.8220496203003191,508.38818359375,30.12,27.04,35.613,1.3125027304351495,1.2774606418245487,1.3331012916464946,304.30251984126636,296.1780446554727,309.0782768255118,63.513671875,62.5322265625,65.255859375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(508.38800000000003), 'mean_duration_us': np.float64(63.548500000000004), 'median_duration_us': np.float64(63.5135), 'std_dev_duration_us': np.float64(0.7690328341494929), 'min_duration_us': np.float64(62.532), 'max_duration_us': np.float64(65.256)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(63.55)}]","{'M': 256, 'N': 3072, 'K': 12288, 'bias': False, 'stride_A': (12288, 1), 'stride_B': (1, 12288), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.02409817483558704,98.9146087659143 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((36864000, 72000, 14400, 120, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23897,2,14.771999999999998,7.385999999999999,0.14849242404917465,0.053344256,172.05859375,0.29567280405021906,vector_bf16,0.7802294466673749,0.10494345073787381,0.2306926282986936,0.031028924346373176,233.345947265625,31.385804555762075,466.69189453125,7.385999999999999,7.281,7.491,0.7802294466673749,0.706023221009508,0.854435672325242,0.2306926282986936,0.20875186548044877,0.25263339111693844,233.345947265625,211.15283203125,255.5390625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(466.692), 'mean_duration_us': np.float64(233.346), 'median_duration_us': np.float64(233.346), 'std_dev_duration_us': np.float64(22.192999999999998), 'min_duration_us': np.float64(211.153), 'max_duration_us': np.float64(255.539)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(233.35)}]","{'input_shape': (1, 512, 5, 120, 120), 'output_shape': (1, 512, 7, 122, 122), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 7, 122, 122), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.022121723579933483,98.93673048949422 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 12288), (256, 12288))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (12288, 1))","('', '', '')",8768,8,306.316,38.2895,5.666549769102383,19.327352832,79.5,231.8490566037736,matrix_bf16,1.431574856201874,0.013719983350255592,331.9092798680873,3.1809651963762526,58.2354736328125,0.5537596988904987,465.8837890625,38.262,31.567,45.708,1.4258211264016567,1.4195022076477288,1.4542159285860305,330.57528304195387,329.1102476900998,337.15859114085174,58.4658203125,57.32421875,58.72607421875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(465.884), 'mean_duration_us': np.float64(58.2355), 'median_duration_us': np.float64(58.465999999999994), 'std_dev_duration_us': np.float64(0.518025819819823), 'min_duration_us': np.float64(57.324), 'max_duration_us': np.float64(58.726)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(58.24)}]","{'M': 256, 'N': 12288, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.02208341846683295,98.95881390796106 +triton_poi_fused_addmm_gelu_view_14,triton,python3,CPU,thread 416 (python3),"((1, 6, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((73728, 12288, 1), (1,), ())","('', '', '73728')",8881,80,1636.46,20.455750000000002,1.8270902335459485,0.000589824,0.3046875,1.8461538461538463,vector_bfloat16,0.05662598419539163,0.0014636801071524757,0.10454027851456915,0.0027021786593584176,5.645831298828125,0.1473221720033376,451.66650390625,20.095,18.287,29.033,0.056576863294422824,0.05247926082771896,0.05997354940421632,0.10444959377431906,0.09688478922040424,0.11072039890009167,5.64697265625,5.3271484375,6.087890625,"[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'count': 80, 'total_duration_us': np.float64(451.668), 'mean_duration_us': np.float64(5.64585), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(0.1464002305326054), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_14', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 73728, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_14']",0.021409503072181514,98.98022341103324 +aten::cat,other,python3,CPU,thread 416 (python3),"(((0,), (1, 8, 351, 128)), ())","('TensorList', 'Scalar')","(((1,), (359424, 128, 1024, 1)), ())","('', '-2')",249,64,634.271,9.910484375,2.934297985280066,,,,,,,,,7.05194091796875,0.5375223212185637,451.32421875,10.065,6.76,20.49,,,,,,,6.84912109375,6.12890625,8.01123046875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(451.324), 'mean_duration_us': np.float64(7.0519375), 'median_duration_us': np.float64(6.849), 'std_dev_duration_us': np.float64(0.5332750191915518), 'min_duration_us': np.float64(6.129), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/cache_utils.py(910): update', 'transformers/cache_utils.py(102): update', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.021393278368686968,99.00161668940193 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4096,), (1, 351, 4096))","('c10::BFloat16', 'c10::BFloat16')","((1,), (1437696, 4096, 1))","('', '')",174,65,533.169,8.2026,1.34126374410479,0.001437696,5.4921875,0.2496443812233286,vector_bf16,0.9081972025444593,0.21461262434690526,0.22672632865796963,0.053576835807797846,6.7468900240384615,1.7591905227172244,438.5478515625,7.781,7.07,13.56,1.0496024604431786,0.5868144110652271,1.2083170625960453,0.26202735676782063,0.14649492054331062,0.3016495654133798,5.48681640625,4.76611328125,9.81396484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(438.54699999999997), 'mean_duration_us': np.float64(6.746876923076923), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(1.7456149589334042), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(9.814)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.75)}]","{'shape_in1': (4096,), 'shape_in2': (1, 351, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1,), 'stride_input2': (1437696, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.020787664115280043,99.0224043535172 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 1))","('float', 'float')","((1437696, 4096, 1), (351, 1, 1))","('', '')",169,65,595.232,9.157415384615383,2.217930855072948,0.001437696,10.970088958740234,0.1249847430733553,vector_fp32,1.7525208435236848,0.25176938016329525,0.21903836735850768,0.03146733129344737,6.6999098557692305,0.9702103970057914,435.494140625,8.532,7.602,21.913,1.719693894152858,1.2994697256329637,2.1597072475247527,0.21493549952551283,0.1624138897898395,0.2699304554455446,6.68896484375,5.326171875,8.85205078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(435.495), 'mean_duration_us': np.float64(6.699923076923077), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.9627103295894487), 'min_duration_us': np.float64(5.326), 'max_duration_us': np.float64(8.852)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.7)}]","{'shape_in1': (1, 351, 4096), 'shape_in2': (1, 351, 1), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (1437696, 4096, 1), 'stride_input2': (351, 1, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.020642914763418584,99.04304726828062 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((2937600, 979200, 240, 1), ())","('', '')",24177,76,494.229,6.5030131578947366,1.4590684104904839,0.0001728,0.6591873168945312,0.2499971065149709,vector_bf16,0.12640171501154668,0.006092935769228045,0.031600063011416636,0.0015232163124885847,5.4808349609375,0.26325786271629587,416.54345703125,6.269,5.599,18.467,0.12686807528230865,0.10992343407361391,0.14262911677581863,0.031716651729700666,0.02748054045659264,0.03565686649874056,5.4482421875,4.84619140625,6.2880859375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 76, 'total_duration_us': np.float64(416.541), 'mean_duration_us': np.float64(5.480802631578947), 'median_duration_us': np.float64(5.448), 'std_dev_duration_us': np.float64(0.26152769903300077), 'min_duration_us': np.float64(4.846), 'max_duration_us': np.float64(6.288)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.48)}]","{'shape_in1': (1, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2937600, 979200, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})']",0.019744630929856854,99.06279189921047 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 60, 60), (1, 512, 5, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((9216000, 18000, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', '1')",16005,30,261.576,8.7192,1.3822386240418487,0.009216,52.734375,0.16666666666666666,vector_bf16,4.067775731673674,0.11750178652520014,0.6779626219456122,0.01958363108753333,13.604671223958333,0.3944050019152468,408.14013671875,8.376999999999999,7.922,15.823,4.066007524698881,3.771604875774329,4.354618472660155,0.6776679207831469,0.6286008126290548,0.7257697454433591,13.599609375,12.6982421875,14.6611328125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(408.1389999999999), 'mean_duration_us': np.float64(13.60463333333333), 'median_duration_us': np.float64(13.599499999999999), 'std_dev_duration_us': np.float64(0.387789761196565), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(13.6)}]","{'shape_in1': (1, 512, 5, 60, 60), 'shape_in2': (1, 512, 5, 60, 60), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (9216000, 18000, 3600, 60, 1), 'stride_input2': (9216000, 18000, 3600, 60, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.019346304043778233,99.08213820325425 +aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((1843200, 3600, 900, 30, 1), (), ())","('', '', '[1., 2., 2.]')",15955,10,99.345,9.9345,2.0011575122635614,,,,,,,,,40.4791015625,1.1539596188284338,404.791015625,9.2985,9.013,15.593,,,,,,,40.55908203125,38.73681640625,42.98291015625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(404.791), 'mean_duration_us': np.float64(40.4791), 'median_duration_us': np.float64(40.559), 'std_dev_duration_us': np.float64(1.0947686011208024), 'min_duration_us': np.float64(38.737), 'max_duration_us': np.float64(42.983)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(40.48)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.019187551916432895,99.10132575517068 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 14336),)","('c10::BFloat16',)","((5031936, 14336, 1),)","('',)",358,32,399.31,12.4784375,1.9920329207264778,0.005031936,19.1953125,0.25,vector_bf16,1.6580723883371564,0.05299788777482993,0.4145180970842891,0.013249471943707482,12.150711059570312,0.37123387869406144,388.82275390625,11.777000000000001,11.106,18.848,1.6475467510791366,1.5509093537002898,1.8680210138215436,0.41188668776978415,0.38772733842507245,0.4670052534553859,12.216796875,10.77490234375,12.97802734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(388.824), 'mean_duration_us': np.float64(12.15075), 'median_duration_us': np.float64(12.217), 'std_dev_duration_us': np.float64(0.3653646295141334), 'min_duration_us': np.float64(10.775), 'max_duration_us': np.float64(12.978)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(12.15)}]","{'op_shape': (1, 351, 14336), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (5031936, 14336, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'nn.Module: SiLUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(102): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.018430638252549737,99.11975639342323 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((4500, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 4500), (1, 512))","('', '')",15714,30,1153.906,38.46353333333333,9.789135838487882,2.359296,9.2890625,242.22035323801515,matrix_bf16,0.778965648179547,0.10807222918021557,188.68133446232932,26.17729352725155,12.748746744791667,1.8363837130001566,382.46240234375,34.1005,27.081,59.569,0.8009088769080001,0.5902156880288774,0.9499099916190475,193.99643107611774,142.96225244097283,230.08753371428568,12.177490234375,10.25390625,16.5029296875,"[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB2_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB0_LBSPPM0_LPA16_LPB0_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(382.4630000000001), 'mean_duration_us': np.float64(12.74876666666667), 'median_duration_us': np.float64(12.1775), 'std_dev_duration_us': np.float64(1.8054999618449796), 'min_duration_us': np.float64(10.254), 'max_duration_us': np.float64(16.503)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.75)}]","{'M': 4500, 'N': 512, 'K': 512, 'bias': False, 'stride_A': (1, 4500), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, True)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB2_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB0_LBSPPM0_LPA16_LPB0_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.018129150395602606,99.13788554381884 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 8, 120, 120), (1, 256, 8, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((29491200, 115200, 14400, 120, 1), (33177600, 129600, 14400, 120, 1), ())","('', '', 'False')",16232,10,59.369,5.9369,0.2615120349896813,0.0294912,112.5,0.25,vector_bf16,3.0965166336703627,0.12042900229641432,0.7741291584175907,0.03010725057410358,38.147509765625,1.4737842299728579,381.47509765625,5.9190000000000005,5.468,6.369,3.095178750724677,2.915663895727733,3.3162470027865094,0.7737946876811692,0.7289159739319333,0.8290617506966274,38.115478515625,35.57177734375,40.458984375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(381.476), 'mean_duration_us': np.float64(38.1476), 'median_duration_us': np.float64(38.1155), 'std_dev_duration_us': np.float64(1.3980922859382354), 'min_duration_us': np.float64(35.572), 'max_duration_us': np.float64(40.459)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(38.15)}]","{'op_shape': (1, 256, 8, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (29491200, 115200, 14400, 120, 1), 'stride_output': (33177600, 129600, 14400, 120, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.01808235103687797,99.15596789485572 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 768), (768, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",7316,48,1524.324,31.75675,6.495863847684891,0.090892032,1.35205078125,64.11105092091007,matrix_bf16,0.18091577072173395,0.004553766926750253,11.59870018913678,0.29194678332284263,7.841481526692708,0.20665183970822962,376.39111328125,31.316499999999998,23.064,56.664,0.1806000462772905,0.16088585050146836,0.18927685423728813,11.57845876320209,10.314560953953565,12.134738040156455,7.85009765625,7.490234375,8.81201171875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(376.39), 'mean_duration_us': np.float64(7.841458333333333), 'median_duration_us': np.float64(7.85), 'std_dev_duration_us': np.float64(0.20446117788932164), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(8.812)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]","{'M': 77, 'N': 768, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(300): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.017841364428054576,99.17380925928377 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 14336), (1, 351, 14336))","('c10::BFloat16', 'c10::BFloat16')","((5031936, 14336, 1), (5031936, 14336, 1))","('', '')",368,32,353.325,11.04140625,2.026749023394521,0.005031936,28.79296875,0.16666666666666666,vector_bf16,2.5968684407497764,0.061371197065949575,0.4328114067916294,0.010228532844324937,11.632553100585938,0.2792152437804258,372.24169921875,10.550999999999998,9.625,20.23,2.608082907373039,2.4552267141041932,2.69187764771441,0.4346804845621731,0.40920445235069886,0.44864627461906836,11.576171875,11.2158203125,12.296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(372.242), 'mean_duration_us': np.float64(11.6325625), 'median_duration_us': np.float64(11.576), 'std_dev_duration_us': np.float64(0.27485666008621656), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(12.297)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(11.63)}]","{'shape_in1': (1, 351, 14336), 'shape_in2': (1, 351, 14336), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (5031936, 14336, 1), 'stride_input2': (5031936, 14336, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(182): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(182): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.01764467750894382,99.19145393679271 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 32, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 128, 4096, 1), (1437696, 44928, 128, 1), ())","('', '', '1')",223,32,273.384,8.54325,0.8745665470170297,0.001437696,8.2265625,0.16666666666666666,vector_bf16,0.7618370149119468,0.08368992238991606,0.12697283581865781,0.013948320398319348,11.448394775390625,1.1922998197142467,366.3486328125,8.363,7.541,12.479,0.7516866915936734,0.6188534153501244,1.0205897428076256,0.12528111526561225,0.1031422358916874,0.17009829046793762,11.47607421875,8.4521484375,13.93896484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(366.34899999999993), 'mean_duration_us': np.float64(11.448406249999998), 'median_duration_us': np.float64(11.475999999999999), 'std_dev_duration_us': np.float64(1.1735182641147677), 'min_duration_us': np.float64(8.452), 'max_duration_us': np.float64(13.939)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]","{'shape_in1': (1, 32, 351, 128), 'shape_in2': (1, 32, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 128, 4096, 1), 'stride_input2': (1437696, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.017365339496853007,99.20881927628956 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",162,65,590.034,9.077446153846154,0.9947568803288257,0.001437696,8.2265625,0.16666666666666666,vector_fp32,1.7237160382398424,0.2614321775705723,0.2872860063733071,0.04357202959509538,5.313363882211538,2.1009148460708174,345.36865234375,8.883,8.062,15.263,1.7371099752212389,0.5836083528129232,1.9063783800582714,0.2895183292035398,0.09726805880215389,0.31772973000971194,4.9658203125,4.52490234375,14.78076171875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(345.373), 'mean_duration_us': np.float64(5.313430769230769), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(2.0846667541783104), 'min_duration_us': np.float64(4.525), 'max_duration_us': np.float64(14.781)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(5.31)}]","{'op_shape': (1, 351, 4096), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (1437696, 4096, 1), 'stride_output': (1437696, 4096, 1)}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.01637086469649623,99.22519014098606 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', '1')",15651,50,427.149,8.54298,0.4447647160612689,0.002304,13.18359375,0.16666666666666666,vector_bf16,2.049290649189194,0.15217728677898917,0.3415484415315323,0.02536288112983155,6.78431640625,0.532550223901356,339.2158203125,8.452,8.042,10.966,2.0729101720413494,1.659333724065174,2.3318962194217936,0.34548502867355824,0.276555620677529,0.3886493699036323,6.6689453125,5.92822265625,8.3310546875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(339.217), 'mean_duration_us': np.float64(6.784339999999999), 'median_duration_us': np.float64(6.6690000000000005), 'std_dev_duration_us': np.float64(0.5272197116952286), 'min_duration_us': np.float64(5.928), 'max_duration_us': np.float64(8.331)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.78)}]","{'shape_in1': (1, 512, 5, 30, 30), 'shape_in2': (1, 512, 5, 30, 30), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2304000, 4500, 900, 30, 1), 'stride_input2': (2304000, 4500, 900, 30, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.01607921350001298,99.24126935448606 +aten::where,elementwise,python3,CPU,thread 416 (python3),"((4500, 4500), (), ())","('bool', 'float', 'float')","((4500, 1), (), ())","('', '', '')",15687,10,138.944,13.8944,1.9382917565045084,,,,,,,,,33.732958984375,2.197378221579753,337.32958984375,13.355,12.829,19.328,,,,,,,34.050048828125,29.8828125,37.1337890625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(337.33), 'mean_duration_us': np.float64(33.733), 'median_duration_us': np.float64(34.05), 'std_dev_duration_us': np.float64(2.0846242826946058), 'min_duration_us': np.float64(29.883), 'max_duration_us': np.float64(37.134)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(33.73)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::where', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})']",0.015989804042667154,99.25725915852873 +aten::_scaled_dot_product_efficient_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 24, 256, 128), (1, 24, 256, 128), (1, 24, 256, 128), (1, 24, 256, 256), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', '')","((786432, 128, 3072, 1), (786432, 128, 3072, 1), (786432, 128, 3072, 1), (1572864, 65536, 256, 1), (), (), (), ())","('', '', '', '', 'False', '0.', 'False', '')",8729,8,500.084,62.5105,15.14021240651153,0.805306368,6.0,128.0,matrix_bf16,0.15138071586861124,0.01605549020256255,19.37673163118224,2.0551027459280062,41.996337890625,4.696939761735354,335.970703125,56.774,47.451,82.834,0.16225248813796841,0.13066129098597548,0.16377169515481216,20.768318481659957,16.72464524620486,20.962776979815956,38.77587890625,38.416015625,48.15087890625,"[{'name': 'attn_fwd', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(335.971), 'mean_duration_us': np.float64(41.996375), 'median_duration_us': np.float64(38.775999999999996), 'std_dev_duration_us': np.float64(4.393628197102597), 'min_duration_us': np.float64(38.416), 'max_duration_us': np.float64(48.151)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(42.0)}]","{'B': 1, 'N_Q': 256, 'H_Q': 24, 'N_KV': 256, 'H_KV': 24, 'd_h_qk': 128, 'd_h_v': 128, 'dropout': 0.0, 'causal': False, 'flash_impl': False, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_ops.py(840): __call__', 'aten::_scaled_dot_product_efficient_attention', 'aten::_efficient_attention_forward', 'attn_fwd']",0.01592539127544131,99.27318454980417 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 18432), (18432,), (7425, 3072), (3072,), (1, 6, 3072), (1, 18432), (18432,), (6, 3072), (3072,), (1, 9216), (9216,), (1, 7431, 3072), (1, 7431, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((22809600, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (18432, 3072, 1), (18432, 1), (1,), (3072, 1), (1,), (9216, 1), (1,), (22828032, 3072, 1), (22828032, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '', '', '', '', '', '7431', '3072')",9518,4,145.447,36.36175,2.9388659235607624,0.045656064,174.3515625,0.24973114665949725,vector_bfloat16,2.235915906632433,0.03487208893599103,0.5583778431975269,0.008708646756397034,81.7803955078125,1.2703215423174574,327.12158203125,36.114000000000004,33.66,39.559,2.229153997388585,2.2068674376517743,2.278488194100787,0.5566891838484533,0.5511235357302842,0.5690094693629167,82.02099609375,80.23779296875,82.841796875,"[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(327.122), 'mean_duration_us': np.float64(81.7805), 'median_duration_us': np.float64(82.021), 'std_dev_duration_us': np.float64(1.1001921423096988), 'min_duration_us': np.float64(80.238), 'max_duration_us': np.float64(82.842)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(81.78)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7431, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_split_unsqueeze_view_19']",0.015505932928177923,99.28869048273235 +triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30,triton,python3,CPU,thread 416 (python3),"((1, 9216), (9216,), (7431, 3072), (3072,), (1, 7431, 3072), (1, 6144), (6144,), (1, 7425, 3072), (1, 7425, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9216, 1), (1,), (3072, 1), (1,), (22828032, 3072, 1), (6144, 1), (1,), (22809600, 3072, 1), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '7425', '3072')",10411,4,134.381,33.59525,4.208170574410374,0.0456192,130.65234375,0.3329895057852722,vector_bfloat16,1.7391430528826213,0.02483007561898138,0.5791163856692735,0.008268154608975547,78.7860107421875,1.1400923770012072,315.14404296875,31.622500000000002,31.236,39.9,1.7488860568533675,1.7022938325577446,1.756506265266005,0.5823607037463563,0.5668459820047203,0.5848981531796612,78.3349609375,77.9951171875,80.47900390625,"[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(315.144), 'mean_duration_us': np.float64(78.786), 'median_duration_us': np.float64(78.33500000000001), 'std_dev_duration_us': np.float64(0.9873616358761349), 'min_duration_us': np.float64(77.995), 'max_duration_us': np.float64(80.479)}]","[{'name': 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split...', 'stream': 0, 'mean_duration_us': np.float64(78.79)}]","{'fused_ops': 'aten.add, aten.addmm, aten.cat, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.unsqueeze, aten.view', 'xnumel': 7425, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_cat_mul_native_layer_norm_slice_split_unsqueeze_view_30']",0.014938184031286082,99.30362866676363 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((33177600, 129600, 120, 1), (), ())","('', '', '[2., 2.]')",16219,10,287.398,28.739800000000002,1.0247026452152403,,,,,,,,,31.23642578125,0.6900769421467635,312.3642578125,28.622500000000002,27.471,30.886,,,,,,,31.30517578125,30.203125,32.44580078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(98.69599999999998), 'mean_duration_us': np.float64(9.869599999999998), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.48515300679270235), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(10.575)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(213.668), 'mean_duration_us': np.float64(21.3668), 'median_duration_us': np.float64(21.211), 'std_dev_duration_us': np.float64(0.448329075568382), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.112)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.87)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(21.37)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.014806419071236948,99.31843508583486 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', 'False')",173,65,459.434,7.068215384615385,0.8592739393724307,0.001437696,8.2265625,0.16666666666666666,vector_bf16,1.8643501341747815,0.12625387455996265,0.3107250223624636,0.02104231242666044,4.647265625,0.3059762548695673,302.072265625,6.82,5.879,10.425,1.8098973924802786,1.6443045837676842,2.1539147095830287,0.3016495654133798,0.27405076396128075,0.3589857849305048,4.76611328125,4.0048828125,5.24609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(302.069), 'mean_duration_us': np.float64(4.647215384615385), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.30359114673965415), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.246)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.65)}]","{'op_shape': (1, 351, 4096), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (1437696, 4096, 1), 'stride_output': (1437696, 4096, 1)}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.014318567002395276,99.33275365283725 +aten::le,elementwise,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500))","('int', 'int')","((0, 1), (1, 0))","('', '')",15679,10,124.634,12.4634,2.8076142185136472,,,,,,,,,28.9501953125,2.373956250174059,289.501953125,11.507,10.225,18.177,,,,,,,28.5615234375,26.078125,33.0078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(289.502), 'mean_duration_us': np.float64(28.950200000000002), 'median_duration_us': np.float64(28.561500000000002), 'std_dev_duration_us': np.float64(2.2521561579961547), 'min_duration_us': np.float64(26.078), 'max_duration_us': np.float64(33.008)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.95)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::le', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})']",0.013722719974201898,99.34647637281145 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 4096), (1, 351, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1437696, 4096, 1), (1437696, 4096, 1), ())","('', '', '1')",332,64,761.874,11.90428125,1.7543345907069132,0.001437696,8.2265625,0.16666666666666666,vector_bf16,1.9498266672252056,0.18037815730556883,0.32497111120420097,0.030063026217594813,4.460662841796875,0.4034041318322504,285.482421875,12.4985,9.494,15.814,1.8892533897978825,1.5953050792848111,2.3162984722695685,0.3148755649663138,0.2658841798808019,0.3860497453782615,4.56591796875,3.72412109375,5.4072265625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(285.48199999999997), 'mean_duration_us': np.float64(4.4606562499999995), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.40021659053059944), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]","{'shape_in1': (1, 351, 4096), 'shape_in2': (1, 351, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 4096, 1), 'stride_input2': (1437696, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(303): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.01353218964728736,99.36000856245875 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 32, 351, 64), (1, 32, 351, 64)), ())","('TensorList', 'Scalar')","(((718848, 64, 2048, 1), (1437696, 128, 4096, 1)), ())","('', '-1')",221,32,411.773,12.86790625,0.9777379871788657,,,,,,,,,8.52154541015625,0.17887395708911727,272.689453125,12.594000000000001,11.687,15.863,,,,,,,8.5322265625,8.2109375,8.89208984375,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(272.69), 'mean_duration_us': np.float64(8.5215625), 'median_duration_us': np.float64(8.532), 'std_dev_duration_us': np.float64(0.17609371395296866), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.012925788461043322,99.37293435091979 +triton_poi_fused_silu_24,triton,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (3072, 1), (3072, 1), ())","('', '', '', '', '3072')",9535,52,1206.872,23.209076923076925,2.1043035720586,1.2288e-05,0.029296875,0.4,vector_bfloat16,0.00596990870579159,0.0004166008589559358,0.002387963482316636,0.00016664034358237435,5.169762244591346,0.35059874796358426,268.82763671875,22.814,21.081,34.812,0.0058103583302548945,0.005364017392787109,0.006848215957331011,0.0023241433321019578,0.0021456069571148435,0.0027392863829324046,5.287109375,4.48583984375,5.72705078125,"[{'name': 'triton_poi_fused_silu_24', 'stream': 0, 'count': 52, 'total_duration_us': np.float64(268.82599999999996), 'mean_duration_us': np.float64(5.169730769230768), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.3472250497978229), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(5.727)}]","[{'name': 'triton_poi_fused_silu_24', 'stream': 0, 'mean_duration_us': np.float64(5.17)}]","{'fused_ops': 'aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_silu_24']",0.012742733996081333,99.38567708491587 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 30, 30), (1, 512, 5, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 4500, 900, 30, 1), (2304000, 1, 460800, 15360, 512), ())","('', '', 'False')",15807,10,92.55799999999999,9.255799999999999,0.38963139275759384,0.002304,8.7890625,0.25,vector_bf16,0.35354580416689746,0.009836118042428581,0.08838645104172436,0.0024590295106071453,26.085595703125,0.7291111897753998,260.85595703125,9.204,8.893,10.195,0.35371643719427714,0.3378325726252483,0.366357421533803,0.08842910929856929,0.08445814315631207,0.09158935538345075,26.057373046875,25.15576171875,27.27978515625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(260.85699999999997), 'mean_duration_us': np.float64(26.085699999999996), 'median_duration_us': np.float64(26.0575), 'std_dev_duration_us': np.float64(0.6917326145267407), 'min_duration_us': np.float64(25.156), 'max_duration_us': np.float64(27.28)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.09)}]","{'op_shape': (1, 512, 5, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304000, 4500, 900, 30, 1), 'stride_output': (2304000, 1, 460800, 15360, 512)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.012364867363767587,99.39804195227964 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((132710400, 518400, 57600, 240, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",24050,1,34.431,34.431,,0.663553536,506.2529296875,1.2499956597473394,vector_bf16,2.0430954133492696,,2.5538603991362834,,259.82373046875,,259.82373046875,34.431,34.431,34.431,2.0430954133492696,2.0430954133492696,2.0430954133492696,2.5538603991362834,2.5538603991362834,2.5538603991362834,259.82373046875,259.82373046875,259.82373046875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(69.983), 'mean_duration_us': np.float64(69.983), 'median_duration_us': np.float64(69.983), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(69.983), 'max_duration_us': np.float64(69.983)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(189.841), 'mean_duration_us': np.float64(189.841), 'median_duration_us': np.float64(189.841), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(189.841), 'max_duration_us': np.float64(189.841)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(69.98)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(189.84)}]","{'op_shape': (1, 256, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.012315938657366063,99.41035789093701 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), ())","('c10::BFloat16', 'ScalarList')","((5529600, 10800, 3600, 60, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23763,7,52.808,7.544,0.3749626648081112,0.00984064,29.31640625,0.3201199200532978,vector_bf16,0.8356853174485853,0.0652326927666893,0.2675195170113559,0.020882284393333953,36.985142299107146,2.997844621887172,258.89599609375,7.551,7.04,8.253,0.8661196213955535,0.7464873429218493,0.9017489263206141,0.2772621439577372,0.2389654685369411,0.28866779420190214,35.4921875,34.08984375,41.18017578125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(258.89599999999996), 'mean_duration_us': np.float64(36.985142857142854), 'median_duration_us': np.float64(35.492), 'std_dev_duration_us': np.float64(2.7754504616919613), 'min_duration_us': np.float64(34.09), 'max_duration_us': np.float64(41.18)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(36.99)}]","{'input_shape': (1, 512, 3, 60, 60), 'output_shape': (1, 512, 5, 62, 62), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 5, 62, 62), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (5529600, 10800, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.01227196299882165,99.42262985393583 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((4500, 4500), (4500, 4500), ())","('c10::BFloat16', 'float', 'Scalar')","((4500, 1), (4500, 1), ())","('', '', 'False')",15693,10,69.976,6.9976,0.2661762991369109,0.02025,115.87142944335938,0.16666666666666666,vector_bf16,4.834001105066538,0.10101105780939573,0.8056668508444231,0.016835176301565957,25.14443359375,0.5304924444151331,251.4443359375,6.980499999999999,6.66,7.501,4.856897590067218,4.659077291791492,4.956121656342741,0.8094829316778698,0.7765128819652487,0.8260202760571235,25.01611328125,24.51513671875,26.078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(251.44399999999996), 'mean_duration_us': np.float64(25.144399999999997), 'median_duration_us': np.float64(25.016), 'std_dev_duration_us': np.float64(0.5033279646512797), 'min_duration_us': np.float64(24.515), 'max_duration_us': np.float64(26.078)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(25.14)}]","{'op_shape': (4500, 4500), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (4500, 1), 'stride_output': (4500, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.01191874588037622,99.43454859981621 +aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 4500, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (1,), ())","('', '', '1')",15716,30,279.286,9.309533333333333,1.8282352284579553,0.002304,8.7900390625,0.24997222530829907,vector_bf16,1.1134019831507815,0.08297725352346684,0.27831957139087415,0.020742008713231903,8.324674479166667,0.6475289678986142,249.740234375,8.347000000000001,7.381,12.529,1.1171880307758837,0.9240938538209233,1.2783736389001763,0.2792659781408441,0.2309977970333382,0.319557903291345,8.2509765625,7.2099609375,9.97412109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(249.73699999999997), 'mean_duration_us': np.float64(8.324566666666666), 'median_duration_us': np.float64(8.251), 'std_dev_duration_us': np.float64(0.6366639450203608), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(9.974)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.32)}]","{'shape_in1': (1, 4500, 512), 'shape_in2': (512,), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2304000, 512, 1), 'stride_input2': (1,), 'stride_output': None}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.011837969539155163,99.44638656935537 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 9, 240, 240), (1, 128, 9, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((66355200, 518400, 57600, 240, 1), (66355200, 518400, 57600, 240, 1), ())","('', '', '1')",24091,3,25.788,8.596,0.6475932365304623,0.0663552,379.6875,0.16666666666666666,vector_bf16,4.913348540831429,0.0638827101568715,0.8188914234719048,0.01064711835947857,81.03971354166667,1.0603492885285808,243.119140625,8.252,8.193,9.343,4.937254068193791,4.840960729552579,4.961830824747914,0.8228756780322986,0.8068267882587632,0.8269718041246523,80.63818359375,80.23876953125,82.2421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(243.119), 'mean_duration_us': np.float64(81.03966666666666), 'median_duration_us': np.float64(80.638), 'std_dev_duration_us': np.float64(0.8656420866745228), 'min_duration_us': np.float64(80.239), 'max_duration_us': np.float64(82.242)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(81.04)}]","{'shape_in1': (1, 128, 9, 240, 240), 'shape_in2': (1, 128, 9, 240, 240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (66355200, 518400, 57600, 240, 1), 'stride_input2': (66355200, 518400, 57600, 240, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.011524122207648707,99.45791069156301 +aten::rsqrt,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 1),)","('float',)","((351, 1, 1),)","('',)",168,65,522.1659999999999,8.033323076923075,1.3787974618722594,3.51e-07,0.00267791748046875,0.125,vector_fp32,0.000811015823124428,0.00015998493776983827,0.00010137697789055351,1.9998117221229787e-05,3.5995192307692307,0.7070860071860678,233.96875,7.581,7.111,14.081,0.0007876707300369811,0.0006431205546857526,0.001016219119985863,9.845884125462266e-05,8.039006933571909e-05,0.00012702738999823292,3.56494140625,2.76318359375,4.3662109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(233.966), 'mean_duration_us': np.float64(3.599476923076923), 'median_duration_us': np.float64(3.565), 'std_dev_duration_us': np.float64(0.7015092105912641), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(4.366)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","{'op_shape': (1, 351, 1), 'dtype_in_out': ('float', None), 'stride_input': (351, 1, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::rsqrt', 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.011090383343900109,99.46900107490691 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4500), (1, 1, 4500, 4500), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), (20250000, 20250000, 4500, 1), ())","('', '', 'False')",15754,10,75.916,7.5916,0.22939107800144828,0.02025,77.24761962890625,0.25,vector_bf16,3.5745571973431325,0.19077837422303046,0.8936392993357831,0.047694593555757614,22.71689453125,1.1823191769798056,227.1689453125,7.607,7.171,7.882,3.492347054494783,3.320349872900863,3.888607594936709,0.8730867636236957,0.8300874682252157,0.9721518987341773,23.19384765625,20.830078125,24.39501953125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(227.16899999999998), 'mean_duration_us': np.float64(22.7169), 'median_duration_us': np.float64(23.194000000000003), 'std_dev_duration_us': np.float64(1.1216505204385192), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(24.395)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.72)}]","{'op_shape': (1, 1, 4500, 4500), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (20268000, 20268000, 4504, 1), 'stride_output': (20250000, 20250000, 4500, 1)}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.010768064911852991,99.47976913981877 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 128, 4096, 1), (44928, 44928, 128, 1))","('', '')",215,32,448.726,14.0226875,0.740545458842942,0.001437696,5.570068359375,0.24615384615384617,vector_bf16,0.8305715382853068,0.027080094686426973,0.20444837865484478,0.006665869461274335,7.0394287109375,0.23301198720589594,225.26171875,13.835,12.889,16.244,0.8356954264292016,0.7756715336229816,0.8784336285525446,0.20570964342872655,0.19093453135334934,0.2162298162590879,6.989013671875,6.64892578125,7.52978515625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(225.261), 'mean_duration_us': np.float64(7.03940625), 'median_duration_us': np.float64(6.989000000000001), 'std_dev_duration_us': np.float64(0.22938693557161774), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.04)}]","{'shape_in1': (1, 32, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 128, 4096, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.010677660215919054,99.49044680003469 +triton_poi_fused_silu_0,triton,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), (1, 3072), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), (3072, 1), (3072, 1), (3072, 1), ())","('', '', '', '', '', '3072')",8844,40,887.968,22.199199999999998,9.269308978199687,1.2288e-05,0.03515625,0.3333333333333333,vector_bfloat16,0.007085985103819509,0.0012804199879796997,0.002361995034606503,0.0004268066626599001,5.32086181640625,0.6771427092767259,212.83447265625,19.3385,17.356,51.336,0.0067186501735338605,0.006055299326275265,0.010959133691392073,0.0022395500578446205,0.0020184331087584216,0.003653044563797358,5.48681640625,3.36376953125,6.087890625,"[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(212.83599999999998), 'mean_duration_us': np.float64(5.3209), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.6685760914062063), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(6.088)}]","[{'name': 'triton_poi_fused_silu_0', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","{'fused_ops': 'aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_silu_0']",0.010088594697174894,99.50053539473187 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (3072, 16, 1, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((475200, 29700, 900, 30, 1), (64, 4, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 2, 2]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",8802,4,658.398,164.5995,4.092888181549397,2.9196288,44.7872314453125,62.168946598091566,matrix_bf16,0.8896826293271557,0.05974683496044974,55.310631871889626,3.7143977920611895,52.9669189453125,3.5973766299697525,211.86767578125,163.0775,161.61,170.633,0.8915369841641705,0.8147037157934861,0.9609528331867957,55.425915158725914,50.649271800432004,59.74142536967469,52.67626953125,48.87109375,57.64404296875,"[{'name': 'Im3d2Col', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.557000000000002), 'mean_duration_us': np.float64(6.8892500000000005), 'median_duration_us': np.float64(6.1080000000000005), 'std_dev_duration_us': np.float64(2.277268470668314), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(10.695)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(184.31099999999998), 'mean_duration_us': np.float64(46.077749999999995), 'median_duration_us': np.float64(46.5685), 'std_dev_duration_us': np.float64(1.0810030931963137), 'min_duration_us': np.float64(44.225), 'max_duration_us': np.float64(46.949)}]","[{'name': 'Im3d2Col', 'stream': 0, 'mean_duration_us': np.float64(6.89)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(46.08)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 33, 30, 30), 'filter_shape': (3072, 16, 1, 2, 2), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (475200, 29700, 900, 30, 1), 'weight_stride': (64, 4, 4, 2, 1), 'bias': False, 'stride': (1, 2, 2), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['Im3d2Col'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32']]",0.010042767431954923,99.51057816216382 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((9216000, 18000, 60, 1), (), ())","('', '', '[2., 2.]')",16075,10,274.438,27.4438,0.9373258416011656,,,,,,,,,20.66845703125,0.45238589520729844,206.6845703125,27.2405,26.159,29.744,,,,,,,20.60791015625,20.02783203125,21.30908203125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.91100000000001), 'mean_duration_us': np.float64(5.6911000000000005), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.10499185682708932), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(5.847)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(149.774), 'mean_duration_us': np.float64(14.9774), 'median_duration_us': np.float64(15.021), 'std_dev_duration_us': np.float64(0.4257833251784293), 'min_duration_us': np.float64(14.301), 'max_duration_us': np.float64(15.542)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(14.98)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.00979708237119231,99.52037524453502 +aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 12, 77, 64), (1, 12, 77, 64), (1, 12, 77, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((59136, 64, 768, 1), (59136, 64, 768, 1), (59136, 64, 768, 1), (), (), (), ())","('', '', '', '0.', 'True', 'False', '0.125')",7344,12,846.866,70.57216666666666,8.632247625074596,0.009106944,0.451171875,19.25,matrix_bf16,0.028048658484837938,0.0035276384230741096,0.5399366758331304,0.0679070396441766,17.1666259765625,2.6112065924067016,205.99951171875,67.36,66.298,96.773,0.029676861918488732,0.020647946125649987,0.030919205514424303,0.5712795919309082,0.39747296291876233,0.5951947061526679,15.94140625,15.30078125,22.912109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(40.326), 'mean_duration_us': np.float64(3.3605), 'median_duration_us': np.float64(2.062), 'std_dev_duration_us': np.float64(2.6652849284832567), 'min_duration_us': np.float64(1.801), 'max_duration_us': np.float64(9.493)}, {'name': 'attn_fwd', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(165.674), 'mean_duration_us': np.float64(13.806166666666668), 'median_duration_us': np.float64(13.6795), 'std_dev_duration_us': np.float64(0.4373817618003243), 'min_duration_us': np.float64(13.378), 'max_duration_us': np.float64(14.981)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}, {'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.81)}]","{'B': 1, 'N_Q': 77, 'H_Q': 12, 'N_KV': 77, 'H_KV': 12, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': True, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(300): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', ['aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)'], ['attn_fwd']]",0.009764609819119778,99.53013985435413 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((172800, 57600, 240, 1), (172800, 57600, 240, 1), ())","('', '', '1')",24181,40,242.27100000000002,6.056775,0.44975095601443443,0.0001728,0.98876953125,0.16666666666666666,vector_bf16,0.202243043137842,0.004947866473555995,0.033707173856307004,0.0008246444122593279,5.12955322265625,0.1278144411402751,205.18212890625,5.969,5.569,8.332,0.2038170858130159,0.1903510891976692,0.20874620526936688,0.033969514302169324,0.03172518153294487,0.03479103421156115,5.0869140625,4.966796875,5.44677734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 40, 'total_duration_us': np.float64(205.18399999999997), 'mean_duration_us': np.float64(5.129599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.12611756420102632), 'min_duration_us': np.float64(4.967), 'max_duration_us': np.float64(5.447)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.13)}]","{'shape_in1': (1, 3, 240, 240), 'shape_in2': (1, 3, 240, 240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (172800, 57600, 240, 1), 'stride_input2': (172800, 57600, 240, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.009725864949433803,99.53986571930356 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 1), (), ())","('float', 'double', 'Scalar')","((351, 1, 1), (), ())","('', '', '1')",167,65,577.346,8.882246153846154,0.8988201994623496,3.51e-07,0.002685546875,0.12464488636363637,vector_fp32,0.0010224754481700444,0.0003662162240220401,0.00012744633604676333,4.5646979627747184e-05,3.15517578125,1.1386083261282682,205.08642578125,8.653,7.932,13.159,0.001212099201345103,0.0006335458640008789,0.0014360478087649404,0.00015108196721311476,7.896825222454136e-05,0.000178996015936255,2.3232421875,1.9609375,4.44482421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 65, 'total_duration_us': np.float64(205.08299999999997), 'mean_duration_us': np.float64(3.1551230769230765), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(1.1297545207520807), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.16)}]","{'shape_in1': (1, 351, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (351, 1, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(62): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaRMSNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/llama/modeling_llama.py(62): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.009721328513078695,99.54958704781664 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 8, 351, 64), (1, 8, 351, 64)), ())","('TensorList', 'Scalar')","(((179712, 64, 512, 1), (359424, 128, 1024, 1)), ())","('', '-1')",230,32,307.449,9.60778125,2.1155782818732733,,,,,,,,,6.35845947265625,0.1797532206189524,203.470703125,9.123999999999999,8.353,19.76,,,,,,,6.388671875,6.087890625,6.72900390625,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(203.47), 'mean_duration_us': np.float64(6.3584375), 'median_duration_us': np.float64(6.3885000000000005), 'std_dev_duration_us': np.float64(0.17691522289998107), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 4, 64, 64>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.00964474143196108,99.5592317892486 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23921,5,161.34,32.268,2.996439804167604,0.092161536,70.3154296875,1.249968751302029,vector_bf16,1.8196259857468635,0.07598200275224626,2.2744756212407307,0.09497512910165266,40.5779296875,1.7379210572548163,202.8896484375,30.966,29.905,37.385,1.8242151765729195,1.7027269959631042,1.8956430126165935,2.280211966367063,2.1283555369522564,2.36949452939478,40.41796875,38.89501953125,43.3017578125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(63.48799999999999), 'mean_duration_us': np.float64(12.697599999999998), 'median_duration_us': np.float64(12.658), 'std_dev_duration_us': np.float64(0.31837122985596544), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.218)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(139.40200000000002), 'mean_duration_us': np.float64(27.8804), 'median_duration_us': np.float64(28.161), 'std_dev_duration_us': np.float64(1.3720892973855596), 'min_duration_us': np.float64(26.358), 'max_duration_us': np.float64(30.084)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(12.7)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(27.88)}]","{'op_shape': (1, 256, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (18432000, 72000, 14400, 120, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.00961719878266221,99.56884898803126 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 9, 240, 240),)","('c10::BFloat16',)","((132710400, 518400, 57600, 240, 1),)","('',)",24054,1,10.546,10.546,,0.1327104,506.25,0.25,vector_bf16,2.6219584234922992,,0.6554896058730748,,202.4599609375,,202.4599609375,10.546,10.546,10.546,2.6219584234922992,2.6219584234922992,2.6219584234922992,0.6554896058730748,0.6554896058730748,0.6554896058730748,202.4599609375,202.4599609375,202.4599609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.46), 'mean_duration_us': np.float64(202.46), 'median_duration_us': np.float64(202.46), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.46), 'max_duration_us': np.float64(202.46)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.46)}]","{'op_shape': (1, 256, 9, 240, 240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (132710400, 518400, 57600, 240, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.009596831109231112,99.5784458191405 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8757,20,579.851,28.99255,2.923976986643542,0.018874368,18.01171875,0.9993493819128172,matrix_bf16,1.887226115973594,0.07791908506895788,1.8859982525279375,0.07786838950287531,10.023876953125,0.41449718217519793,200.4775390625,28.2025,25.398,35.983,1.8748919900656542,1.7528377889155753,1.9979272462809918,1.8736721514254033,1.7516973609462092,1.996627358677686,10.074462890625,9.453125,10.77490234375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(200.47699999999998), 'mean_duration_us': np.float64(10.02385), 'median_duration_us': np.float64(10.0745), 'std_dev_duration_us': np.float64(0.4040388935486285), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.775)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(10.02)}]","{'M': 1, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.00950286207044673,99.58794868121095 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 3072), (3072, 6144), (1, 6144))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (6144, 1))","('', '', '')",8765,12,456.359,38.029916666666665,10.470274759426268,0.037748736,36.017578125,0.9995119570522206,matrix_bf16,2.2660357358354664,0.05920983918842227,2.2649298130751756,0.05918094224396699,16.677042643229168,0.43521086334175285,200.12451171875,32.7245,28.452,53.66,2.2610839588400373,2.1525982429032617,2.3748705844207683,2.259980452759588,2.1515476825114104,2.3737115455801527,16.703125,15.90283203125,17.544921875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(200.12500000000003), 'mean_duration_us': np.float64(16.677083333333336), 'median_duration_us': np.float64(16.703), 'std_dev_duration_us': np.float64(0.4166806247662062), 'min_duration_us': np.float64(15.903), 'max_duration_us': np.float64(17.545)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(16.68)}]","{'M': 1, 'N': 6144, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.00948612817511641,99.59743480938606 +triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 9216), (9216,), (3072,), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (9216, 1), (1,), (1,), (22828032, 3072, 1), ())","('', '', '', '', '', '22828032')",9540,4,106.08699999999999,26.521749999999997,1.633805654497092,0.045656064,130.6640625,0.33322869955156953,vector_bfloat16,2.7832908104064056,0.05782628163374851,0.9274723772255608,0.01926937662871679,49.2423095703125,1.0254499436432176,196.96923828125,26.084,25.057,28.862,2.785288445110521,2.712332533614298,2.850253817790283,0.9281380464401922,0.9038270429277064,0.9497863730941523,49.192626953125,48.06982421875,50.51416015625,"[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(196.969), 'mean_duration_us': np.float64(49.24225), 'median_duration_us': np.float64(49.192499999999995), 'std_dev_duration_us': np.float64(0.8879511177424136), 'min_duration_us': np.float64(48.07), 'max_duration_us': np.float64(50.514)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26', 'stream': 0, 'mean_duration_us': np.float64(49.24)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.split, aten.unsqueeze, aten.view', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_26']",0.00933656464589851,99.60677137403195 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 8, 351, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((359424, 128, 1024, 1), (359424, 44928, 128, 1), ())","('', '', '1')",232,32,253.965,7.93640625,1.2311671582577977,0.000359424,2.056640625,0.16666666666666666,vector_bf16,0.35531993179079213,0.01044808569923762,0.0592199886317987,0.001741347616539604,6.0743408203125,0.17698023169520577,194.37890625,7.631,6.6,12.118,0.3554075953952792,0.3386445416347186,0.3792051268137718,0.05923459923254655,0.05644075693911977,0.06320085446896197,6.06787109375,5.68701171875,6.3681640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(194.37900000000002), 'mean_duration_us': np.float64(6.074343750000001), 'median_duration_us': np.float64(6.068), 'std_dev_duration_us': np.float64(0.17418714960047285), 'min_duration_us': np.float64(5.687), 'max_duration_us': np.float64(6.368)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}]","{'shape_in1': (1, 8, 351, 128), 'shape_in2': (1, 8, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (359424, 128, 1024, 1), 'stride_input2': (359424, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.009213779978225813,99.61598515401018 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2937600, 979200, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",24184,36,205.996,5.722111111111111,1.2457159909701452,0.0001728,0.6591796875,0.25,vector_bf16,0.13413030987096974,0.0053303296294913765,0.033532577467742436,0.0013325824073728441,5.162204318576389,0.23417343393297987,185.83935546875,5.4030000000000005,5.117,11.477,0.13484259859020767,0.10922666666666668,0.14145873888278207,0.03371064964755192,0.02730666666666667,0.03536468472069552,5.1259765625,4.88623046875,6.328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 36, 'total_duration_us': np.float64(185.84), 'mean_duration_us': np.float64(5.162222222222223), 'median_duration_us': np.float64(5.126), 'std_dev_duration_us': np.float64(0.23083376788299786), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.16)}]","{'op_shape': (1, 3, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2937600, 979200, 240, 1), 'stride_output': (172800, 57600, 240, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.008808995613866197,99.62479414962404 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), ())","('c10::BFloat16', 'ScalarList')","((36864000, 72000, 14400, 120, 1), ())","('', '[0, 0, 0, 0, 0, 0]')",23938,1,7.802,7.802,,0.036864,140.625,0.25,vector_bf16,0.8066917265918002,,0.20167293164795005,,182.791015625,,182.791015625,7.802,7.802,7.802,0.8066917265918002,0.8066917265918002,0.8066917265918002,0.20167293164795005,0.20167293164795005,0.20167293164795005,182.791015625,182.791015625,182.791015625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(182.791), 'mean_duration_us': np.float64(182.791), 'median_duration_us': np.float64(182.791), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(182.791), 'max_duration_us': np.float64(182.791)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(182.79)}]","{'input_shape': (1, 512, 5, 120, 120), 'output_shape': (1, 512, 5, 120, 120), 'padding': [0, 0, 0, 0, 0, 0], 'op_shape': (1, 512, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.008664500857922627,99.63345865048196 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 4500), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4500, 4500, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",15701,10,391.722,39.1722,2.09307385865329,0.011523072,8.794921875,1.249500333111259,vector_bf16,0.522348305962933,0.036923707309992886,0.6526743823007867,0.04613618458353874,17.736328125,1.2795679686855788,177.36328125,38.572500000000005,37.496,44.836,0.5256550308680521,0.46046641421849477,0.5814231902475064,0.6568061361712405,0.5753529379525563,0.7264884698928703,17.544189453125,15.861328125,20.02783203125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(61.56), 'mean_duration_us': np.float64(6.156000000000001), 'median_duration_us': np.float64(6.088), 'std_dev_duration_us': np.float64(0.5113282702921871), 'min_duration_us': np.float64(5.286), 'max_duration_us': np.float64(7.129)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(115.80299999999998), 'mean_duration_us': np.float64(11.580299999999998), 'median_duration_us': np.float64(11.536000000000001), 'std_dev_duration_us': np.float64(1.026855398778231), 'min_duration_us': np.float64(9.694), 'max_duration_us': np.float64(13.379)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(11.58)}]","{'op_shape': (1, 512, 4500), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (4500, 4500, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.008407220110354356,99.64186587059231 +aten::neg,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 64),)","('c10::BFloat16',)","((1437696, 128, 4096, 1),)","('',)",220,32,306.006,9.5626875,1.2968399418114098,0.000718848,2.7421875,0.25,vector_bf16,0.5276864595464045,0.017043813348026016,0.13192161488660115,0.004260953337006503,5.4546661376953125,0.17955712635322646,174.54931640625,9.249,8.433,15.924,0.5279070207082026,0.48181989985272455,0.5608383634285714,0.13197675517705065,0.12045497496318115,0.14020959085714285,5.44677734375,5.126953125,5.9677734375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(174.54999999999998), 'mean_duration_us': np.float64(5.4546874999999995), 'median_duration_us': np.float64(5.447), 'std_dev_duration_us': np.float64(0.17679409589618653), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]","{'op_shape': (1, 32, 351, 64), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (1437696, 128, 4096, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(138): rotate_half,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::neg', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.00827383499446411,99.65013970558678 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 3072), (3072, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (3072, 1))","('', '', '')",8766,8,181.851,22.731375,1.4241725354444539,4.831838208,21.0,219.42857142857142,matrix_bf16,1.0240073277948698,0.019970737826024786,224.69646507041716,4.382150471539155,21.510986328125,0.41850110365772064,172.087890625,22.744,20.791,25.237,1.0227870482106778,0.9940519895077919,1.0571297845288326,224.42870086451444,218.12340798342407,231.9644784337553,21.531005859375,20.830078125,22.15185546875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(172.088), 'mean_duration_us': np.float64(21.511), 'median_duration_us': np.float64(21.531), 'std_dev_duration_us': np.float64(0.391523307096781), 'min_duration_us': np.float64(20.83), 'max_duration_us': np.float64(22.152)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.51)}]","{'M': 256, 'N': 3072, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.008157160628820746,99.65829686621561 +aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((3686400, 7200, 3600, 60, 1), (), ())","('', '', '[2., 2., 2.]')",23887,1,8.472,8.472,,,,,,,,,,170.73291015625,,170.73291015625,8.472,8.472,8.472,,,,,,,170.73291015625,170.73291015625,170.73291015625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(170.733), 'mean_duration_us': np.float64(170.733), 'median_duration_us': np.float64(170.733), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(170.733), 'max_duration_us': np.float64(170.733)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(170.73)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.008092933022262456,99.66638979923788 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 128, 1024, 1), (44928, 44928, 128, 1))","('', '')",224,32,228.349,7.13590625,0.45208030683789485,0.000359424,1.456787109375,0.23529411764705882,vector_bf16,0.29794120018477027,0.02798009687290115,0.07010381180818125,0.006583552205388514,5.1719207763671875,0.4977407381986989,165.50146484375,7.061,6.479,7.992,0.296790990040014,0.23983643790248388,0.3598374161490683,0.06983317412706214,0.05643210303587857,0.08466762732919254,5.14697265625,4.2451171875,6.369140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(165.5), 'mean_duration_us': np.float64(5.171875), 'median_duration_us': np.float64(5.147), 'std_dev_duration_us': np.float64(0.4898999100581669), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(6.369)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.17)}]","{'shape_in1': (1, 8, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (359424, 128, 1024, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.007844956598238844,99.67423475583611 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 4500, 512), (1, 4500, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304000, 512, 1), (4500, 1, 4500), ())","('', '', '1')",15797,10,142.512,14.2512,0.3789522983759875,0.002304,13.18359375,0.16666666666666666,vector_bf16,0.866632001790552,0.013100851859139626,0.14443866696509197,0.0021834753098566033,15.9546875,0.24112172126375578,159.546875,14.241,13.65,14.902,0.8649292662887628,0.8458784583208844,0.8849019191098331,0.1441548777147938,0.1409797430534807,0.14748365318497217,15.98291015625,15.6220703125,16.3427734375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(159.547), 'mean_duration_us': np.float64(15.954699999999999), 'median_duration_us': np.float64(15.983), 'std_dev_duration_us': np.float64(0.22880430502942894), 'min_duration_us': np.float64(15.622), 'max_duration_us': np.float64(16.343)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(15.95)}]","{'shape_in1': (1, 4500, 512), 'shape_in2': (1, 4500, 512), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2304000, 512, 1), 'stride_input2': (4500, 1, 4500), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.007562702305634034,99.68179745814174 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 256, 1, 240, 240), (1, 256, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((14745600, 57600, 57600, 240, 1), (117964800, 460800, 57600, 240, 1)), ())","('', '2')",24033,1,27.211,27.211,,,,,,,,,,158.67431640625,,158.67431640625,27.211,27.211,27.211,,,,,,,158.67431640625,158.67431640625,158.67431640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.558), 'mean_duration_us': np.float64(26.558), 'median_duration_us': np.float64(26.558), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.558), 'max_duration_us': np.float64(26.558)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(132.116), 'mean_duration_us': np.float64(132.116), 'median_duration_us': np.float64(132.116), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(132.116), 'max_duration_us': np.float64(132.116)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(26.56)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(132.12)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.007521342041518839,99.68931880018326 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23418,10,316.748,31.674799999999998,1.337243001269568,0.006915072,5.279296875,1.2491675915649278,vector_bf16,0.3659939535869764,0.06756550586031682,0.45718778552956935,0.08440064022839798,15.753125,3.8272314794361426,157.53125,31.822000000000003,29.874,34.17,0.4035390297725771,0.22326119952737297,0.4188106284447728,0.5040878779234579,0.27889065490350534,0.5231646640561507,13.718017578125,13.2177734375,24.794921875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(55.06999999999999), 'mean_duration_us': np.float64(5.507), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(1.9236527753209518), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(11.135)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(102.462), 'mean_duration_us': np.float64(10.2462), 'median_duration_us': np.float64(9.053), 'std_dev_duration_us': np.float64(2.999576996844722), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(19.027)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.51)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.25)}]","{'op_shape': (1, 512, 3, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.0074671594011754315,99.69678595958443 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((475200, 29700, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",15598,10,1019.914,101.9914,39.2052860642258,0.002304,0.275146484375,7.985803016858918,matrix_bf16,0.01836508175951614,0.0006520163690589507,0.14665992532000466,0.005206874287072375,15.7283203125,0.5794745470816367,157.283203125,89.1875,85.797,213.097,0.0186630107655767,0.016989349204980016,0.018956450946422843,0.14903912767541289,0.13567359613559907,0.1513824831568816,15.4599609375,15.2197265625,16.98193359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(47.061), 'mean_duration_us': np.float64(4.7061), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.21281938351569393), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(5.167)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(53.59000000000001), 'mean_duration_us': np.float64(5.359000000000001), 'median_duration_us': np.float64(5.367), 'std_dev_duration_us': np.float64(0.1893995776130454), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.688)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL2_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU16_SUM0_SUS128_SPO0_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(56.633), 'mean_duration_us': np.float64(5.6633000000000004), 'median_duration_us': np.float64(5.587), 'std_dev_duration_us': np.float64(0.2747045867836939), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(6.288)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.71)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.36)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.66)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 5, 30, 30), 'filter_shape': (16, 16, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (475200, 29700, 900, 30, 1), 'weight_stride': (16, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', ['aten::miopen_convolution', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['aten::miopen_convolution', 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL2_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU16_SUM0_SUS128_SPO0_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16']]",0.007455401698785662,99.70424136128322 +aten::where,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (), ())","('bool', 'c10::BFloat16', 'c10::BFloat16')","((123201, 123201, 351, 1), (), ())","('', '', '')",280,32,446.696,13.95925,1.3376534099538981,,,,,,,,,4.8874053955078125,0.15500533287165916,156.39697265625,13.7105,12.599,20.571,,,,,,,4.88623046875,4.60595703125,5.2470703125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(156.39600000000002), 'mean_duration_us': np.float64(4.8873750000000005), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.15261302164297783), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::where', 'aten::where', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(bool, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.007413393372334023,99.71165475465556 +triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1), (1, 7425, 1), (1, 18432), (18432,), (1, 7425, 3072), (), ())","('c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((0, 1, 7488), (7456, 1, 7456), (7456, 1, 7456), (18432, 1), (1,), (22809600, 3072, 1), (), ())","('', '', '', '', '', '', '7425', '3072')",8850,4,110.124,27.531,2.6237424924459862,6.144e-06,87.087890625,6.728116800107649e-05,vector_bfloat16,2.376026446449097,0.1668847412996888,0.0001598618345185425,1.1228200316200539e-05,38.575927734375,2.7097272122605083,154.3037109375,26.965,24.987,31.207,2.376362755125996,2.2240170892961197,2.5273631862482775,0.00015988446175913313,0.00014963446742219738,0.00017004394713370633,38.555908203125,36.1318359375,41.06005859375,"[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(154.304), 'mean_duration_us': np.float64(38.576), 'median_duration_us': np.float64(38.556), 'std_dev_duration_us': np.float64(2.346681167095354), 'min_duration_us': np.float64(36.132), 'max_duration_us': np.float64(41.06)}]","[{'name': 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(38.58)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_4']",0.007314170399607757,99.71896892505517 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 32, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((1437696, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",222,32,245.71,7.6784375,0.35801035644598406,0.001437696,5.570068359375,0.24615384615384617,vector_bf16,1.229998791966302,0.11853194266220045,0.30276893340708977,0.029177093578387797,4.7911376953125,0.4589674339754898,153.31640625,7.692,6.97,8.633,1.230642340557995,1.019833806803649,1.4439438338966684,0.3029273453681219,0.25103601398243675,0.3554323283437953,4.74609375,4.044921875,5.72705078125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(153.316), 'mean_duration_us': np.float64(4.791125), 'median_duration_us': np.float64(4.746), 'std_dev_duration_us': np.float64(0.45170425543158216), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(5.727)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.79)}]","{'shape_in1': (1, 32, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1437696, 44928, 128, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.007267371040883121,99.72623629609605 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 4, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (7372800, 14400, 3600, 60, 1)), ())","('', '2')",15957,10,269.491,26.949099999999998,1.7547678827190292,,,,,,,,,15.17275390625,0.32528595041515274,151.7275390625,26.139,25.588,31.106,,,,,,,15.06103515625,14.7802734375,15.7021484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(50.82599999999999), 'mean_duration_us': np.float64(5.082599999999999), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.08492961791978107), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.207)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.902), 'mean_duration_us': np.float64(10.0902), 'median_duration_us': np.float64(9.994), 'std_dev_duration_us': np.float64(0.2913725450347027), 'min_duration_us': np.float64(9.734), 'max_duration_us': np.float64(10.655)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.08)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.09)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0071920569393549485,99.7334283530354 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120),)","('c10::BFloat16',)","((18432000, 72000, 14400, 120, 1),)","('',)",23925,5,45.308,9.0616,0.362999035811392,0.018432,70.3125,0.25,vector_bf16,2.4536168048092937,0.17738158283104108,0.6134042012023234,0.04434539570776027,30.171875,2.1300137500140033,150.859375,9.054,8.683,9.544,2.356571214533196,2.300700045710803,2.6597196455937007,0.589142803633299,0.5751750114277008,0.6649299113984252,31.2861328125,27.72021484375,32.0458984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(150.859), 'mean_duration_us': np.float64(30.1718), 'median_duration_us': np.float64(31.286), 'std_dev_duration_us': np.float64(1.9051704805607295), 'min_duration_us': np.float64(27.72), 'max_duration_us': np.float64(32.046)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(30.17)}]","{'op_shape': (1, 256, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (18432000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0071509049809907535,99.7405792580164 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 128), (1, 1, 351, 128))","('c10::BFloat16', 'c10::BFloat16')","((359424, 44928, 128, 1), (44928, 44928, 128, 1))","('', '')",231,32,251.614,7.8629375,1.1720413385173527,0.000359424,1.456787109375,0.23529411764705882,vector_bf16,0.34780146454729505,0.011605865440599236,0.0818356387170106,0.0027307918683762925,4.3968048095703125,0.14804499906876914,140.69775390625,7.5815,6.74,13.109,0.3498575817490494,0.32043700665778957,0.37031563636363635,0.08231943099977634,0.07539694274300932,0.08713309090909091,4.3662109375,4.125,4.76708984375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(140.697), 'mean_duration_us': np.float64(4.39678125), 'median_duration_us': np.float64(4.366), 'std_dev_duration_us': np.float64(0.14578424434223852), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.767)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.4)}]","{'shape_in1': (1, 8, 351, 128), 'shape_in2': (1, 1, 351, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (359424, 44928, 128, 1), 'stride_input2': (44928, 44928, 128, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.006669232649428745,99.74724849066583 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 351, 351), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), (123201, 123201, 351, 1), ())","('', '', 'False')",290,32,207.449,6.48278125,0.8496979628221978,0.000123201,0.4699745178222656,0.25,vector_bf16,0.11543131976609389,0.004881216178096082,0.028857829941523472,0.0012203040445240205,4.276641845703125,0.18087827426542186,136.8525390625,6.3445,5.819,10.886,0.11500257429352778,0.10699274801229725,0.1242934226600985,0.028750643573381945,0.02674818700307431,0.031073355665024626,4.28515625,3.96484375,4.60595703125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(136.852), 'mean_duration_us': np.float64(4.276625), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.1780245330705855), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.28)}]","{'op_shape': (1, 1, 351, 351), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (123552, 123552, 352, 1), 'stride_output': (123201, 123201, 351, 1)}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.006486965117303867,99.75373545578313 +aten::neg,elementwise,python3,CPU,thread 416 (python3),"((1, 8, 351, 64),)","('c10::BFloat16',)","((359424, 128, 1024, 1),)","('',)",229,32,248.001,7.75003125,0.9561580542977124,0.000179712,0.685546875,0.25,vector_bf16,0.17266842365452623,0.006498707416741959,0.043167105913631564,0.0016246768541854904,4.1689300537109375,0.15816634330533075,133.40576171875,7.5265,6.96,12.158,0.1742661818181818,0.15883058625525948,0.18504282352941176,0.043566545454545455,0.03970764656381487,0.04626070588235295,4.125,3.884765625,4.52587890625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(133.406), 'mean_duration_us': np.float64(4.1689375), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.1556189130335706), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.17)}]","{'op_shape': (1, 8, 351, 64), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (359424, 128, 1024, 1), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(138): rotate_half,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/models/llama/modeling_llama.py(145): apply_rotary_pos_emb', 'transformers/models/llama/modeling_llama.py(138): rotate_half', 'aten::neg', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::neg_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0063235839732696435,99.7600590397564 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",7302,25,282.74,11.3096,1.062251265002777,5.9136e-05,0.33837890625,0.16666666666666666,vector_bf16,0.06696871528946978,0.004092702257238866,0.01116145254824496,0.0006821170428731442,5.31740234375,0.32771737589226274,132.93505859375,11.226,9.574,12.99,0.06762173534338359,0.059455340206185564,0.07507626490339911,0.011270289223897263,0.009909223367697593,0.012512710817233184,5.2470703125,4.72607421875,5.9677734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 25, 'total_duration_us': np.float64(132.935), 'mean_duration_us': np.float64(5.3174), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.3211545422378454), 'min_duration_us': np.float64(4.726), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","{'shape_in1': (1, 77, 768), 'shape_in2': (1, 77, 768), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (59136, 768, 1), 'stride_input2': (59136, 768, 1), 'stride_output': None}",True,transformers/models/clip/modeling_clip.py(234): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.006301272112829214,99.76636031186924 +triton_red_fused_native_layer_norm_1,triton,python3,CPU,thread 416 (python3),"((1, 7425, 3072), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (), ())","('c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar')","((0, 1, 7488), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (), ())","('', '', '', '', '178200', '128')",8846,4,126.999,31.74975,1.7506923154379037,0.0,43.505859375,0.0,vector_bfloat16,1.4196437581264647,0.014764517716361579,0.0,0.0,32.1368408203125,0.33101828646015685,128.54736328125,31.2015,30.305,34.291,1.4138001840690495,1.4094273714699492,1.4415472928978106,0.0,0.0,0.0,32.26708984375,31.64599609375,32.3671875,"[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(128.547), 'mean_duration_us': np.float64(32.13675), 'median_duration_us': np.float64(32.266999999999996), 'std_dev_duration_us': np.float64(0.2866098175220092), 'min_duration_us': np.float64(31.646), 'max_duration_us': np.float64(32.367)}]","[{'name': 'triton_red_fused_native_layer_norm_1', 'stream': 0, 'mean_duration_us': np.float64(32.14)}]","{'fused_ops': 'aten.native_layer_norm', 'xnumel': 178200, 'rnumel': 128}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_native_layer_norm', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_native_layer_norm_1']",0.006093290392997576,99.77245360226223 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((512,), (4500, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",15794,10,414.63599999999997,41.4636,2.094029990234144,2.3616,9.2900390625,242.43140964995268,matrix_bf16,0.7612129422393321,0.020453315955345892,184.54192663086928,4.958526219070381,12.805810546875,0.36069397961349864,128.05810546875,40.896,39.919,46.75,0.7659476402095992,0.7090381695276683,0.7819930611476953,185.6897661340679,171.89312293421474,189.57968015051742,12.718017578125,12.45703125,13.73876953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(128.058), 'mean_duration_us': np.float64(12.8058), 'median_duration_us': np.float64(12.718), 'std_dev_duration_us': np.float64(0.3422799439055698), 'min_duration_us': np.float64(12.457), 'max_duration_us': np.float64(13.739)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(12.81)}]","{'M': 4500, 'N': 512, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.006070099019386258,99.77852370128161 +triton_poi_fused_convolution_13,triton,python3,CPU,thread 416 (python3),"((1, 3072, 33, 15, 15), (3072,), (1, 3072, 33, 15, 15), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22809600, 7425, 225, 15, 1), (1,), (23003136, 7488, 225, 15, 1), ())","('', '', '', '22809600')",8805,4,114.218,28.5545,1.3348988725742508,0.0,130.5234375,0.0,vector_bfloat16,4.369735222624342,0.058180651481740626,0.0,0.0,31.324951171875,0.41248052917149597,125.2998046875,28.437,27.41,29.934,4.349751224884022,4.324836026476987,4.4546024142523395,0.0,0.0,0.0,31.46484375,30.72412109375,31.64599609375,"[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(125.3), 'mean_duration_us': np.float64(31.325), 'median_duration_us': np.float64(31.465), 'std_dev_duration_us': np.float64(0.3572960956965524), 'min_duration_us': np.float64(30.724), 'max_duration_us': np.float64(31.646)}]","[{'name': 'triton_poi_fused_convolution_13', 'stream': 0, 'mean_duration_us': np.float64(31.32)}]","{'fused_ops': 'aten.convolution', 'xnumel': 22809600, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_convolution', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_convolution_13']",0.005939352443008679,99.78446305372462 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (256, 512, 1, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((36864000, 72000, 14400, 120, 1), (512, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23940,1,68.021,68.021,,18.874368,105.71875,170.26308010641444,matrix_bf16,0.9034553182060567,,153.82508521628395,,122.7001953125,,122.7001953125,68.021,68.021,68.021,0.9034553182060567,0.9034553182060567,0.9034553182060567,153.82508521628395,153.82508521628395,153.82508521628395,122.7001953125,122.7001953125,122.7001953125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(40.98), 'mean_duration_us': np.float64(40.98), 'median_duration_us': np.float64(40.98), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(40.98), 'max_duration_us': np.float64(40.98)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC1_NTD1_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT2_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGMn2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(81.72), 'mean_duration_us': np.float64(81.72), 'median_duration_us': np.float64(81.72), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(81.72), 'max_duration_us': np.float64(81.72)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(40.98)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(81.72)}]","{'convNd': 'conv3d', 'input_shape': (1, 512, 5, 120, 120), 'filter_shape': (256, 512, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (36864000, 72000, 14400, 120, 1), 'weight_stride': (512, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT128x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC1_NTD1_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT2_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGMn2']]",0.00581612801875054,99.79027918174337 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23772,6,185.085,30.8475,2.0122074197259083,0.027651072,21.099609375,1.2497917245209664,vector_bf16,1.114613440442963,0.06900000895541585,1.393034653905458,0.08623564018435133,19.91455078125,1.2612885205196425,119.4873046875,30.591,28.632,34.341,1.1347295854278623,1.0209564027849756,1.1878949798657719,1.4181756454368493,1.275982863297357,1.4846213154362418,19.507568359375,18.625,21.67041015625,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(36.448), 'mean_duration_us': np.float64(6.074666666666666), 'median_duration_us': np.float64(6.0485), 'std_dev_duration_us': np.float64(0.2942950144932046), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.449)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.038), 'mean_duration_us': np.float64(13.839666666666666), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8712071446498181), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(15.262)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.07)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.84)}]","{'op_shape': (1, 512, 3, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (5529600, 10800, 3600, 60, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.0056638333696861975,99.79594301511305 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', '1')",10434,4,56.205,14.05125,0.4287123161281942,0.0004752,4.5318603515625,0.1,vector_fp32,0.1594766784732344,0.004269637105907157,0.01594766784732344,0.00042696371059071364,29.813232421875,0.7855962782338508,119.2529296875,14.0765,13.54,14.512,0.15849119111451043,0.15547721063982747,0.16544712102408923,0.015849119111451045,0.015547721063982747,0.01654471210240892,29.9833984375,28.72216796875,30.56396484375,"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(119.25300000000001), 'mean_duration_us': np.float64(29.813250000000004), 'median_duration_us': np.float64(29.9835), 'std_dev_duration_us': np.float64(0.6804231679624079), 'min_duration_us': np.float64(28.722), 'max_duration_us': np.float64(30.564)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(29.81)}]","{'shape_in1': (1, 16, 33, 30, 30), 'shape_in2': (1, 16, 33, 30, 30), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (475200, 29700, 900, 30, 1), 'stride_input2': (475200, 29700, 900, 30, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::add', 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)']",0.005652723729632872,99.80159573884269 +aten::layer_norm,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), (), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((59136, 768, 1), (), (1,), (1,), (), ())","('', '[768]', '', '', '1.0000000000000001e-05', 'True')",7303,25,548.183,21.927319999999998,3.0013883831764705,0.000300288,0.234375,1.221875,vector_bf16,0.052216829114861606,0.0029769326519793384,0.06380243807472152,0.0036374395841372465,4.7198046875,0.2444226349748887,117.9951171875,21.011,19.639,33.89,0.052445189121600504,0.046482866642039156,0.06391320380952381,0.06408146545795561,0.05679625267824159,0.0780939459047619,4.68603515625,3.84521484375,5.287109375,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 25, 'total_duration_us': np.float64(117.994), 'mean_duration_us': np.float64(4.71976), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.23948549517663897), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.72)}]","{'op_shape': (1, 77, 768), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (59136, 768, 1), 'stride_output': None, 'num_channels': 768, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,torch/nn/functional.py(2880): layer_norm,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/normalization.py(228): forward', 'torch/nn/functional.py(2880): layer_norm', 'aten::layer_norm', 'aten::native_layer_norm', 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)']",0.005593101994680022,99.80718884083737 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 3072), (256, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",8723,4,287.01800000000003,71.75450000000001,6.129838415488616,6.442450944,27.5,223.4181818181818,matrix_bf16,1.0019885272195925,0.011884306386974484,223.86245495407917,2.655170125148043,28.7816162109375,0.3376165906830312,115.12646484375,72.7485,63.585,77.936,0.9970271728498881,0.9942723469593912,1.0196274162192027,222.7539981814441,222.13851998976364,227.8033034636648,28.921875,28.28076171875,29.001953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.127), 'mean_duration_us': np.float64(28.78175), 'median_duration_us': np.float64(28.922), 'std_dev_duration_us': np.float64(0.29231864035671795), 'min_duration_us': np.float64(28.281), 'max_duration_us': np.float64(29.002)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(28.78)}]","{'M': 256, 'N': 3072, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.005457124629444003,99.81264596546681 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((2304000, 4500, 30, 1), (), ())","('', '', '[2., 2.]')",15941,10,310.78,31.077999999999996,3.7270490859242638,,,,,,,,,11.4830078125,0.4077479987454964,114.830078125,29.8445,28.622,40.65,,,,,,,11.33447265625,11.13525390625,12.537109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.617), 'mean_duration_us': np.float64(4.4616999999999996), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.213733502287311), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.087)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(70.213), 'mean_duration_us': np.float64(7.021299999999999), 'median_duration_us': np.float64(6.949), 'std_dev_duration_us': np.float64(0.20199259887431512), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.45)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(7.02)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.005443075563793235,99.8180890410306 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((1382400, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23424,10,75.732,7.5732,0.35573954267444335,0.00262144,7.63671875,0.3273657289002558,vector_bf16,0.7076539965155456,0.06178449865927964,0.23166166637849067,0.02022612743833192,11.400146484375,1.0742672872655885,114.00146484375,7.6065000000000005,6.99,8.001,0.7379154100589864,0.6057595626639087,0.7572833690432212,0.24156821608069123,0.19830492076977063,0.24790862209087552,10.85546875,10.57421875,13.21923828125,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(114.00099999999999), 'mean_duration_us': np.float64(11.400099999999998), 'median_duration_us': np.float64(10.8555), 'std_dev_duration_us': np.float64(1.0190769794279526), 'min_duration_us': np.float64(10.574), 'max_duration_us': np.float64(13.219)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(11.4)}]","{'input_shape': (1, 512, 3, 30, 30), 'output_shape': (1, 512, 5, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 512, 5, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.005403798357188038,99.8234928393878 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 60, 60), (1, 512, 4, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7372800, 14400, 3600, 60, 1), (9216000, 18000, 3600, 60, 1), ())","('', '', 'False')",16088,10,64.809,6.4809,2.0716897799729677,0.0073728,28.125,0.25,vector_bf16,2.6257999435642825,0.05310636454549985,0.6564499858910706,0.013276591136374962,11.23544921875,0.2268741028729728,112.3544921875,5.7490000000000006,5.579,12.338,2.634138894733294,2.556419944129349,2.7068515036077625,0.6585347236833236,0.6391049860323372,0.6767128759019406,11.19580078125,10.89501953125,11.5361328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(112.355), 'mean_duration_us': np.float64(11.2355), 'median_duration_us': np.float64(11.196), 'std_dev_duration_us': np.float64(0.2151749288369813), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(11.536)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.24)}]","{'op_shape': (1, 512, 4, 60, 60), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (7372800, 14400, 3600, 60, 1), 'stride_output': (9216000, 18000, 3600, 60, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.005325729990729979,99.82881856937853 +triton_poi_fused_cat_slice_20,triton,python3,CPU,thread 416 (python3),"((1, 7431, 3072), (1, 7431, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((22828032, 3072, 1), (22828032, 3072, 1), ())","('', '', '22828032')",9519,4,88.833,22.20825,1.8151432220810202,0.0,130.623046875,0.0,vector_bfloat16,4.891225828046335,0.14185672170069666,0.0,0.0,28.020751953125,0.8238069732058474,112.0830078125,21.6525,20.841,24.687,4.920384972057894,4.7030859301187045,5.021047437950847,0.0,0.0,0.0,27.840576171875,27.27880859375,29.123046875,"[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(112.083), 'mean_duration_us': np.float64(28.02075), 'median_duration_us': np.float64(27.8405), 'std_dev_duration_us': np.float64(0.7133667973069681), 'min_duration_us': np.float64(27.279), 'max_duration_us': np.float64(29.123)}]","[{'name': 'triton_poi_fused_cat_slice_20', 'stream': 0, 'mean_duration_us': np.float64(28.02)}]","{'fused_ops': 'aten.cat, aten.slice', 'xnumel': 22828032, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_slice', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_slice_20']",0.005312861324334877,99.83413143070287 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",7411,12,396.267,33.02225,2.6232116029089934,0.36339072,5.0654296875,68.41599190283401,matrix_bf16,0.5882212782379445,0.01929912788756603,40.24374220900187,1.3203689772874743,9.0390625,0.3101109126738394,108.46875,32.6485,29.854,36.875,0.5946616741462067,0.5390182559833507,0.6110851875737319,40.684368283312594,36.877468636836625,41.807999244986235,8.93212890625,8.69189453125,9.85400390625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(108.469), 'mean_duration_us': np.float64(9.039083333333332), 'median_duration_us': np.float64(8.931999999999999), 'std_dev_duration_us': np.float64(0.2969294131420611), 'min_duration_us': np.float64(8.692), 'max_duration_us': np.float64(9.854)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.04)}]","{'M': 77, 'N': 768, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.005141541416679215,99.83927297211955 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 4500, 4504), ())","('c10::BFloat16', 'Scalar')","((20268000, 20268000, 4504, 1), ())","('', '0.')",15750,10,86.337,8.633700000000001,0.9340877962542447,,,,,,,,,10.009765625,0.43111397138173235,100.09765625,8.453,7.671,11.127,,,,,,,10.013427734375,9.453125,10.5751953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(100.09799999999998), 'mean_duration_us': np.float64(10.009799999999998), 'median_duration_us': np.float64(10.0135), 'std_dev_duration_us': np.float64(0.40890972108767476), 'min_duration_us': np.float64(9.453), 'max_duration_us': np.float64(10.575)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]",,False,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.004744742106107925,99.84401771422566 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",7400,12,420.436,35.03633333333333,3.351654118988616,0.363568128,5.06982421875,68.39006067610516,matrix_bf16,0.6489723356417577,0.033584758408361205,44.38325741165351,2.296863665340159,8.214558919270834,0.4854992416870445,98.57470703125,36.6695,30.806,39.819,0.657096929199102,0.548454214296509,0.6772012569509236,44.93889885800897,37.50881699380384,46.31383505280836,8.091064453125,7.85009765625,9.69287109375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(98.574), 'mean_duration_us': np.float64(8.2145), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.4649102960070183), 'min_duration_us': np.float64(7.85), 'max_duration_us': np.float64(9.693)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]","{'M': 77, 'N': 3072, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0046725525908447516,99.8486902668165 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 5, 120, 120), (1, 256, 5, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((18432000, 72000, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', '1')",23947,3,25.498,8.499333333333334,0.4262866797512364,0.018432,105.46875,0.16666666666666666,vector_bf16,3.7162673445179872,0.14551911553469862,0.6193778907529978,0.024253185922449755,29.7900390625,1.1931431850768015,89.3701171875,8.683,8.012,8.803,3.7923182640144666,3.548480541455161,3.8080032280843334,0.632053044002411,0.5914134235758601,0.6346672046807222,29.162109375,29.0419921875,31.166015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.37), 'mean_duration_us': np.float64(29.790000000000003), 'median_duration_us': np.float64(29.162), 'std_dev_duration_us': np.float64(0.9742114760153464), 'min_duration_us': np.float64(29.042), 'max_duration_us': np.float64(31.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(29.79)}]","{'shape_in1': (1, 256, 5, 120, 120), 'shape_in2': (1, 256, 5, 120, 120), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (18432000, 72000, 14400, 120, 1), 'stride_input2': (18432000, 72000, 14400, 120, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.004236244622833822,99.85292651143934 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 352), ())","('c10::BFloat16', 'Scalar')","((123552, 123552, 352, 1), ())","('', '0.')",286,32,172.528,5.3915,0.45871236331503473,,,,,,,,,2.7806549072265625,0.14340866108737566,88.98095703125,5.223,4.717,6.43,,,,,,,2.76318359375,2.60302734375,3.36376953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(88.97999999999999), 'mean_duration_us': np.float64(2.7806249999999997), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.14124264361374722), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.78)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.004217797991328613,99.85714430943067 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((7425, 3072), (3072, 64), (7425, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((3072, 1), (1, 3072), (64, 1))","('', '', '')",10412,4,183.944,45.986,4.000609370250154,2.9196288,44.7872314453125,62.168946598091566,matrix_bf16,2.1745453125474734,0.03673918317195276,135.1891914108942,2.284036316674645,21.6011962890625,0.36163358406667456,86.40478515625,45.608000000000004,41.532,51.196,2.165133479341412,2.143331264607568,2.2245830268995026,134.60406765491643,133.24864693140793,138.29998340233607,21.69140625,21.11083984375,21.9111328125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(86.405), 'mean_duration_us': np.float64(21.60125), 'median_duration_us': np.float64(21.691499999999998), 'std_dev_duration_us': np.float64(0.3130737732548036), 'min_duration_us': np.float64(21.111), 'max_duration_us': np.float64(21.911)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(21.6)}]","{'M': 7425, 'N': 64, 'K': 3072, 'bias': False, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x32x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.004095684531075805,99.86123999396175 +aten::index,other,python3,CPU,thread 416 (python3),"((1, 256, 3072), ())","('c10::BFloat16', '')","((786432, 3072, 1), ())","('', '')",8826,4,612.491,153.12275,20.39973230829269,,,,,,,,,20.2420654296875,0.9286748569565053,80.96826171875,153.7185,128.932,176.122,,,,,,,20.402587890625,19.0205078125,21.142578125,"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.845999999999999), 'mean_duration_us': np.float64(1.7114999999999998), 'median_duration_us': np.float64(1.7215), 'std_dev_duration_us': np.float64(0.27234215611983387), 'min_duration_us': np.float64(1.401), 'max_duration_us': np.float64(2.002)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(7.606), 'mean_duration_us': np.float64(1.9015), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.0605), 'min_duration_us': np.float64(1.841), 'max_duration_us': np.float64(1.962)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.088999999999999), 'mean_duration_us': np.float64(2.2722499999999997), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.8777059231314325), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.765)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.012999999999998), 'mean_duration_us': np.float64(2.7532499999999995), 'median_duration_us': np.float64(2.643), 'std_dev_duration_us': np.float64(0.21467460841934716), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(3.124)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.335), 'mean_duration_us': np.float64(3.33375), 'median_duration_us': np.float64(3.404), 'std_dev_duration_us': np.float64(0.14568866634024752), 'min_duration_us': np.float64(3.083), 'max_duration_us': np.float64(3.444)}, {'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536000000000001), 'mean_duration_us': np.float64(3.3840000000000003), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.404)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.545), 'mean_duration_us': np.float64(4.88625), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.20625272725469596), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(1.9)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.33)}, {'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'aten::index', ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)'], ['aten::nonzero', 'Memset (Device)'], ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})'], ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})'], ['aten::nonzero', 'Memcpy DtoD (Device -> Device)'], ['void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)'], ['aten::nonzero', 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})']]",0.0038379871720055346,99.86507798113375 +aten::sigmoid,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",7403,12,101.761,8.480083333333333,1.3476461268943467,0.000236544,0.90234375,0.25,vector_bf16,0.14114164673452692,0.0075676801717640746,0.03528541168363173,0.0018919200429410189,6.72265625,0.38600629713516427,80.671875,8.077,7.541,12.569,0.14103243831188492,0.12238795225162635,0.14949609998457028,0.03525810957797122,0.030596988062906585,0.03737402499614257,6.708984375,6.3291015625,7.73095703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(80.67099999999999), 'mean_duration_us': np.float64(6.722583333333333), 'median_duration_us': np.float64(6.709), 'std_dev_duration_us': np.float64(0.3695933482295854), 'min_duration_us': np.float64(6.329), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.72)}]","{'op_shape': (1, 77, 3072), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::sigmoid', 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.003823938106354766,99.8689019192401 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60),)","('c10::BFloat16',)","((5529600, 10800, 3600, 60, 1),)","('',)",23776,6,55.482,9.247,0.6862495173040196,0.0055296,21.09375,0.25,vector_bf16,1.7229887363259582,0.40565225068878874,0.43074718408148954,0.10141306267219719,13.412353515625,2.9502668769184965,80.47412109375,9.489,8.343,10.135,1.5905173123821301,1.3273113924050635,2.2265167461292705,0.39762932809553253,0.33182784810126587,0.5566291865323176,13.99951171875,9.93408203125,16.6640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.474), 'mean_duration_us': np.float64(13.412333333333335), 'median_duration_us': np.float64(13.999500000000001), 'std_dev_duration_us': np.float64(2.693267820985421), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(16.664)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(13.41)}]","{'op_shape': (1, 512, 3, 60, 60), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (5529600, 10800, 3600, 60, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0038145643475597725,99.87271648358767 +triton_poi_fused_addmm_silu_view_10,triton,python3,CPU,thread 416 (python3),"((1, 256, 12288), (12288,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 12288, 1), (1,), ())","('', '', '3145728')",8769,8,175.383,21.922875,2.21974525163201,0.012582912,12.0234375,0.9980506822612085,vector_bfloat16,1.2689848480038175,0.06566213629943483,1.2665111933293463,0.06553413993237935,9.95880126953125,0.5239840543537515,79.67041015625,21.6725,19.529,26.049,1.27688115502905,1.1744432760518535,1.3508493996023858,1.2743921079432234,1.1721539129406413,1.348216164905305,9.8740234375,9.3330078125,10.73486328125,"[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(79.67099999999999), 'mean_duration_us': np.float64(9.958874999999999), 'median_duration_us': np.float64(9.873999999999999), 'std_dev_duration_us': np.float64(0.4902161353678597), 'min_duration_us': np.float64(9.333), 'max_duration_us': np.float64(10.735)}]","[{'name': 'triton_poi_fused_addmm_silu_view_10', 'stream': 0, 'mean_duration_us': np.float64(9.96)}]","{'fused_ops': 'aten.addmm, aten.silu, aten.view', 'xnumel': 3145728, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_silu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_silu_view_10']",0.0037764675402102424,99.87649295112787 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",7402,12,183.302,15.275166666666665,2.7142145300531264,0.000236544,0.9023513793945312,0.24999788624622696,vector_bf16,0.14551973000242957,0.009329217672864494,0.03637962490772905,0.0023322846985470666,6.528645833333333,0.4531159275466089,78.34375,14.151,13.75,23.104,0.14766957208867632,0.12304176976315957,0.15542066345845365,0.03691708088505391,0.030760182360784812,0.03885483734359961,6.408447265625,6.087890625,7.68994140625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(78.34400000000001), 'mean_duration_us': np.float64(6.528666666666667), 'median_duration_us': np.float64(6.4085), 'std_dev_duration_us': np.float64(0.4338206874837678), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.69)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.003713582348491729,99.88020653347637 +triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",8801,4,118.126,29.5315,1.6449005035766355,0.002359296,4.541015625,0.49548387096774194,vector_bfloat16,0.24737637234986534,0.008942471956551123,0.12257100255786875,0.004430850621052429,19.2677001953125,0.7119972658310234,77.07080078125,29.323500000000003,28.092,31.387,0.2492027157042075,0.23491982366119826,0.25618023432984816,0.12347592623279441,0.11639898359470983,0.12693317417117636,19.107421875,18.5869140625,20.26904296875,"[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(77.071), 'mean_duration_us': np.float64(19.26775), 'median_duration_us': np.float64(19.1075), 'std_dev_duration_us': np.float64(0.6165555023677911), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(20.269)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.27)}]","{'fused_ops': 'aten.add, aten.addmm, aten.div, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_12']",0.0036532431159521025,99.88385977659232 +triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (3072,), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (1,), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '', '256', '3072')",8767,4,120.53,30.1325,1.7644182232868337,0.002359296,4.546875,0.4948453608247423,vector_bfloat16,0.24810598640880147,0.006757780371793374,0.12277409636724197,0.0033440562664544472,19.2274169921875,0.5314483833154173,76.90966796875,30.060000000000002,28.122,32.288,0.25008368827155925,0.23900572066382725,0.2532508484282602,0.1237527529591221,0.11827087208106916,0.12532000746965452,19.067626953125,18.826171875,19.9482421875,"[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(76.90899999999999), 'mean_duration_us': np.float64(19.227249999999998), 'median_duration_us': np.float64(19.067500000000003), 'std_dev_duration_us': np.float64(0.4602180868892483), 'min_duration_us': np.float64(18.826), 'max_duration_us': np.float64(19.948)}]","[{'name': 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqu...', 'stream': 0, 'mean_duration_us': np.float64(19.23)}]","{'fused_ops': 'aten.add, aten.addmm, aten.div, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_div_mul_native_layer_norm_split_unsqueeze_view_9']",0.003645605238415441,99.88750538183074 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((36864000, 72000, 14400, 120, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23906,1,33.369,33.369,,0.184323072,140.630859375,1.249968751302029,vector_bf16,1.9973708393650793,,2.4966511339682538,,73.828125,,73.828125,33.369,33.369,33.369,1.9973708393650793,1.9973708393650793,1.9973708393650793,2.4966511339682538,2.4966511339682538,2.4966511339682538,73.828125,73.828125,73.828125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.71), 'mean_duration_us': np.float64(20.71), 'median_duration_us': np.float64(20.71), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.71), 'max_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(53.118), 'mean_duration_us': np.float64(53.118), 'median_duration_us': np.float64(53.118), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(53.118), 'max_duration_us': np.float64(53.118)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(20.71)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(53.12)}]","{'op_shape': (1, 512, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.00349953661679765,99.89100491844754 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 256), (256, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (3072, 1))","('', '', '')",8755,12,431.968,35.99733333333334,6.150257279664047,0.001572864,1.50634765625,0.9957860615883306,matrix_bf16,0.27985082309786186,0.01022192222582133,0.2786715489648725,0.010178847675112845,5.6510009765625,0.20468343430239708,67.81201171875,34.576,28.141,45.557,0.27672341764813324,0.26644073470060126,0.2942919359534207,0.2755573222090974,0.265317969854213,0.293051807860262,5.7080078125,5.3671875,5.92822265625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.81099999999999), 'mean_duration_us': np.float64(5.650916666666666), 'median_duration_us': np.float64(5.708), 'std_dev_duration_us': np.float64(0.19595554697147227), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","{'M': 1, 'N': 3072, 'K': 256, 'bias': False, 'stride_A': (256, 1), 'stride_B': (1, 256), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0032143660436788415,99.89421928449121 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 3, 13, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 12, 240, 240), (1, 3, 8, 240, 240)), ())","('TensorList', 'Scalar')","(((2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (2937600, 979200, 57600, 240, 1), (1555200, 518400, 57600, 240, 1)), ())","('', '2')",24594,1,104.415,104.415,,,,,,,,,,67.77099609375,,67.77099609375,104.415,104.415,104.415,,,,,,,67.77099609375,67.77099609375,67.77099609375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.407), 'mean_duration_us': np.float64(5.407), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.688), 'mean_duration_us': np.float64(5.688), 'median_duration_us': np.float64(5.688), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(5.688)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.727), 'mean_duration_us': np.float64(5.727), 'median_duration_us': np.float64(5.727), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(5.727)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.888), 'mean_duration_us': np.float64(5.888), 'median_duration_us': np.float64(5.888), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.208), 'mean_duration_us': np.float64(6.208), 'median_duration_us': np.float64(6.208), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(6.208)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.288), 'mean_duration_us': np.float64(6.288), 'median_duration_us': np.float64(6.288), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(6.288)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.328), 'mean_duration_us': np.float64(6.328), 'median_duration_us': np.float64(6.328), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.328), 'max_duration_us': np.float64(6.328)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.369), 'mean_duration_us': np.float64(6.369), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.369), 'max_duration_us': np.float64(6.369)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.011), 'mean_duration_us': np.float64(8.011), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.011), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.81)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.89)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.21)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.33)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.37)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.01)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0032124218566695097,99.89743170634789 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30),)","('c10::BFloat16',)","((1382400, 2700, 900, 30, 1),)","('',)",23422,10,94.32,9.431999999999999,0.6764787916524466,0.0013824,5.2734375,0.25,vector_bf16,0.8695253285713485,0.06056836956587955,0.2173813321428371,0.015142092391469887,6.388623046875,0.46857604295754646,63.88623046875,9.314,8.633,10.756,0.8821257781071701,0.766938967899228,0.9655231307016797,0.22053144452679252,0.191734741974807,0.24138078267541993,6.2685546875,5.72705078125,7.2099609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(63.886), 'mean_duration_us': np.float64(6.3886), 'median_duration_us': np.float64(6.2684999999999995), 'std_dev_duration_us': np.float64(0.4445501546507435), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(7.21)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(6.39)}]","{'op_shape': (1, 512, 3, 30, 30), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.003028279572785633,99.90045998592068 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '-inf')",274,32,292.695,9.14671875,0.9814487065089363,,,,,,,,,1.94549560546875,0.08448160107434809,62.255859375,8.993500000000001,8.252,14.031,,,,,,,1.94140625,1.8017578125,2.162109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(62.259), 'mean_duration_us': np.float64(1.94559375), 'median_duration_us': np.float64(1.9415), 'std_dev_duration_us': np.float64(0.08307220480363749), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.162)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.95)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0029509981391646852,99.90341098405985 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",7404,12,87.418,7.284833333333334,0.24314374100083005,0.000236544,1.353515625,0.16666666666666666,vector_bf16,0.2782672329167705,0.01820344400621297,0.04637787215279509,0.0030339073343688253,5.120198567708333,0.3315673742872191,61.4423828125,7.265499999999999,6.83,7.611,0.277947674233891,0.2495195014164306,0.3135885933757687,0.04632461237231515,0.041586583569405096,0.052264765562628115,5.10693359375,4.52587890625,5.68798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.442), 'mean_duration_us': np.float64(5.120166666666667), 'median_duration_us': np.float64(5.106999999999999), 'std_dev_duration_us': np.float64(0.31744863976537824), 'min_duration_us': np.float64(4.526), 'max_duration_us': np.float64(5.688)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (1, 77, 3072), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.0029124384301462665,99.90632342248999 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '0.')",278,32,173.37800000000001,5.4180625000000004,0.5015904342286418,,,,,,,,,1.8853912353515625,0.10690437015342119,60.33251953125,5.273,4.867,7.311,,,,,,,1.88134765625,1.68212890625,2.0419921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 32, 'total_duration_us': np.float64(60.334), 'mean_duration_us': np.float64(1.8854375), 'median_duration_us': np.float64(1.8815), 'std_dev_duration_us': np.float64(0.10526631034547564), 'min_duration_us': np.float64(1.682), 'max_duration_us': np.float64(2.042)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]",,False,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: LlamaDecoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(303): forward', 'nn.Module: LlamaAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/llama/modeling_llama.py(251): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::where', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0028598296554770797,99.90918325214547 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 4500, 512), ())","('c10::BFloat16', 'double')","((2304000, 512, 1), ())","('', '')",15798,10,105.898,10.5898,0.3741927013956551,0.002304,8.789070129394531,0.2499997829862995,vector_bf16,1.5538426134001333,0.1266760153837485,0.3884603161448978,0.031668976355506244,5.96787109375,0.5024323533781808,59.6787109375,10.6005,10.095,11.337,1.5445090965801156,1.3534875858013624,1.7300077345554536,0.3861269389653944,0.338371602724991,0.432501558203483,5.968017578125,5.3271484375,6.80908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(59.678999999999995), 'mean_duration_us': np.float64(5.967899999999999), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.4766303494323458), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.809)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]","{'shape_in1': (1, 4500, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2304000, 512, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0028288383887449895,99.91201209053422 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 5, 32, 32), (512, 16, 3, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((81920, 5120, 1024, 32, 1), (432, 27, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23411,1,76.653,76.653,,1.1943936,3.21484375,354.31348724179827,matrix_bf16,0.059645301724435835,,21.13313485157411,,56.517578125,,56.517578125,76.653,76.653,76.653,0.059645301724435835,0.059645301724435835,0.059645301724435835,21.13313485157411,21.13313485157411,21.13313485157411,56.517578125,56.517578125,56.517578125,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.486), 'mean_duration_us': np.float64(4.486), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(4.486)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.291), 'mean_duration_us': np.float64(8.291), 'median_duration_us': np.float64(8.291), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.291), 'max_duration_us': np.float64(8.291)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.664), 'mean_duration_us': np.float64(16.664), 'median_duration_us': np.float64(16.664), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.664), 'max_duration_us': np.float64(16.664)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(16.904), 'mean_duration_us': np.float64(16.904), 'median_duration_us': np.float64(16.904), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(16.904), 'max_duration_us': np.float64(16.904)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.61)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.57)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.29)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(16.66)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(16.9)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 5, 32, 32), 'filter_shape': (512, 16, 3, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (81920, 5120, 1024, 32, 1), 'weight_stride': (432, 27, 9, 3, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_32x16_half'], ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi128ELi32ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9EEEENS9_IJLi10EEEENS9_IJLi11ELi13ELi15ELi17EEEENS9_IJLi12ELi14ELi16ELi18EEEENS9_IJLi19EEEENS9_IJLi20EEEENS9_IJLi22EEEENS9_IJLi21EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4ELi5EEEES19_S1A_S1B_S1C_S1D_NS9_IJLi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14ELi15EEEENS9_IJLi16ELi17EEEENS9_IJLi18EEEES1G_S1H_S1J_S1I_NS9_IJLi23ELi24EEEENS9_IJLi25EEEEEEENS9_IJLi23ELi25ELi24EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEES26_EEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1Z_S16_S17_S20_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi128ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1Z_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.0026789971185257567,99.91469108765274 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 5, 120, 120),)","('c10::BFloat16',)","((36864000, 72000, 14400, 120, 1),)","('',)",23910,1,10.216,10.216,,0.036864,140.625,0.25,vector_bf16,2.623671943146079,,0.6559179857865197,,56.2021484375,,56.2021484375,10.216,10.216,10.216,2.623671943146079,2.623671943146079,2.623671943146079,0.6559179857865197,0.6559179857865197,0.6559179857865197,56.2021484375,56.2021484375,56.2021484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(56.202), 'mean_duration_us': np.float64(56.202), 'median_duration_us': np.float64(56.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(56.202), 'max_duration_us': np.float64(56.202)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(56.2)}]","{'op_shape': (1, 512, 5, 120, 120), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (36864000, 72000, 14400, 120, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.002664045394620656,99.91735513304737 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((), (1, 16, 33, 30, 30))","('float', 'c10::BFloat16')","((), (475200, 29700, 900, 30, 1))","('', '')",10433,4,70.905,17.72625,1.3672659763191637,0.0004752,2.7191200256347656,0.16666643284731644,vector_fp32,0.20851280370248568,0.004700497547749346,0.034752085196086004,0.000783415158890937,13.67919921875,0.307546133080185,54.716796875,17.8315,15.954,19.288,0.20788238374007562,0.20453486258713088,0.21375158474266054,0.03464701534975538,0.03408909594031315,0.0356252141445201,13.718994140625,13.3388671875,13.93994140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(54.717), 'mean_duration_us': np.float64(13.67925), 'median_duration_us': np.float64(13.719000000000001), 'std_dev_duration_us': np.float64(0.26632721884929417), 'min_duration_us': np.float64(13.339), 'max_duration_us': np.float64(13.94)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(13.68)}]","{'shape_in1': (), 'shape_in2': (1, 16, 33, 30, 30), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (), 'stride_input2': (475200, 29700, 900, 30, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})']",0.002593638050782703,99.91994877109815 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 4096), (4096, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (3072, 1))","('', '', '')",8761,4,149.041,37.26025,1.1281103300061852,0.025165824,24.013671875,0.9994306628710858,matrix_bf16,1.8836103211463935,0.01746044514912491,1.8825379118541588,0.01745050426941411,13.368896484375,0.12458063350205915,53.4755859375,37.5655,35.773,38.137,1.887815051541091,1.8596814886404616,1.89912969286293,1.8867402483397258,1.8586227029210243,1.8980484478161597,13.33837890625,13.2587890625,13.5400390625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(53.476), 'mean_duration_us': np.float64(13.369), 'median_duration_us': np.float64(13.3385), 'std_dev_duration_us': np.float64(0.10779842299403042), 'min_duration_us': np.float64(13.259), 'max_duration_us': np.float64(13.54)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(13.37)}]","{'M': 1, 'N': 3072, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0025348032486669646,99.92248357434681 +triton_poi_fused_addmm_silu_4,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), ())","('', '', '3072')",8756,20,380.685,19.03425,3.5172065302333024,1.2288e-05,0.017578125,0.6666666666666666,vector_bfloat16,0.007611346059008757,0.0010170857401483736,0.005074230706005838,0.0006780571600989158,2.4708251953125,0.3904354518977978,49.41650390625,17.826999999999998,15.243,26.94,0.008072869118905047,0.0053521531263292215,0.00885289305816135,0.005381912745936699,0.0035681020842194813,0.0059019287054409,2.283203125,2.08203125,3.44384765625,"[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'count': 20, 'total_duration_us': np.float64(49.415), 'mean_duration_us': np.float64(2.47075), 'median_duration_us': np.float64(2.283), 'std_dev_duration_us': np.float64(0.3805816436718934), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(3.444)}]","[{'name': 'triton_poi_fused_addmm_silu_4', 'stream': 0, 'mean_duration_us': np.float64(2.47)}]","{'fused_ops': 'aten.addmm, aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_silu_4']",0.0023423981699934276,99.9248259725168 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 4, 30, 30), (1, 512, 4, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1843200, 3600, 900, 30, 1), (2304000, 4500, 900, 30, 1), ())","('', '', 'False')",15954,10,61.2,6.12,0.2774951451026766,0.0018432,7.03125,0.25,vector_bf16,1.5027582498115497,0.07674218856873587,0.3756895624528874,0.019185547142183967,4.918505859375,0.26837691894912835,49.18505859375,6.103999999999999,5.719,6.559,1.5276967037358058,1.3434909155618826,1.573355673648015,0.38192417593395145,0.33587272889047065,0.39333891841200375,4.826171875,4.68603515625,5.48779296875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(49.184000000000005), 'mean_duration_us': np.float64(4.9184), 'median_duration_us': np.float64(4.8260000000000005), 'std_dev_duration_us': np.float64(0.25466613437989755), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.488)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.92)}]","{'op_shape': (1, 512, 4, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1843200, 3600, 900, 30, 1), 'stride_output': (2304000, 4500, 900, 30, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.002331427400440768,99.92715739991723 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 5, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((72000, 4500, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",15611,10,104.58500000000001,10.4585,2.5761808187918622,0.000114688,0.3560791015625,0.30716489544052106,vector_bf16,0.07974401877274273,0.0034605898065232375,0.024494563188336472,0.0010629717060832433,4.690087890625,0.202737951359435,46.90087890625,9.644,9.274,17.757,0.07934093029170627,0.07398162229102168,0.08630632595936795,0.02437074855720563,0.022724557275541797,0.026510273589164787,4.7060546875,4.326171875,5.046875,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(46.901), 'mean_duration_us': np.float64(4.6901), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.19239358097400241), 'min_duration_us': np.float64(4.326), 'max_duration_us': np.float64(5.047)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]","{'input_shape': (1, 16, 5, 30, 30), 'output_shape': (1, 16, 7, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 16, 7, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (72000, 4500, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.0022231547000877297,99.92938055461732 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '0')",15686,11,55.721,5.065545454545454,0.2860176091209646,,,,,,,,,4.223499644886363,0.8120007401551401,46.45849609375,5.087,4.707,5.698,,,,,,,4.40576171875,1.8818359375,4.88720703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(46.459), 'mean_duration_us': np.float64(4.223545454545455), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.7741596456964116), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.887)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.22)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.002202185254487077,99.93158273987181 +triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16,triton,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",8811,4,66.999,16.74975,0.9864712785141445,0.0,0.0,,,0.0,0.0,0.0,0.0,11.446044921875,0.038334483806650256,45.7841796875,16.384,16.034,18.197,0.0,0.0,0.0,0.0,0.0,0.0,11.43603515625,11.416015625,11.49609375,"[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.78399999999999), 'mean_duration_us': np.float64(11.445999999999998), 'median_duration_us': np.float64(11.436), 'std_dev_duration_us': np.float64(0.033166247903553964), 'min_duration_us': np.float64(11.416), 'max_duration_us': np.float64(11.496)}]","[{'name': 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16', 'stream': 0, 'mean_duration_us': np.float64(11.45)}]","{'fused_ops': 'aten.cat, aten.clone, aten.expand, aten.sin, aten.unsqueeze, aten.view', 'xnumel': 950400, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_expand_sin_unsqueeze_view_16']",0.0021702218942503205,99.93375296176606 +triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15,triton,python3,CPU,thread 416 (python3),"((7425, 128), ())","('float', 'Scalar')","((128, 1), ())","('', '950400')",8810,4,87.991,21.99775,2.091984922667147,0.0,0.0,,,0.0,0.0,0.0,0.0,11.295654296875,0.0980764883845896,45.1826171875,22.423000000000002,19.339,23.806,0.0,0.0,0.0,0.0,0.0,0.0,11.29541015625,11.17578125,11.416015625,"[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(45.183), 'mean_duration_us': np.float64(11.29575), 'median_duration_us': np.float64(11.2955), 'std_dev_duration_us': np.float64(0.0848539185895384), 'min_duration_us': np.float64(11.176), 'max_duration_us': np.float64(11.416)}]","[{'name': 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15', 'stream': 0, 'mean_duration_us': np.float64(11.3)}]","{'fused_ops': 'aten.cat, aten.clone, aten.cos, aten.expand, aten.unsqueeze, aten.view', 'xnumel': 950400, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_cat_clone_cos_expand_unsqueeze_view_15']",0.002141707151446784,99.93589466891751 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('float', 'Scalar')","((), ())","('', '-inf')",15683,11,106.539,9.685363636363636,2.433095816967645,,,,,,,,,4.055841619318182,0.7697365198769237,44.6142578125,8.552,7.862,14.953,,,,,,,4.2451171875,1.8017578125,4.64599609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(44.614), 'mean_duration_us': np.float64(4.055818181818181), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.733827180321438), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.06)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::scalar_tensor', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.002114766274317469,99.93800943519183 +aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '6', '1', '')",15658,10,122.231,12.223099999999999,2.564487839272742,,,,,,,,,4.449560546875,0.20212210188296303,44.49560546875,11.081,10.455,17.546,,,,,,,4.42578125,4.1650390625,4.80615234375,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(44.496), 'mean_duration_us': np.float64(4.4496), 'median_duration_us': np.float64(4.426), 'std_dev_duration_us': np.float64(0.19173794616611492), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.002109142019040473,99.94011857721087 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((5, 900), (5, 900), ())","('int', 'int', 'Scalar')","((900, 1), (1, 0), ())","('', '', 'False')",15669,10,96.916,9.6916,0.8569727339108674,4.5e-06,0.034332275390625,0.125,,0.008286666591879384,0.0006870143417483529,0.001035833323984923,8.587679271854412e-05,4.369287109375,0.3361100771303973,43.69287109375,9.479,9.184,12.108,0.008172024041874143,0.0074270172257479596,0.009879137076242796,0.0010215030052342679,0.0009283771532184949,0.0012348921345303496,4.4052734375,3.64404296875,4.84716796875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(43.693000000000005), 'mean_duration_us': np.float64(4.369300000000001), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.31885766417008077), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(4.847)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]","{'op_shape': (5, 900), 'dtype_in_out': ('int', 'int'), 'stride_input': (900, 1), 'stride_output': (1, 0)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::repeat_interleave', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.0020710915018578315,99.94218966871273 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 120, 120), (1, 512, 4, 120, 120)), ())","('TensorList', 'Scalar')","(((7372800, 14400, 14400, 120, 1), (29491200, 57600, 14400, 120, 1)), ())","('', '2')",23889,1,25.248,25.248,,,,,,,,,,42.6611328125,,42.6611328125,25.248,25.248,25.248,,,,,,,42.6611328125,42.6611328125,42.6611328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.456), 'mean_duration_us': np.float64(11.456), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.456), 'max_duration_us': np.float64(11.456)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(31.205), 'mean_duration_us': np.float64(31.205), 'median_duration_us': np.float64(31.205), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(31.205), 'max_duration_us': np.float64(31.205)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.46)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(31.2)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0020221859405397534,99.94421185465328 +triton_poi_fused_silu_18,triton,python3,CPU,thread 416 (python3),"((1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (3072, 1), ())","('', '', '3072')",9510,8,195.319,24.414875,3.5100225655562785,1.2288e-05,0.017578125,0.6666666666666666,vector_bfloat16,0.0037142269266815663,0.0002438981145842082,0.002476151284454378,0.00016259874305613888,4.98150634765625,0.3302784986302354,39.85205078125,24.0205,19.95,31.246,0.0037172806199717375,0.0033840193635141192,0.003967287020493957,0.0024781870799811586,0.002256012909009413,0.0026448580136626382,4.966552734375,4.64599609375,5.44677734375,"[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(39.852), 'mean_duration_us': np.float64(4.9815), 'median_duration_us': np.float64(4.9665), 'std_dev_duration_us': np.float64(0.3089826046883546), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.447)}]","[{'name': 'triton_poi_fused_silu_18', 'stream': 0, 'mean_duration_us': np.float64(4.98)}]","{'fused_ops': 'aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_silu_18']",0.0018890322754839537,99.94610088692876 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2700, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 2700), (1, 512))","('', '')",23512,3,112.537,37.51233333333334,13.078013852773418,1.4155776,5.7734375,233.82949932341,matrix_bf16,0.4937179551143691,0.06505753033299232,115.44582225137076,15.212369744981157,12.417317708333334,1.770000157041956,37.251953125,30.876,29.083,52.578,0.5284444047395789,0.418665584655906,0.5340438759476224,123.56589058051318,97.89636404403323,124.87521212956582,11.4560546875,11.3359375,14.4599609375,"[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB2048_LBSPPM0_LPA16_LPB32_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.252), 'mean_duration_us': np.float64(12.417333333333334), 'median_duration_us': np.float64(11.456), 'std_dev_duration_us': np.float64(1.44521401721529), 'min_duration_us': np.float64(11.336), 'max_duration_us': np.float64(14.46)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.42)}]","{'M': 2700, 'N': 512, 'K': 512, 'bias': False, 'stride_A': (1, 2700), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, True)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x128x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB2048_LBSPPM0_LPA16_LPB32_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.00176578470614237,99.9478666716349 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 768), (768, 3072), (1, 3072))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768), (3072, 1))","('', '', '')",8822,4,100.73,25.1825,1.4581507695251072,0.004718592,4.50732421875,0.9983750406239844,matrix_bf16,0.6030240207262196,0.012640305184470336,0.602044131189778,0.012619765202045177,7.8402099609375,0.1648879704515517,31.36083984375,25.403,23.315,26.609,0.6036086511765286,0.5870575604075692,0.6178212201442522,0.6026278116393552,0.586103615720524,0.6168172857598774,7.830078125,7.64990234375,8.05078125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(31.361), 'mean_duration_us': np.float64(7.84025), 'median_duration_us': np.float64(7.83), 'std_dev_duration_us': np.float64(0.1428467272988779), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(8.051)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.84)}]","{'M': 1, 'N': 3072, 'K': 768, 'bias': False, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0014865392743853352,99.94935321090928 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', '1')",23449,5,42.485,8.497,0.2733678839951766,0.0013824,7.91015625,0.16666666666666666,vector_bf16,1.3812113325818098,0.0842420361751385,0.230201888763635,0.014040339362523085,6.02421875,0.39087327315214687,30.12109375,8.433,8.293,8.973,1.3991377316530762,1.240012497262574,1.4582308524336853,0.2331896219421794,0.20666874954376235,0.24303847540561424,5.92822265625,5.68798828125,6.68896484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(30.121), 'mean_duration_us': np.float64(6.0241999999999996), 'median_duration_us': np.float64(5.928), 'std_dev_duration_us': np.float64(0.3496423315332399), 'min_duration_us': np.float64(5.688), 'max_duration_us': np.float64(6.689)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.02)}]","{'shape_in1': (1, 512, 3, 30, 30), 'shape_in2': (1, 512, 3, 30, 30), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1382400, 2700, 900, 30, 1), 'stride_input2': (1382400, 2700, 900, 30, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0014277739075199303,99.9507809848168 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 120, 120), (), ())","('c10::BFloat16', '', 'ScalarList')","((18432000, 72000, 120, 1), (), ())","('', '', '[2., 2.]')",24017,1,27.841,27.841,,,,,,,,,,29.44189453125,,29.44189453125,27.841,27.841,27.841,,,,,,,29.44189453125,29.44189453125,29.44189453125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.309), 'mean_duration_us': np.float64(20.309), 'median_duration_us': np.float64(20.309), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.309), 'max_duration_us': np.float64(20.309)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(9.13)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.31)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.0013955790964487297,99.95217656391326 +aten::where,elementwise,python3,CPU,thread 416 (python3),"((2700, 2700), (), ())","('bool', 'float', 'float')","((2700, 1), (), ())","('', '', '')",23485,1,13.109,13.109,,,,,,,,,,28.9619140625,,28.9619140625,13.109,13.109,13.109,,,,,,,28.9619140625,28.9619140625,28.9619140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(28.962), 'mean_duration_us': np.float64(28.962), 'median_duration_us': np.float64(28.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(28.962), 'max_duration_us': np.float64(28.962)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.96)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::where', 'aten::where', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool, float, float)#1} const&)::{lambda(int, bool)#1})']",0.001372827479422856,99.95354939139268 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '', '', '', '256', '3072')",8771,4,141.57,35.3925,14.702319306830473,0.001572864,4.541015625,0.3303225806451613,vector_bfloat16,0.6851827154488181,0.06909820745429199,0.22633132278051282,0.022824698204256425,6.99951171875,0.6636223025908732,27.998046875,29.168,25.909,57.325,0.6631096959926885,0.6323686401660074,0.7821428296438884,0.21904010603113322,0.20888564113870695,0.25835943792107796,7.190185546875,6.087890625,7.52978515625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.998), 'mean_duration_us': np.float64(6.9995), 'median_duration_us': np.float64(7.1899999999999995), 'std_dev_duration_us': np.float64(0.5746923089793354), 'min_duration_us': np.float64(6.088), 'max_duration_us': np.float64(7.53)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(7.0)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11']",0.0013271390847035534,99.95487653047739 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 6, 3072), (3072,), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 3072, 1), (1,), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '', '', '6', '3072')",8873,4,107.22,26.805,0.9492010675650702,3.6864e-05,0.181640625,0.1935483870967742,vector_bfloat16,0.027263880261753002,0.0007167436078113684,0.005276880050661871,0.00013872456925381293,6.9896240234375,0.18656449590027488,27.95849609375,26.735,25.718,28.032,0.02740628600167764,0.026270896551724137,0.027972052491932593,0.005304442451937607,0.005084689655172414,0.0054139456435998564,6.94970703125,6.80908203125,7.25,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.958), 'mean_duration_us': np.float64(6.9895), 'median_duration_us': np.float64(6.9495000000000005), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(7.25)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(6.99)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_11']",0.0013252643329445548,99.95620179481034 +aten::clamp,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '0', '1')",24635,1,15.483,15.483,,,,,,,,,,27.64111328125,,27.64111328125,15.483,15.483,15.483,,,,,,,27.64111328125,27.64111328125,27.64111328125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.641), 'mean_duration_us': np.float64(27.641), 'median_duration_us': np.float64(27.641), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.641), 'max_duration_us': np.float64(27.641)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(27.64)}]",,False,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::clamp', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0013102200287056758,99.95751201483904 +triton_per_fused_native_layer_norm_2,triton,python3,CPU,thread 416 (python3),"((1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1, 24), (1, 7425, 1), (1, 7425, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (178200, 1, 178200, 7425), (7456, 1, 7456), (7456, 1, 7456), (), ())","('', '', '', '', '', '7425', '24')",8847,4,104.506,26.1265,2.8952933645257204,0.0,0.0,,,0.0,0.0,0.0,0.0,6.5887451171875,0.43476345613526435,26.35498046875,25.458,23.485,30.105,0.0,0.0,0.0,0.0,0.0,0.0,6.468505859375,6.2080078125,7.2099609375,"[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(26.355), 'mean_duration_us': np.float64(6.58875), 'median_duration_us': np.float64(6.468500000000001), 'std_dev_duration_us': np.float64(0.37655104235680975), 'min_duration_us': np.float64(6.208), 'max_duration_us': np.float64(7.21)}]","[{'name': 'triton_per_fused_native_layer_norm_2', 'stream': 0, 'mean_duration_us': np.float64(6.59)}]","{'fused_ops': 'aten.native_layer_norm', 'xnumel': 7425, 'rnumel': 24}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused_native_layer_norm', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused_native_layer_norm_2']",0.00124925587891305,99.95876127071796 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 60, 60), (1, 512, 3, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((5529600, 10800, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', '1')",23803,3,24.928,8.309333333333333,0.035641735835019395,0.0055296,31.640625,0.16666666666666666,vector_bf16,3.964083768595541,0.2087833368924987,0.6606806280992569,0.03479722281541643,8.384602864583334,0.4286879502189478,25.15380859375,8.313,8.272,8.343,3.8525670352100696,3.8347381229189006,4.204946147657652,0.642094505868345,0.6391230204864835,0.7008243579429421,8.61181640625,7.89013671875,8.65185546875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(25.153999999999996), 'mean_duration_us': np.float64(8.384666666666666), 'median_duration_us': np.float64(8.612), 'std_dev_duration_us': np.float64(0.3501631365838246), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.652)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(8.38)}]","{'shape_in1': (1, 512, 3, 60, 60), 'shape_in2': (1, 512, 3, 60, 60), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (5529600, 10800, 3600, 60, 1), 'stride_input2': (5529600, 10800, 3600, 60, 1), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0011923189736397551,99.9599535896916 +triton_red_fused_addmm_native_layer_norm_view_0,triton,python3,CPU,thread 416 (python3),"((256, 3072), (3072,), (3072,), (3072,), (1, 256, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((3072, 1), (1,), (1,), (1,), (786432, 3072, 1), (), ())","('', '', '', '', '', '256', '3072')",8724,4,195.07,48.7675,13.383424736093023,0.0,3.017578125,0.0,vector_bfloat16,0.552064744817549,0.03412372272570506,0.0,0.0,5.74755859375,0.346767475313975,22.990234375,43.454499999999996,39.599,68.562,0.5467207495711939,0.5163505721115538,0.5984669080162541,0.0,0.0,0.0,5.78759765625,5.287109375,6.1279296875,"[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.99), 'mean_duration_us': np.float64(5.7475), 'median_duration_us': np.float64(5.7875), 'std_dev_duration_us': np.float64(0.30036685902409416), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(6.128)}]","[{'name': 'triton_red_fused_addmm_native_layer_norm_view_0', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]","{'fused_ops': 'aten.addmm, aten.native_layer_norm, aten.view', 'xnumel': 256, 'rnumel': 3072}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_addmm_native_layer_norm_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_addmm_native_layer_norm_view_0']",0.0010897631088974905,99.96104335280049 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((57600, 7430400, 240, 1), (), ())","('', '', '1')",24634,1,10.766,10.766,,0.0222912,85.03418731689453,0.2499999775696259,vector_bf16,3.946778049278119,,0.9866944237918217,,22.591796875,,22.591796875,10.766,10.766,10.766,3.946778049278119,3.946778049278119,3.946778049278119,0.9866944237918217,0.9866944237918217,0.9866944237918217,22.591796875,22.591796875,22.591796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.592), 'mean_duration_us': np.float64(22.592), 'median_duration_us': np.float64(22.592), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.592), 'max_duration_us': np.float64(22.592)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(22.59)}]","{'shape_in1': (129, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (57600, 7430400, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0010708767208068366,99.96211422952129 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((129, 3, 240, 240), ())","('c10::BFloat16', 'double')","((57600, 7430400, 240, 1), ())","('', '')",24633,1,16.134,16.134,,0.0222912,85.03418731689453,0.2499999775696259,vector_bf16,3.9748705248906204,,0.9937175420648222,,22.43212890625,,22.43212890625,16.134,16.134,16.134,3.9748705248906204,3.9748705248906204,3.9748705248906204,0.9937175420648222,0.9937175420648222,0.9937175420648222,22.43212890625,22.43212890625,22.43212890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.432), 'mean_duration_us': np.float64(22.432), 'median_duration_us': np.float64(22.432), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.432), 'max_duration_us': np.float64(22.432)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(22.43)}]","{'shape_in1': (129, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (57600, 7430400, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/video_processor.py(93): postprocess_video', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0010633082785205083,99.96317753779981 +triton_poi_fused__to_copy_cat_slice_3,triton,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '256')",8754,12,190.804,15.900333333333334,4.325386274570448,0.0,0.00048828125,0.0,vector_bfloat16,0.00027737682601958554,2.6973625899397195e-05,0.0,0.0,1.8617757161458333,0.18005556047818996,22.34130859375,13.525500000000001,12.258,23.445,0.00027510269361937824,0.00022834843205574913,0.0003277824320100031,0.0,0.0,0.0,1.861328125,1.56201171875,2.2421875,"[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.342), 'mean_duration_us': np.float64(1.8618333333333332), 'median_duration_us': np.float64(1.8615), 'std_dev_duration_us': np.float64(0.17237596184567677), 'min_duration_us': np.float64(1.562), 'max_duration_us': np.float64(2.242)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_3', 'stream': 0, 'mean_duration_us': np.float64(1.86)}]","{'fused_ops': 'aten._to_copy, aten.cat, aten.slice', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_cat_slice', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_cat_slice_3']",0.0010590032929998444,99.9642365410928 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3,triton,python3,CPU,thread 416 (python3),"((1, 6, 3072), (1, 18432), (18432,), (1, 6, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((18432, 3072, 1), (18432, 1), (1,), (18432, 3072, 1), (), ())","('', '', '', '', '6', '3072')",8849,4,108.431,27.10775,1.6010570206377206,3.6864e-05,0.140625,0.25,vector_bfloat16,0.027122606428067145,0.0002951317347994232,0.006780651607016786,7.37829336998558e-05,5.4371337890625,0.059814453125000076,21.74853515625,26.499499999999998,25.969,29.463,0.027270172295466858,0.02667990882586801,0.027270172295466858,0.0068175430738667145,0.006669977206467003,0.0068175430738667145,5.4072265625,5.4072265625,5.52685546875,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.748), 'mean_duration_us': np.float64(5.437), 'median_duration_us': np.float64(5.407), 'std_dev_duration_us': np.float64(0.05196152422706637), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(5.527)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 6, 'rnumel': 3072}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_3']",0.0010309051616983079,99.9652674462545 +triton_red_fused__to_copy_mul_sum_unsqueeze_5,triton,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256), (1, 4096, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'float', 'Scalar', 'Scalar')","((1048576, 4096, 1), (256, 1), (8192, 1, 4096), (), ())","('', '', '', '8192', '128')",8758,4,109.063,27.26575,2.826843395615208,0.002097152,2.00048828125,0.9997559189650964,vector_bfloat16,0.38593002023742,0.007783255073664616,0.38583582203868005,0.007781355328711315,5.43701171875,0.10999305125165447,21.748046875,26.855,24.807,30.546,0.3865704980368063,0.3768104439961407,0.3937686408799267,0.38647614350958226,0.37671847171300765,0.39367252942254816,5.427001953125,5.3271484375,5.56689453125,"[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(21.747999999999998), 'mean_duration_us': np.float64(5.436999999999999), 'median_duration_us': np.float64(5.427), 'std_dev_duration_us': np.float64(0.09539392014169465), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.567)}]","[{'name': 'triton_red_fused__to_copy_mul_sum_unsqueeze_5', 'stream': 0, 'mean_duration_us': np.float64(5.44)}]","{'fused_ops': 'aten._to_copy, aten.mul, aten.sum, aten.unsqueeze', 'xnumel': 8192, 'rnumel': 128}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__to_copy_mul_sum_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__to_copy_mul_sum_unsqueeze_5']",0.0010308820166148635,99.96629832827112 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('c10::BFloat16', 'float', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",8714,5,58.946,11.7892,3.6696312757550995,0.0004752,2.7191162109375,0.16666666666666666,vector_bf16,0.6834939752189207,0.06414232990346092,0.1139156625364868,0.010690388317243478,4.2052734375,0.44987235908125317,21.0263671875,9.945,8.582,16.304,0.7048838242394978,0.569461439438268,0.7191203940886699,0.11748063737324965,0.09491023990637801,0.11985339901477832,4.044921875,3.96484375,5.0068359375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(21.027), 'mean_duration_us': np.float64(4.2054), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.4023936381206839), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.21)}]","{'op_shape': (1, 16, 33, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (475200, 29700, 900, 30, 1), 'stride_output': (475200, 29700, 900, 30, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.0009966735832839975,99.96729500185441 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 3, 30, 30), (1, 512, 3, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 2700, 900, 30, 1), (1382400, 1, 460800, 15360, 512), ())","('', '', 'False')",23605,1,8.733,8.733,,0.0013824,5.2734375,0.25,vector_bf16,0.2696081516046091,,0.06740203790115228,,20.509765625,,20.509765625,8.733,8.733,8.733,0.2696081516046091,0.2696081516046091,0.2696081516046091,0.06740203790115228,0.06740203790115228,0.06740203790115228,20.509765625,20.509765625,20.509765625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.51), 'mean_duration_us': np.float64(20.51), 'median_duration_us': np.float64(20.51), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.51), 'max_duration_us': np.float64(20.51)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.51)}]","{'op_shape': (1, 512, 3, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1382400, 2700, 900, 30, 1), 'stride_output': (1382400, 1, 460800, 15360, 512)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: HunyuanVideoResnetBlockCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(167): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0009721860849997916,99.9682671879394 +aten::upsample_nearest3d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((921600, 1800, 900, 30, 1), (), ())","('', '', '[1., 2., 2.]')",23753,1,8.683,8.683,,,,,,,,,,20.18896484375,,20.18896484375,8.683,8.683,8.683,,,,,,,20.18896484375,20.18896484375,20.18896484375,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(20.189), 'mean_duration_us': np.float64(20.189), 'median_duration_us': np.float64(20.189), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(20.189), 'max_duration_us': np.float64(20.189)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest3d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(20.19)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest3d', 'aten::upsample_nearest3d', 'void at::native::(anonymous namespace)::upsample_nearest3d_out_frame(c10::BFloat16 const*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, c10::BFloat16*, float, float, float)']",0.0009569797651768019,99.96922416770458 +aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 2700, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (1,), ())","('', '', '1')",23514,3,27.481,9.160333333333334,1.861493575958116,0.0013824,5.2744140625,0.24995371227550453,vector_bf16,0.838959693432371,0.1285371762053959,0.20970108982294036,0.032128344357949326,6.68896484375,0.9474872133303112,20.06689453125,8.182,7.992,11.307,0.7800769939393939,0.7504119485888432,0.9863901377688757,0.1949831404958678,0.18756825228567645,0.24655187668727685,7.08984375,5.60693359375,7.3701171875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.067), 'mean_duration_us': np.float64(6.689), 'median_duration_us': np.float64(7.09), 'std_dev_duration_us': np.float64(0.7735817129862019), 'min_duration_us': np.float64(5.607), 'max_duration_us': np.float64(7.37)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.69)}]","{'shape_in1': (1, 2700, 512), 'shape_in2': (512,), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1382400, 512, 1), 'stride_input2': (1,), 'stride_output': None}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.0009511934943156947,99.9701753611989 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), (1, 3, 240, 240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1555200, 518400, 240, 1), (172800, 57600, 240, 1), ())","('', '', 'False')",24562,4,21.833,5.45825,0.30354612499585587,0.0001728,0.6591796875,0.25,vector_bf16,0.13918134795507703,0.0016063428511871143,0.03479533698876926,0.00040158571279677856,4.9666748046875,0.056854021444259904,19.86669921875,5.398,5.168,5.869,0.13860769744594267,0.13805125804564075,0.14145873888278207,0.03465192436148567,0.03451281451141019,0.03536468472069552,4.98681640625,4.88623046875,5.0068359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.867), 'mean_duration_us': np.float64(4.96675), 'median_duration_us': np.float64(4.987), 'std_dev_duration_us': np.float64(0.049398254017728016), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]","{'op_shape': (1, 3, 240, 240), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1555200, 518400, 240, 1), 'stride_output': (172800, 57600, 240, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0009417040101034788,99.971117065209 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 240, 240), ())","('c10::BFloat16', 'double')","((1555200, 518400, 240, 1), ())","('', '')",24558,4,24.305999999999997,6.076499999999999,0.16760568804985918,0.0001728,0.6591873168945312,0.2499971065149709,vector_bf16,0.13917722334307966,0.0009275068197403422,0.034793903128557783,0.00023187402120798762,4.966552734375,0.03309163842745591,19.8662109375,6.074,5.909,6.249,0.1391657475422729,0.13805285586112737,0.14032454242664552,0.03479103421156115,0.03451281451141019,0.035080729579698655,4.966796875,4.92578125,5.0068359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.866999999999997), 'mean_duration_us': np.float64(4.966749999999999), 'median_duration_us': np.float64(4.967), 'std_dev_duration_us': np.float64(0.02863891583143451), 'min_duration_us': np.float64(4.926), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.97)}]","{'shape_in1': (1, 3, 240, 240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (1555200, 518400, 240, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(867): blend_t', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::AUnaryFunctor > const&)::{lambda(int, bool)#1})']",0.0009416808650200344,99.97205874607403 +triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14,triton,python3,CPU,thread 416 (python3),"((1, 256, 3072), (256, 3072), (3072,), (1, 6144), (6144,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((786432, 3072, 1), (3072, 1), (1,), (6144, 1), (1,), ())","('', '', '', '', '', '786432')",8809,4,102.731,25.68275,2.7150337474882345,0.001572864,4.529296875,0.3311772315653299,vector_bfloat16,1.0187083492000564,0.03145074450221282,0.337373010860562,0.010415770494911379,4.66552734375,0.1483710960296656,18.662109375,25.387500000000003,22.773,29.183,1.0312331515408668,0.9719787125012491,1.0403883812172425,0.34152094022569457,0.3218972191465974,0.34455294384426144,4.60546875,4.56494140625,4.88623046875,"[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.662), 'mean_duration_us': np.float64(4.6655), 'median_duration_us': np.float64(4.6055), 'std_dev_duration_us': np.float64(0.12837542599734572), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.886)}]","[{'name': 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14', 'stream': 0, 'mean_duration_us': np.float64(4.67)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.split, aten.unsqueeze, aten.view', 'xnumel': 786432, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_mul_split_unsqueeze_view_14']",0.0008846050892460727,99.97294335116327 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4, 120, 120), (1, 256, 4, 120, 120), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((14745600, 57600, 14400, 120, 1), (18432000, 72000, 14400, 120, 1), ())","('', '', 'False')",24030,1,5.878,5.878,,0.0147456,56.25,0.25,vector_bf16,3.173329354279409,,0.7933323385698523,,18.5869140625,,18.5869140625,5.878,5.878,5.878,3.173329354279409,3.173329354279409,3.173329354279409,0.7933323385698523,0.7933323385698523,0.7933323385698523,18.5869140625,18.5869140625,18.5869140625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(18.587), 'mean_duration_us': np.float64(18.587), 'median_duration_us': np.float64(18.587), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(18.587), 'max_duration_us': np.float64(18.587)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(18.59)}]","{'op_shape': (1, 256, 4, 120, 120), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (14745600, 57600, 14400, 120, 1), 'stride_output': (18432000, 72000, 14400, 120, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0008810407463956307,99.97382439190966 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 60, 60), (), ())","('c10::BFloat16', '', 'ScalarList')","((5529600, 10800, 60, 1), (), ())","('', '', '[2., 2.]')",23873,1,26.82,26.82,,,,,,,,,,18.46484375,,18.46484375,26.82,26.82,26.82,,,,,,,18.46484375,18.46484375,18.46484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(13.218), 'mean_duration_us': np.float64(13.218), 'median_duration_us': np.float64(13.218), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(13.218), 'max_duration_us': np.float64(13.218)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(13.22)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.0008752544755345234,99.97469964638519 +triton_poi_fused_addmm_clone_permute_view_31,triton,python3,CPU,thread 416 (python3),"((7425, 64), (64,), (1, 16, 33, 1, 15, 2, 15, 2), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1), (1,), (475200, 29700, 900, 900, 60, 30, 2, 1), ())","('', '', '', '475200')",10413,4,114.78,28.695,1.2848234638787273,0.0,2.71923828125,0.0,vector_bfloat16,0.6208310618269924,0.018353194911004008,0.0,0.0,4.595703125,0.13275863452711426,18.3828125,28.197,27.811,30.575,0.6137628454066637,0.6084734546212358,0.6473251018734065,0.0,0.0,0.0,4.64599609375,4.40478515625,4.68603515625,"[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.383000000000003), 'mean_duration_us': np.float64(4.595750000000001), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.11487030730349758), 'min_duration_us': np.float64(4.405), 'max_duration_us': np.float64(4.686)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_31', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]","{'fused_ops': 'aten.addmm, aten.clone, aten.permute, aten.view', 'xnumel': 475200, 'rnumel': 1}",True,/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'Torch-Compiled Region: 1/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(240): torch_dynamo_resume_in_forward_at', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ff/cffmuq337h3pf76ym5icy7t33wsldujnyn5qjn3l6h6p5o35hedd.py(3472): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_clone_permute_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_clone_permute_view_31']",0.0008713661015158595,99.97557101248671 +triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1,triton,python3,CPU,thread 416 (python3),"((1, 256), (1, 24, 256, 256), (1, 24, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1), (1572864, 65536, 256, 1), (1572864, 65536, 256, 1), ())","('', '', '', '1572864')",8728,4,131.815,32.95375,2.281149911046329,0.0,9.00048828125,0.0,vector_bfloat16,2.178712378705549,0.07557592568513834,0.0,0.0,4.335693359375,0.15054089193657735,17.3427734375,32.953500000000005,30.735,35.173,2.1833347712206237,2.1043441924877517,2.243835779893197,0.0,0.0,0.0,4.325927734375,4.2060546875,4.48486328125,"[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.343), 'mean_duration_us': np.float64(4.33575), 'median_duration_us': np.float64(4.3260000000000005), 'std_dev_duration_us': np.float64(0.13048060200658163), 'min_duration_us': np.float64(4.206), 'max_duration_us': np.float64(4.485)}]","[{'name': 'triton_poi_fused__scaled_dot_product_efficient_attention__to_cop...', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]","{'fused_ops': 'aten._scaled_dot_product_efficient_attention, aten._to_copy, aten.bitwise_and, aten.clone, aten.expand, aten.fill, aten.lift_fresh, aten.repeat, aten.scalar_tensor, aten.select, aten.transpose, aten.unsqueeze, aten.view, aten.where', 'xnumel': 1572864, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__scaled_dot_product_efficient_attention__to_copy_bitwise_and_clone_expand_fill_lift_fresh_repeat_scalar_tensor_select_transpose_unsqueeze_view_where_1']",0.0008220670737792259,99.9763930795605 +triton_per_fused__to_copy_div_mul_sum_unsqueeze_7,triton,python3,CPU,thread 416 (python3),"((1, 4096, 2), (1, 1), (1, 4096), (), ())","('float', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((8192, 1, 4096), (1, 1), (4096, 1), (), ())","('', '', '', '4096', '2')",8760,4,80.35900000000001,20.089750000000002,2.45601688037087,2.4576e-05,0.0078125,3.0,vector_bfloat16,0.0018962719219206546,0.0001336466931292521,0.005688815765761963,0.0004009400793877561,4.33544921875,0.29147214306464797,17.341796875,19.7945,17.596,23.174,0.0018596418783100956,0.0017785663097635957,0.0020872376212988306,0.005578925634930287,0.005335698929290787,0.006261712863896492,4.405517578125,3.9248046875,4.60595703125,"[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(17.342), 'mean_duration_us': np.float64(4.3355), 'median_duration_us': np.float64(4.4055), 'std_dev_duration_us': np.float64(0.25236927309004953), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.606)}]","[{'name': 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7', 'stream': 0, 'mean_duration_us': np.float64(4.34)}]","{'fused_ops': 'aten._to_copy, aten.div, aten.mul, aten.sum, aten.unsqueeze', 'xnumel': 4096, 'rnumel': 2}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_div_mul_sum_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_div_mul_sum_unsqueeze_7']",0.000822020783612337,99.97721510034411 +aten::nonzero,other,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",10416,1,127.97,127.97,,,,,,,,,,16.4580078125,,16.4580078125,127.97,127.97,127.97,,,,,,,16.4580078125,16.4580078125,16.4580078125,"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.881), 'mean_duration_us': np.float64(1.881), 'median_duration_us': np.float64(1.881), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(1.881)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.922), 'mean_duration_us': np.float64(1.922), 'median_duration_us': np.float64(1.922), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.922), 'max_duration_us': np.float64(1.922)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.962), 'mean_duration_us': np.float64(1.962), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(1.962)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.284), 'mean_duration_us': np.float64(3.284), 'median_duration_us': np.float64(3.284), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.284), 'max_duration_us': np.float64(3.284)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.324), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.324)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::nonzero', ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})'], ['Memset (Device)'], ['void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)'], ['Memcpy DtoD (Device -> Device)'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})']]",0.0007801281825779206,99.9779952285267 +aten::cat,elementwise,python3,CPU,thread 416 (python3),"(((1, 512, 1, 60, 60), (1, 512, 2, 60, 60)), ())","('TensorList', 'Scalar')","(((1843200, 3600, 3600, 60, 1), (3686400, 7200, 3600, 60, 1)), ())","('', '2')",23755,1,25.658,25.658,,,,,,,,,,15.822265625,,15.822265625,25.658,25.658,25.658,,,,,,,15.822265625,15.822265625,15.822265625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.332), 'mean_duration_us': np.float64(8.332), 'median_duration_us': np.float64(8.332), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.332), 'max_duration_us': np.float64(8.332)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(8.33)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::cat', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', []]",0.0007499932839332741,99.97874522181063 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), (16, 16, 1, 1, 1), (16,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((475200, 29700, 900, 30, 1), (16, 1, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1, 1]', '[0, 0, 0]', '[1, 1, 1]', 'False', '[0, 0, 0]', '1')",23396,1,89.533,89.533,,0.0013824,0.165283203125,7.976366322008863,matrix_bf16,0.011066377003180148,,0.08826947683481949,,15.6611328125,,15.6611328125,89.533,89.533,89.533,0.011066377003180148,0.011066377003180148,0.011066377003180148,0.08826947683481949,0.08826947683481949,0.08826947683481949,15.6611328125,15.6611328125,15.6611328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR0_DTVA0_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SPO1_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.768), 'mean_duration_us': np.float64(5.768), 'median_duration_us': np.float64(5.768), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(5.768)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0...', 'stream': 0, 'mean_duration_us': np.float64(5.77)}]","{'convNd': 'conv3d', 'input_shape': (1, 16, 3, 30, 30), 'filter_shape': (16, 16, 1, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (475200, 29700, 900, 30, 1), 'weight_stride': (16, 1, 1, 1, 1), 'bias': False, 'stride': (1, 1, 1), 'padding': (0, 0, 0), 'dilation': (1, 1, 1), 'transposed_conv': False, 'output_padding': (0, 0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(699): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: Conv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(716): forward', 'torch/nn/modules/conv.py(699): _conv_forward', 'aten::conv3d', 'aten::convolution', 'aten::_convolution', ['aten::miopen_convolution', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['aten::miopen_convolution', 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR0_DTVA0_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LRVW8_LWPMn1_MIAV1_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SPO1_SRVW0_SSO1_SVW1_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WG32_8_1_WGMn16']]",0.0007423554063966126,99.97948757721703 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 2700), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2700, 2700, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",23499,1,40.139,40.139,,0.006915072,5.279296875,1.2491675915649278,vector_bf16,0.3543651333729253,,0.44266144019004156,,15.62158203125,,15.62158203125,40.139,40.139,40.139,0.3543651333729253,0.3543651333729253,0.3543651333729253,0.44266144019004156,0.44266144019004156,0.44266144019004156,15.62158203125,15.62158203125,15.62158203125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.488), 'mean_duration_us': np.float64(5.488), 'median_duration_us': np.float64(5.488), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.488), 'max_duration_us': np.float64(5.488)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.134), 'mean_duration_us': np.float64(10.134), 'median_duration_us': np.float64(10.134), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.134), 'max_duration_us': np.float64(10.134)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(5.49)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(10.13)}]","{'op_shape': (1, 512, 2700), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2700, 2700, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.0007404806546376139,99.98022805787167 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (1, 16, 33, 30, 30), ())","('float', 'c10::BFloat16', 'Scalar')","((475200, 29700, 900, 30, 1), (475200, 29700, 900, 30, 1), ())","('', '', 'False')",12145,3,119.156,39.71866666666667,1.1365713058727702,0.0004752,2.7191162109375,0.16666666666666666,vector_fp32,0.632147440062655,0.016996500050284122,0.10535790667710916,0.00283275000838068,4.512532552083333,0.12232135644087852,13.53759765625,39.208,38.927,41.021,0.6356000435397844,0.613689710982659,0.6471525656655215,0.10593334058996408,0.10228161849710984,0.10785876094425358,4.48583984375,4.40576171875,4.64599609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.538), 'mean_duration_us': np.float64(4.512666666666667), 'median_duration_us': np.float64(4.486), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.646)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","{'op_shape': (1, 16, 33, 30, 30), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (475200, 29700, 900, 30, 1), 'stride_output': (475200, 29700, 900, 30, 1)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.0006416974384967914,99.98086975531017 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",10481,6,119.807,19.967833333333335,6.4283491945185025,1.536e-06,0.0004901885986328125,2.9883268482490273,vector_bfloat16,0.0002332364906786265,1.225297684470494e-05,0.0006969868670863236,3.661589967600538e-05,2.2089029947916665,0.11725194218808946,13.25341796875,19.629,13.77,27.17,0.0002357283544803103,0.00021762910895182963,0.000246874296435272,0.0007044333705870751,0.0006503469092412653,0.0007377410881801125,2.18212890625,2.08203125,2.36181640625,"[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(13.253000000000002), 'mean_duration_us': np.float64(2.2088333333333336), 'median_duration_us': np.float64(2.182), 'std_dev_duration_us': np.float64(0.10705203822855923), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.21)}]","{'fused_ops': 'aten._to_copy, aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/1', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2']",0.0006282269999321337,99.9814979823101 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 2700, 512), (1, 2700, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1382400, 512, 1), (2700, 1, 2700), ())","('', '', '1')",23595,1,13.79,13.79,,0.0013824,7.91015625,0.16666666666666666,vector_bf16,0.6573381007661946,,0.1095563501276991,,12.6181640625,,12.6181640625,13.79,13.79,13.79,0.6573381007661946,0.6573381007661946,0.6573381007661946,0.1095563501276991,0.1095563501276991,0.1095563501276991,12.6181640625,12.6181640625,12.6181640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.618), 'mean_duration_us': np.float64(12.618), 'median_duration_us': np.float64(12.618), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.618), 'max_duration_us': np.float64(12.618)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.62)}]","{'shape_in1': (1, 2700, 512), 'shape_in2': (1, 2700, 512), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1382400, 512, 1), 'stride_input2': (2700, 1, 2700), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.0005981152463709318,99.98209609755648 +aten::le,elementwise,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700))","('int', 'int')","((0, 1), (1, 0))","('', '')",23477,1,10.736,10.736,,,,,,,,,,12.537109375,,12.537109375,10.736,10.736,10.736,,,,,,,12.537109375,12.537109375,12.537109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.537), 'mean_duration_us': np.float64(12.537), 'median_duration_us': np.float64(12.537), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.537), 'max_duration_us': np.float64(12.537)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(12.54)}]",,False,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::le', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})']",0.0005942731625191565,99.982690370719 +aten::cos,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",147,1,16.845,16.845,,,,,,,,,,12.09716796875,,12.09716796875,16.845,16.845,16.845,,,,,,,12.09716796875,12.09716796875,12.09716796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.097), 'mean_duration_us': np.float64(12.097), 'median_duration_us': np.float64(12.097), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.097), 'max_duration_us': np.float64(12.097)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(12.1)}]",,False,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::cos', 'void at::native::vectorized_elementwise_kernel<4, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::cos_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.0005734194423357261,99.98326379016133 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((512,), (2700, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",23592,1,42.643,42.643,,1.41696,5.7744140625,234.01826484018264,matrix_bf16,0.5021852256104968,,117.52051512574415,,12.05712890625,,12.05712890625,42.643,42.643,42.643,0.5021852256104968,0.5021852256104968,0.5021852256104968,117.52051512574415,117.52051512574415,117.52051512574415,12.05712890625,12.05712890625,12.05712890625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.057), 'mean_duration_us': np.float64(12.057), 'median_duration_us': np.float64(12.057), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.057), 'max_duration_us': np.float64(12.057)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.06)}]","{'M': 2700, 'N': 512, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.0005715215454932829,99.98383531170683 +triton_poi_fused_add_addmm_silu_8,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (1, 3072), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (3072, 1), ())","('', '', '', '', '', '', '3072')",8764,4,115.021,28.75525,4.793401393234938,1.536e-05,0.041015625,0.3571428571428571,vector_bfloat16,0.014748919431173384,0.0008462290311069907,0.0052674712254190655,0.00030222465396678234,2.9234619140625,0.17329026350422627,11.69384765625,26.995,25.408,35.623,0.014919185316700043,0.013592651851851852,0.015564655239441597,0.0053282804702500155,0.004854518518518518,0.005558805442657713,2.88330078125,2.76318359375,3.1640625,"[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(11.693999999999999), 'mean_duration_us': np.float64(2.9234999999999998), 'median_duration_us': np.float64(2.8834999999999997), 'std_dev_duration_us': np.float64(0.1500674848193306), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.164)}]","[{'name': 'triton_poi_fused_add_addmm_silu_8', 'stream': 0, 'mean_duration_us': np.float64(2.92)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_8']",0.0005543016034106279,99.98438961331024 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2700), (1, 1, 2700, 2700), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), (7290000, 7290000, 2700, 1), ())","('', '', 'False')",23552,1,7.391,7.391,,0.00729,27.80914306640625,0.25,vector_bf16,2.5998989986939485,,0.6499747496734871,,11.2158203125,,11.2158203125,7.391,7.391,7.391,2.5998989986939485,2.5998989986939485,2.5998989986939485,0.6499747496734871,0.6499747496734871,0.6499747496734871,11.2158203125,11.2158203125,11.2158203125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(11.216), 'mean_duration_us': np.float64(11.216), 'median_duration_us': np.float64(11.216), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(11.216), 'max_duration_us': np.float64(11.216)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(11.22)}]","{'op_shape': (1, 1, 2700, 2700), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (7300800, 7300800, 2704, 1), 'stride_output': (7290000, 7290000, 2700, 1)}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0005316425667185319,99.98492125587696 +triton_poi_fused_add_addmm_17,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",10553,3,74.961,24.987,2.9250770930011396,3.072e-06,0.041015625,0.07142857142857142,vector_bfloat16,0.012204518933368316,0.0001403398434262342,0.0008717513523834513,1.00242745304454e-05,3.5242513020833335,0.040528324222577586,10.57275390625,24.537,22.313,28.111,0.012204570320077593,0.012064153403643335,0.012344833076384022,0.0008717550228626854,0.0008617252431173812,0.0008817737911702874,3.52392578125,3.48388671875,3.56494140625,"[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.573), 'mean_duration_us': np.float64(3.5243333333333333), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0330689515339624), 'min_duration_us': np.float64(3.484), 'max_duration_us': np.float64(3.565)}]","[{'name': 'triton_poi_fused_add_addmm_17', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]","{'fused_ops': 'aten.add, aten.addmm', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/1', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_17']",0.0005011604918222191,99.98542241636878 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 30, 30), (), ())","('c10::BFloat16', '', 'ScalarList')","((1382400, 2700, 30, 1), (), ())","('', '', '[2., 2.]')",23739,1,28.592,28.592,,,,,,,,,,10.5341796875,,10.5341796875,28.592,28.592,28.592,,,,,,,10.5341796875,10.5341796875,10.5341796875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.245), 'mean_duration_us': np.float64(4.245), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.245)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.289), 'mean_duration_us': np.float64(6.289), 'median_duration_us': np.float64(6.289), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.289), 'max_duration_us': np.float64(6.289)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.24)}, {'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(6.29)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})'], ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']]",0.0004993320302301091,99.98592174839901 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((2700, 2700), (2700, 2700), ())","('c10::BFloat16', 'float', 'Scalar')","((2700, 1), (2700, 1), ())","('', '', 'False')",23491,1,6.54,6.54,,0.00729,41.713714599609375,0.16666666666666666,vector_bf16,4.367815105563411,,0.7279691842605686,,10.01416015625,,10.01416015625,6.54,6.54,6.54,4.367815105563411,4.367815105563411,4.367815105563411,0.7279691842605686,0.7279691842605686,0.7279691842605686,10.01416015625,10.01416015625,10.01416015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.014), 'mean_duration_us': np.float64(10.014), 'median_duration_us': np.float64(10.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.014), 'max_duration_us': np.float64(10.014)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.01)}]","{'op_shape': (2700, 2700), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (2700, 1), 'stride_output': (2700, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.0004746825163617924,99.98639643091536 +aten::sin,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128),)","('float',)","((44928, 128, 1),)","('',)",149,1,12.108,12.108,,,,,,,,,,9.212890625,,9.212890625,12.108,12.108,12.108,,,,,,,9.212890625,9.212890625,9.212890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.213), 'mean_duration_us': np.float64(9.213), 'median_duration_us': np.float64(9.213), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.213), 'max_duration_us': np.float64(9.213)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(9.21)}]",,False,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::sin', 'void at::native::vectorized_elementwise_kernel<4, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::sin_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.0004367014344294846,99.98683313234979 +triton_per_fused__to_copy_any_sum_unsqueeze_6,triton,python3,CPU,thread 416 (python3),"((1, 256), (1, 1), (256,), (), ())","('c10::BFloat16', 'float', 'bool', 'Scalar', 'Scalar')","((256, 1), (1, 1), (1,), (), ())","('', '', '', '1', '256')",8759,4,85.898,21.4745,1.5295176799675563,2.56e-07,0.00048828125,0.5,vector_bfloat16,0.0002452685614352615,7.593514035416293e-05,0.00012263428071763075,3.7967570177081464e-05,2.29248046875,0.9005283959186826,9.169921875,21.482,19.599,23.335,0.00025963160527421516,0.00014202573479615334,0.00031978530039646237,0.00012981580263710758,7.101286739807667e-05,0.00015989265019823119,1.98193359375,1.60107421875,3.60498046875,"[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(9.17), 'mean_duration_us': np.float64(2.2925), 'median_duration_us': np.float64(1.982), 'std_dev_duration_us': np.float64(0.779879638149375), 'min_duration_us': np.float64(1.601), 'max_duration_us': np.float64(3.605)}]","[{'name': 'triton_per_fused__to_copy_any_sum_unsqueeze_6', 'stream': 0, 'mean_duration_us': np.float64(2.29)}]","{'fused_ops': 'aten._to_copy, aten.any, aten.sum, aten.unsqueeze', 'xnumel': 1, 'rnumel': 256}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_any_sum_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_any_sum_unsqueeze_6']",0.0004346646670863748,99.98726779701687 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128), ())","('float', 'double')","((44928, 128, 1), ())","('', '')",148,2,26.779,13.3895,5.2545104909972356,4.4928e-05,0.34278106689453125,0.12499721783258029,vector_fp32,0.08327604552156585,0.005457428614938392,0.01040927400229504,0.0006821633933872109,4.325439453125,0.28346419304402126,8.65087890625,13.3895,9.674,17.105,0.08327604552156585,0.07941706074010141,0.0871350303030303,0.01040927400229504,0.009926911640953717,0.010891636363636364,4.325439453125,4.125,4.52587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.651), 'mean_duration_us': np.float64(4.3255), 'median_duration_us': np.float64(4.3255), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]","{'shape_in1': (1, 351, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (44928, 128, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.00041006144338494695,99.98767785846026 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 2700, 512), ())","('c10::BFloat16', 'double')","((1382400, 512, 1), ())","('', '')",23596,1,10.365,10.365,,0.0013824,5.273445129394531,0.24999963831070846,vector_bf16,0.6451681868626445,,0.16129181336523674,,8.57080078125,,8.57080078125,10.365,10.365,10.365,0.6451681868626445,0.6451681868626445,0.6451681868626445,0.16129181336523674,0.16129181336523674,0.16129181336523674,8.57080078125,8.57080078125,8.57080078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.571), 'mean_duration_us': np.float64(8.571), 'median_duration_us': np.float64(8.571), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.571), 'max_duration_us': np.float64(8.571)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.57)}]","{'shape_in1': (1, 2700, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (1382400, 512, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.00040626564970006057,99.98808412410996 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351), (1, 351), ())","('long int', 'long int', 'Scalar')","((351, 1), (351, 1), ())","('', '', 'False')",15,2,86.509,43.2545,37.234121776940036,3.51e-07,0.0053558349609375,0.0625,,0.0013532306674602038,0.00021888653106099558,8.457691671626274e-05,1.368040819131224e-05,4.205078125,0.6801759565124506,8.41015625,43.2545,16.926,69.583,0.0013532306674602038,0.001198454517036574,0.0015080068178838337,8.457691671626274e-05,7.490340731478587e-05,9.425042611773962e-05,4.205078125,3.72412109375,4.68603515625,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.41), 'mean_duration_us': np.float64(4.205), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.48099999999999987), 'min_duration_us': np.float64(3.724), 'max_duration_us': np.float64(4.686)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.2)}]","{'op_shape': (1, 351), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (351, 1), 'stride_output': (351, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00039865091724684343,99.98848277502721 +aten::sub,elementwise,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",10432,4,88.112,22.028,0.8249173695993242,,,,,,,,,2.011962890625,0.06005859375000001,8.0478515625,22.1635,20.921,22.864,,,,,,,2.001953125,1.9619140625,2.08203125,"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.047999999999998), 'mean_duration_us': np.float64(2.0119999999999996), 'median_duration_us': np.float64(2.002), 'std_dev_duration_us': np.float64(0.05196152422706626), 'min_duration_us': np.float64(1.962), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::unrolled_elementwise_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::sub', 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)']",0.0003814772653310772,99.98886425229254 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('c10::BFloat16', 'float', 'Scalar')","((0,), (0,), ())","('', '', 'False')",10445,3,42.423,14.141,1.0069314773111429,1e-09,5.7220458984375e-06,0.16666666666666666,vector_bf16,2.364906950017053e-06,3.4176105987712203e-07,3.941511583361755e-07,5.696017664618699e-08,2.576171875,0.40562243773792883,7.728515625,14.191,13.11,15.122,2.539367637941723e-06,1.971126082771896e-06,2.58422712933754e-06,4.232279396569539e-07,3.2852101379531603e-07,4.307045215562566e-07,2.36279296875,2.32177734375,3.0439453125,"[{'name': 'void at::native::unrolled_elementwise_kernel, 4, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(7.729), 'mean_duration_us': np.float64(2.5763333333333334), 'median_duration_us': np.float64(2.363), 'std_dev_duration_us': np.float64(0.3311136092374069), 'min_duration_us': np.float64(2.322), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::unrolled_elementwise_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::unrolled_elementwise_kernel, 4, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array, TrivialOffsetCalculator<1, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)']",0.0003663403807584207,99.98923059267331 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351), (1, 351), ())","('bool', 'long int', 'Scalar')","((351, 1), (351, 1), ())","('', '', 'False')",43,1,14.191,14.191,,3.51e-07,,,,,,4.588293866087956e-05,,7.64990234375,,7.64990234375,14.191,14.191,14.191,,,,4.588293866087956e-05,4.588293866087956e-05,4.588293866087956e-05,7.64990234375,7.64990234375,7.64990234375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.65), 'mean_duration_us': np.float64(7.65), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.65), 'max_duration_us': np.float64(7.65)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.65)}]","{'op_shape': (1, 351), 'dtype_in_out': ('bool', 'long int'), 'stride_input': (351, 1), 'stride_output': (351, 1)}",True,transformers/masking_utils.py(776): _preprocess_mask_arguments,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(776): _preprocess_mask_arguments', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#11}::operator()() const::{lambda(bool)#1} const&)::{lambda(int, bool)#1})']",0.0003626140223238676,99.98959320669563 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 351, 64), (1, 351, 64)), ())","('TensorList', 'Scalar')","(((22464, 1, 351), (22464, 1, 351)), ())","('', '-1')",146,1,23.995,23.995,,,,,,,,,,7.490234375,,7.490234375,23.995,23.995,23.995,,,,,,,7.490234375,7.490234375,7.490234375,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 3, 64, 64>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.49), 'mean_duration_us': np.float64(7.49), 'median_duration_us': np.float64(7.49), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.49), 'max_duration_us': np.float64(7.49)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy, unsigned int, 3, 64, 64>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 64, 64>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0003550455800375394,99.98994825227567 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 351, 128), (1, 351, 128), ())","('c10::BFloat16', 'float', 'Scalar')","((44928, 128, 1), (44928, 128, 1), ())","('', '', 'False')",154,2,23.695,11.8475,7.279664312315507,4.4928e-05,0.257080078125,0.16666666666666666,vector_bf16,0.07224303389411016,0.006015314059006786,0.012040505649018362,0.0010025523431677961,3.744384765625,0.31177608565012327,7.48876953125,11.8475,6.7,16.995,0.07224303389411016,0.0679895645320197,0.07649650325620064,0.012040505649018362,0.01133159408866995,0.012749417209366773,3.744384765625,3.52392578125,3.96484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.489), 'mean_duration_us': np.float64(3.7445), 'median_duration_us': np.float64(3.7445), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.965)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.74)}]","{'op_shape': (1, 351, 128), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (44928, 128, 1), 'stride_output': (44928, 128, 1)}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.0003549761447872061,99.99030322842046 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351), (1, 1, 351), ())","('float', 'long int', 'Scalar')","((351, 351, 1), (351, 351, 1), ())","('', '', 'False')",130,1,12.228,12.228,,3.51e-07,0.004016876220703125,0.08333333333333333,vector_fp32,0.0005652802096985584,,4.7106684141546534e-05,,7.451171875,,7.451171875,12.228,12.228,12.228,0.0005652802096985584,0.0005652802096985584,0.0005652802096985584,4.7106684141546534e-05,4.7106684141546534e-05,4.7106684141546534e-05,7.451171875,7.451171875,7.451171875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.451), 'mean_duration_us': np.float64(7.451), 'median_duration_us': np.float64(7.451), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.451), 'max_duration_us': np.float64(7.451)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.45)}]","{'op_shape': (1, 1, 351), 'dtype_in_out': ('float', 'long int'), 'stride_input': (351, 351, 1), 'stride_output': (351, 351, 1)}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})']",0.00035319397336198505,99.99065642239383 +aten::normal_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), (), (), ())","('float', 'Scalar', 'Scalar', '')","((475200, 29700, 900, 30, 1), (), (), ())","('', '0.', '1.', '')",8691,1,15.973,15.973,,,,,,,,,,7.25,,7.25,15.973,15.973,15.973,,,,,,,7.25,7.25,7.25,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.25), 'mean_duration_us': np.float64(7.25), 'median_duration_us': np.float64(7.25), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.25), 'max_duration_us': np.float64(7.25)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(7.25)}]",,False,diffusers/utils/torch_utils.py(152): randn_tensor,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(387): prepare_latents', 'diffusers/utils/torch_utils.py(152): randn_tensor', 'aten::randn', 'aten::normal_', 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})']",0.00034365819898288035,99.99100008059281 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 60, 60), (1, 512, 2, 60, 60), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3686400, 7200, 3600, 60, 1), (5529600, 10800, 3600, 60, 1), ())","('', '', 'False')",23886,1,5.539,5.539,,0.0036864,14.0625,0.25,vector_bf16,2.056591446472351,,0.5141478616180878,,7.169921875,,7.169921875,5.539,5.539,5.539,2.056591446472351,2.056591446472351,2.056591446472351,0.5141478616180878,0.5141478616180878,0.5141478616180878,7.169921875,7.169921875,7.169921875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.17), 'mean_duration_us': np.float64(7.17), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.17), 'max_duration_us': np.float64(7.17)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.17)}]","{'op_shape': (1, 512, 2, 60, 60), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (3686400, 7200, 3600, 60, 1), 'stride_output': (5529600, 10800, 3600, 60, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.000339862405297994,99.99133994299811 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 2700, 2704), ())","('c10::BFloat16', 'Scalar')","((7300800, 7300800, 2704, 1), ())","('', '0.')",23548,1,8.152,8.152,,,,,,,,,,7.0888671875,,7.0888671875,8.152,8.152,8.152,,,,,,,7.0888671875,7.0888671875,7.0888671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(7.089), 'mean_duration_us': np.float64(7.089), 'median_duration_us': np.float64(7.089), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(7.089)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]",,False,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.00033602032144621884,99.99167596331955 +aten::all,reduce,python3,CPU,thread 416 (python3),"((1, 351),)","('bool',)","((351, 1),)","('',)",44,1,25.728,25.728,,,,,,,,,,6.96923828125,,6.96923828125,25.728,25.728,25.728,,,,,,,6.96923828125,6.96923828125,6.96923828125,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, bool, 4, 4> >(at::native::ReduceOp, unsigned int, bool, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.969), 'mean_duration_us': np.float64(6.969), 'median_duration_us': np.float64(6.969), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.969), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(233): _ignore_causal_mask_sdpa', 'aten::all', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, bool, 4, 4> >(at::native::ReduceOp, unsigned int, bool, 4, 4>)']",0.00033034977600233375,99.99200631309556 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((351,), (), ())","('long int', 'long int', 'Scalar')","((1,), (), ())","('', '', '1')",37,3,42.713,14.237666666666668,8.485826378929357,3.51e-07,0.00536346435546875,0.06241109530583215,,0.002498265902290507,0.0002632304295773652,0.0001559195113271636,1.642849942774808e-05,2.26904296875,0.2545641079483555,6.80712890625,11.577,7.401,23.735,0.0026502420616658995,0.0021943135835397216,0.0026502420616658995,0.00016540450989415556,0.00013694951419317966,0.00016540450989415556,2.1220703125,2.1220703125,2.56298828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.807), 'mean_duration_us': np.float64(2.269), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.2078893936688451), 'min_duration_us': np.float64(2.122), 'max_duration_us': np.float64(2.563)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.27)}]","{'shape_in1': (351,), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,transformers/models/llama/modeling_llama.py(372): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0003226656082987834,99.99232897870385 +aten::bmm,GEMM,python3,CPU,thread 416 (python3),"((1, 64, 1), (1, 1, 351))","('float', 'float')","((64, 1, 1), (351, 351, 1))","('', '')",142,1,102.082,102.082,,4.4928e-05,0.08727645874023438,0.4909305476637965,matrix_fp32,0.013519784173699775,,0.00663727504869076,,6.76904296875,,6.76904296875,102.082,102.082,102.082,0.013519784173699775,0.013519784173699775,0.013519784173699775,0.00663727504869076,0.00663727504869076,0.00663727504869076,6.76904296875,6.76904296875,6.76904296875,"[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA4_GRVWB4_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB8_LPM0_LRVW4_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.769), 'mean_duration_us': np.float64(6.769), 'median_duration_us': np.float64(6.769), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.769), 'max_duration_us': np.float64(6.769)}]","[{'name': 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_S...', 'stream': 0, 'mean_duration_us': np.float64(6.77)}]","{'B': 1, 'M': 64, 'N': 351, 'K': 1, 'bias': False, 'stride_A': (64, 1, 1), 'stride_B': (351, 351, 1), 'dtype_A_B': ('float', 'float'), 'transpose': (False, False)}",True,transformers/models/llama/modeling_llama.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: LlamaRotaryEmbedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/utils/_contextlib.py(117): decorate_context', 'transformers/modeling_rope_utils.py(120): wrapper', 'transformers/models/llama/modeling_llama.py(122): forward', 'aten::matmul', 'aten::bmm', 'Cijk_Ailk_Bljk_S_B_Bias_HA_S_SAV_UserArgs_MT16x16x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA4_GRVWB4_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB256_LBSPPM0_LPA16_LPB8_LPM0_LRVW4_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_1']",0.0003208602917901179,99.99264983899565 +aten::le,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 351, 1))","('long int', 'long int')","((351, 351, 351, 1), (351, 351, 1, 1))","('', '')",95,1,16.714,16.714,,,,,,,,,,6.52783203125,,6.52783203125,16.714,16.714,16.714,,,,,,,6.52783203125,6.52783203125,6.52783203125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.528), 'mean_duration_us': np.float64(6.528), 'median_duration_us': np.float64(6.528), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",,False,transformers/masking_utils.py(74): causal_mask_function,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'transformers/masking_utils.py(74): causal_mask_function', 'aten::le', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::(anonymous namespace)::CompareFunctor const&)::{lambda(int, bool)#1})']",0.00030942662056857,99.99295926561622 +aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '351', '1', '')",35,3,31.167,10.389000000000001,5.012205003788254,,,,,,,,,2.0421549479166665,0.3822298351596716,6.12646484375,7.832,7.171,16.164,,,,,,,1.841796875,1.8017578125,2.48291015625,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.127000000000001), 'mean_duration_us': np.float64(2.0423333333333336), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.3120259960679915), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.483)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.00029040136197724947,99.9932496669782 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('c10::BFloat16', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",8676,1,8.673,8.673,,2.56e-07,0.00244140625,0.1,vector_bf16,0.00042329081220733085,,4.232908122073309e-05,,6.0478515625,,6.0478515625,8.673,8.673,8.673,0.00042329081220733085,0.00042329081220733085,0.00042329081220733085,4.232908122073309e-05,4.232908122073309e-05,4.232908122073309e-05,6.0478515625,6.0478515625,6.0478515625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.05)}]","{'op_shape': (1, 256), 'dtype_in_out': ('c10::BFloat16', 'long int'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0002866750035426964,99.99353634198174 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",10545,3,48.212,16.070666666666668,0.4472631589269735,1.536e-06,0.0004901885986328125,2.9883268482490273,vector_bfloat16,0.00025804302222858384,2.1514189340863932e-05,0.0007711168913289977,6.42914296256168e-05,2.0016276041666665,0.17475103197716266,6.0048828125,15.854,15.773,16.585,0.0002675831215048297,0.00023340842572062084,0.000273137519460301,0.0007996258261311642,0.00069750066518847,0.0008162241826673587,1.9208984375,1.8818359375,2.2021484375,"[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.005), 'mean_duration_us': np.float64(2.0016666666666665), 'median_duration_us': np.float64(1.921), 'std_dev_duration_us': np.float64(0.14254901691075328), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(2.202)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(2.0)}]","{'fused_ops': 'aten._to_copy, aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/1', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/5t/c5tonpsfcfmuo4ntelgrlvdnbdhhvu2rwrph7dpulvmbjnlahrmp.py(1763): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_2']",0.00028463823619958667,99.99382098021793 +aten::argmax,reduce,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",8650,1,19.019,19.019,,,,,,,,,,5.72802734375,,5.72802734375,19.019,19.019,19.019,,,,,,,5.72802734375,5.72802734375,5.72802734375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::argmax', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)']",0.0002715149738865955,99.99409249519182 +aten::gather,other,python3,CPU,thread 416 (python3),"((128320, 4096), (), (351, 4096), (), (351, 4096))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((4096, 1), (), (1, 0), (), (4096, 1))","('', '0', '', 'False', '')",29,1,39.849,39.849,,,,,,,,,,5.64794921875,,5.64794921875,39.849,39.849,39.849,,,,,,,5.64794921875,5.64794921875,5.64794921875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.648), 'mean_duration_us': np.float64(5.648), 'median_duration_us': np.float64(5.648), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.648), 'max_duration_us': np.float64(5.648)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.00026771918020170916,99.99436021437202 +aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",51,3,29.072,9.690666666666667,2.456177789438976,,,,,,,,,1.80126953125,0.04028542252408849,5.40380859375,9.474,7.35,12.248,,,,,,,1.80078125,1.76123046875,1.841796875,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.404), 'mean_duration_us': np.float64(1.8013333333333332), 'median_duration_us': np.float64(1.801), 'std_dev_duration_us': np.float64(0.0330689515339625), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.842)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.00025614663847949465,99.9946163610105 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",8649,1,12.149,12.149,,7.7e-08,0.000881195068359375,0.08333333333333333,,0.0001734511457378552,,1.4454262144821266e-05,,5.3271484375,,5.3271484375,12.149,12.149,12.149,0.0001734511457378552,0.0001734511457378552,0.0001734511457378552,1.4454262144821266e-05,1.4454262144821266e-05,1.4454262144821266e-05,5.3271484375,5.3271484375,5.3271484375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.327), 'mean_duration_us': np.float64(5.327), 'median_duration_us': np.float64(5.327), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(5.327)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.33)}]","{'op_shape': (1, 77), 'dtype_in_out': ('int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.0002525128603787193,99.99486887387089 +"aten::index->void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}) (Synthetic Op)",elementwise,python3,CPU,thread 416 (python3),"((1, 351), ())","('bool', '')","((351, 1), ())","('', '')",487006,1,73.61,73.61,,,,,,,,,,5.287109375,,5.287109375,73.61,73.61,73.61,,,,,,,5.287109375,5.287109375,5.287109375,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.287), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.287), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",,False,Not found,"['void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.0002506149635362762,99.99511948883442 +aten::_local_scalar_dense,other,python3,CPU,thread 416 (python3),"((1,),)","('long int',)","((1,),)","('',)",10426,1,22.884,22.884,,,,,,,,,,5.2470703125,,5.2470703125,22.884,22.884,22.884,,,,,,,5.2470703125,5.2470703125,5.2470703125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::item', 'aten::_local_scalar_dense', 'Memcpy DtoD (Device -> Device)']",0.00024871706669383304,99.99536820590112 +aten::index,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",8652,1,26.87,26.87,,,,,,,,,,5.20703125,,5.20703125,26.87,26.87,26.87,,,,,,,5.20703125,5.20703125,5.20703125,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.207), 'mean_duration_us': np.float64(5.207), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.207), 'max_duration_us': np.float64(5.207)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",,False,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::index', 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.00024681916985138985,99.99561502507096 +aten::bitwise_and,elementwise,python3,CPU,thread 416 (python3),"((), (1, 1, 351, 351))","('bool', 'bool')","((), (123201, 123201, 351, 1))","('', '')",98,1,19.669,19.669,,,,,,,,,,4.80615234375,,4.80615234375,19.669,19.669,19.669,,,,,,,4.80615234375,4.80615234375,4.80615234375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.806), 'mean_duration_us': np.float64(4.806), 'median_duration_us': np.float64(4.806), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",,False,transformers/masking_utils.py(51): and_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'aten::__and__', 'aten::bitwise_and', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.0002278170563435137,99.9958428421273 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 33, 30, 30), ())","('c10::BFloat16', 'double')","((475200, 29700, 900, 30, 1), ())","('', '')",15594,1,29.745,29.745,,0.0004752,1.8127517700195312,0.2499989478158762,vector_bf16,0.4056324668125456,,0.10140768990309472,,4.68603515625,,4.68603515625,29.745,29.745,29.745,0.4056324668125456,0.4056324668125456,0.4056324668125456,0.10140768990309472,0.10140768990309472,0.10140768990309472,4.68603515625,4.68603515625,4.68603515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(4.69)}]","{'shape_in1': (1, 16, 33, 30, 30), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (475200, 29700, 900, 30, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.00022212336581618422,99.99606496549312 +triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '256')",8753,2,47.049,23.5245,10.990560699982508,1.536e-06,0.0,,,0.0,0.0,0.000662979914179152,4.838247361330896e-05,2.322998046875,0.16952608865361077,4.64599609375,23.5245,15.753,31.296,0.0,0.0,0.0,0.000662979914179152,0.0006287683389966021,0.0006971914893617021,2.322998046875,2.203125,2.44287109375,"[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.646), 'mean_duration_us': np.float64(2.323), 'median_duration_us': np.float64(2.323), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.443)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2', 'stream': 0, 'mean_duration_us': np.float64(2.32)}]","{'fused_ops': 'aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_2']",0.00022022546897374103,99.9962851909621 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((3, 900), (3, 900), ())","('int', 'int', 'Scalar')","((900, 1), (1, 0), ())","('', '', 'False')",23467,1,9.674,9.674,,2.7e-06,0.020599365234375,0.125,,0.0046895791370719815,,0.0005861973921339977,,4.60595703125,,4.60595703125,9.674,9.674,9.674,0.0046895791370719815,0.0046895791370719815,0.0046895791370719815,0.0005861973921339977,0.0005861973921339977,0.0005861973921339977,4.60595703125,4.60595703125,4.60595703125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.606), 'mean_duration_us': np.float64(4.606), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(4.606)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","{'op_shape': (3, 900), 'dtype_in_out': ('int', 'int'), 'stride_input': (900, 1), 'stride_output': (1, 0)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::repeat_interleave', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.00021832757213129786,99.99650351853423 +aten::replication_pad3d,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 3, 30, 30), ())","('c10::BFloat16', 'ScalarList')","((43200, 2700, 900, 30, 1), ())","('', '[1, 1, 1, 1, 2, 0]')",23409,1,10.035,10.035,,8.192e-05,0.2386474609375,0.3273657289002558,vector_bf16,0.05481779013798267,,0.01794546582522195,,4.56494140625,,4.56494140625,10.035,10.035,10.035,0.05481779013798267,0.05481779013798267,0.05481779013798267,0.01794546582522195,0.01794546582522195,0.01794546582522195,4.56494140625,4.56494140625,4.56494140625,"[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.565), 'mean_duration_us': np.float64(4.565), 'median_duration_us': np.float64(4.565), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.565)}]","[{'name': 'void at::native::(anonymous namespace)::replication_pad_forward_...', 'stream': 0, 'mean_duration_us': np.float64(4.57)}]","{'input_shape': (1, 16, 3, 30, 30), 'output_shape': (1, 16, 5, 32, 32), 'padding': [1, 1, 1, 1, 2, 0], 'op_shape': (1, 16, 5, 32, 32), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (43200, 2700, 900, 30, 1), 'stride_output': None}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoCausalConv3d', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(74): forward', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::replication_pad3d', 'void at::native::(anonymous namespace)::replication_pad_forward_kernel3d(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, int, int, int, int, int)']",0.00021638338512196582,99.99671990191935 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 2, 30, 30), (1, 512, 2, 30, 30), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((921600, 1800, 900, 30, 1), (1382400, 2700, 900, 30, 1), ())","('', '', 'False')",23752,1,5.929,5.929,,0.0009216,3.515625,0.25,vector_bf16,0.8219648557430593,,0.20549121393576483,,4.48486328125,,4.48486328125,5.929,5.929,5.929,0.8219648557430593,0.8219648557430593,0.8219648557430593,0.20549121393576483,0.20549121393576483,0.20549121393576483,4.48486328125,4.48486328125,4.48486328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.485), 'mean_duration_us': np.float64(4.485), 'median_duration_us': np.float64(4.485), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.485), 'max_duration_us': np.float64(4.485)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}]","{'op_shape': (1, 512, 2, 30, 30), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (921600, 1800, 900, 30, 1), 'stride_output': (1382400, 2700, 900, 30, 1)}",True,diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoUpBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(394): forward', 'nn.Module: HunyuanVideoUpsampleCausal3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(96): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0002125875914370795,99.99693248951078 +aten::bitwise_and,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 351, 351), (1, 1, 1, 351))","('bool', 'bool')","((123201, 123201, 351, 1), (351, 351, 351, 1))","('', '')",114,1,9.114,9.114,,,,,,,,,,4.44482421875,,4.44482421875,9.114,9.114,9.114,,,,,,,4.44482421875,4.44482421875,4.44482421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.445), 'mean_duration_us': np.float64(4.445), 'median_duration_us': np.float64(4.445), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.445)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.44)}]",,False,transformers/masking_utils.py(51): and_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'aten::__and__', 'aten::bitwise_and', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.00021068969459463633,99.99714317920538 +aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'int')","((), (), (), (1,))","('1', '4', '1', '')",23456,1,11.257,11.257,,,,,,,,,,4.40576171875,,4.40576171875,11.257,11.257,11.257,,,,,,,4.40576171875,4.40576171875,4.40576171875,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.406), 'mean_duration_us': np.float64(4.406), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.406), 'max_duration_us': np.float64(4.406)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(825): decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(805): _decode', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(1014): _temporal_tiled_decode', 'nn.Module: HunyuanVideoDecoder3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(603): forward', 'nn.Module: HunyuanVideoMidBlock3D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(250): forward', 'diffusers/models/autoencoders/autoencoder_kl_hunyuan_video.py(33): prepare_causal_attention_mask', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#3}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.000208838087919082,99.9973520172933 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1437696, 1437696, 1437696, 1437696, 4096, 1), ())","('', '', 'False')",7234,1,20.07,20.07,,0.001048576,4.0,0.25,vector_bf16,1.0267672235237868,,0.2566918058809467,,4.0849609375,,4.0849609375,20.07,20.07,20.07,1.0267672235237868,1.0267672235237868,1.0267672235237868,0.2566918058809467,0.2566918058809467,0.2566918058809467,4.0849609375,4.0849609375,4.0849609375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.085), 'mean_duration_us': np.float64(4.085), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.085)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.08)}]","{'op_shape': (1, 1, 1, 1, 256, 4096), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1048576, 1048576, 4096, 1048576, 4096, 1), 'stride_output': (1437696, 1437696, 1437696, 1437696, 4096, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.00019363176809609223,99.9975456490614 +aten::gather,other,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",7285,1,23.495,23.495,,,,,,,,,,4.044921875,,4.044921875,23.495,23.495,23.495,,,,,,,4.044921875,4.044921875,4.044921875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.045), 'mean_duration_us': np.float64(4.045), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.045)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(4.04)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.00019173387125364904,99.99773738293264 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",8682,1,31.206,31.206,,4e-09,3.0517578125e-05,0.125,vector_fp32,8.23730517848165e-06,,1.0296631473102062e-06,,3.884765625,,3.884765625,31.206,31.206,31.206,8.23730517848165e-06,8.23730517848165e-06,8.23730517848165e-06,1.0296631473102062e-06,1.0296631473102062e-06,1.0296631473102062e-06,3.884765625,3.884765625,3.884765625,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.885), 'mean_duration_us': np.float64(3.885), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(3.885)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.88)}]","{'op_shape': (4,), 'dtype_in_out': ('float', 'float'), 'stride_input': (1,), 'stride_output': (1,)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00018414228388387638,99.99792152521653 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((), ())","('bool', 'Scalar')","((), ())","('', '1.')",94,1,11.246,11.246,,,,,,,,,,3.76513671875,,3.76513671875,11.246,11.246,11.246,,,,,,,3.76513671875,3.76513671875,3.76513671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.765), 'mean_duration_us': np.float64(3.765), 'median_duration_us': np.float64(3.765), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<16, at::native::F...', 'stream': 0, 'mean_duration_us': np.float64(3.76)}]",,False,transformers/masking_utils.py(51): and_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'aten::new_ones', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<16, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0001784717384399913,99.99809999695496 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",7273,1,38.568,38.568,,7.7e-08,0.0011749267578125,0.0625,,0.0003344116633532141,,2.0900728959575882e-05,,3.68408203125,,3.68408203125,38.568,38.568,38.568,0.0003344116633532141,0.0003344116633532141,0.0003344116633532141,2.0900728959575882e-05,2.0900728959575882e-05,2.0900728959575882e-05,3.68408203125,3.68408203125,3.68408203125,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.684), 'mean_duration_us': np.float64(3.684), 'median_duration_us': np.float64(3.684), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(3.684)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.68)}]","{'op_shape': (1, 77), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00017462965458821608,99.99827462660956 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",8697,1,20.56,20.56,,1e-09,3.814697265625e-06,0.25,vector_bf16,1.0976818973603108e-06,,2.744204743400777e-07,,3.64404296875,,3.64404296875,20.56,20.56,20.56,1.0976818973603108e-06,1.0976818973603108e-06,1.0976818973603108e-06,2.744204743400777e-07,2.744204743400777e-07,2.744204743400777e-07,3.64404296875,3.64404296875,3.64404296875,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.644), 'mean_duration_us': np.float64(3.644), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.644), 'max_duration_us': np.float64(3.644)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.64)}]","{'op_shape': (1,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00017273175774577292,99.9984473583673 +aten::_local_scalar_dense,other,python3,CPU,thread 416 (python3),"((),)","('bool',)","((),)","('',)",48,1,27.36,27.36,,,,,,,,,,3.52392578125,,3.52392578125,27.36,27.36,27.36,,,,,,,3.52392578125,3.52392578125,3.52392578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",,False,transformers/masking_utils.py(233): _ignore_causal_mask_sdpa,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(233): _ignore_causal_mask_sdpa', 'aten::is_nonzero', 'aten::item', 'aten::_local_scalar_dense', 'Memcpy DtoD (Device -> Device)']",0.00016703806721844343,99.99861439643452 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 351), (1, 1, 1, 351), ())","('long int', 'long int', 'Scalar')","((351, 351, 351, 1), (0, 0, 0, 0), ())","('', '', 'False')",111,1,12.128,12.128,,3.51e-07,0.0053558349609375,0.0625,,0.0016307341556784346,,0.00010192088472990217,,3.44384765625,,3.44384765625,12.128,12.128,12.128,0.0016307341556784346,0.0016307341556784346,0.0016307341556784346,0.00010192088472990217,0.00010192088472990217,0.00010192088472990217,3.44384765625,3.44384765625,3.44384765625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.444), 'mean_duration_us': np.float64(3.444), 'median_duration_us': np.float64(3.444), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.444), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]","{'op_shape': (1, 1, 1, 351), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (351, 351, 351, 1), 'stride_output': (0, 0, 0, 0)}",True,transformers/masking_utils.py(153): inner_mask,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'nn.Module: LlamaModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/llama/modeling_llama.py(372): forward', 'transformers/utils/deprecation.py(119): wrapped_func', 'transformers/masking_utils.py(881): create_causal_mask', 'transformers/masking_utils.py(367): sdpa_mask', 'transformers/masking_utils.py(51): and_mask', 'transformers/masking_utils.py(153): inner_mask', 'aten::index', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})']",0.00016324227353355704,99.99877763870805 +aten::gather,other,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",7298,1,10.436,10.436,,,,,,,,,,3.36376953125,,3.36376953125,10.436,10.436,10.436,,,,,,,3.36376953125,3.36376953125,3.36376953125,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.364), 'mean_duration_us': np.float64(3.364), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(3.364)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.36)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(616): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.00015944647984867072,99.9989370851879 +aten::eq,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",10415,1,43.915,43.915,,,,,,,,,,3.00390625,,3.00390625,43.915,43.915,43.915,,,,,,,3.00390625,3.00390625,3.00390625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.004), 'mean_duration_us': np.float64(3.004), 'median_duration_us': np.float64(3.004), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(3.004)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::eq', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.00014238855335012662,99.99907947374126 +triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17,triton,python3,CPU,thread 416 (python3),"((1,), (1, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((1,), (256, 1), ())","('', '', '256')",8817,1,23.615,23.615,,1.536e-06,0.0004901885986328125,2.9883268482490273,vector_bfloat16,0.0001711661788617886,,0.0005115004878048781,,3.0029296875,,3.0029296875,23.615,23.615,23.615,0.0001711661788617886,0.0001711661788617886,0.0001711661788617886,0.0005115004878048781,0.0005115004878048781,0.0005115004878048781,3.0029296875,3.0029296875,3.0029296875,"[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.003), 'mean_duration_us': np.float64(3.003), 'median_duration_us': np.float64(3.003), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.003)}]","[{'name': 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsquee...', 'stream': 0, 'mean_duration_us': np.float64(3.0)}]","{'fused_ops': 'aten._to_copy, aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 256, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_arange_cat_cos_div_exp_mul_sin_unsqueeze_17']",0.00014234226318323776,99.99922181600445 +aten::cat,other,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",8688,1,15.092,15.092,,,,,,,,,,2.962890625,,2.962890625,15.092,15.092,15.092,,,,,,,2.962890625,2.962890625,2.962890625,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.963), 'mean_duration_us': np.float64(2.963), 'median_duration_us': np.float64(2.963), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(2.963)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(2.96)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.00014044436634079457,99.99936226037079 +triton_poi_fused_add_addmm_18,triton,python3,CPU,thread 416 (python3),"((1, 3072), (3072,), (1, 3072), (3072,), (1, 3072), (3072,), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3072, 1), (1,), (3072, 1), (1,), (3072, 1), (1,), ())","('', '', '', '', '', '', '3072')",8825,1,26.659,26.659,,3.072e-06,0.041015625,0.07142857142857142,vector_bfloat16,0.01579350618612157,,0.0011281075847229694,,2.72314453125,,2.72314453125,26.659,26.659,26.659,0.01579350618612157,0.01579350618612157,0.01579350618612157,0.0011281075847229694,0.0011281075847229694,0.0011281075847229694,2.72314453125,2.72314453125,2.72314453125,"[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'triton_poi_fused_add_addmm_18', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]","{'fused_ops': 'aten.add, aten.addmm', 'xnumel': 3072, 'rnumel': 1}",True,/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'nn.Module: xFuserHunyuanVideoTransformer3DWrapper', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'torch/nn/modules/module.py(1779): _call_impl', 'Torch-Compiled Region: 0/0', '/app/xDiT/xfuser/model_executor/models/transformers/transformer_hunyuan_video.py(190): forward', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/sk/cskbcvdcs3teoszarstusmvl6iu7nju2hrwnmgoclkp76lifcicq.py(1864): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_18']",0.00012908013036958,99.99949134050115 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1,), ())","('c10::BFloat16', 'double')","((1,), ())","('', '')",8701,1,11.617,11.617,,1e-09,1.1444091796875e-05,0.08333333333333333,vector_bf16,5.080835228447385e-06,,4.234029357039487e-07,,2.36181640625,,2.36181640625,11.617,11.617,11.617,5.080835228447385e-06,5.080835228447385e-06,5.080835228447385e-06,4.234029357039487e-07,4.234029357039487e-07,4.234029357039487e-07,2.36181640625,2.36181640625,2.36181640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.362), 'mean_duration_us': np.float64(2.362), 'median_duration_us': np.float64(2.362), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.36)}]","{'shape_in1': (1,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.00011195276862070262,99.99960329326977 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",8687,1,9.244,9.244,,,,,,,,,,2.203125,,2.203125,9.244,9.244,9.244,,,,,,,2.203125,2.203125,2.203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.203), 'mean_duration_us': np.float64(2.203), 'median_duration_us': np.float64(2.203), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.203), 'max_duration_us': np.float64(2.203)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.00010443061650126321,99.99970772388627 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",8670,1,10.987,10.987,,7.68e-07,0.0029296875,0.25,vector_bf16,0.00139500133037694,,0.000348750332594235,,2.2021484375,,2.2021484375,10.987,10.987,10.987,0.00139500133037694,0.00139500133037694,0.00139500133037694,0.000348750332594235,0.000348750332594235,0.000348750332594235,2.2021484375,2.2021484375,2.2021484375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.2)}]","{'op_shape': (1, 1, 1, 768), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (768, 768, 768, 1), 'stride_output': (768, 768, 768, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(265): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.00010438432633437435,99.99981210821261 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",8683,1,15.674,15.674,,4e-09,3.814697265625e-05,0.1,vector_fp32,1.9212007504690427e-05,,1.921200750469043e-06,,2.08203125,,2.08203125,15.674,15.674,15.674,1.9212007504690427e-05,1.9212007504690427e-05,1.9212007504690427e-05,1.921200750469043e-06,1.921200750469043e-06,1.921200750469043e-06,2.08203125,2.08203125,2.08203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.082), 'mean_duration_us': np.float64(2.082), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.082)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.08)}]","{'shape_in1': (4,), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(85): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",9.869063580704486e-05,99.99991079884842 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 256), (1, 1, 1, 256), ())","('long int', 'long int', 'Scalar')","((256, 256, 256, 1), (351, 351, 351, 1), ())","('', '', 'False')",7248,1,7.32,7.32,,2.56e-07,0.00390625,0.0625,,0.0021765978204462896,,0.0001360373637778931,,1.8818359375,,1.8818359375,7.32,7.32,7.32,0.0021765978204462896,0.0021765978204462896,0.0021765978204462896,0.0001360373637778931,0.0001360373637778931,0.0001360373637778931,1.8818359375,1.8818359375,1.8818359375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.882), 'mean_duration_us': np.float64(1.882), 'median_duration_us': np.float64(1.882), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(1.882)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.88)}]","{'op_shape': (1, 1, 1, 256), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (256, 256, 256, 1), 'stride_output': (351, 351, 351, 1)}",True,diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/hunyuan.py(79): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(491): __call__', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(304): encode_prompt', 'diffusers/pipelines/hunyuan_video/pipeline_hunyuan_video.py(199): _get_llama_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",8.920115159482899e-05,100.00000000000001 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/BinaryElementwise.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/BinaryElementwise.csv index de118cfda..bb5b8e4bd 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/BinaryElementwise.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/BinaryElementwise.csv @@ -1,49 +1,49 @@ name,param: shape_in1,param: shape_in2,param: dtype_in1_in2_out,param: stride_input1,param: stride_input2,param: stride_output,num_kernels,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::add_,"(1, 128, 1024, 1024)","(1, 128, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(134217728, 1048576, 1024, 1)","(128, 1, 1, 1)",,1,0.134217728,512.000244140625,0.2499998807907673,2.5627008036557375,2.5537208010721097,0.07672882202885167,2.46177441051062,2.6992822911461083,0.6406748954163379,0.6384298958409301,0.0191821963604289,0.6154433091614163,0.6748202510071563,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(1467.5729999999999), 'mean_duration_us': np.float64(209.6532857142857), 'median_duration_us': np.float64(210.231), 'std_dev_duration_us': np.float64(5.740387411373299), 'min_duration_us': np.float64(198.894), 'max_duration_us': np.float64(218.083)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.65)}]","[[1, 128, 1024, 1024], [1, 128, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 1048576, 1024, 1], [128, 1, 1, 1], []]","['', '', '1']",209.6533203125,210.23095703125,6.200337293638209,198.89404296875,218.0830078125,1467.5732421875,7,27245 -aten::add_,"(1, 64, 256, 256)","(1, 64, 256, 256)","('c10::BFloat16', 'c10::BFloat16', None)","(4194304, 65536, 256, 1)","(64, 1, 16384, 64)",,1,0.004194304,24.0,0.16666666666666666,0.8932989719901001,0.8923680232703096,0.01530507743233117,0.8443994225142127,0.9211561464853175,0.14888316199835,0.14872800387838492,0.0025508462387218603,0.14073323708570212,0.1535260244142196,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(1352.64), 'mean_duration_us': np.float64(28.180000000000003), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4838763616186821), 'min_duration_us': np.float64(27.32), 'max_duration_us': np.float64(29.803)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.18)}]","[[1, 64, 256, 256], [1, 64, 256, 256], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[4194304, 65536, 256, 1], [64, 1, 16384, 64], []]","['', '', '1']",28.179982503255207,28.201171875,0.4890157762664813,27.31982421875,29.80322265625,1352.63916015625,48,5219 -aten::add_,"(1, 256, 512, 512)","(1, 256, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(67108864, 262144, 512, 1)","(256, 1, 1, 1)",,1,0.067108864,256.00048828125,0.2499995231637513,2.2718179132660135,2.315477441335653,0.10975672891979588,2.1012760863203765,2.377913096261565,0.5679533950313719,0.578868256230336,0.027439129893962116,0.5253180196154875,0.5944771401902307,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(828.8230000000001), 'mean_duration_us': np.float64(118.40328571428573), 'median_duration_us': np.float64(115.931), 'std_dev_duration_us': np.float64(5.460850606539129), 'min_duration_us': np.float64(112.887), 'max_duration_us': np.float64(127.749)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(118.4)}]","[[1, 256, 512, 512], [1, 256, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[67108864, 262144, 512, 1], [256, 1, 1, 1], []]","['', '', '1']",118.40325055803571,115.93115234375,5.8983346516891535,112.88720703125,127.7490234375,828.82275390625,7,27140 -aten::mul,"(1, 256, 10240)",(),"('c10::BFloat16', 'double', None)","(2621440, 10240, 1)",(),,1,0.00262144,10.000007629394531,0.24999980926528223,1.9659441249296883,2.1285412900164973,0.36292666417321007,1.3563350510958125,3.5390331021753463,0.4914856562586243,0.5321349165174021,0.09073159682058766,0.33908350407377,0.8847576005273567,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(796.32), 'mean_duration_us': np.float64(5.53), 'median_duration_us': np.float64(4.9265), 'std_dev_duration_us': np.float64(1.0894735923065477), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]","[[1, 256, 10240], []]","['c10::BFloat16', 'double']","[[2621440, 10240, 1], []]","['', '']",5.530008951822917,4.92626953125,1.0932611565836916,2.962890625,7.73095703125,796.3212890625,144,5288 -aten::add,"(1, 256, 4096)","(1, 256, 4096)","('c10::BFloat16', 'c10::BFloat16', None)","(1048576, 4096, 1)","(1048576, 4096, 1)",,1,0.001048576,6.0,0.16666666666666666,1.3954191507413258,1.6361780175238096,0.5661557267697908,0.3916740702191689,1.9890246816918802,0.23256985845688763,0.2726963362539682,0.09435928779496518,0.06527901170319482,0.33150411361531334,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(622.1469999999999), 'mean_duration_us': np.float64(6.480697916666666), 'median_duration_us': np.float64(3.845), 'std_dev_duration_us': np.float64(4.946894453256743), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(16.063)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.48)}]","[[1, 256, 4096], [1, 256, 4096], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1048576, 4096, 1], [1048576, 4096, 1], []]","['', '', '1']",6.4807078043619795,3.84521484375,4.972852050214373,3.1630859375,16.06298828125,622.14794921875,96,5262 -aten::mul,"(1, 256, 4096)","(1, 256, 1)","('c10::BFloat16', 'float', None)","(1048576, 4096, 1)","(256, 1, 1)",,1,0.001048576,6.0009765625,0.16663954434499592,1.023365961807252,1.0268525131474102,0.06258853332057247,0.8267786642715083,1.1385280537149924,0.17053323757373895,0.1711142349003984,0.010429724673761803,0.13777401988836852,0.1897237960950614,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(604.921), 'mean_duration_us': np.float64(6.172663265306123), 'median_duration_us': np.float64(6.128), 'std_dev_duration_us': np.float64(0.3935874755317555), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(7.611)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.17)}]","[[1, 256, 4096], [1, 256, 1]]","['c10::BFloat16', 'float']","[[1048576, 4096, 1], [256, 1, 1]]","['', '']",6.172662228954081,6.1279296875,0.395586423329981,5.52685546875,7.61083984375,604.9208984375,98,5098 -aten::mul,"(1, 256, 10240)","(1, 256, 10240)","('c10::BFloat16', 'c10::BFloat16', None)","(2621440, 10240, 1)","(2621440, 10240, 1)",,1,0.00262144,15.0,0.16666666666666666,2.7734013735868164,2.8367131118865982,0.608155849747016,1.8012780137560813,3.4455294384426143,0.4622335622644694,0.4727855186477665,0.10135930829116938,0.3002130022926802,0.5742549064071024,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(572.318), 'mean_duration_us': np.float64(5.961645833333333), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(1.33823683737196), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(8.732)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.96)}]","[[1, 256, 10240], [1, 256, 10240]]","['c10::BFloat16', 'c10::BFloat16']","[[2621440, 10240, 1], [2621440, 10240, 1]]","['', '']",5.9616546630859375,5.647216796875,1.3452461606471542,4.56494140625,8.73193359375,572.31884765625,96,5297 -aten::add,"(1, 128, 1024, 1024)","(1, 128, 1024, 1024)","('c10::BFloat16', 'c10::BFloat16', None)","(134217728, 1048576, 1024, 1)","(134217728, 1048576, 1024, 1)",,1,0.134217728,768.0,0.16666666666666666,5.022471221335316,5.011919815187697,0.029738981350048137,4.999446608457364,5.056047240360886,0.8370785368892193,0.8353199691979494,0.004956496891674644,0.8332411014095608,0.8426745400601476,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(481.033), 'mean_duration_us': np.float64(160.34433333333334), 'median_duration_us': np.float64(160.678), 'std_dev_duration_us': np.float64(0.7729606860780295), 'min_duration_us': np.float64(159.276), 'max_duration_us': np.float64(161.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(160.34)}]","[[1, 128, 1024, 1024], [1, 128, 1024, 1024], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 1048576, 1024, 1], [134217728, 1048576, 1024, 1], []]","['', '', '1']",160.34440104166666,160.67822265625,0.9468266154769833,159.27587890625,161.0791015625,481.033203125,3,27268 -aten::mul,"(4096,)","(1, 256, 4096)","('c10::BFloat16', 'c10::BFloat16', None)","(1,)","(1048576, 4096, 1)",,1,0.001048576,4.0078125,0.24951267056530213,0.8907988689554314,0.8930138578461777,0.05272997979301834,0.6640981333333333,1.0493430636430139,0.2222656047296203,0.2228182725230229,0.013156798077010416,0.1657008987654321,0.2618243901487442,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(464.06999999999994), 'mean_duration_us': np.float64(4.735408163265306), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.3041668727260965), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","[[4096], [1, 256, 4096]]","['c10::BFloat16', 'c10::BFloat16']","[[1], [1048576, 4096, 1]]","['', '']",4.73542629942602,4.7060546875,0.30576023168563127,4.0048828125,6.328125,464.07177734375,98,5103 -aten::add_,"(1, 512, 256, 256)","(1, 512, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(33554432, 65536, 256, 1)","(512, 1, 1, 1)",,1,0.033554432,128.0009765625,0.249998092665919,2.0868179208638438,2.1246270934471085,0.13534303091841254,1.900468784800675,2.2592629458526483,0.5217004999570196,0.5311527209881124,0.033835499585227656,0.47511357137128557,0.5648114272939475,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(451.86600000000004), 'mean_duration_us': np.float64(64.55228571428572), 'median_duration_us': np.float64(63.173), 'std_dev_duration_us': np.float64(3.9155450893762884), 'min_duration_us': np.float64(59.408), 'max_duration_us': np.float64(70.624)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.55)}]","[[1, 512, 256, 256], [1, 512, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[33554432, 65536, 256, 1], [512, 1, 1, 1], []]","['', '', '1']",64.55231584821429,63.1728515625,4.22928109753556,59.408203125,70.6240234375,451.8662109375,7,27030 -aten::add_,"(1, 256, 1024, 1024)","(1, 256, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(268435456, 1048576, 1024, 1)","(256, 1, 1, 1)",,1,0.268435456,1024.00048828125,0.2499998807907673,2.733129795667559,2.733129795667559,,2.733129795667559,2.733129795667559,0.6832821231025838,0.6832821231025838,,0.6832821231025838,0.6832821231025838,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(392.862), 'mean_duration_us': np.float64(392.862), 'median_duration_us': np.float64(392.862), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(392.862), 'max_duration_us': np.float64(392.862)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(392.86)}]","[[1, 256, 1024, 1024], [1, 256, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[268435456, 1048576, 1024, 1], [256, 1, 1, 1], []]","['', '', '1']",392.86181640625,392.86181640625,,392.86181640625,392.86181640625,392.86181640625,1,27232 -aten::add,"(1, 512, 128, 128)","(1, 512, 128, 128)","('c10::BFloat16', 'c10::BFloat16', None)","(512, 1, 65536, 512)","(8388608, 16384, 128, 1)",,1,0.008388608,48.0,0.16666666666666666,0.6726143662492617,0.6991881751917899,0.07519814684310595,0.5415616254538004,0.7283669215452123,0.11210239437487694,0.11653136253196497,0.012533024473850997,0.09026027090896672,0.12139448692420206,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(378.52), 'mean_duration_us': np.float64(75.704), 'median_duration_us': np.float64(71.986), 'std_dev_duration_us': np.float64(8.753032731573668), 'min_duration_us': np.float64(69.102), 'max_duration_us': np.float64(92.938)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(75.7)}]","[[1, 512, 128, 128], [1, 512, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[512, 1, 65536, 512], [8388608, 16384, 128, 1], []]","['', '', '1']",75.70400390625,71.98583984375,9.7861765523355,69.10205078125,92.93798828125,378.52001953125,5,26878 -aten::add,"(1, 256, 10240)",(),"('c10::BFloat16', 'double', None)","(2621440, 10240, 1)",(),,1,0.00262144,10.000007629394531,0.24999980926528223,1.3699063380734053,1.3563714325383884,0.09661753073931967,1.1431306751836474,1.60631706664672,0.34247632322965266,0.33909259942747483,0.024154364256512472,0.2857824507612052,0.4015789602812477,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(369.18199999999996), 'mean_duration_us': np.float64(7.6912916666666655), 'median_duration_us': np.float64(7.731), 'std_dev_duration_us': np.float64(0.5311947994197189), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.69)}]","[[1, 256, 10240], [], []]","['c10::BFloat16', 'double', 'Scalar']","[[2621440, 10240, 1], [], []]","['', '', '1']",7.6912841796875,7.73095703125,0.5368066733838069,6.52783203125,9.1728515625,369.181640625,48,5296 -aten::add,"(1, 77, 1280)","(1, 77, 1280)","('c10::BFloat16', 'c10::BFloat16', None)","(98560, 1280, 1)","(98560, 1280, 1)",,1,9.856e-05,0.56396484375,0.16666666666666666,0.21374836252903948,0.21401400954232197,0.010641487638759984,0.19175194426852438,0.25028007439553623,0.03562472708817325,0.035669001590386995,0.0017735812731266625,0.031958657378087396,0.04171334573258938,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(360.52700000000004), 'mean_duration_us': np.float64(2.7732846153846156), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.13570642718271758), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(3.084)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.77)}]","[[1, 77, 1280], [1, 77, 1280], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[98560, 1280, 1], [98560, 1280, 1], []]","['', '', '1']",2.7733285757211537,2.76318359375,0.1361878321358302,2.36279296875,3.083984375,360.53271484375,130,1499 -aten::add,"(1, 256, 10240)","(1, 256, 10240)","('c10::BFloat16', 'c10::BFloat16', None)","(2621440, 10240, 1)","(2621440, 10240, 1)",,1,0.00262144,15.0,0.16666666666666666,2.1403600581760758,2.1575522250502344,0.12136864503662081,1.7376337641601036,2.35143110592014,0.3567266763626793,0.35959203750837243,0.020228107506103484,0.2896056273600173,0.3919051843200234,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(353.918), 'mean_duration_us': np.float64(7.373291666666667), 'median_duration_us': np.float64(7.29), 'std_dev_duration_us': np.float64(0.4421139068127377), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.052)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.37)}]","[[1, 256, 10240], [1, 256, 10240], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[2621440, 10240, 1], [2621440, 10240, 1], []]","['', '', '1']",7.373291015625,7.2900390625,0.4467926884954272,6.68896484375,9.0517578125,353.91796875,48,5293 -aten::div,"(1, 128, 1024, 1024)",(),"('c10::BFloat16', 'double', None)","(134217728, 1048576, 1024, 1)",(),,1,0.134217728,512.0000076293945,0.24999999627470976,4.586877843701335,4.569380051033554,0.04590349744788913,4.552296594446215,4.638956885624237,1.1467194438378827,1.1423449957361216,0.01147587419096851,1.138074131652928,1.1597392041245986,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(351.158), 'mean_duration_us': np.float64(117.05266666666667), 'median_duration_us': np.float64(117.493), 'std_dev_duration_us': np.float64(0.951743079244021), 'min_duration_us': np.float64(115.731), 'max_duration_us': np.float64(117.934)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(117.05)}]","[[1, 128, 1024, 1024], []]","['c10::BFloat16', 'double']","[[134217728, 1048576, 1024, 1], []]","['', '']",117.052734375,117.4931640625,1.1657288165048338,115.73095703125,117.93408203125,351.158203125,3,27269 -aten::add,"(1, 256, 512, 512)","(1, 256, 512, 512)","('c10::BFloat16', 'c10::BFloat16', None)","(67108864, 262144, 512, 1)","(67108864, 262144, 512, 1)",,1,0.067108864,384.0,0.16666666666666666,4.806911957597861,4.832423384269189,0.06987866686866041,4.7278621765393885,4.860450311985005,0.8011519929329768,0.8054038973781982,0.011646444478110094,0.7879770294232313,0.8100750519975009,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(251.332), 'mean_duration_us': np.float64(83.77733333333333), 'median_duration_us': np.float64(83.323), 'std_dev_duration_us': np.float64(1.0012979354595477), 'min_duration_us': np.float64(82.843), 'max_duration_us': np.float64(85.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(83.78)}]","[[1, 256, 512, 512], [1, 256, 512, 512], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[67108864, 262144, 512, 1], [67108864, 262144, 512, 1], []]","['', '', '1']",83.77734375,83.3232421875,1.2263848242878954,82.8427734375,85.166015625,251.33203125,3,27163 -aten::add,"(1, 77, 768)","(1, 77, 768)","('c10::BFloat16', 'c10::BFloat16', None)","(59136, 768, 1)","(59136, 768, 1)",,1,5.9136e-05,0.33837890625,0.16666666666666666,0.07100890361360628,0.07030409907120744,0.005397594404611995,0.059059100130039004,0.08518911699882767,0.011834817268934377,0.011717349845201237,0.000899599067435332,0.0098431833550065,0.014198186166471278,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(251.23900000000003), 'mean_duration_us': np.float64(5.024780000000001), 'median_duration_us': np.float64(5.047), 'std_dev_duration_us': np.float64(0.37414020313246205), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.02)}]","[[1, 77, 768], [1, 77, 768], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[59136, 768, 1], [59136, 768, 1], []]","['', '', '1']",5.024775390625,5.046875,0.37790636847342857,4.1650390625,6.0078125,251.23876953125,50,54 -aten::add_,"(1, 512, 128, 128)","(1, 512, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(8388608, 16384, 128, 1)","(512, 1, 1, 1)",,1,0.008388608,32.0009765625,0.2499923708382923,1.647089341575493,1.6489879757168568,0.10197465791491123,1.4878342005239342,1.817069642728715,0.41175976948293935,0.4122344135332934,0.02549288649757247,0.3719471992032735,0.45425354796404016,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(224.881), 'mean_duration_us': np.float64(20.443727272727273), 'median_duration_us': np.float64(20.349), 'std_dev_duration_us': np.float64(1.2062343425952518), 'min_duration_us': np.float64(18.467), 'max_duration_us': np.float64(22.553)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.44)}]","[[1, 512, 128, 128], [1, 512, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [512, 1, 1, 1], []]","['', '', '1']",20.443670099431817,20.34912109375,1.265204583928953,18.466796875,22.55322265625,224.88037109375,11,26753 -aten::add_,"(1, 512, 512, 512)","(1, 512, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(134217728, 262144, 512, 1)","(512, 1, 1, 1)",,1,0.134217728,512.0009765625,0.2499995231637513,2.6298934061609778,2.6298934061609778,,2.6298934061609778,2.6298934061609778,0.6574720975117381,0.6574720975117381,,0.6574720975117381,0.6574720975117381,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(204.142), 'mean_duration_us': np.float64(204.142), 'median_duration_us': np.float64(204.142), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(204.142), 'max_duration_us': np.float64(204.142)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(204.14)}]","[[1, 512, 512, 512], [1, 512, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 262144, 512, 1], [512, 1, 1, 1], []]","['', '', '1']",204.14208984375,204.14208984375,,204.14208984375,204.14208984375,204.14208984375,1,27127 -aten::add,"(1, 256, 1)",(),"('float', 'double', None)","(256, 1, 1)",(),,1,2.56e-07,0.00196075439453125,0.1245136186770428,0.0010399005747285341,0.0010479561971129916,3.1825317628982755e-05,0.0009004893071000856,0.0010931173416407062,0.00012948178362378636,0.00013048481831757092,3.962685463530916e-06,0.00011212318220701456,0.0001361079958463136,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(193.94899999999998), 'mean_duration_us': np.float64(1.9790714285714284), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.062211825439298846), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(2.283)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.98)}]","[[1, 256, 1], [], []]","['float', 'double', 'Scalar']","[[256, 1, 1], [], []]","['', '', '1']",1.97900390625,1.9619140625,0.0625893259287263,1.880859375,2.283203125,193.9423828125,98,5096 -aten::div,"(1, 256, 512, 512)",(),"('c10::BFloat16', 'double', None)","(67108864, 262144, 512, 1)",(),,1,0.067108864,256.00000762939453,0.24999999254941963,4.469912772646585,4.533844348089992,0.12985639942242433,4.320485290245513,4.555408679604249,1.1174781598582018,1.133461053242726,0.03246409888810058,1.0801212903712551,1.1388521359606238,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(180.265), 'mean_duration_us': np.float64(60.08833333333333), 'median_duration_us': np.float64(59.207), 'std_dev_duration_us': np.float64(1.448899659128341), 'min_duration_us': np.float64(58.927), 'max_duration_us': np.float64(62.131)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(60.09)}]","[[1, 256, 512, 512], []]","['c10::BFloat16', 'double']","[[67108864, 262144, 512, 1], []]","['', '']",60.088216145833336,59.20703125,1.7745229841248433,58.9267578125,62.130859375,180.2646484375,3,27164 -aten::mul,"(1, 77, 3072)",(),"('c10::BFloat16', 'double', None)","(236544, 3072, 1)",(),,1,0.000236544,0.9023513793945312,0.24999788624622696,0.14903961514748587,0.14673507991585708,0.017924786857637046,0.12175839346528433,0.20365578896479244,0.03725958875382261,0.03668345981713545,0.00448115882582341,0.030439340999057492,0.05091351676300578,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(154.16500000000002), 'mean_duration_us': np.float64(6.423541666666668), 'median_duration_us': np.float64(6.4485), 'std_dev_duration_us': np.float64(0.6465522651705911), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(7.771)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.42)}]","[[1, 77, 3072], []]","['c10::BFloat16', 'double']","[[236544, 3072, 1], []]","['', '']",6.423543294270833,6.448486328125,0.6604502574194904,4.64599609375,7.77099609375,154.1650390625,24,154 -aten::add,"(1, 512, 256, 256)","(1, 512, 256, 256)","('c10::BFloat16', 'c10::BFloat16', None)","(33554432, 65536, 256, 1)","(33554432, 65536, 256, 1)",,1,0.033554432,192.0,0.16666666666666666,4.863714008193326,4.837242314648397,0.10654152556180534,4.7729040297266945,4.980995680204885,0.8106190013655542,0.8062070524413995,0.017756920926967516,0.7954840049544492,0.8301659467008141,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(124.22), 'mean_duration_us': np.float64(41.406666666666666), 'median_duration_us': np.float64(41.62), 'std_dev_duration_us': np.float64(0.7349804230197037), 'min_duration_us': np.float64(40.419), 'max_duration_us': np.float64(42.181)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(41.41)}]","[[1, 512, 256, 256], [1, 512, 256, 256], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[33554432, 65536, 256, 1], [33554432, 65536, 256, 1], []]","['', '', '1']",41.40673828125,41.6201171875,0.9002729161043719,40.4189453125,42.18115234375,124.22021484375,3,27058 -aten::mul,"(1, 77, 3072)","(1, 77, 3072)","('c10::BFloat16', 'c10::BFloat16', None)","(236544, 3072, 1)","(236544, 3072, 1)",,1,0.000236544,1.353515625,0.16666666666666666,0.28015792972435755,0.27684094815905147,0.029938919474100666,0.21741735896476921,0.344064,0.04669298828739291,0.046140158026508574,0.004989819912350111,0.0362362264941282,0.05734399999999999,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(122.91999999999999), 'mean_duration_us': np.float64(5.121666666666666), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.5380385415769229), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]","[[1, 77, 3072], [1, 77, 3072]]","['c10::BFloat16', 'c10::BFloat16']","[[236544, 3072, 1], [236544, 3072, 1]]","['', '']",5.121663411458333,5.126953125,0.5496177307356938,4.125,6.52783203125,122.919921875,24,156 -aten::div,"(1, 512, 256, 256)",(),"('c10::BFloat16', 'double', None)","(33554432, 65536, 256, 1)",(),,1,0.033554432,128.00000762939453,0.2499999850988397,4.2628518963360476,4.391231581832995,0.23752221117813557,3.9887673345812833,4.4085567725938635,1.0657129105625724,1.097807830023803,0.05938054925517739,0.9971917742080594,1.1021391274558547,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(94.65899999999999), 'mean_duration_us': np.float64(31.552999999999997), 'median_duration_us': np.float64(30.565), 'std_dev_duration_us': np.float64(1.4829052565824967), 'min_duration_us': np.float64(30.445), 'max_duration_us': np.float64(33.649)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(31.55)}]","[[1, 512, 256, 256], []]","['c10::BFloat16', 'double']","[[33554432, 65536, 256, 1], []]","['', '']",31.552897135416668,30.56494140625,1.8162073388792004,30.44482421875,33.64892578125,94.65869140625,3,27059 -aten::add_,"(1, 16384, 512)","(512,)","('c10::BFloat16', 'c10::BFloat16', None)","(8388608, 512, 1)","(1,)",,1,0.008388608,32.0009765625,0.2499923708382923,1.6930266731505812,1.7026305408057083,0.06847488706448931,1.6202568465129439,1.7561926321330914,0.4232437519133803,0.42564464555770276,0.01711819936013603,0.40505185042674585,0.4390347597556924,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.525), 'mean_duration_us': np.float64(19.841666666666665), 'median_duration_us': np.float64(19.708), 'std_dev_duration_us': np.float64(0.6612121864844571), 'min_duration_us': np.float64(19.107), 'max_duration_us': np.float64(20.71)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(19.84)}]","[[1, 16384, 512], [512], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 512, 1], [1], []]","['', '', '1']",19.841634114583332,19.7080078125,0.8098247697242251,19.10693359375,20.7099609375,59.52490234375,3,26803 -aten::mul,(),"(1, 16, 128, 128)","('float', 'c10::BFloat16', None)",(),"(262144, 16384, 128, 1)",,1,0.000262144,1.5000038146972656,0.16666624281249284,0.10583075101983144,0.10627978761983532,0.0030098973109926094,0.10198941438703141,0.10877401445262375,0.017638413646499703,0.017713252889507643,0.0005016482760745645,0.016998192502532927,0.018128956304450595,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(59.485), 'mean_duration_us': np.float64(14.87125), 'median_duration_us': np.float64(14.8015), 'std_dev_duration_us': np.float64(0.3699130810068764), 'min_duration_us': np.float64(14.46), 'max_duration_us': np.float64(15.422)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.87)}]","[[], [1, 16, 128, 128]]","['float', 'c10::BFloat16']","[[], [262144, 16384, 128, 1]]","['', '']",14.8712158203125,14.801513671875,0.4270736026430738,14.4599609375,15.421875,59.48486328125,4,20483 -aten::div,"(1, 512, 128, 128)",(),"('c10::BFloat16', 'double', None)","(512, 1, 65536, 512)",(),,1,0.008388608,32.00000762939453,0.24999994039536944,3.7863698265084067,3.7905837674444265,0.09410203192276984,3.69023161421974,3.8782940978610534,0.9465922309419269,0.9476457159247614,0.023525502371775572,0.922557683600043,0.9695732933009764,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.596999999999998), 'mean_duration_us': np.float64(8.865666666666666), 'median_duration_us': np.float64(8.852), 'std_dev_duration_us': np.float64(0.18029666910092654), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(9.093)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]","[[1, 512, 128, 128], []]","['c10::BFloat16', 'double']","[[512, 1, 65536, 512], []]","['', '']",8.865559895833334,8.85205078125,0.22076919151973087,8.65185546875,9.0927734375,26.5966796875,3,26947 -aten::add,"(1, 16, 128, 128)","(1, 16, 128, 128)","('float', 'c10::BFloat16', None)","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",,1,0.000262144,2.5,0.1,0.5696638661689855,0.5717238154840321,0.01925345978273532,0.5454342294016052,0.5897736043062726,0.05696638661689855,0.0571723815484032,0.0019253459782735385,0.05454342294016052,0.05897736043062726,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.423000000000002), 'mean_duration_us': np.float64(4.6057500000000005), 'median_duration_us': np.float64(4.586), 'std_dev_duration_us': np.float64(0.13594185337856768), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['float', 'c10::BFloat16', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', '1']",4.605712890625,4.5859375,0.15711709075500374,4.44482421875,4.80615234375,18.4228515625,4,20484 -aten::div,"(1, 512, 128, 128)",(),"('c10::BFloat16', 'long int', None)","(512, 1, 65536, 512)",(),,1,0.008388608,32.00000762939453,0.24999994039536944,3.6540526689465587,3.6540526689465587,0.16894613833063338,3.5345897088776876,3.77351562901543,0.9135129494381802,0.9135129494381802,0.04223652451268619,0.883647216541508,0.9433786823348524,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(18.384999999999998), 'mean_duration_us': np.float64(9.192499999999999), 'median_duration_us': np.float64(9.192499999999999), 'std_dev_duration_us': np.float64(0.30050000000000043), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.19)}]","[[1, 512, 128, 128], []]","['c10::BFloat16', 'long int']","[[512, 1, 65536, 512], []]","['', '']",9.192626953125,9.192626953125,0.42502365607453124,8.89208984375,9.4931640625,18.38525390625,2,26879 -aten::mul,"(1, 16, 128, 128)",(),"('c10::BFloat16', 'double', None)","(262144, 16384, 128, 1)",(),,1,0.000262144,1.0000076293945312,0.249998092665919,0.27803774295407285,0.2830870390932726,0.01866830191289951,0.25175850316529896,0.2942183904644472,0.06950890542765527,0.0707712198317606,0.004667039871536402,0.06293914560375147,0.0735540364433484,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(15.139), 'mean_duration_us': np.float64(3.78475), 'median_duration_us': np.float64(3.705), 'std_dev_duration_us': np.float64(0.23088999003854627), 'min_duration_us': np.float64(3.564), 'max_duration_us': np.float64(4.165)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]","[[1, 16, 128, 128], []]","['c10::BFloat16', 'double']","[[262144, 16384, 128, 1], []]","['', '']",3.7847900390625,3.705078125,0.26663028995436494,3.56396484375,4.1650390625,15.13916015625,4,20459 -aten::add,"(1, 16, 128, 128)","(1, 16, 128, 128)","('c10::BFloat16', 'c10::BFloat16', None)","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",,1,0.000262144,1.5,0.16666666666666666,0.4587556569474247,0.45690230962562683,0.03613384601984402,0.4177441929710803,0.5034738155673648,0.07645927615790411,0.07615038493760448,0.006022307669974005,0.0696240321618467,0.0839123025945608,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.778), 'mean_duration_us': np.float64(3.4445), 'median_duration_us': np.float64(3.4444999999999997), 'std_dev_duration_us': np.float64(0.23366696386096175), 'min_duration_us': np.float64(3.124), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', '1']",3.4444580078125,3.4443359375,0.2698734709293077,3.1240234375,3.76513671875,13.77783203125,4,20460 -aten::add,"(1, 512, 128, 128)","(1, 512, 128, 128)","('c10::BFloat16', 'c10::BFloat16', None)","(8388608, 16384, 128, 1)","(8388608, 16384, 128, 1)",,1,0.008388608,48.0,0.16666666666666666,3.9513633267144557,3.9513633267144557,,3.9513633267144557,3.9513633267144557,0.6585605544524092,0.6585605544524092,,0.6585605544524092,0.6585605544524092,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.738), 'mean_duration_us': np.float64(12.738), 'median_duration_us': np.float64(12.738), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.738), 'max_duration_us': np.float64(12.738)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(12.74)}]","[[1, 512, 128, 128], [1, 512, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [8388608, 16384, 128, 1], []]","['', '', '1']",12.73779296875,12.73779296875,,12.73779296875,12.73779296875,12.73779296875,1,26781 -aten::add,"(256, 256)",(),"('long int', 'long int', None)","(256, 1)",(),,1,6.5536e-05,1.0000076293945312,0.06249952316647975,0.3354102272086957,0.3361487217642716,0.018940029952049627,0.3154377250293772,0.3539057402768622,0.02096297926570411,0.021009134823288648,0.0011837428407619468,0.01971470740305523,0.022118940013183916,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(3.13375), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.1535746968090772), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.324)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.13)}]","[[256, 256], [], []]","['long int', 'long int', 'Scalar']","[[256, 1], [], []]","['', '', '1']",3.1337890625,3.1240234375,0.177498125952915,2.962890625,3.32421875,12.53515625,4,5173 -aten::add_,"(1, 3, 1024, 1024)","(1, 3, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(3145728, 1048576, 1024, 1)","(3, 1, 1, 1)",,1,0.003145728,12.000005722045898,0.2499998807907673,1.1464971332473195,1.1464971332473195,,1.1464971332473195,1.1464971332473195,0.2866241466387863,0.2866241466387863,,0.2866241466387863,0.2866241466387863,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.975), 'mean_duration_us': np.float64(10.975), 'median_duration_us': np.float64(10.975), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.975), 'max_duration_us': np.float64(10.975)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.98)}]","[[1, 3, 1024, 1024], [1, 3, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[3145728, 1048576, 1024, 1], [3, 1, 1, 1], []]","['', '', '1']",10.97509765625,10.97509765625,,10.97509765625,10.97509765625,10.97509765625,1,27340 -aten::div,"(1, 512, 128, 128)",(),"('c10::BFloat16', 'long int', None)","(8388608, 16384, 128, 1)",(),,1,0.008388608,32.00000762939453,0.24999994039536944,3.6584057240204433,3.6584057240204433,,3.6584057240204433,3.6584057240204433,0.9146012129471891,0.9146012129471891,,0.9146012129471891,0.9146012129471891,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.172), 'mean_duration_us': np.float64(9.172), 'median_duration_us': np.float64(9.172), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.172), 'max_duration_us': np.float64(9.172)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.17)}]","[[1, 512, 128, 128], []]","['c10::BFloat16', 'long int']","[[8388608, 16384, 128, 1], []]","['', '']",9.171875,9.171875,,9.171875,9.171875,9.171875,1,26782 -aten::add_,"(256, 256)","(256, 256)","('long int', 'long int', None)","(256, 1)","(256, 1)",,1,6.5536e-05,1.5,0.041666666666666664,0.43636216893953483,0.43636216893953483,8.359649111635002e-05,0.43630305729378305,0.43642128058528656,0.018181757039147282,0.018181757039147282,3.4831871298454644e-06,0.018179294053907627,0.018184220024386938,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.209), 'mean_duration_us': np.float64(3.6045), 'median_duration_us': np.float64(3.6045), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(3.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","[[256, 256], [256, 256], []]","['long int', 'long int', 'Scalar']","[[256, 1], [256, 1], []]","['', '', '1']",3.6044921875,3.6044921875,0.0006905339660024879,3.60400390625,3.60498046875,7.208984375,2,5201 -aten::mul,"(256, 256)",(),"('long int', 'long int', None)","(256, 1)",(),,1,6.5536e-05,1.0000076293945312,0.06249952316647975,0.3210768746606883,0.3210768746606883,0.033256019157474094,0.29756131799916863,0.34459243132220796,0.0200671515660766,0.0200671515660766,0.0020784853397574476,0.018597440487737284,0.021536862644415917,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.567), 'mean_duration_us': np.float64(3.2835), 'median_duration_us': np.float64(3.2835), 'std_dev_duration_us': np.float64(0.24049999999999994), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.28)}]","[[256, 256], []]","['long int', 'long int']","[[256, 1], []]","['', '']",3.283447265625,3.283447265625,0.3400879782562253,3.04296875,3.52392578125,6.56689453125,2,5172 -aten::mul,"(1, 3, 1024, 1024)",(),"('c10::BFloat16', 'double', None)","(3145728, 1048576, 1024, 1)",(),,1,0.003145728,12.000007629394531,0.24999984105438167,1.951076632344034,1.951076632344034,,1.951076632344034,1.951076632344034,0.4877688479709268,0.4877688479709268,,0.4877688479709268,0.4877688479709268,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.449), 'mean_duration_us': np.float64(6.449), 'median_duration_us': np.float64(6.449), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.449), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.45)}]","[[1, 3, 1024, 1024], []]","['c10::BFloat16', 'double']","[[3145728, 1048576, 1024, 1], []]","['', '']",6.44921875,6.44921875,,6.44921875,6.44921875,6.44921875,1,27341 -aten::add,"(1, 3, 1024, 1024)",(),"('c10::BFloat16', 'double', None)","(3145728, 1048576, 1024, 1)",(),,1,0.003145728,12.000007629394531,0.24999984105438167,2.1084781672394044,2.1084781672394044,,2.1084781672394044,2.1084781672394044,0.527119206676485,0.527119206676485,,0.527119206676485,0.527119206676485,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]","[[1, 3, 1024, 1024], [], []]","['c10::BFloat16', 'double', 'Scalar']","[[3145728, 1048576, 1024, 1], [], []]","['', '', '1']",5.9677734375,5.9677734375,,5.9677734375,5.9677734375,5.9677734375,1,27342 -aten::div,"(256, 256)",(),"('float', 'double', None)","(256, 1)",(),,1,6.5536e-05,0.5000076293945312,0.12499809268047057,0.20649471566880673,0.20649471566880673,0.011494943093073473,0.19836656345834103,0.21462286787927246,0.02581144560719692,0.02581144560719692,0.0014368459621047333,0.024795442083872157,0.026827449130521687,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.086), 'mean_duration_us': np.float64(2.543), 'median_duration_us': np.float64(2.543), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.643)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.54)}]","[[256, 256], []]","['float', 'double']","[[256, 1], []]","['', '']",2.54296875,2.54296875,0.14155946303051,2.44287109375,2.64306640625,5.0859375,2,5185 -aten::mul,"(256, 256)",(),"('float', 'long int', None)","(256, 1)",(),,1,6.5536e-05,0.5000076293945312,0.12499809268047057,0.20802032607994764,0.20802032607994764,0.009337404158740426,0.2014177842806228,0.21462286787927246,0.026002143998763,0.026002143998763,0.0011671577104292474,0.025176838867004316,0.026827449130521687,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.046), 'mean_duration_us': np.float64(2.523), 'median_duration_us': np.float64(2.523), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.603)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.52)}]","[[256, 256], []]","['float', 'long int']","[[256, 1], []]","['', '']",2.52294921875,2.52294921875,0.113247570424408,2.44287109375,2.60302734375,5.0458984375,2,5186 -aten::div,"(256, 256)",(),"('float', 'long int', None)","(256, 1)",(),,1,6.5536e-05,0.5000076293945312,0.12499809268047057,0.21834858271893276,0.21834858271893276,0.005147571704512462,0.214708699860028,0.2219884655778375,0.02729315637935055,0.02729315637935055,0.0006434366450000153,0.026838177964407118,0.027748134794293982,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.804), 'mean_duration_us': np.float64(2.402), 'median_duration_us': np.float64(2.402), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.442)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.4)}]","[[256, 256], []]","['float', 'long int']","[[256, 1], []]","['', '']",2.40185546875,2.40185546875,0.056623785212204,2.36181640625,2.44189453125,4.8037109375,2,5183 -aten::add,"(256, 1)",(),"('long int', 'long int', None)","(1, 1)",(),,1,2.56e-07,0.00391387939453125,0.06237816764132553,0.0018030654487239854,0.0018030654487239854,0.00013446468803464246,0.001707984555984556,0.0018981463414634147,0.0001124719188287866,0.0001124719188287866,8.38766085206349e-06,0.00010654094696199958,0.00011840289069557363,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.5649999999999995), 'mean_duration_us': np.float64(2.2824999999999998), 'median_duration_us': np.float64(2.2824999999999998), 'std_dev_duration_us': np.float64(0.12050000000000005), 'min_duration_us': np.float64(2.162), 'max_duration_us': np.float64(2.403)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.28)}]","[[256, 1], [], []]","['long int', 'long int', 'Scalar']","[[1, 1], [], []]","['', '', '1']",2.282470703125,2.282470703125,0.17021662261961323,2.162109375,2.40283203125,4.56494140625,2,5159 -aten::add,"(1, 16, 128, 128)",(),"('c10::BFloat16', 'double', None)","(262144, 16384, 128, 1)",(),,1,0.000262144,1.0000076293945312,0.249998092665919,0.3686695333905579,0.3686695333905579,,0.3686695333905579,0.3686695333905579,0.09216668017167381,0.09216668017167381,,0.09216668017167381,0.09216668017167381,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.844), 'mean_duration_us': np.float64(2.844), 'median_duration_us': np.float64(2.844), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.844), 'max_duration_us': np.float64(2.844)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","[[1, 16, 128, 128], [], []]","['c10::BFloat16', 'double', 'Scalar']","[[262144, 16384, 128, 1], [], []]","['', '', '1']",2.84423828125,2.84423828125,,2.84423828125,2.84423828125,2.84423828125,1,26745 -aten::div,"(1, 16, 128, 128)",(),"('c10::BFloat16', 'double', None)","(262144, 16384, 128, 1)",(),,1,0.000262144,1.0000076293945312,0.249998092665919,0.3850636600322754,0.3850636600322754,,0.3850636600322754,0.3850636600322754,0.09626518056302671,0.09626518056302671,,0.09626518056302671,0.09626518056302671,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]","[[1, 16, 128, 128], []]","['c10::BFloat16', 'double']","[[262144, 16384, 128, 1], []]","['', '']",2.72314453125,2.72314453125,,2.72314453125,2.72314453125,2.72314453125,1,26744 -aten::mul,"(4,)",(),"('float', 'long int', None)","(1,)",(),,1,4e-09,3.814697265625e-05,0.1,2.039840637450199e-05,2.039840637450199e-05,,2.039840637450199e-05,2.039840637450199e-05,2.0398406374501996e-06,2.0398406374501996e-06,,2.0398406374501996e-06,2.0398406374501996e-06,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.961), 'mean_duration_us': np.float64(1.961), 'median_duration_us': np.float64(1.961), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(1.961)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.96)}]","[[4], []]","['float', 'long int']","[[1], []]","['', '']",1.9609375,1.9609375,,1.9609375,1.9609375,1.9609375,1,18381 +aten::add_,"(1, 128, 1024, 1024)","(1, 128, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(134217728, 1048576, 1024, 1)","(128, 1, 1, 1)",None,1,0.134217728,512.000244140625,0.2499998807907673,2.5627008036557375,2.5537208010721097,0.07672882202885167,2.46177441051062,2.6992822911461083,0.6406748954163379,0.6384298958409301,0.0191821963604289,0.6154433091614163,0.6748202510071563,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(1467.5729999999999), 'mean_duration_us': np.float64(209.6532857142857), 'median_duration_us': np.float64(210.231), 'std_dev_duration_us': np.float64(5.740387411373299), 'min_duration_us': np.float64(198.894), 'max_duration_us': np.float64(218.083)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.65)}]","[[1, 128, 1024, 1024], [1, 128, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 1048576, 1024, 1], [128, 1, 1, 1], []]","['', '', '1']",209.6533203125,210.23095703125,6.200337293638209,198.89404296875,218.0830078125,1467.5732421875,7,27245 +aten::add_,"(1, 64, 256, 256)","(1, 64, 256, 256)","('c10::BFloat16', 'c10::BFloat16', None)","(4194304, 65536, 256, 1)","(64, 1, 16384, 64)",None,1,0.004194304,24.0,0.16666666666666666,0.8932989719901001,0.8923680232703096,0.01530507743233117,0.8443994225142127,0.9211561464853175,0.14888316199835,0.14872800387838492,0.0025508462387218603,0.14073323708570212,0.1535260244142196,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(1352.64), 'mean_duration_us': np.float64(28.180000000000003), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4838763616186821), 'min_duration_us': np.float64(27.32), 'max_duration_us': np.float64(29.803)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.18)}]","[[1, 64, 256, 256], [1, 64, 256, 256], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[4194304, 65536, 256, 1], [64, 1, 16384, 64], []]","['', '', '1']",28.179982503255207,28.201171875,0.4890157762664813,27.31982421875,29.80322265625,1352.63916015625,48,5219 +aten::add_,"(1, 256, 512, 512)","(1, 256, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(67108864, 262144, 512, 1)","(256, 1, 1, 1)",None,1,0.067108864,256.00048828125,0.2499995231637513,2.2718179132660135,2.315477441335653,0.10975672891979588,2.1012760863203765,2.377913096261565,0.5679533950313719,0.578868256230336,0.027439129893962116,0.5253180196154875,0.5944771401902307,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(828.8230000000001), 'mean_duration_us': np.float64(118.40328571428573), 'median_duration_us': np.float64(115.931), 'std_dev_duration_us': np.float64(5.460850606539129), 'min_duration_us': np.float64(112.887), 'max_duration_us': np.float64(127.749)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(118.4)}]","[[1, 256, 512, 512], [1, 256, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[67108864, 262144, 512, 1], [256, 1, 1, 1], []]","['', '', '1']",118.40325055803571,115.93115234375,5.8983346516891535,112.88720703125,127.7490234375,828.82275390625,7,27140 +aten::mul,"(1, 256, 10240)",(),"('c10::BFloat16', 'double', None)","(2621440, 10240, 1)",(),None,1,0.00262144,10.000007629394531,0.24999980926528223,1.9659441249296883,2.1285412900164973,0.36292666417321007,1.3563350510958125,3.5390331021753463,0.4914856562586243,0.5321349165174021,0.09073159682058766,0.33908350407377,0.8847576005273567,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(796.32), 'mean_duration_us': np.float64(5.53), 'median_duration_us': np.float64(4.9265), 'std_dev_duration_us': np.float64(1.0894735923065477), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]","[[1, 256, 10240], []]","['c10::BFloat16', 'double']","[[2621440, 10240, 1], []]","['', '']",5.530008951822917,4.92626953125,1.0932611565836916,2.962890625,7.73095703125,796.3212890625,144,5288 +aten::add,"(1, 256, 4096)","(1, 256, 4096)","('c10::BFloat16', 'c10::BFloat16', None)","(1048576, 4096, 1)","(1048576, 4096, 1)",None,1,0.001048576,6.0,0.16666666666666666,1.3954191507413258,1.6361780175238096,0.5661557267697908,0.3916740702191689,1.9890246816918802,0.23256985845688763,0.2726963362539682,0.09435928779496518,0.06527901170319482,0.33150411361531334,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(622.1469999999999), 'mean_duration_us': np.float64(6.480697916666666), 'median_duration_us': np.float64(3.845), 'std_dev_duration_us': np.float64(4.946894453256743), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(16.063)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.48)}]","[[1, 256, 4096], [1, 256, 4096], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1048576, 4096, 1], [1048576, 4096, 1], []]","['', '', '1']",6.4807078043619795,3.84521484375,4.972852050214373,3.1630859375,16.06298828125,622.14794921875,96,5262 +aten::mul,"(1, 256, 4096)","(1, 256, 1)","('c10::BFloat16', 'float', None)","(1048576, 4096, 1)","(256, 1, 1)",None,1,0.001048576,6.0009765625,0.16663954434499592,1.023365961807252,1.0268525131474102,0.06258853332057247,0.8267786642715083,1.1385280537149924,0.17053323757373895,0.1711142349003984,0.010429724673761803,0.13777401988836852,0.1897237960950614,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(604.921), 'mean_duration_us': np.float64(6.172663265306123), 'median_duration_us': np.float64(6.128), 'std_dev_duration_us': np.float64(0.3935874755317555), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(7.611)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.17)}]","[[1, 256, 4096], [1, 256, 1]]","['c10::BFloat16', 'float']","[[1048576, 4096, 1], [256, 1, 1]]","['', '']",6.172662228954081,6.1279296875,0.395586423329981,5.52685546875,7.61083984375,604.9208984375,98,5098 +aten::mul,"(1, 256, 10240)","(1, 256, 10240)","('c10::BFloat16', 'c10::BFloat16', None)","(2621440, 10240, 1)","(2621440, 10240, 1)",None,1,0.00262144,15.0,0.16666666666666666,2.7734013735868164,2.8367131118865982,0.608155849747016,1.8012780137560813,3.4455294384426143,0.4622335622644694,0.4727855186477665,0.10135930829116938,0.3002130022926802,0.5742549064071024,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(572.318), 'mean_duration_us': np.float64(5.961645833333333), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(1.33823683737196), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(8.732)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.96)}]","[[1, 256, 10240], [1, 256, 10240]]","['c10::BFloat16', 'c10::BFloat16']","[[2621440, 10240, 1], [2621440, 10240, 1]]","['', '']",5.9616546630859375,5.647216796875,1.3452461606471542,4.56494140625,8.73193359375,572.31884765625,96,5297 +aten::add,"(1, 128, 1024, 1024)","(1, 128, 1024, 1024)","('c10::BFloat16', 'c10::BFloat16', None)","(134217728, 1048576, 1024, 1)","(134217728, 1048576, 1024, 1)",None,1,0.134217728,768.0,0.16666666666666666,5.022471221335316,5.011919815187697,0.029738981350048137,4.999446608457364,5.056047240360886,0.8370785368892193,0.8353199691979494,0.004956496891674644,0.8332411014095608,0.8426745400601476,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(481.033), 'mean_duration_us': np.float64(160.34433333333334), 'median_duration_us': np.float64(160.678), 'std_dev_duration_us': np.float64(0.7729606860780295), 'min_duration_us': np.float64(159.276), 'max_duration_us': np.float64(161.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(160.34)}]","[[1, 128, 1024, 1024], [1, 128, 1024, 1024], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 1048576, 1024, 1], [134217728, 1048576, 1024, 1], []]","['', '', '1']",160.34440104166666,160.67822265625,0.9468266154769833,159.27587890625,161.0791015625,481.033203125,3,27268 +aten::mul,"(4096,)","(1, 256, 4096)","('c10::BFloat16', 'c10::BFloat16', None)","(1,)","(1048576, 4096, 1)",None,1,0.001048576,4.0078125,0.24951267056530213,0.8907988689554314,0.8930138578461777,0.05272997979301834,0.6640981333333333,1.0493430636430139,0.2222656047296203,0.2228182725230229,0.013156798077010416,0.1657008987654321,0.2618243901487442,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(464.06999999999994), 'mean_duration_us': np.float64(4.735408163265306), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.3041668727260965), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","[[4096], [1, 256, 4096]]","['c10::BFloat16', 'c10::BFloat16']","[[1], [1048576, 4096, 1]]","['', '']",4.73542629942602,4.7060546875,0.30576023168563127,4.0048828125,6.328125,464.07177734375,98,5103 +aten::add_,"(1, 512, 256, 256)","(1, 512, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(33554432, 65536, 256, 1)","(512, 1, 1, 1)",None,1,0.033554432,128.0009765625,0.249998092665919,2.0868179208638438,2.1246270934471085,0.13534303091841254,1.900468784800675,2.2592629458526483,0.5217004999570196,0.5311527209881124,0.033835499585227656,0.47511357137128557,0.5648114272939475,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(451.86600000000004), 'mean_duration_us': np.float64(64.55228571428572), 'median_duration_us': np.float64(63.173), 'std_dev_duration_us': np.float64(3.9155450893762884), 'min_duration_us': np.float64(59.408), 'max_duration_us': np.float64(70.624)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.55)}]","[[1, 512, 256, 256], [1, 512, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[33554432, 65536, 256, 1], [512, 1, 1, 1], []]","['', '', '1']",64.55231584821429,63.1728515625,4.22928109753556,59.408203125,70.6240234375,451.8662109375,7,27030 +aten::add_,"(1, 256, 1024, 1024)","(1, 256, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(268435456, 1048576, 1024, 1)","(256, 1, 1, 1)",None,1,0.268435456,1024.00048828125,0.2499998807907673,2.733129795667559,2.733129795667559,,2.733129795667559,2.733129795667559,0.6832821231025838,0.6832821231025838,,0.6832821231025838,0.6832821231025838,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(392.862), 'mean_duration_us': np.float64(392.862), 'median_duration_us': np.float64(392.862), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(392.862), 'max_duration_us': np.float64(392.862)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(392.86)}]","[[1, 256, 1024, 1024], [1, 256, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[268435456, 1048576, 1024, 1], [256, 1, 1, 1], []]","['', '', '1']",392.86181640625,392.86181640625,,392.86181640625,392.86181640625,392.86181640625,1,27232 +aten::add,"(1, 512, 128, 128)","(1, 512, 128, 128)","('c10::BFloat16', 'c10::BFloat16', None)","(512, 1, 65536, 512)","(8388608, 16384, 128, 1)",None,1,0.008388608,48.0,0.16666666666666666,0.6726143662492617,0.6991881751917899,0.07519814684310595,0.5415616254538004,0.7283669215452123,0.11210239437487694,0.11653136253196497,0.012533024473850997,0.09026027090896672,0.12139448692420206,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(378.52), 'mean_duration_us': np.float64(75.704), 'median_duration_us': np.float64(71.986), 'std_dev_duration_us': np.float64(8.753032731573668), 'min_duration_us': np.float64(69.102), 'max_duration_us': np.float64(92.938)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(75.7)}]","[[1, 512, 128, 128], [1, 512, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[512, 1, 65536, 512], [8388608, 16384, 128, 1], []]","['', '', '1']",75.70400390625,71.98583984375,9.7861765523355,69.10205078125,92.93798828125,378.52001953125,5,26878 +aten::add,"(1, 256, 10240)",(),"('c10::BFloat16', 'double', None)","(2621440, 10240, 1)",(),None,1,0.00262144,10.000007629394531,0.24999980926528223,1.3699063380734053,1.3563714325383884,0.09661753073931967,1.1431306751836474,1.60631706664672,0.34247632322965266,0.33909259942747483,0.024154364256512472,0.2857824507612052,0.4015789602812477,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(369.18199999999996), 'mean_duration_us': np.float64(7.6912916666666655), 'median_duration_us': np.float64(7.731), 'std_dev_duration_us': np.float64(0.5311947994197189), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.69)}]","[[1, 256, 10240], [], []]","['c10::BFloat16', 'double', 'Scalar']","[[2621440, 10240, 1], [], []]","['', '', '1']",7.6912841796875,7.73095703125,0.5368066733838069,6.52783203125,9.1728515625,369.181640625,48,5296 +aten::add,"(1, 77, 1280)","(1, 77, 1280)","('c10::BFloat16', 'c10::BFloat16', None)","(98560, 1280, 1)","(98560, 1280, 1)",None,1,9.856e-05,0.56396484375,0.16666666666666666,0.21374836252903948,0.21401400954232197,0.010641487638759984,0.19175194426852438,0.25028007439553623,0.03562472708817325,0.035669001590386995,0.0017735812731266625,0.031958657378087396,0.04171334573258938,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(360.52700000000004), 'mean_duration_us': np.float64(2.7732846153846156), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.13570642718271758), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(3.084)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.77)}]","[[1, 77, 1280], [1, 77, 1280], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[98560, 1280, 1], [98560, 1280, 1], []]","['', '', '1']",2.7733285757211537,2.76318359375,0.1361878321358302,2.36279296875,3.083984375,360.53271484375,130,1499 +aten::add,"(1, 256, 10240)","(1, 256, 10240)","('c10::BFloat16', 'c10::BFloat16', None)","(2621440, 10240, 1)","(2621440, 10240, 1)",None,1,0.00262144,15.0,0.16666666666666666,2.1403600581760758,2.1575522250502344,0.12136864503662081,1.7376337641601036,2.35143110592014,0.3567266763626793,0.35959203750837243,0.020228107506103484,0.2896056273600173,0.3919051843200234,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(353.918), 'mean_duration_us': np.float64(7.373291666666667), 'median_duration_us': np.float64(7.29), 'std_dev_duration_us': np.float64(0.4421139068127377), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.052)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.37)}]","[[1, 256, 10240], [1, 256, 10240], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[2621440, 10240, 1], [2621440, 10240, 1], []]","['', '', '1']",7.373291015625,7.2900390625,0.4467926884954272,6.68896484375,9.0517578125,353.91796875,48,5293 +aten::div,"(1, 128, 1024, 1024)",(),"('c10::BFloat16', 'double', None)","(134217728, 1048576, 1024, 1)",(),None,1,0.134217728,512.0000076293945,0.24999999627470976,4.586877843701335,4.569380051033554,0.04590349744788913,4.552296594446215,4.638956885624237,1.1467194438378827,1.1423449957361216,0.01147587419096851,1.138074131652928,1.1597392041245986,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(351.158), 'mean_duration_us': np.float64(117.05266666666667), 'median_duration_us': np.float64(117.493), 'std_dev_duration_us': np.float64(0.951743079244021), 'min_duration_us': np.float64(115.731), 'max_duration_us': np.float64(117.934)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(117.05)}]","[[1, 128, 1024, 1024], []]","['c10::BFloat16', 'double']","[[134217728, 1048576, 1024, 1], []]","['', '']",117.052734375,117.4931640625,1.1657288165048338,115.73095703125,117.93408203125,351.158203125,3,27269 +aten::add,"(1, 256, 512, 512)","(1, 256, 512, 512)","('c10::BFloat16', 'c10::BFloat16', None)","(67108864, 262144, 512, 1)","(67108864, 262144, 512, 1)",None,1,0.067108864,384.0,0.16666666666666666,4.806911957597861,4.832423384269189,0.06987866686866041,4.7278621765393885,4.860450311985005,0.8011519929329768,0.8054038973781982,0.011646444478110094,0.7879770294232313,0.8100750519975009,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(251.332), 'mean_duration_us': np.float64(83.77733333333333), 'median_duration_us': np.float64(83.323), 'std_dev_duration_us': np.float64(1.0012979354595477), 'min_duration_us': np.float64(82.843), 'max_duration_us': np.float64(85.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(83.78)}]","[[1, 256, 512, 512], [1, 256, 512, 512], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[67108864, 262144, 512, 1], [67108864, 262144, 512, 1], []]","['', '', '1']",83.77734375,83.3232421875,1.2263848242878954,82.8427734375,85.166015625,251.33203125,3,27163 +aten::add,"(1, 77, 768)","(1, 77, 768)","('c10::BFloat16', 'c10::BFloat16', None)","(59136, 768, 1)","(59136, 768, 1)",None,1,5.9136e-05,0.33837890625,0.16666666666666666,0.07100890361360628,0.07030409907120744,0.005397594404611995,0.059059100130039004,0.08518911699882767,0.011834817268934377,0.011717349845201237,0.000899599067435332,0.0098431833550065,0.014198186166471278,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(251.23900000000003), 'mean_duration_us': np.float64(5.024780000000001), 'median_duration_us': np.float64(5.047), 'std_dev_duration_us': np.float64(0.37414020313246205), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.02)}]","[[1, 77, 768], [1, 77, 768], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[59136, 768, 1], [59136, 768, 1], []]","['', '', '1']",5.024775390625,5.046875,0.37790636847342857,4.1650390625,6.0078125,251.23876953125,50,54 +aten::add_,"(1, 512, 128, 128)","(1, 512, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(8388608, 16384, 128, 1)","(512, 1, 1, 1)",None,1,0.008388608,32.0009765625,0.2499923708382923,1.647089341575493,1.6489879757168568,0.10197465791491123,1.4878342005239342,1.817069642728715,0.41175976948293935,0.4122344135332934,0.02549288649757247,0.3719471992032735,0.45425354796404016,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(224.881), 'mean_duration_us': np.float64(20.443727272727273), 'median_duration_us': np.float64(20.349), 'std_dev_duration_us': np.float64(1.2062343425952518), 'min_duration_us': np.float64(18.467), 'max_duration_us': np.float64(22.553)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.44)}]","[[1, 512, 128, 128], [1, 512, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [512, 1, 1, 1], []]","['', '', '1']",20.443670099431817,20.34912109375,1.265204583928953,18.466796875,22.55322265625,224.88037109375,11,26753 +aten::add_,"(1, 512, 512, 512)","(1, 512, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(134217728, 262144, 512, 1)","(512, 1, 1, 1)",None,1,0.134217728,512.0009765625,0.2499995231637513,2.6298934061609778,2.6298934061609778,,2.6298934061609778,2.6298934061609778,0.6574720975117381,0.6574720975117381,,0.6574720975117381,0.6574720975117381,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(204.142), 'mean_duration_us': np.float64(204.142), 'median_duration_us': np.float64(204.142), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(204.142), 'max_duration_us': np.float64(204.142)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(204.14)}]","[[1, 512, 512, 512], [1, 512, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 262144, 512, 1], [512, 1, 1, 1], []]","['', '', '1']",204.14208984375,204.14208984375,,204.14208984375,204.14208984375,204.14208984375,1,27127 +aten::add,"(1, 256, 1)",(),"('float', 'double', None)","(256, 1, 1)",(),None,1,2.56e-07,0.00196075439453125,0.1245136186770428,0.0010399005747285341,0.0010479561971129916,3.1825317628982755e-05,0.0009004893071000856,0.0010931173416407062,0.00012948178362378636,0.00013048481831757092,3.962685463530916e-06,0.00011212318220701456,0.0001361079958463136,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(193.94899999999998), 'mean_duration_us': np.float64(1.9790714285714284), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.062211825439298846), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(2.283)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.98)}]","[[1, 256, 1], [], []]","['float', 'double', 'Scalar']","[[256, 1, 1], [], []]","['', '', '1']",1.97900390625,1.9619140625,0.0625893259287263,1.880859375,2.283203125,193.9423828125,98,5096 +aten::div,"(1, 256, 512, 512)",(),"('c10::BFloat16', 'double', None)","(67108864, 262144, 512, 1)",(),None,1,0.067108864,256.00000762939453,0.24999999254941963,4.469912772646585,4.533844348089992,0.12985639942242433,4.320485290245513,4.555408679604249,1.1174781598582018,1.133461053242726,0.03246409888810058,1.0801212903712551,1.1388521359606238,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(180.265), 'mean_duration_us': np.float64(60.08833333333333), 'median_duration_us': np.float64(59.207), 'std_dev_duration_us': np.float64(1.448899659128341), 'min_duration_us': np.float64(58.927), 'max_duration_us': np.float64(62.131)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(60.09)}]","[[1, 256, 512, 512], []]","['c10::BFloat16', 'double']","[[67108864, 262144, 512, 1], []]","['', '']",60.088216145833336,59.20703125,1.7745229841248433,58.9267578125,62.130859375,180.2646484375,3,27164 +aten::mul,"(1, 77, 3072)",(),"('c10::BFloat16', 'double', None)","(236544, 3072, 1)",(),None,1,0.000236544,0.9023513793945312,0.24999788624622696,0.14903961514748587,0.14673507991585708,0.017924786857637046,0.12175839346528433,0.20365578896479244,0.03725958875382261,0.03668345981713545,0.00448115882582341,0.030439340999057492,0.05091351676300578,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(154.16500000000002), 'mean_duration_us': np.float64(6.423541666666668), 'median_duration_us': np.float64(6.4485), 'std_dev_duration_us': np.float64(0.6465522651705911), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(7.771)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.42)}]","[[1, 77, 3072], []]","['c10::BFloat16', 'double']","[[236544, 3072, 1], []]","['', '']",6.423543294270833,6.448486328125,0.6604502574194904,4.64599609375,7.77099609375,154.1650390625,24,154 +aten::add,"(1, 512, 256, 256)","(1, 512, 256, 256)","('c10::BFloat16', 'c10::BFloat16', None)","(33554432, 65536, 256, 1)","(33554432, 65536, 256, 1)",None,1,0.033554432,192.0,0.16666666666666666,4.863714008193326,4.837242314648397,0.10654152556180534,4.7729040297266945,4.980995680204885,0.8106190013655542,0.8062070524413995,0.017756920926967516,0.7954840049544492,0.8301659467008141,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(124.22), 'mean_duration_us': np.float64(41.406666666666666), 'median_duration_us': np.float64(41.62), 'std_dev_duration_us': np.float64(0.7349804230197037), 'min_duration_us': np.float64(40.419), 'max_duration_us': np.float64(42.181)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(41.41)}]","[[1, 512, 256, 256], [1, 512, 256, 256], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[33554432, 65536, 256, 1], [33554432, 65536, 256, 1], []]","['', '', '1']",41.40673828125,41.6201171875,0.9002729161043719,40.4189453125,42.18115234375,124.22021484375,3,27058 +aten::mul,"(1, 77, 3072)","(1, 77, 3072)","('c10::BFloat16', 'c10::BFloat16', None)","(236544, 3072, 1)","(236544, 3072, 1)",None,1,0.000236544,1.353515625,0.16666666666666666,0.28015792972435755,0.27684094815905147,0.029938919474100666,0.21741735896476921,0.344064,0.04669298828739291,0.046140158026508574,0.004989819912350111,0.0362362264941282,0.05734399999999999,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(122.91999999999999), 'mean_duration_us': np.float64(5.121666666666666), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.5380385415769229), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]","[[1, 77, 3072], [1, 77, 3072]]","['c10::BFloat16', 'c10::BFloat16']","[[236544, 3072, 1], [236544, 3072, 1]]","['', '']",5.121663411458333,5.126953125,0.5496177307356938,4.125,6.52783203125,122.919921875,24,156 +aten::div,"(1, 512, 256, 256)",(),"('c10::BFloat16', 'double', None)","(33554432, 65536, 256, 1)",(),None,1,0.033554432,128.00000762939453,0.2499999850988397,4.2628518963360476,4.391231581832995,0.23752221117813557,3.9887673345812833,4.4085567725938635,1.0657129105625724,1.097807830023803,0.05938054925517739,0.9971917742080594,1.1021391274558547,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(94.65899999999999), 'mean_duration_us': np.float64(31.552999999999997), 'median_duration_us': np.float64(30.565), 'std_dev_duration_us': np.float64(1.4829052565824967), 'min_duration_us': np.float64(30.445), 'max_duration_us': np.float64(33.649)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(31.55)}]","[[1, 512, 256, 256], []]","['c10::BFloat16', 'double']","[[33554432, 65536, 256, 1], []]","['', '']",31.552897135416668,30.56494140625,1.8162073388792004,30.44482421875,33.64892578125,94.65869140625,3,27059 +aten::add_,"(1, 16384, 512)","(512,)","('c10::BFloat16', 'c10::BFloat16', None)","(8388608, 512, 1)","(1,)",None,1,0.008388608,32.0009765625,0.2499923708382923,1.6930266731505812,1.7026305408057083,0.06847488706448931,1.6202568465129439,1.7561926321330914,0.4232437519133803,0.42564464555770276,0.01711819936013603,0.40505185042674585,0.4390347597556924,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.525), 'mean_duration_us': np.float64(19.841666666666665), 'median_duration_us': np.float64(19.708), 'std_dev_duration_us': np.float64(0.6612121864844571), 'min_duration_us': np.float64(19.107), 'max_duration_us': np.float64(20.71)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(19.84)}]","[[1, 16384, 512], [512], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 512, 1], [1], []]","['', '', '1']",19.841634114583332,19.7080078125,0.8098247697242251,19.10693359375,20.7099609375,59.52490234375,3,26803 +aten::mul,(),"(1, 16, 128, 128)","('float', 'c10::BFloat16', None)",(),"(262144, 16384, 128, 1)",None,1,0.000262144,1.5000038146972656,0.16666624281249284,0.10583075101983144,0.10627978761983532,0.0030098973109926094,0.10198941438703141,0.10877401445262375,0.017638413646499703,0.017713252889507643,0.0005016482760745645,0.016998192502532927,0.018128956304450595,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(59.485), 'mean_duration_us': np.float64(14.87125), 'median_duration_us': np.float64(14.8015), 'std_dev_duration_us': np.float64(0.3699130810068764), 'min_duration_us': np.float64(14.46), 'max_duration_us': np.float64(15.422)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.87)}]","[[], [1, 16, 128, 128]]","['float', 'c10::BFloat16']","[[], [262144, 16384, 128, 1]]","['', '']",14.8712158203125,14.801513671875,0.4270736026430738,14.4599609375,15.421875,59.48486328125,4,20483 +aten::div,"(1, 512, 128, 128)",(),"('c10::BFloat16', 'double', None)","(512, 1, 65536, 512)",(),None,1,0.008388608,32.00000762939453,0.24999994039536944,3.7863698265084067,3.7905837674444265,0.09410203192276984,3.69023161421974,3.8782940978610534,0.9465922309419269,0.9476457159247614,0.023525502371775572,0.922557683600043,0.9695732933009764,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.596999999999998), 'mean_duration_us': np.float64(8.865666666666666), 'median_duration_us': np.float64(8.852), 'std_dev_duration_us': np.float64(0.18029666910092654), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(9.093)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]","[[1, 512, 128, 128], []]","['c10::BFloat16', 'double']","[[512, 1, 65536, 512], []]","['', '']",8.865559895833334,8.85205078125,0.22076919151973087,8.65185546875,9.0927734375,26.5966796875,3,26947 +aten::add,"(1, 16, 128, 128)","(1, 16, 128, 128)","('float', 'c10::BFloat16', None)","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",None,1,0.000262144,2.5,0.1,0.5696638661689855,0.5717238154840321,0.01925345978273532,0.5454342294016052,0.5897736043062726,0.05696638661689855,0.0571723815484032,0.0019253459782735385,0.05454342294016052,0.05897736043062726,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.423000000000002), 'mean_duration_us': np.float64(4.6057500000000005), 'median_duration_us': np.float64(4.586), 'std_dev_duration_us': np.float64(0.13594185337856768), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['float', 'c10::BFloat16', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', '1']",4.605712890625,4.5859375,0.15711709075500374,4.44482421875,4.80615234375,18.4228515625,4,20484 +aten::div,"(1, 512, 128, 128)",(),"('c10::BFloat16', 'long int', None)","(512, 1, 65536, 512)",(),None,1,0.008388608,32.00000762939453,0.24999994039536944,3.6540526689465587,3.6540526689465587,0.16894613833063338,3.5345897088776876,3.77351562901543,0.9135129494381802,0.9135129494381802,0.04223652451268619,0.883647216541508,0.9433786823348524,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(18.384999999999998), 'mean_duration_us': np.float64(9.192499999999999), 'median_duration_us': np.float64(9.192499999999999), 'std_dev_duration_us': np.float64(0.30050000000000043), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.19)}]","[[1, 512, 128, 128], []]","['c10::BFloat16', 'long int']","[[512, 1, 65536, 512], []]","['', '']",9.192626953125,9.192626953125,0.42502365607453124,8.89208984375,9.4931640625,18.38525390625,2,26879 +aten::mul,"(1, 16, 128, 128)",(),"('c10::BFloat16', 'double', None)","(262144, 16384, 128, 1)",(),None,1,0.000262144,1.0000076293945312,0.249998092665919,0.27803774295407285,0.2830870390932726,0.01866830191289951,0.25175850316529896,0.2942183904644472,0.06950890542765527,0.0707712198317606,0.004667039871536402,0.06293914560375147,0.0735540364433484,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(15.139), 'mean_duration_us': np.float64(3.78475), 'median_duration_us': np.float64(3.705), 'std_dev_duration_us': np.float64(0.23088999003854627), 'min_duration_us': np.float64(3.564), 'max_duration_us': np.float64(4.165)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]","[[1, 16, 128, 128], []]","['c10::BFloat16', 'double']","[[262144, 16384, 128, 1], []]","['', '']",3.7847900390625,3.705078125,0.26663028995436494,3.56396484375,4.1650390625,15.13916015625,4,20459 +aten::add,"(1, 16, 128, 128)","(1, 16, 128, 128)","('c10::BFloat16', 'c10::BFloat16', None)","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",None,1,0.000262144,1.5,0.16666666666666666,0.4587556569474247,0.45690230962562683,0.03613384601984402,0.4177441929710803,0.5034738155673648,0.07645927615790411,0.07615038493760448,0.006022307669974005,0.0696240321618467,0.0839123025945608,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.778), 'mean_duration_us': np.float64(3.4445), 'median_duration_us': np.float64(3.4444999999999997), 'std_dev_duration_us': np.float64(0.23366696386096175), 'min_duration_us': np.float64(3.124), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', '1']",3.4444580078125,3.4443359375,0.2698734709293077,3.1240234375,3.76513671875,13.77783203125,4,20460 +aten::add,"(1, 512, 128, 128)","(1, 512, 128, 128)","('c10::BFloat16', 'c10::BFloat16', None)","(8388608, 16384, 128, 1)","(8388608, 16384, 128, 1)",None,1,0.008388608,48.0,0.16666666666666666,3.9513633267144557,3.9513633267144557,,3.9513633267144557,3.9513633267144557,0.6585605544524092,0.6585605544524092,,0.6585605544524092,0.6585605544524092,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.738), 'mean_duration_us': np.float64(12.738), 'median_duration_us': np.float64(12.738), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.738), 'max_duration_us': np.float64(12.738)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(12.74)}]","[[1, 512, 128, 128], [1, 512, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [8388608, 16384, 128, 1], []]","['', '', '1']",12.73779296875,12.73779296875,,12.73779296875,12.73779296875,12.73779296875,1,26781 +aten::add,"(256, 256)",(),"('long int', 'long int', None)","(256, 1)",(),None,1,6.5536e-05,1.0000076293945312,0.06249952316647975,0.3354102272086957,0.3361487217642716,0.018940029952049627,0.3154377250293772,0.3539057402768622,0.02096297926570411,0.021009134823288648,0.0011837428407619468,0.01971470740305523,0.022118940013183916,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(3.13375), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.1535746968090772), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.324)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.13)}]","[[256, 256], [], []]","['long int', 'long int', 'Scalar']","[[256, 1], [], []]","['', '', '1']",3.1337890625,3.1240234375,0.177498125952915,2.962890625,3.32421875,12.53515625,4,5173 +aten::add_,"(1, 3, 1024, 1024)","(1, 3, 1, 1)","('c10::BFloat16', 'c10::BFloat16', None)","(3145728, 1048576, 1024, 1)","(3, 1, 1, 1)",None,1,0.003145728,12.000005722045898,0.2499998807907673,1.1464971332473195,1.1464971332473195,,1.1464971332473195,1.1464971332473195,0.2866241466387863,0.2866241466387863,,0.2866241466387863,0.2866241466387863,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.975), 'mean_duration_us': np.float64(10.975), 'median_duration_us': np.float64(10.975), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.975), 'max_duration_us': np.float64(10.975)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.98)}]","[[1, 3, 1024, 1024], [1, 3, 1, 1], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[3145728, 1048576, 1024, 1], [3, 1, 1, 1], []]","['', '', '1']",10.97509765625,10.97509765625,,10.97509765625,10.97509765625,10.97509765625,1,27340 +aten::div,"(1, 512, 128, 128)",(),"('c10::BFloat16', 'long int', None)","(8388608, 16384, 128, 1)",(),None,1,0.008388608,32.00000762939453,0.24999994039536944,3.6584057240204433,3.6584057240204433,,3.6584057240204433,3.6584057240204433,0.9146012129471891,0.9146012129471891,,0.9146012129471891,0.9146012129471891,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.172), 'mean_duration_us': np.float64(9.172), 'median_duration_us': np.float64(9.172), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.172), 'max_duration_us': np.float64(9.172)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.17)}]","[[1, 512, 128, 128], []]","['c10::BFloat16', 'long int']","[[8388608, 16384, 128, 1], []]","['', '']",9.171875,9.171875,,9.171875,9.171875,9.171875,1,26782 +aten::add_,"(256, 256)","(256, 256)","('long int', 'long int', None)","(256, 1)","(256, 1)",None,1,6.5536e-05,1.5,0.041666666666666664,0.43636216893953483,0.43636216893953483,8.359649111635002e-05,0.43630305729378305,0.43642128058528656,0.018181757039147282,0.018181757039147282,3.4831871298454644e-06,0.018179294053907627,0.018184220024386938,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.209), 'mean_duration_us': np.float64(3.6045), 'median_duration_us': np.float64(3.6045), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(3.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","[[256, 256], [256, 256], []]","['long int', 'long int', 'Scalar']","[[256, 1], [256, 1], []]","['', '', '1']",3.6044921875,3.6044921875,0.0006905339660024879,3.60400390625,3.60498046875,7.208984375,2,5201 +aten::mul,"(256, 256)",(),"('long int', 'long int', None)","(256, 1)",(),None,1,6.5536e-05,1.0000076293945312,0.06249952316647975,0.3210768746606883,0.3210768746606883,0.033256019157474094,0.29756131799916863,0.34459243132220796,0.0200671515660766,0.0200671515660766,0.0020784853397574476,0.018597440487737284,0.021536862644415917,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.567), 'mean_duration_us': np.float64(3.2835), 'median_duration_us': np.float64(3.2835), 'std_dev_duration_us': np.float64(0.24049999999999994), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.28)}]","[[256, 256], []]","['long int', 'long int']","[[256, 1], []]","['', '']",3.283447265625,3.283447265625,0.3400879782562253,3.04296875,3.52392578125,6.56689453125,2,5172 +aten::mul,"(1, 3, 1024, 1024)",(),"('c10::BFloat16', 'double', None)","(3145728, 1048576, 1024, 1)",(),None,1,0.003145728,12.000007629394531,0.24999984105438167,1.951076632344034,1.951076632344034,,1.951076632344034,1.951076632344034,0.4877688479709268,0.4877688479709268,,0.4877688479709268,0.4877688479709268,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.449), 'mean_duration_us': np.float64(6.449), 'median_duration_us': np.float64(6.449), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.449), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.45)}]","[[1, 3, 1024, 1024], []]","['c10::BFloat16', 'double']","[[3145728, 1048576, 1024, 1], []]","['', '']",6.44921875,6.44921875,,6.44921875,6.44921875,6.44921875,1,27341 +aten::add,"(1, 3, 1024, 1024)",(),"('c10::BFloat16', 'double', None)","(3145728, 1048576, 1024, 1)",(),None,1,0.003145728,12.000007629394531,0.24999984105438167,2.1084781672394044,2.1084781672394044,,2.1084781672394044,2.1084781672394044,0.527119206676485,0.527119206676485,,0.527119206676485,0.527119206676485,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]","[[1, 3, 1024, 1024], [], []]","['c10::BFloat16', 'double', 'Scalar']","[[3145728, 1048576, 1024, 1], [], []]","['', '', '1']",5.9677734375,5.9677734375,,5.9677734375,5.9677734375,5.9677734375,1,27342 +aten::div,"(256, 256)",(),"('float', 'double', None)","(256, 1)",(),None,1,6.5536e-05,0.5000076293945312,0.12499809268047057,0.20649471566880673,0.20649471566880673,0.011494943093073473,0.19836656345834103,0.21462286787927246,0.02581144560719692,0.02581144560719692,0.0014368459621047333,0.024795442083872157,0.026827449130521687,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.086), 'mean_duration_us': np.float64(2.543), 'median_duration_us': np.float64(2.543), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.643)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.54)}]","[[256, 256], []]","['float', 'double']","[[256, 1], []]","['', '']",2.54296875,2.54296875,0.14155946303051,2.44287109375,2.64306640625,5.0859375,2,5185 +aten::mul,"(256, 256)",(),"('float', 'long int', None)","(256, 1)",(),None,1,6.5536e-05,0.5000076293945312,0.12499809268047057,0.20802032607994764,0.20802032607994764,0.009337404158740426,0.2014177842806228,0.21462286787927246,0.026002143998763,0.026002143998763,0.0011671577104292474,0.025176838867004316,0.026827449130521687,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.046), 'mean_duration_us': np.float64(2.523), 'median_duration_us': np.float64(2.523), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.603)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.52)}]","[[256, 256], []]","['float', 'long int']","[[256, 1], []]","['', '']",2.52294921875,2.52294921875,0.113247570424408,2.44287109375,2.60302734375,5.0458984375,2,5186 +aten::div,"(256, 256)",(),"('float', 'long int', None)","(256, 1)",(),None,1,6.5536e-05,0.5000076293945312,0.12499809268047057,0.21834858271893276,0.21834858271893276,0.005147571704512462,0.214708699860028,0.2219884655778375,0.02729315637935055,0.02729315637935055,0.0006434366450000153,0.026838177964407118,0.027748134794293982,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.804), 'mean_duration_us': np.float64(2.402), 'median_duration_us': np.float64(2.402), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.442)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.4)}]","[[256, 256], []]","['float', 'long int']","[[256, 1], []]","['', '']",2.40185546875,2.40185546875,0.056623785212204,2.36181640625,2.44189453125,4.8037109375,2,5183 +aten::add,"(256, 1)",(),"('long int', 'long int', None)","(1, 1)",(),None,1,2.56e-07,0.00391387939453125,0.06237816764132553,0.0018030654487239854,0.0018030654487239854,0.00013446468803464246,0.001707984555984556,0.0018981463414634147,0.0001124719188287866,0.0001124719188287866,8.38766085206349e-06,0.00010654094696199958,0.00011840289069557363,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.5649999999999995), 'mean_duration_us': np.float64(2.2824999999999998), 'median_duration_us': np.float64(2.2824999999999998), 'std_dev_duration_us': np.float64(0.12050000000000005), 'min_duration_us': np.float64(2.162), 'max_duration_us': np.float64(2.403)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.28)}]","[[256, 1], [], []]","['long int', 'long int', 'Scalar']","[[1, 1], [], []]","['', '', '1']",2.282470703125,2.282470703125,0.17021662261961323,2.162109375,2.40283203125,4.56494140625,2,5159 +aten::add,"(1, 16, 128, 128)",(),"('c10::BFloat16', 'double', None)","(262144, 16384, 128, 1)",(),None,1,0.000262144,1.0000076293945312,0.249998092665919,0.3686695333905579,0.3686695333905579,,0.3686695333905579,0.3686695333905579,0.09216668017167381,0.09216668017167381,,0.09216668017167381,0.09216668017167381,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.844), 'mean_duration_us': np.float64(2.844), 'median_duration_us': np.float64(2.844), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.844), 'max_duration_us': np.float64(2.844)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","[[1, 16, 128, 128], [], []]","['c10::BFloat16', 'double', 'Scalar']","[[262144, 16384, 128, 1], [], []]","['', '', '1']",2.84423828125,2.84423828125,,2.84423828125,2.84423828125,2.84423828125,1,26745 +aten::div,"(1, 16, 128, 128)",(),"('c10::BFloat16', 'double', None)","(262144, 16384, 128, 1)",(),None,1,0.000262144,1.0000076293945312,0.249998092665919,0.3850636600322754,0.3850636600322754,,0.3850636600322754,0.3850636600322754,0.09626518056302671,0.09626518056302671,,0.09626518056302671,0.09626518056302671,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]","[[1, 16, 128, 128], []]","['c10::BFloat16', 'double']","[[262144, 16384, 128, 1], []]","['', '']",2.72314453125,2.72314453125,,2.72314453125,2.72314453125,2.72314453125,1,26744 +aten::mul,"(4,)",(),"('float', 'long int', None)","(1,)",(),None,1,4e-09,3.814697265625e-05,0.1,2.039840637450199e-05,2.039840637450199e-05,,2.039840637450199e-05,2.039840637450199e-05,2.0398406374501996e-06,2.0398406374501996e-06,,2.0398406374501996e-06,2.0398406374501996e-06,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.961), 'mean_duration_us': np.float64(1.961), 'median_duration_us': np.float64(1.961), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(1.961)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.96)}]","[[4], []]","['float', 'long int']","[[1], []]","['', '']",1.9609375,1.9609375,,1.9609375,1.9609375,1.9609375,1,18381 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/Normalization_fwd.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/Normalization_fwd.csv index 9b5914289..0671b1ac7 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/Normalization_fwd.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/Normalization_fwd.csv @@ -1,13 +1,13 @@ name,param: op_shape,param: dtype_in_out,param: stride_input,param: stride_output,param: num_channels,param: has_bias,param: is_affine,param: is_training,num_kernels,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aiter::_groupnorm_run,"(1, 128, 1024, 1024)","('c10::BFloat16', None)","(134217728, 1048576, 1024, 1)",,128,True,True,True,2,0.671089408,512.00146484375,1.2499978542389272,2.3220529179169467,2.3282250635427584,0.09431026455339626,2.1543145933092727,2.4112959275063877,2.902561164825423,2.910276333613738,0.11788762832445064,2.692888618992198,3.014114735318048,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(361.81), 'mean_duration_us': np.float64(60.30166666666667), 'median_duration_us': np.float64(60.147999999999996), 'std_dev_duration_us': np.float64(1.7322068454880177), 'min_duration_us': np.float64(58.405), 'max_duration_us': np.float64(63.413)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1027.403), 'mean_duration_us': np.float64(171.23383333333334), 'median_duration_us': np.float64(170.95350000000002), 'std_dev_duration_us': np.float64(7.346735406892563), 'min_duration_us': np.float64(163.362), 'max_duration_us': np.float64(185.795)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(60.3)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.23)}]","[[1, 128, 1024, 1024], [], [128], [128], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 1048576, 1024, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",231.535400390625,230.600830078125,9.740609604863426,222.64892578125,249.2080078125,1389.21240234375,6,27246 -aten::layer_norm,"(1, 77, 1280)","('c10::BFloat16', None)","(98560, 1280, 1)",,1280,True,True,True,1,0.00050048,0.390625,1.221875,0.08385900993368818,0.0838274008194264,0.001796481186491025,0.07927242487242488,0.08816193378875462,0.10246522776272524,0.10242660537623663,0.002195075449743723,0.09686099414099414,0.10772286284813454,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","[[1, 77, 1280], [], [1280], [1280], [], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar']","[[98560, 1280, 1], [], [1], [1], [], []]","['', '[1280]', '', '', '1.0000000000000001e-05', 'True']",4.886613581730769,4.88623046875,0.10469760256131358,4.64599609375,5.1669921875,635.259765625,130,1500 -aten::native_layer_norm,"(1, 77, 1280)","('c10::BFloat16', None)","(98560, 1280, 1)",,1280,True,True,True,1,0.00050048,0.390625,1.221875,0.08385900993368818,0.0838274008194264,0.001796481186491025,0.07927242487242488,0.08816193378875462,0.10246522776272524,0.10242660537623663,0.002195075449743723,0.09686099414099414,0.10772286284813454,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","[[1, 77, 1280], [], [1280], [1280], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[98560, 1280, 1], [], [1], [1], []]","['', '[1280]', '', '', '1.0000000000000001e-05']",4.886613581730769,4.88623046875,0.10469760256131358,4.64599609375,5.1669921875,635.259765625,130,1501 -aiter::_groupnorm_run,"(1, 256, 512, 512)","('c10::BFloat16', None)","(67108864, 262144, 512, 1)",,256,True,True,True,2,0.335545856,256.0029296875,1.2499914170293767,2.269364568268366,2.2426728945202075,0.04039953532870862,2.2374338362710664,2.316319020758986,2.836686232446034,2.8033218693546873,0.050499072412860564,2.796773091509944,2.8953788950506225,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(178.62), 'mean_duration_us': np.float64(35.724000000000004), 'median_duration_us': np.float64(35.612), 'std_dev_duration_us': np.float64(0.5430587445203343), 'min_duration_us': np.float64(34.931), 'max_duration_us': np.float64(36.493)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(412.969), 'mean_duration_us': np.float64(82.5938), 'median_duration_us': np.float64(83.483), 'std_dev_duration_us': np.float64(1.7604830473480866), 'min_duration_us': np.float64(80.038), 'max_duration_us': np.float64(84.405)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(35.72)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(82.59)}]","[[1, 256, 512, 512], [], [256], [256], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[67108864, 262144, 512, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",118.3177734375,119.69580078125,2.0926909657870496,115.89013671875,119.97607421875,591.5888671875,5,27141 -aiter::_groupnorm_run,"(1, 256, 1024, 1024)","('c10::BFloat16', None)","(268435456, 1048576, 1024, 1)",,256,True,True,True,2,1.342178816,1024.0029296875,1.2499978542389272,2.144821332646688,2.144821332646688,,2.144821332646688,2.144821332646688,2.6810220635342357,2.6810220635342357,,2.6810220635342357,2.6810220635342357,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(164.163), 'mean_duration_us': np.float64(164.163), 'median_duration_us': np.float64(164.163), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(164.163), 'max_duration_us': np.float64(164.163)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(336.459), 'mean_duration_us': np.float64(336.459), 'median_duration_us': np.float64(336.459), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(336.459), 'max_duration_us': np.float64(336.459)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(164.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(336.46)}]","[[1, 256, 1024, 1024], [], [256], [256], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[268435456, 1048576, 1024, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",500.6220703125,500.6220703125,,500.6220703125,500.6220703125,500.6220703125,1,27233 -aiter::_groupnorm_run,"(1, 512, 256, 256)","('c10::BFloat16', None)","(33554432, 65536, 256, 1)",,512,True,True,True,2,0.167775232,128.005859375,1.2499656692961443,2.149101927696643,2.125241709245668,0.11003496193377399,2.0221457249963217,2.293429750175205,2.6863036294389686,2.6564791755133426,0.13753992483952507,2.5276127345593644,2.866708452661438,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(111.75900000000001), 'mean_duration_us': np.float64(18.626500000000004), 'median_duration_us': np.float64(18.426000000000002), 'std_dev_duration_us': np.float64(0.5515921651606974), 'min_duration_us': np.float64(17.906), 'max_duration_us': np.float64(19.548)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(263.786), 'mean_duration_us': np.float64(43.964333333333336), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(2.4412839290468074), 'min_duration_us': np.float64(40.219), 'max_duration_us': np.float64(46.829)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(18.63)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(43.96)}]","[[1, 512, 256, 256], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[33554432, 65536, 256, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",62.590901692708336,63.171630859375,3.1680777446719164,58.525390625,66.376953125,375.54541015625,6,27031 -aiter::_groupnorm_run,"(1, 512, 128, 128)","('c10::BFloat16', None)","(512, 1, 65536, 512)",,512,True,True,True,3,0.041946112,32.005859375,1.2498626960395436,0.39912130302732496,0.39407333797801747,0.017376149938031805,0.3841346451234302,0.4242038910298347,0.49884682784854806,0.4925375646425072,0.021717801608335786,0.4801155631961638,0.530196618913014,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.756999999999998), 'mean_duration_us': np.float64(6.9392499999999995), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.39939477650565214), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(7.491)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(56.881), 'mean_duration_us': np.float64(14.22025), 'median_duration_us': np.float64(14.381), 'std_dev_duration_us': np.float64(0.4814152962879343), 'min_duration_us': np.float64(13.419), 'max_duration_us': np.float64(14.7)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(252.17000000000002), 'mean_duration_us': np.float64(63.042500000000004), 'median_duration_us': np.float64(63.313), 'std_dev_duration_us': np.float64(2.4823704900759695), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.94)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(14.22)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.04)}]","[[1, 512, 128, 128], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[512, 1, 65536, 512], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",84.2020263671875,85.16357421875,3.5496797689210453,79.1142578125,87.36669921875,336.80810546875,4,26880 -aiter::_groupnorm_run,"(1, 512, 512, 512)","('c10::BFloat16', None)","(134217728, 262144, 512, 1)",,512,True,True,True,2,0.671091712,512.005859375,1.2499914170293767,2.1229327891536838,2.1229327891536838,,2.1229327891536838,2.1229327891536838,2.6536477653723396,2.6536477653723396,,2.6536477653723396,2.6536477653723396,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.455), 'mean_duration_us': np.float64(64.455), 'median_duration_us': np.float64(64.455), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.455), 'max_duration_us': np.float64(64.455)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(188.439), 'mean_duration_us': np.float64(188.439), 'median_duration_us': np.float64(188.439), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(188.439), 'max_duration_us': np.float64(188.439)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.46)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(188.44)}]","[[1, 512, 512, 512], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 262144, 512, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",252.89404296875,252.89404296875,,252.89404296875,252.89404296875,252.89404296875,1,27128 -aten::layer_norm,"(1, 77, 768)","('c10::BFloat16', None)","(59136, 768, 1)",,768,True,True,True,1,0.000300288,0.234375,1.221875,0.057607321869964326,0.05789239475500345,0.0024247130139245644,0.04949031268436578,0.06075766296475133,0.07038894640986265,0.07073726984126984,0.0029626962138890687,0.060470975811209436,0.07423826943505553,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]","[[1, 77, 768], [], [768], [768], [], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar']","[[59136, 768, 1], [], [1], [1], [], []]","['', '[768]', '', '', '1.0000000000000001e-05', 'True']",4.274140625,4.2451171875,0.19483437471531076,4.044921875,4.9658203125,213.70703125,50,55 -aten::native_layer_norm,"(1, 77, 768)","('c10::BFloat16', None)","(59136, 768, 1)",,768,True,True,True,1,0.000300288,0.234375,1.221875,0.057607321869964326,0.05789239475500345,0.0024247130139245644,0.04949031268436578,0.06075766296475133,0.07038894640986265,0.07073726984126984,0.0029626962138890687,0.060470975811209436,0.07423826943505553,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]","[[1, 77, 768], [], [768], [768], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[59136, 768, 1], [], [1], [1], []]","['', '[768]', '', '', '1.0000000000000001e-05']",4.274140625,4.2451171875,0.19483437471531076,4.044921875,4.9658203125,213.70703125,50,56 -aiter::_groupnorm_run,"(1, 512, 128, 128)","('c10::BFloat16', None)","(8388608, 16384, 128, 1)",,512,True,True,True,2,0.041946112,32.005859375,1.2498626960395436,1.6614942822631178,1.6444940762585691,0.12358495556463041,1.54579119395466,1.8744936768211198,2.0766397230836664,2.055391799773594,0.1544642257519363,1.9320267491903564,2.342859720620722,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(40.815000000000005), 'mean_duration_us': np.float64(6.802500000000001), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.5678253105782916), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.851)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.91400000000002), 'mean_duration_us': np.float64(13.485666666666669), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8789754768415834), 'min_duration_us': np.float64(11.856), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.8)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.49)}]","[[1, 512, 128, 128], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",20.2880859375,20.427978515625,1.4392336798467016,17.90380859375,21.7109375,121.728515625,6,26754 -aiter::_groupnorm_run,"(1, 512, 16384)","('c10::BFloat16', None)","(8388608, 16384, 1)",,512,True,True,True,2,0.041946112,32.005859375,1.2498626960395436,1.3579653781167267,1.3579653781167267,,1.3579653781167267,1.3579653781167267,1.6972702686213301,1.6972702686213301,,1.6972702686213301,1.6972702686213301,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.809), 'mean_duration_us': np.float64(6.809), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(6.809)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(17.905), 'mean_duration_us': np.float64(17.905), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(17.905), 'max_duration_us': np.float64(17.905)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.81)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(17.9)}]","[[1, 512, 16384], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",24.7138671875,24.7138671875,,24.7138671875,24.7138671875,24.7138671875,1,26788 +aiter::_groupnorm_run,"(1, 128, 1024, 1024)","('c10::BFloat16', None)","(134217728, 1048576, 1024, 1)",None,128,True,True,True,2,0.671089408,512.00146484375,1.2499978542389272,2.3220529179169467,2.3282250635427584,0.09431026455339626,2.1543145933092727,2.4112959275063877,2.902561164825423,2.910276333613738,0.11788762832445064,2.692888618992198,3.014114735318048,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(361.81), 'mean_duration_us': np.float64(60.30166666666667), 'median_duration_us': np.float64(60.147999999999996), 'std_dev_duration_us': np.float64(1.7322068454880177), 'min_duration_us': np.float64(58.405), 'max_duration_us': np.float64(63.413)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1027.403), 'mean_duration_us': np.float64(171.23383333333334), 'median_duration_us': np.float64(170.95350000000002), 'std_dev_duration_us': np.float64(7.346735406892563), 'min_duration_us': np.float64(163.362), 'max_duration_us': np.float64(185.795)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(60.3)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.23)}]","[[1, 128, 1024, 1024], [], [128], [128], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 1048576, 1024, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",231.535400390625,230.600830078125,9.740609604863426,222.64892578125,249.2080078125,1389.21240234375,6,27246 +aten::layer_norm,"(1, 77, 1280)","('c10::BFloat16', None)","(98560, 1280, 1)",None,1280,True,True,True,1,0.00050048,0.390625,1.221875,0.08385900993368818,0.0838274008194264,0.001796481186491025,0.07927242487242488,0.08816193378875462,0.10246522776272524,0.10242660537623663,0.002195075449743723,0.09686099414099414,0.10772286284813454,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","[[1, 77, 1280], [], [1280], [1280], [], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar']","[[98560, 1280, 1], [], [1], [1], [], []]","['', '[1280]', '', '', '1.0000000000000001e-05', 'True']",4.886613581730769,4.88623046875,0.10469760256131358,4.64599609375,5.1669921875,635.259765625,130,1500 +aten::native_layer_norm,"(1, 77, 1280)","('c10::BFloat16', None)","(98560, 1280, 1)",None,1280,True,True,True,1,0.00050048,0.390625,1.221875,0.08385900993368818,0.0838274008194264,0.001796481186491025,0.07927242487242488,0.08816193378875462,0.10246522776272524,0.10242660537623663,0.002195075449743723,0.09686099414099414,0.10772286284813454,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","[[1, 77, 1280], [], [1280], [1280], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[98560, 1280, 1], [], [1], [1], []]","['', '[1280]', '', '', '1.0000000000000001e-05']",4.886613581730769,4.88623046875,0.10469760256131358,4.64599609375,5.1669921875,635.259765625,130,1501 +aiter::_groupnorm_run,"(1, 256, 512, 512)","('c10::BFloat16', None)","(67108864, 262144, 512, 1)",None,256,True,True,True,2,0.335545856,256.0029296875,1.2499914170293767,2.269364568268366,2.2426728945202075,0.04039953532870862,2.2374338362710664,2.316319020758986,2.836686232446034,2.8033218693546873,0.050499072412860564,2.796773091509944,2.8953788950506225,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(178.62), 'mean_duration_us': np.float64(35.724000000000004), 'median_duration_us': np.float64(35.612), 'std_dev_duration_us': np.float64(0.5430587445203343), 'min_duration_us': np.float64(34.931), 'max_duration_us': np.float64(36.493)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(412.969), 'mean_duration_us': np.float64(82.5938), 'median_duration_us': np.float64(83.483), 'std_dev_duration_us': np.float64(1.7604830473480866), 'min_duration_us': np.float64(80.038), 'max_duration_us': np.float64(84.405)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(35.72)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(82.59)}]","[[1, 256, 512, 512], [], [256], [256], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[67108864, 262144, 512, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",118.3177734375,119.69580078125,2.0926909657870496,115.89013671875,119.97607421875,591.5888671875,5,27141 +aiter::_groupnorm_run,"(1, 256, 1024, 1024)","('c10::BFloat16', None)","(268435456, 1048576, 1024, 1)",None,256,True,True,True,2,1.342178816,1024.0029296875,1.2499978542389272,2.144821332646688,2.144821332646688,,2.144821332646688,2.144821332646688,2.6810220635342357,2.6810220635342357,,2.6810220635342357,2.6810220635342357,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(164.163), 'mean_duration_us': np.float64(164.163), 'median_duration_us': np.float64(164.163), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(164.163), 'max_duration_us': np.float64(164.163)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(336.459), 'mean_duration_us': np.float64(336.459), 'median_duration_us': np.float64(336.459), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(336.459), 'max_duration_us': np.float64(336.459)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(164.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(336.46)}]","[[1, 256, 1024, 1024], [], [256], [256], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[268435456, 1048576, 1024, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",500.6220703125,500.6220703125,,500.6220703125,500.6220703125,500.6220703125,1,27233 +aiter::_groupnorm_run,"(1, 512, 256, 256)","('c10::BFloat16', None)","(33554432, 65536, 256, 1)",None,512,True,True,True,2,0.167775232,128.005859375,1.2499656692961443,2.149101927696643,2.125241709245668,0.11003496193377399,2.0221457249963217,2.293429750175205,2.6863036294389686,2.6564791755133426,0.13753992483952507,2.5276127345593644,2.866708452661438,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(111.75900000000001), 'mean_duration_us': np.float64(18.626500000000004), 'median_duration_us': np.float64(18.426000000000002), 'std_dev_duration_us': np.float64(0.5515921651606974), 'min_duration_us': np.float64(17.906), 'max_duration_us': np.float64(19.548)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(263.786), 'mean_duration_us': np.float64(43.964333333333336), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(2.4412839290468074), 'min_duration_us': np.float64(40.219), 'max_duration_us': np.float64(46.829)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(18.63)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(43.96)}]","[[1, 512, 256, 256], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[33554432, 65536, 256, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",62.590901692708336,63.171630859375,3.1680777446719164,58.525390625,66.376953125,375.54541015625,6,27031 +aiter::_groupnorm_run,"(1, 512, 128, 128)","('c10::BFloat16', None)","(512, 1, 65536, 512)",None,512,True,True,True,3,0.041946112,32.005859375,1.2498626960395436,0.39912130302732496,0.39407333797801747,0.017376149938031805,0.3841346451234302,0.4242038910298347,0.49884682784854806,0.4925375646425072,0.021717801608335786,0.4801155631961638,0.530196618913014,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.756999999999998), 'mean_duration_us': np.float64(6.9392499999999995), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.39939477650565214), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(7.491)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(56.881), 'mean_duration_us': np.float64(14.22025), 'median_duration_us': np.float64(14.381), 'std_dev_duration_us': np.float64(0.4814152962879343), 'min_duration_us': np.float64(13.419), 'max_duration_us': np.float64(14.7)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(252.17000000000002), 'mean_duration_us': np.float64(63.042500000000004), 'median_duration_us': np.float64(63.313), 'std_dev_duration_us': np.float64(2.4823704900759695), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.94)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(14.22)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.04)}]","[[1, 512, 128, 128], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[512, 1, 65536, 512], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",84.2020263671875,85.16357421875,3.5496797689210453,79.1142578125,87.36669921875,336.80810546875,4,26880 +aiter::_groupnorm_run,"(1, 512, 512, 512)","('c10::BFloat16', None)","(134217728, 262144, 512, 1)",None,512,True,True,True,2,0.671091712,512.005859375,1.2499914170293767,2.1229327891536838,2.1229327891536838,,2.1229327891536838,2.1229327891536838,2.6536477653723396,2.6536477653723396,,2.6536477653723396,2.6536477653723396,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.455), 'mean_duration_us': np.float64(64.455), 'median_duration_us': np.float64(64.455), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.455), 'max_duration_us': np.float64(64.455)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(188.439), 'mean_duration_us': np.float64(188.439), 'median_duration_us': np.float64(188.439), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(188.439), 'max_duration_us': np.float64(188.439)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.46)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(188.44)}]","[[1, 512, 512, 512], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[134217728, 262144, 512, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",252.89404296875,252.89404296875,,252.89404296875,252.89404296875,252.89404296875,1,27128 +aten::layer_norm,"(1, 77, 768)","('c10::BFloat16', None)","(59136, 768, 1)",None,768,True,True,True,1,0.000300288,0.234375,1.221875,0.057607321869964326,0.05789239475500345,0.0024247130139245644,0.04949031268436578,0.06075766296475133,0.07038894640986265,0.07073726984126984,0.0029626962138890687,0.060470975811209436,0.07423826943505553,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]","[[1, 77, 768], [], [768], [768], [], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar']","[[59136, 768, 1], [], [1], [1], [], []]","['', '[768]', '', '', '1.0000000000000001e-05', 'True']",4.274140625,4.2451171875,0.19483437471531076,4.044921875,4.9658203125,213.70703125,50,55 +aten::native_layer_norm,"(1, 77, 768)","('c10::BFloat16', None)","(59136, 768, 1)",None,768,True,True,True,1,0.000300288,0.234375,1.221875,0.057607321869964326,0.05789239475500345,0.0024247130139245644,0.04949031268436578,0.06075766296475133,0.07038894640986265,0.07073726984126984,0.0029626962138890687,0.060470975811209436,0.07423826943505553,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]","[[1, 77, 768], [], [768], [768], []]","['c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[59136, 768, 1], [], [1], [1], []]","['', '[768]', '', '', '1.0000000000000001e-05']",4.274140625,4.2451171875,0.19483437471531076,4.044921875,4.9658203125,213.70703125,50,56 +aiter::_groupnorm_run,"(1, 512, 128, 128)","('c10::BFloat16', None)","(8388608, 16384, 128, 1)",None,512,True,True,True,2,0.041946112,32.005859375,1.2498626960395436,1.6614942822631178,1.6444940762585691,0.12358495556463041,1.54579119395466,1.8744936768211198,2.0766397230836664,2.055391799773594,0.1544642257519363,1.9320267491903564,2.342859720620722,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(40.815000000000005), 'mean_duration_us': np.float64(6.802500000000001), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.5678253105782916), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.851)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.91400000000002), 'mean_duration_us': np.float64(13.485666666666669), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8789754768415834), 'min_duration_us': np.float64(11.856), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.8)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.49)}]","[[1, 512, 128, 128], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",20.2880859375,20.427978515625,1.4392336798467016,17.90380859375,21.7109375,121.728515625,6,26754 +aiter::_groupnorm_run,"(1, 512, 16384)","('c10::BFloat16', None)","(8388608, 16384, 1)",None,512,True,True,True,2,0.041946112,32.005859375,1.2498626960395436,1.3579653781167267,1.3579653781167267,,1.3579653781167267,1.3579653781167267,1.6972702686213301,1.6972702686213301,,1.6972702686213301,1.6972702686213301,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.809), 'mean_duration_us': np.float64(6.809), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(6.809)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(17.905), 'mean_duration_us': np.float64(17.905), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(17.905), 'max_duration_us': np.float64(17.905)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.81)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(17.9)}]","[[1, 512, 16384], [], [512], [512], []]","['c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 1], [], [1], [1], []]","['', '32', '', '', '9.9999999999999995e-07']",24.7138671875,24.7138671875,,24.7138671875,24.7138671875,24.7138671875,1,26788 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/UnaryElementwise.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/UnaryElementwise.csv index 4f489e54b..2b867a607 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/UnaryElementwise.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/UnaryElementwise.csv @@ -1,40 +1,40 @@ name,param: op_shape,param: dtype_in_out,param: stride_input,param: stride_output,param: input_shape,param: output_shape,num_kernels,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::silu,"(1, 128, 1024, 1024)","('c10::BFloat16', None)","(134217728, 1048576, 1024, 1)",,,,1,0.134217728,512.0,0.25,3.060151396175012,3.05344141829577,0.2008227131970654,2.728391166448712,3.2831729172481956,0.765037849043753,0.7633603545739425,0.05020567829926635,0.682097791612178,0.8207932293120489,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1056.564), 'mean_duration_us': np.float64(176.09400000000002), 'median_duration_us': np.float64(175.8405), 'std_dev_duration_us': np.float64(10.951276226997471), 'min_duration_us': np.float64(163.522), 'max_duration_us': np.float64(196.772)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(176.09)}]","[[1, 128, 1024, 1024]]",['c10::BFloat16'],"[[134217728, 1048576, 1024, 1]]",[''],176.09407552083334,175.840576171875,11.99649579488144,163.52197265625,196.77197265625,1056.564453125,6,27250 -aten::copy_,"(1, 64, 256, 256)","('c10::BFloat16', 'float')","(4194304, 65536, 256, 1)","(4194304, 65536, 256, 1)",,,1,0.004194304,24.0,0.16666666666666666,2.4496158621719375,2.4165232348087025,0.17195036303672756,2.151697388719576,3.1258859505094616,0.4082693103619896,0.402753872468117,0.028658393839454614,0.35861623145326266,0.520980991751577,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(495.32899999999995), 'mean_duration_us': np.float64(10.319354166666665), 'median_duration_us': np.float64(10.414), 'std_dev_duration_us': np.float64(0.6669758394419588), 'min_duration_us': np.float64(8.051), 'max_duration_us': np.float64(11.696)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.32)}]","[[1, 64, 256, 256], [1, 64, 256, 256], []]","['c10::BFloat16', 'float', 'Scalar']","[[4194304, 65536, 256, 1], [4194304, 65536, 256, 1], []]","['', '', 'False']",10.319356282552084,10.4140625,0.6740310252108017,8.05078125,11.69580078125,495.3291015625,48,5230 -aten::silu,"(1, 256, 512, 512)","('c10::BFloat16', None)","(67108864, 262144, 512, 1)",,,,1,0.067108864,256.0,0.25,2.964445182785716,2.9637390637325196,0.09138310205874534,2.831005627902426,3.0640208551189088,0.741111295696429,0.7409347659331299,0.022845775514686334,0.7077514069756065,0.7660052137797272,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(453.1069999999999), 'mean_duration_us': np.float64(90.62139999999998), 'median_duration_us': np.float64(90.573), 'std_dev_duration_us': np.float64(2.5293653433223118), 'min_duration_us': np.float64(87.609), 'max_duration_us': np.float64(94.82)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(90.62)}]","[[1, 256, 512, 512]]",['c10::BFloat16'],"[[67108864, 262144, 512, 1]]",[''],90.62138671875,90.5732421875,2.827936505522151,87.60888671875,94.81982421875,453.10693359375,5,27145 -aten::pow,"(1, 256, 4096)","('float', None)","(1048576, 4096, 1)",,,,1,0.001048576,8.0,0.125,1.9879502095622998,2.063857867340539,0.496119610033179,1.2850526728999925,2.585772002408188,0.24849377619528748,0.2579822334175674,0.062014951254147375,0.16063158411249906,0.3232215003010235,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(441.52500000000003), 'mean_duration_us': np.float64(4.505357142857143), 'median_duration_us': np.float64(4.0655), 'std_dev_duration_us': np.float64(1.1575871567662643), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","[[1, 256, 4096], []]","['float', 'Scalar']","[[1048576, 4096, 1], []]","['', '2']",4.5053411989795915,4.0654296875,1.1635621576041233,3.244140625,6.52783203125,441.5234375,98,5092 -aten::copy_,"(1, 3, 1024, 1024)","('c10::BFloat16', 'c10::BFloat16')","(3145728, 1048576, 1024, 1)","(3145728, 1048576, 1024, 1)",,,1,0.003145728,12.0,0.25,0.030540216065674412,0.030540216065674412,,0.030540216065674412,0.030540216065674412,0.007635054016418603,0.007635054016418603,,0.007635054016418603,0.007635054016418603,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(412.011), 'mean_duration_us': np.float64(412.011), 'median_duration_us': np.float64(412.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(412.011), 'max_duration_us': np.float64(412.011)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(412.01)}]","[[1, 3, 1024, 1024], [1, 3, 1024, 1024], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[3145728, 1048576, 1024, 1], [3145728, 1048576, 1024, 1], []]","['', '', 'False']",412.01123046875,412.01123046875,,412.01123046875,412.01123046875,412.01123046875,1,27348 -aten::silu,"(1, 256, 1024, 1024)","('c10::BFloat16', None)","(268435456, 1048576, 1024, 1)",,,,1,0.268435456,1024.0,0.25,2.78161956543441,2.78161956543441,,2.78161956543441,2.78161956543441,0.6954048913586025,0.6954048913586025,,0.6954048913586025,0.6954048913586025,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(386.013), 'mean_duration_us': np.float64(386.013), 'median_duration_us': np.float64(386.013), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(386.013), 'max_duration_us': np.float64(386.013)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(386.01)}]","[[1, 256, 1024, 1024]]",['c10::BFloat16'],"[[268435456, 1048576, 1024, 1]]",[''],386.01318359375,386.01318359375,,386.01318359375,386.01318359375,386.01318359375,1,27237 -aten::upsample_nearest2d,"(1, 256, 1024, 1024)","('c10::BFloat16', 'c10::BFloat16')","(67108864, 262144, 512, 1)",,"(1, 256, 512, 512)","(1, 256, 1024, 1024)",1,0.268435456,640.0,0.4,1.7554571512943784,1.7554571512943784,,1.7554571512943784,1.7554571512943784,0.7021828605177515,0.7021828605177515,,0.7021828605177515,0.7021828605177515,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(382.287), 'mean_duration_us': np.float64(382.287), 'median_duration_us': np.float64(382.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(382.287), 'max_duration_us': np.float64(382.287)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(382.29)}]","[[1, 256, 512, 512], [], [], []]","['c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar']","[[67108864, 262144, 512, 1], [], [], []]","['', '[1024, 1024]', '2.', '2.']",382.287109375,382.287109375,,382.287109375,382.287109375,382.287109375,1,27224 -aten::copy_,"(1, 64, 256, 256)","('float', 'c10::BFloat16')","(4194304, 65536, 256, 1)","(4194304, 65536, 256, 1)",,,1,0.004194304,24.0,0.16666666666666666,3.1941074188111482,3.141491445453812,0.25569355103516106,2.7435115273075694,3.631339924751638,0.5323512364685247,0.5235819075756354,0.04261559183919351,0.45725192121792824,0.6052233207919396,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(380.557), 'mean_duration_us': np.float64(7.928270833333333), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.6257010647926363), 'min_duration_us': np.float64(6.93), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(7.93)}]","[[1, 64, 256, 256], [1, 64, 256, 256], []]","['float', 'c10::BFloat16', 'Scalar']","[[4194304, 65536, 256, 1], [4194304, 65536, 256, 1], []]","['', '', 'False']",7.928293863932292,8.010986328125,0.6323219764114211,6.93017578125,9.1728515625,380.55810546875,48,5223 -aten::copy_,"(1, 256, 4096)","('float', 'c10::BFloat16')","(1048576, 4096, 1)","(1048576, 4096, 1)",,,1,0.001048576,6.0,0.16666666666666666,1.772961286208643,1.8058727243167485,0.17509553373520487,0.41118527852948683,1.9635632258457787,0.2954935477014405,0.3009787873861247,0.029182588955867478,0.06853087975491447,0.32726053764096313,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(358.069), 'mean_duration_us': np.float64(3.653765306122449), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(1.202514761257105), 'min_duration_us': np.float64(3.204), 'max_duration_us': np.float64(15.301)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.65)}]","[[1, 256, 4096], [1, 256, 4096], []]","['float', 'c10::BFloat16', 'Scalar']","[[1048576, 4096, 1], [1048576, 4096, 1], []]","['', '', 'False']",3.653773716517857,3.48388671875,1.208679528258489,3.2041015625,15.30078125,358.06982421875,98,5091 -aten::copy_,"(1, 256, 4096)","('c10::BFloat16', 'float')","(1048576, 4096, 1)","(1048576, 4096, 1)",,,1,0.001048576,6.0,0.16666666666666666,1.8500109098074213,1.83761300947469,0.12718544383168334,1.6033974474863117,2.0951059980487807,0.3083351516345702,0.3062688349124484,0.021197573971947235,0.26723290791438525,0.34918433300813007,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(334.84000000000003), 'mean_duration_us': np.float64(3.4167346938775514), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.23425720867615366), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.924)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]","[[1, 256, 4096], [1, 256, 4096], []]","['c10::BFloat16', 'float', 'Scalar']","[[1048576, 4096, 1], [1048576, 4096, 1], []]","['', '', 'False']",3.4167580117984695,3.423828125,0.23546391148849397,3.0029296875,3.923828125,334.84228515625,98,5102 -aten::copy_,"(1, 512, 128, 128)","('c10::BFloat16', 'c10::BFloat16')","(8388608, 16384, 128, 1)","(512, 1, 65536, 512)",,,1,0.008388608,32.0,0.25,0.5313059264910167,0.5284650153495954,0.021674178105880168,0.5064297370259554,0.5659650530060946,0.13282648162275418,0.13211625383739886,0.005418544526470042,0.12660743425648885,0.14149126325152364,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(316.184), 'mean_duration_us': np.float64(63.2368), 'median_duration_us': np.float64(63.494), 'std_dev_duration_us': np.float64(2.254049813114166), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.24)}]","[[1, 512, 128, 128], [1, 512, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [512, 1, 65536, 512], []]","['', '', 'False']",63.23681640625,63.494140625,2.5200299383080496,59.287109375,66.2568359375,316.18408203125,5,26885 -aten::copy_,"(1, 256, 64, 64)","('c10::BFloat16', 'c10::BFloat16')","(1048576, 4096, 64, 1)","(1048576, 64, 16384, 1)",,,1,0.001048576,4.0,0.25,0.6409524591891147,0.6405197978707994,0.030831353206344933,0.5850656989510965,0.6935196667204909,0.16023811479727867,0.16012994946769984,0.007707838301586233,0.14626642473777413,0.17337991668012273,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(314.819), 'mean_duration_us': np.float64(6.558729166666667), 'median_duration_us': np.float64(6.5485), 'std_dev_duration_us': np.float64(0.31280177026775097), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.169)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.56)}]","[[1, 256, 64, 64], [1, 256, 64, 64], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1048576, 4096, 64, 1], [1048576, 64, 16384, 1], []]","['', '', 'False']",6.558736165364583,6.54833984375,0.31613188099540285,6.0478515625,7.1689453125,314.8193359375,48,5249 -aten::rsqrt,"(1, 256, 1)","('float', None)","(256, 1, 1)",,,,1,2.56e-07,0.001953125,0.125,0.0007148460470941715,0.0007204232222603916,4.830387704882627e-05,0.0003043541107321675,0.0007748575651210049,8.935575588677144e-05,9.005290278254895e-05,6.037984631103284e-06,3.8044263841520934e-05,9.685719564012561e-05,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(283.322), 'mean_duration_us': np.float64(2.8910408163265306), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.40249580853103045), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(2.89)}]","[[1, 256, 1]]",['float'],"[[256, 1, 1]]",[''],2.89102857940051,2.8427734375,0.4045436215443143,2.64306640625,6.72900390625,283.32080078125,98,5097 -aten::silu,"(1, 512, 256, 256)","('c10::BFloat16', None)","(33554432, 65536, 256, 1)",,,,1,0.033554432,128.0,0.25,2.957530060564024,2.913184611115289,0.21523914482639145,2.706396894078727,3.2216533478352596,0.739382515141006,0.7282961527788222,0.05380978620659786,0.6765992235196817,0.8054133369588149,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(273.482), 'mean_duration_us': np.float64(45.580333333333336), 'median_duration_us': np.float64(46.108000000000004), 'std_dev_duration_us': np.float64(2.993738168614989), 'min_duration_us': np.float64(41.661), 'max_duration_us': np.float64(49.593)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(45.58)}]","[[1, 512, 256, 256]]",['c10::BFloat16'],"[[33554432, 65536, 256, 1]]",[''],45.580403645833336,46.108154296875,3.2794362265579236,41.6611328125,49.5927734375,273.482421875,6,27035 -aten::pow,"(1, 256, 10240)","('c10::BFloat16', None)","(2621440, 10240, 1)",,,,1,0.00262144,10.0,0.25,2.1873946560920685,2.200065206433767,0.12845204619245754,1.625896159903089,2.4695074149034038,0.5468486640230172,0.5500163016084417,0.03211301154811437,0.4064740399757723,0.6173768537258509,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(231.017), 'mean_duration_us': np.float64(4.812854166666667), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.334003617095143), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","[[1, 256, 10240], []]","['c10::BFloat16', 'Scalar']","[[2621440, 10240, 1], []]","['', '3.']",4.81292724609375,4.76611328125,0.3375204223664483,4.24609375,6.44921875,231.0205078125,48,5289 -aten::silu,"(1, 512, 128, 128)","('c10::BFloat16', None)","(8388608, 16384, 128, 1)",,,,1,0.008388608,32.0,0.25,1.5712199540858873,1.528658727505411,0.23950682265366277,1.3960563289452301,2.221846058262472,0.39280498852147183,0.3821646818763528,0.05987670566341569,0.34901408223630753,0.555461514565618,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(217.03300000000002), 'mean_duration_us': np.float64(21.703300000000002), 'median_duration_us': np.float64(21.9515), 'std_dev_duration_us': np.float64(2.425225888448332), 'min_duration_us': np.float64(15.102), 'max_duration_us': np.float64(24.035)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(21.7)}]","[[1, 512, 128, 128]]",['c10::BFloat16'],"[[8388608, 16384, 128, 1]]",[''],21.7033203125,21.951416015625,2.556412588605594,15.10205078125,24.03515625,217.033203125,10,26758 -aten::silu,"(1, 512, 512, 512)","('c10::BFloat16', None)","(134217728, 262144, 512, 1)",,,,1,0.134217728,512.0,0.25,2.650166378496158,2.650166378496158,,2.650166378496158,2.650166378496158,0.6625415946240395,0.6625415946240395,,0.6625415946240395,0.6625415946240395,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.58), 'mean_duration_us': np.float64(202.58), 'median_duration_us': np.float64(202.58), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.58), 'max_duration_us': np.float64(202.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.58)}]","[[1, 512, 512, 512]]",['c10::BFloat16'],"[[134217728, 262144, 512, 1]]",[''],202.580078125,202.580078125,,202.580078125,202.580078125,202.580078125,1,27132 -aten::upsample_nearest2d,"(1, 512, 512, 512)","('c10::BFloat16', 'c10::BFloat16')","(33554432, 65536, 256, 1)",,"(1, 512, 256, 256)","(1, 512, 512, 512)",1,0.134217728,320.0,0.4,2.1035136394552616,2.1035136394552616,,2.1035136394552616,2.1035136394552616,0.8414054557821047,0.8414054557821047,,0.8414054557821047,0.8414054557821047,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(159.516), 'mean_duration_us': np.float64(159.516), 'median_duration_us': np.float64(159.516), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(159.516), 'max_duration_us': np.float64(159.516)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(159.52)}]","[[1, 512, 256, 256], [], [], []]","['c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar']","[[33554432, 65536, 256, 1], [], [], []]","['', '[512, 512]', '2.', '2.']",159.51611328125,159.51611328125,,159.51611328125,159.51611328125,159.51611328125,1,27119 -aten::sigmoid,"(1, 77, 3072)","('c10::BFloat16', None)","(236544, 3072, 1)",,,,1,0.000236544,0.90234375,0.25,0.1554287062821396,0.1564482841918295,0.009436700801585865,0.13654911197237685,0.174983605562579,0.03885717657053489,0.03911207104795737,0.002359175200396465,0.03413727799309421,0.04374590139064475,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(146.634), 'mean_duration_us': np.float64(6.109749999999999), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.37528314310664157), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(6.929)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.11)}]","[[1, 77, 3072]]",['c10::BFloat16'],"[[236544, 3072, 1]]",[''],6.109761555989583,6.0478515625,0.38336007029338576,5.4072265625,6.92919921875,146.63427734375,24,155 -aten::upsample_nearest2d,"(1, 512, 256, 256)","('c10::BFloat16', 'c10::BFloat16')","(512, 1, 65536, 512)",,"(1, 512, 128, 128)","(1, 512, 256, 256)",2,0.033554432,80.0,0.4,0.8692770061831465,0.8692770061831465,,0.8692770061831465,0.8692770061831465,0.34771080247325864,0.34771080247325864,,0.34771080247325864,0.34771080247325864,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.487), 'mean_duration_us': np.float64(32.487), 'median_duration_us': np.float64(32.487), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.487), 'max_duration_us': np.float64(32.487)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.014), 'mean_duration_us': np.float64(64.014), 'median_duration_us': np.float64(64.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.014), 'max_duration_us': np.float64(64.014)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(32.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}]","[[1, 512, 128, 128], [], [], []]","['c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar']","[[512, 1, 65536, 512], [], [], []]","['', '[256, 256]', '2.', '2.']",96.5009765625,96.5009765625,,96.5009765625,96.5009765625,96.5009765625,1,27017 -aten::copy_,"(1, 77)","('int', 'long int')","(77, 1)","(77, 1)",,,1,7.7e-08,0.000881195068359375,0.08333333333333333,0.000204408392642626,0.0002126285554446636,1.991845552618759e-05,0.000174764684152198,0.00021761177552897883,1.7034032720218834e-05,1.7719046287055302e-05,1.659871293848969e-06,1.4563723679349833e-05,1.8134314627414904e-05,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.224), 'mean_duration_us': np.float64(4.556), 'median_duration_us': np.float64(4.3454999999999995), 'std_dev_duration_us': np.float64(0.42424108711910485), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.56)}]","[[1, 77], [1, 77], []]","['int', 'long int', 'Scalar']","[[77, 1], [77, 1], []]","['', '', 'False']",4.55615234375,4.345703125,0.48984807208769054,4.24609375,5.287109375,18.224609375,4,1401 -aten::copy_,"(256, 256)","('long int', 'bool')","(256, 1)","(256, 1)",,,1,6.5536e-05,,,,,,,,0.008676379506827888,0.008676379506827888,0.0005844485318503793,0.008263111986701963,0.009089647026953813,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(15.141), 'mean_duration_us': np.float64(7.5705), 'median_duration_us': np.float64(7.5705), 'std_dev_duration_us': np.float64(0.36050000000000004), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(7.931)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]","[[256, 256], [256, 256], []]","['long int', 'bool', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",7.570556640625,7.570556640625,0.5099593338928372,7.2099609375,7.93115234375,15.14111328125,2,5171 -aten::copy_,"(1, 77)","('long int', 'long int')","(77, 1)","(77, 1)",,,1,7.7e-08,0.0011749267578125,0.0625,0.00034795994099494283,0.00033264928894099143,4.661040970475972e-05,0.0003107310344827586,0.00041581015161502974,2.1747496312183927e-05,2.0790580558811965e-05,2.9131506065474824e-06,1.9420689655172414e-05,2.598813447593936e-05,python3,CPU,thread 416 (python3),,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.337000000000002), 'mean_duration_us': np.float64(3.5842500000000004), 'median_duration_us': np.float64(3.7045000000000003), 'std_dev_duration_us': np.float64(0.3765510423568098), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.965)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.58)}]","[[1, 77], [1, 77], []]","['long int', 'long int', 'Scalar']","[[77, 1], [77, 1], []]","['', '', 'False']",3.584228515625,3.70458984375,0.4348311081041389,2.962890625,3.96484375,14.3369140625,4,25 -aten::copy_,"(1, 16, 128, 128)","('float', 'c10::BFloat16')","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",,,1,0.000262144,1.5,0.16666666666666666,0.442202039589035,0.44890337639244104,0.02304089823211664,0.4090445043809524,0.46195690119030547,0.07370033993150582,0.07481722939874016,0.003840149705352772,0.06817408406349205,0.07699281686505091,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.258000000000001), 'mean_duration_us': np.float64(3.5645000000000002), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.16751193987295365), 'min_duration_us': np.float64(3.405), 'max_duration_us': np.float64(3.845)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.56)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['float', 'c10::BFloat16', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', 'False']",3.564453125,3.50390625,0.19360992946960456,3.40478515625,3.84521484375,14.2578125,4,20477 -aten::copy_,"(1, 16, 128, 128)","('c10::BFloat16', 'float')","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",,,1,0.000262144,1.5,0.16666666666666666,0.4649342648875561,0.4676212078152885,0.010455401439686662,0.451341666246322,0.47315297767332554,0.07748904414792601,0.07793686796921476,0.0017425669066144418,0.07522361104105366,0.07885882961222092,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536999999999999), 'mean_duration_us': np.float64(3.3842499999999998), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0667097256777451), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.485)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['c10::BFloat16', 'float', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', 'False']",3.38427734375,3.364013671875,0.07683981154707822,3.32421875,3.48486328125,13.537109375,4,20488 -aten::copy_,"(256, 256)","('float', 'long int')","(256, 1)","(256, 1)",,,1,6.5536e-05,0.75,0.08333333333333333,0.11866382322961364,0.11866382322961364,0.0025340510883724607,0.11687197852115232,0.12045566793807495,0.009888651935801136,0.009888651935801136,0.00021117092403103737,0.00973933154342936,0.010037972328172912,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.258), 'mean_duration_us': np.float64(6.629), 'median_duration_us': np.float64(6.629), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.63)}]","[[256, 256], [256, 256], []]","['float', 'long int', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",6.62890625,6.62890625,0.14155946303051,6.52880859375,6.72900390625,13.2578125,2,5182 -aten::copy_,"(256, 256)","('long int', 'float')","(256, 1)","(256, 1)",,,1,6.5536e-05,0.75,0.08333333333333333,0.14182547560451392,0.14182547560451392,0.0036194682899149014,0.13926612503242541,0.14438482617660242,0.011818789633709493,0.011818789633709493,0.00030162235749290847,0.011605510419368784,0.012032068848050201,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.094000000000001), 'mean_duration_us': np.float64(5.547000000000001), 'median_duration_us': np.float64(5.547000000000001), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(5.447), 'max_duration_us': np.float64(5.647)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.55)}]","[[256, 256], [256, 256], []]","['long int', 'float', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",5.546875,5.546875,0.14155946303051,5.44677734375,5.64697265625,11.09375,2,5190 -aten::copy_,"(1, 77, 2048)","('c10::BFloat16', 'c10::BFloat16')","(315392, 4096, 1)","(157696, 2048, 1)",,,1,0.000157696,0.6015625,0.25,0.13146708067116858,0.13146708067116858,0.007753461466496543,0.1259845554905403,0.13694960585179689,0.032866770167792145,0.032866770167792145,0.0019383653666241358,0.031496138872635075,0.03423740146294922,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.613), 'mean_duration_us': np.float64(4.8065), 'median_duration_us': np.float64(4.8065), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","[[1, 77, 2048], [1, 77, 2048], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[315392, 4096, 1], [157696, 2048, 1], []]","['', '', 'False']",4.806396484375,4.806396484375,0.28346419304402126,4.60595703125,5.0068359375,9.61279296875,2,9179 -aten::copy_,"(1, 1, 1, 1, 256, 4096)","('c10::BFloat16', 'c10::BFloat16')","(1048576, 1048576, 4096, 1048576, 4096, 1)","(1048576, 1048576, 1048576, 1048576, 4096, 1)",,,1,0.001048576,4.0,0.25,1.286461166118709,1.286461166118709,0.05593962523760452,1.2469058777761648,1.3260164544612534,0.32161529152967727,0.32161529152967727,0.01398490630940113,0.3117264694440412,0.33150411361531334,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.526999999999999), 'mean_duration_us': np.float64(3.2634999999999996), 'median_duration_us': np.float64(3.2634999999999996), 'std_dev_duration_us': np.float64(0.10050000000000003), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(3.364)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.26)}]","[[1, 1, 1, 1, 256, 4096], [1, 1, 1, 1, 256, 4096], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1048576, 1048576, 4096, 1048576, 4096, 1], [1048576, 1048576, 1048576, 1048576, 4096, 1], []]","['', '', 'False']",3.263427734375,3.263427734375,0.14190473001351125,3.1630859375,3.36376953125,6.52685546875,2,9170 -aten::copy_,"(1, 1, 1, 1, 77, 768)","('c10::BFloat16', 'c10::BFloat16')","(59136, 59136, 768, 59136, 768, 1)","(59136, 59136, 59136, 59136, 768, 1)",,,1,5.9136e-05,0.2255859375,0.25,0.07881544776038232,0.07881544776038232,0.009602730785797826,0.07202529170383586,0.08560560381692879,0.01970386194009558,0.01970386194009558,0.002400682696449453,0.018006322925958964,0.021401400954232194,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.047), 'mean_duration_us': np.float64(3.0235), 'median_duration_us': np.float64(3.0235), 'std_dev_duration_us': np.float64(0.26049999999999995), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.284)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.02)}]","[[1, 1, 1, 1, 77, 768], [1, 1, 1, 1, 77, 768], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[59136, 59136, 768, 59136, 768, 1], [59136, 59136, 59136, 59136, 768, 1], []]","['', '', 'False']",3.023681640625,3.023681640625,0.36839987086232723,2.76318359375,3.2841796875,6.04736328125,2,1431 -aten::copy_,"(1, 1, 1, 1, 77, 1280)","('c10::BFloat16', 'c10::BFloat16')","(98560, 98560, 1280, 98560, 1280, 1)","(98560, 98560, 98560, 98560, 1280, 1)",,,1,9.856e-05,0.3759765625,0.25,0.13245858379797232,0.13245858379797232,0.008800490467240142,0.12623569731081927,0.1386814702851254,0.03311464594949308,0.03311464594949308,0.0022001226168100354,0.03155892432770482,0.03467036757128135,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.966), 'mean_duration_us': np.float64(2.983), 'median_duration_us': np.float64(2.983), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.123)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.98)}]","[[1, 1, 1, 1, 77, 1280], [1, 1, 1, 1, 77, 1280], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[98560, 98560, 1280, 98560, 1280, 1], [98560, 98560, 98560, 98560, 1280, 1], []]","['', '', 'False']",2.98291015625,2.98291015625,0.198183248242714,2.8427734375,3.123046875,5.9658203125,2,5032 -aten::copy_,"(1, 256)","('long int', 'long int')","(256, 1)","(256, 1)",,,1,2.56e-07,0.00390625,0.0625,0.001441005046664297,0.001441005046664297,2.8525194290411314e-05,0.0014208346883468833,0.0014611754049817106,9.006281541651856e-05,9.006281541651856e-05,1.782824643150707e-06,8.880216802168021e-05,9.132346281135691e-05,python3,CPU,thread 416 (python3),,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.686), 'mean_duration_us': np.float64(2.843), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(2.883)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","[[1, 256], [1, 256], []]","['long int', 'long int', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",2.843017578125,2.843017578125,0.05627851822920276,2.80322265625,2.8828125,5.68603515625,2,5072 -aten::copy_,"(1,)","('float', 'float')","(1,)","(1,)",,,1,1e-09,7.62939453125e-06,0.125,4.745146984886265e-06,4.755878084179971e-06,6.621960788630501e-07,4.077650572424091e-06,5.401912298054731e-06,5.931433731107831e-07,5.944847605224964e-07,8.277450985788126e-08,5.097063215530114e-07,6.752390372568414e-07,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.125), 'mean_duration_us': np.float64(1.7083333333333333), 'median_duration_us': np.float64(1.682), 'std_dev_duration_us': np.float64(0.19724829248662426), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.962)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.71)}]","[[1], [1], []]","['float', 'float', 'Scalar']","[[1], [1], []]","['', '', 'False']",1.7083333333333333,1.68212890625,0.24154693224356558,1.48095703125,1.9619140625,5.125,3,20500 -aten::copy_,"(1, 1, 1, 768)","('c10::BFloat16', 'c10::BFloat16')","(768, 768, 768, 1)","(768, 768, 768, 1)",,,1,7.68e-07,0.0029296875,0.25,0.00204703168771126,0.00204703168771126,3.8611756340311866e-05,0.0020197290529695025,0.0020743343224530167,0.000511757921927815,0.000511757921927815,9.652939085077967e-06,0.0005049322632423756,0.0005185835806132542,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.002), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.501), 'std_dev_duration_us': np.float64(0.019999999999999907), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.521)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.5)}]","[[1, 1, 1, 768], [1, 1, 1, 768], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[768, 768, 768, 1], [768, 768, 768, 1], []]","['', '', 'False']",1.5009765625,1.5009765625,0.028311892606102,1.48095703125,1.52099609375,3.001953125,2,1445 -aten::copy_,"(1, 1, 1, 1280)","('c10::BFloat16', 'c10::BFloat16')","(1280, 1280, 1280, 1)","(1280, 1280, 1280, 1)",,,1,1.28e-06,0.0048828125,0.25,0.0035632188356983976,0.0035632188356983976,0.00028165994123286267,0.003364055181264036,0.003762382490132759,0.0008908047089245995,0.0008908047089245995,7.041498530821571e-05,0.0008410137953160091,0.0009405956225331899,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(2.883), 'mean_duration_us': np.float64(1.4415), 'median_duration_us': np.float64(1.4415), 'std_dev_duration_us': np.float64(0.08050000000000002), 'min_duration_us': np.float64(1.361), 'max_duration_us': np.float64(1.522)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.44)}]","[[1, 1, 1, 1280], [1, 1, 1, 1280], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1280, 1280, 1280, 1], [1280, 1280, 1280, 1], []]","['', '', 'False']",1.44140625,1.44140625,0.1139381043904105,1.36083984375,1.52197265625,2.8828125,2,5046 -aten::copy_,"(4,)","('float', 'double')","(1,)","(1,)",,,1,4e-09,4.57763671875e-05,0.08333333333333333,1.8167436703012383e-05,1.8167436703012383e-05,,1.8167436703012383e-05,1.8167436703012383e-05,1.513953058584365e-06,1.513953058584365e-06,,1.513953058584365e-06,1.513953058584365e-06,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]","[[4], [4], []]","['float', 'double', 'Scalar']","[[1], [1], []]","['', '', 'False']",2.64208984375,2.64208984375,,2.64208984375,2.64208984375,2.64208984375,1,18372 -aten::copy_,"(4,)","('float', 'float')","(1,)","(1,)",,,1,4e-09,3.0517578125e-05,0.125,1.211162446867492e-05,1.211162446867492e-05,,1.211162446867492e-05,1.211162446867492e-05,1.513953058584365e-06,1.513953058584365e-06,,1.513953058584365e-06,1.513953058584365e-06,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]","[[4], [4], []]","['float', 'float', 'Scalar']","[[1], [1], []]","['', '', 'False']",2.64208984375,2.64208984375,,2.64208984375,2.64208984375,2.64208984375,1,18380 -aten::copy_,"(4,)","('float', 'double')","(1,)","(1,)",,,0,4e-09,4.57763671875e-05,0.08333333333333333,,,,,,,,,,,python3,CPU,thread 416 (python3),vector_fp32,[],,"[[4], [4], []]","['float', 'double', 'Scalar']","[[1], [1], []]","['', '', 'False']",0.0,0.0,,0.0,0.0,0.0,1,18376 -aten::copy_,"(1, 1024, 1024, 3)","('float', 'c10::BFloat16')","(3145728, 1024, 1, 1048576)","(3145728, 1024, 1, 1048576)",,,0,0.003145728,18.0,0.16666666666666666,,,,,,,,,,,python3,CPU,thread 416 (python3),vector_fp32,[],,"[[1, 1024, 1024, 3], [1, 1024, 1024, 3], []]","['float', 'c10::BFloat16', 'Scalar']","[[3145728, 1024, 1, 1048576], [3145728, 1024, 1, 1048576], []]","['', '', 'False']",0.0,0.0,,0.0,0.0,0.0,1,27354 +aten::silu,"(1, 128, 1024, 1024)","('c10::BFloat16', None)","(134217728, 1048576, 1024, 1)",None,nan,nan,1,0.134217728,512.0,0.25,3.060151396175012,3.05344141829577,0.2008227131970654,2.728391166448712,3.2831729172481956,0.765037849043753,0.7633603545739425,0.05020567829926635,0.682097791612178,0.8207932293120489,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1056.564), 'mean_duration_us': np.float64(176.09400000000002), 'median_duration_us': np.float64(175.8405), 'std_dev_duration_us': np.float64(10.951276226997471), 'min_duration_us': np.float64(163.522), 'max_duration_us': np.float64(196.772)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(176.09)}]","[[1, 128, 1024, 1024]]",['c10::BFloat16'],"[[134217728, 1048576, 1024, 1]]",[''],176.09407552083334,175.840576171875,11.99649579488144,163.52197265625,196.77197265625,1056.564453125,6,27250 +aten::copy_,"(1, 64, 256, 256)","('c10::BFloat16', 'float')","(4194304, 65536, 256, 1)","(4194304, 65536, 256, 1)",nan,nan,1,0.004194304,24.0,0.16666666666666666,2.4496158621719375,2.4165232348087025,0.17195036303672756,2.151697388719576,3.1258859505094616,0.4082693103619896,0.402753872468117,0.028658393839454614,0.35861623145326266,0.520980991751577,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(495.32899999999995), 'mean_duration_us': np.float64(10.319354166666665), 'median_duration_us': np.float64(10.414), 'std_dev_duration_us': np.float64(0.6669758394419588), 'min_duration_us': np.float64(8.051), 'max_duration_us': np.float64(11.696)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.32)}]","[[1, 64, 256, 256], [1, 64, 256, 256], []]","['c10::BFloat16', 'float', 'Scalar']","[[4194304, 65536, 256, 1], [4194304, 65536, 256, 1], []]","['', '', 'False']",10.319356282552084,10.4140625,0.6740310252108017,8.05078125,11.69580078125,495.3291015625,48,5230 +aten::silu,"(1, 256, 512, 512)","('c10::BFloat16', None)","(67108864, 262144, 512, 1)",None,nan,nan,1,0.067108864,256.0,0.25,2.964445182785716,2.9637390637325196,0.09138310205874534,2.831005627902426,3.0640208551189088,0.741111295696429,0.7409347659331299,0.022845775514686334,0.7077514069756065,0.7660052137797272,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(453.1069999999999), 'mean_duration_us': np.float64(90.62139999999998), 'median_duration_us': np.float64(90.573), 'std_dev_duration_us': np.float64(2.5293653433223118), 'min_duration_us': np.float64(87.609), 'max_duration_us': np.float64(94.82)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(90.62)}]","[[1, 256, 512, 512]]",['c10::BFloat16'],"[[67108864, 262144, 512, 1]]",[''],90.62138671875,90.5732421875,2.827936505522151,87.60888671875,94.81982421875,453.10693359375,5,27145 +aten::pow,"(1, 256, 4096)","('float', None)","(1048576, 4096, 1)",None,nan,nan,1,0.001048576,8.0,0.125,1.9879502095622998,2.063857867340539,0.496119610033179,1.2850526728999925,2.585772002408188,0.24849377619528748,0.2579822334175674,0.062014951254147375,0.16063158411249906,0.3232215003010235,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(441.52500000000003), 'mean_duration_us': np.float64(4.505357142857143), 'median_duration_us': np.float64(4.0655), 'std_dev_duration_us': np.float64(1.1575871567662643), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","[[1, 256, 4096], []]","['float', 'Scalar']","[[1048576, 4096, 1], []]","['', '2']",4.5053411989795915,4.0654296875,1.1635621576041233,3.244140625,6.52783203125,441.5234375,98,5092 +aten::copy_,"(1, 3, 1024, 1024)","('c10::BFloat16', 'c10::BFloat16')","(3145728, 1048576, 1024, 1)","(3145728, 1048576, 1024, 1)",nan,nan,1,0.003145728,12.0,0.25,0.030540216065674412,0.030540216065674412,,0.030540216065674412,0.030540216065674412,0.007635054016418603,0.007635054016418603,,0.007635054016418603,0.007635054016418603,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(412.011), 'mean_duration_us': np.float64(412.011), 'median_duration_us': np.float64(412.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(412.011), 'max_duration_us': np.float64(412.011)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(412.01)}]","[[1, 3, 1024, 1024], [1, 3, 1024, 1024], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[3145728, 1048576, 1024, 1], [3145728, 1048576, 1024, 1], []]","['', '', 'False']",412.01123046875,412.01123046875,,412.01123046875,412.01123046875,412.01123046875,1,27348 +aten::silu,"(1, 256, 1024, 1024)","('c10::BFloat16', None)","(268435456, 1048576, 1024, 1)",None,nan,nan,1,0.268435456,1024.0,0.25,2.78161956543441,2.78161956543441,,2.78161956543441,2.78161956543441,0.6954048913586025,0.6954048913586025,,0.6954048913586025,0.6954048913586025,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(386.013), 'mean_duration_us': np.float64(386.013), 'median_duration_us': np.float64(386.013), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(386.013), 'max_duration_us': np.float64(386.013)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(386.01)}]","[[1, 256, 1024, 1024]]",['c10::BFloat16'],"[[268435456, 1048576, 1024, 1]]",[''],386.01318359375,386.01318359375,,386.01318359375,386.01318359375,386.01318359375,1,27237 +aten::upsample_nearest2d,"(1, 256, 1024, 1024)","('c10::BFloat16', 'c10::BFloat16')","(67108864, 262144, 512, 1)",None,"(1, 256, 512, 512)","(1, 256, 1024, 1024)",1,0.268435456,640.0,0.4,1.7554571512943784,1.7554571512943784,,1.7554571512943784,1.7554571512943784,0.7021828605177515,0.7021828605177515,,0.7021828605177515,0.7021828605177515,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(382.287), 'mean_duration_us': np.float64(382.287), 'median_duration_us': np.float64(382.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(382.287), 'max_duration_us': np.float64(382.287)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(382.29)}]","[[1, 256, 512, 512], [], [], []]","['c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar']","[[67108864, 262144, 512, 1], [], [], []]","['', '[1024, 1024]', '2.', '2.']",382.287109375,382.287109375,,382.287109375,382.287109375,382.287109375,1,27224 +aten::copy_,"(1, 64, 256, 256)","('float', 'c10::BFloat16')","(4194304, 65536, 256, 1)","(4194304, 65536, 256, 1)",nan,nan,1,0.004194304,24.0,0.16666666666666666,3.1941074188111482,3.141491445453812,0.25569355103516106,2.7435115273075694,3.631339924751638,0.5323512364685247,0.5235819075756354,0.04261559183919351,0.45725192121792824,0.6052233207919396,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(380.557), 'mean_duration_us': np.float64(7.928270833333333), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.6257010647926363), 'min_duration_us': np.float64(6.93), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(7.93)}]","[[1, 64, 256, 256], [1, 64, 256, 256], []]","['float', 'c10::BFloat16', 'Scalar']","[[4194304, 65536, 256, 1], [4194304, 65536, 256, 1], []]","['', '', 'False']",7.928293863932292,8.010986328125,0.6323219764114211,6.93017578125,9.1728515625,380.55810546875,48,5223 +aten::copy_,"(1, 256, 4096)","('float', 'c10::BFloat16')","(1048576, 4096, 1)","(1048576, 4096, 1)",nan,nan,1,0.001048576,6.0,0.16666666666666666,1.772961286208643,1.8058727243167485,0.17509553373520487,0.41118527852948683,1.9635632258457787,0.2954935477014405,0.3009787873861247,0.029182588955867478,0.06853087975491447,0.32726053764096313,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(358.069), 'mean_duration_us': np.float64(3.653765306122449), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(1.202514761257105), 'min_duration_us': np.float64(3.204), 'max_duration_us': np.float64(15.301)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.65)}]","[[1, 256, 4096], [1, 256, 4096], []]","['float', 'c10::BFloat16', 'Scalar']","[[1048576, 4096, 1], [1048576, 4096, 1], []]","['', '', 'False']",3.653773716517857,3.48388671875,1.208679528258489,3.2041015625,15.30078125,358.06982421875,98,5091 +aten::copy_,"(1, 256, 4096)","('c10::BFloat16', 'float')","(1048576, 4096, 1)","(1048576, 4096, 1)",nan,nan,1,0.001048576,6.0,0.16666666666666666,1.8500109098074213,1.83761300947469,0.12718544383168334,1.6033974474863117,2.0951059980487807,0.3083351516345702,0.3062688349124484,0.021197573971947235,0.26723290791438525,0.34918433300813007,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(334.84000000000003), 'mean_duration_us': np.float64(3.4167346938775514), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.23425720867615366), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.924)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]","[[1, 256, 4096], [1, 256, 4096], []]","['c10::BFloat16', 'float', 'Scalar']","[[1048576, 4096, 1], [1048576, 4096, 1], []]","['', '', 'False']",3.4167580117984695,3.423828125,0.23546391148849397,3.0029296875,3.923828125,334.84228515625,98,5102 +aten::copy_,"(1, 512, 128, 128)","('c10::BFloat16', 'c10::BFloat16')","(8388608, 16384, 128, 1)","(512, 1, 65536, 512)",nan,nan,1,0.008388608,32.0,0.25,0.5313059264910167,0.5284650153495954,0.021674178105880168,0.5064297370259554,0.5659650530060946,0.13282648162275418,0.13211625383739886,0.005418544526470042,0.12660743425648885,0.14149126325152364,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(316.184), 'mean_duration_us': np.float64(63.2368), 'median_duration_us': np.float64(63.494), 'std_dev_duration_us': np.float64(2.254049813114166), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.24)}]","[[1, 512, 128, 128], [1, 512, 128, 128], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[8388608, 16384, 128, 1], [512, 1, 65536, 512], []]","['', '', 'False']",63.23681640625,63.494140625,2.5200299383080496,59.287109375,66.2568359375,316.18408203125,5,26885 +aten::copy_,"(1, 256, 64, 64)","('c10::BFloat16', 'c10::BFloat16')","(1048576, 4096, 64, 1)","(1048576, 64, 16384, 1)",nan,nan,1,0.001048576,4.0,0.25,0.6409524591891147,0.6405197978707994,0.030831353206344933,0.5850656989510965,0.6935196667204909,0.16023811479727867,0.16012994946769984,0.007707838301586233,0.14626642473777413,0.17337991668012273,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(314.819), 'mean_duration_us': np.float64(6.558729166666667), 'median_duration_us': np.float64(6.5485), 'std_dev_duration_us': np.float64(0.31280177026775097), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.169)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.56)}]","[[1, 256, 64, 64], [1, 256, 64, 64], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1048576, 4096, 64, 1], [1048576, 64, 16384, 1], []]","['', '', 'False']",6.558736165364583,6.54833984375,0.31613188099540285,6.0478515625,7.1689453125,314.8193359375,48,5249 +aten::rsqrt,"(1, 256, 1)","('float', None)","(256, 1, 1)",None,nan,nan,1,2.56e-07,0.001953125,0.125,0.0007148460470941715,0.0007204232222603916,4.830387704882627e-05,0.0003043541107321675,0.0007748575651210049,8.935575588677144e-05,9.005290278254895e-05,6.037984631103284e-06,3.8044263841520934e-05,9.685719564012561e-05,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(283.322), 'mean_duration_us': np.float64(2.8910408163265306), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.40249580853103045), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(2.89)}]","[[1, 256, 1]]",['float'],"[[256, 1, 1]]",[''],2.89102857940051,2.8427734375,0.4045436215443143,2.64306640625,6.72900390625,283.32080078125,98,5097 +aten::silu,"(1, 512, 256, 256)","('c10::BFloat16', None)","(33554432, 65536, 256, 1)",None,nan,nan,1,0.033554432,128.0,0.25,2.957530060564024,2.913184611115289,0.21523914482639145,2.706396894078727,3.2216533478352596,0.739382515141006,0.7282961527788222,0.05380978620659786,0.6765992235196817,0.8054133369588149,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(273.482), 'mean_duration_us': np.float64(45.580333333333336), 'median_duration_us': np.float64(46.108000000000004), 'std_dev_duration_us': np.float64(2.993738168614989), 'min_duration_us': np.float64(41.661), 'max_duration_us': np.float64(49.593)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(45.58)}]","[[1, 512, 256, 256]]",['c10::BFloat16'],"[[33554432, 65536, 256, 1]]",[''],45.580403645833336,46.108154296875,3.2794362265579236,41.6611328125,49.5927734375,273.482421875,6,27035 +aten::pow,"(1, 256, 10240)","('c10::BFloat16', None)","(2621440, 10240, 1)",None,nan,nan,1,0.00262144,10.0,0.25,2.1873946560920685,2.200065206433767,0.12845204619245754,1.625896159903089,2.4695074149034038,0.5468486640230172,0.5500163016084417,0.03211301154811437,0.4064740399757723,0.6173768537258509,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(231.017), 'mean_duration_us': np.float64(4.812854166666667), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.334003617095143), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","[[1, 256, 10240], []]","['c10::BFloat16', 'Scalar']","[[2621440, 10240, 1], []]","['', '3.']",4.81292724609375,4.76611328125,0.3375204223664483,4.24609375,6.44921875,231.0205078125,48,5289 +aten::silu,"(1, 512, 128, 128)","('c10::BFloat16', None)","(8388608, 16384, 128, 1)",None,nan,nan,1,0.008388608,32.0,0.25,1.5712199540858873,1.528658727505411,0.23950682265366277,1.3960563289452301,2.221846058262472,0.39280498852147183,0.3821646818763528,0.05987670566341569,0.34901408223630753,0.555461514565618,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(217.03300000000002), 'mean_duration_us': np.float64(21.703300000000002), 'median_duration_us': np.float64(21.9515), 'std_dev_duration_us': np.float64(2.425225888448332), 'min_duration_us': np.float64(15.102), 'max_duration_us': np.float64(24.035)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(21.7)}]","[[1, 512, 128, 128]]",['c10::BFloat16'],"[[8388608, 16384, 128, 1]]",[''],21.7033203125,21.951416015625,2.556412588605594,15.10205078125,24.03515625,217.033203125,10,26758 +aten::silu,"(1, 512, 512, 512)","('c10::BFloat16', None)","(134217728, 262144, 512, 1)",None,nan,nan,1,0.134217728,512.0,0.25,2.650166378496158,2.650166378496158,,2.650166378496158,2.650166378496158,0.6625415946240395,0.6625415946240395,,0.6625415946240395,0.6625415946240395,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.58), 'mean_duration_us': np.float64(202.58), 'median_duration_us': np.float64(202.58), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.58), 'max_duration_us': np.float64(202.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.58)}]","[[1, 512, 512, 512]]",['c10::BFloat16'],"[[134217728, 262144, 512, 1]]",[''],202.580078125,202.580078125,,202.580078125,202.580078125,202.580078125,1,27132 +aten::upsample_nearest2d,"(1, 512, 512, 512)","('c10::BFloat16', 'c10::BFloat16')","(33554432, 65536, 256, 1)",None,"(1, 512, 256, 256)","(1, 512, 512, 512)",1,0.134217728,320.0,0.4,2.1035136394552616,2.1035136394552616,,2.1035136394552616,2.1035136394552616,0.8414054557821047,0.8414054557821047,,0.8414054557821047,0.8414054557821047,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(159.516), 'mean_duration_us': np.float64(159.516), 'median_duration_us': np.float64(159.516), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(159.516), 'max_duration_us': np.float64(159.516)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(159.52)}]","[[1, 512, 256, 256], [], [], []]","['c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar']","[[33554432, 65536, 256, 1], [], [], []]","['', '[512, 512]', '2.', '2.']",159.51611328125,159.51611328125,,159.51611328125,159.51611328125,159.51611328125,1,27119 +aten::sigmoid,"(1, 77, 3072)","('c10::BFloat16', None)","(236544, 3072, 1)",None,nan,nan,1,0.000236544,0.90234375,0.25,0.1554287062821396,0.1564482841918295,0.009436700801585865,0.13654911197237685,0.174983605562579,0.03885717657053489,0.03911207104795737,0.002359175200396465,0.03413727799309421,0.04374590139064475,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(146.634), 'mean_duration_us': np.float64(6.109749999999999), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.37528314310664157), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(6.929)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.11)}]","[[1, 77, 3072]]",['c10::BFloat16'],"[[236544, 3072, 1]]",[''],6.109761555989583,6.0478515625,0.38336007029338576,5.4072265625,6.92919921875,146.63427734375,24,155 +aten::upsample_nearest2d,"(1, 512, 256, 256)","('c10::BFloat16', 'c10::BFloat16')","(512, 1, 65536, 512)",None,"(1, 512, 128, 128)","(1, 512, 256, 256)",2,0.033554432,80.0,0.4,0.8692770061831465,0.8692770061831465,,0.8692770061831465,0.8692770061831465,0.34771080247325864,0.34771080247325864,,0.34771080247325864,0.34771080247325864,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.487), 'mean_duration_us': np.float64(32.487), 'median_duration_us': np.float64(32.487), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.487), 'max_duration_us': np.float64(32.487)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.014), 'mean_duration_us': np.float64(64.014), 'median_duration_us': np.float64(64.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.014), 'max_duration_us': np.float64(64.014)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(32.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}]","[[1, 512, 128, 128], [], [], []]","['c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar']","[[512, 1, 65536, 512], [], [], []]","['', '[256, 256]', '2.', '2.']",96.5009765625,96.5009765625,,96.5009765625,96.5009765625,96.5009765625,1,27017 +aten::copy_,"(1, 77)","('int', 'long int')","(77, 1)","(77, 1)",nan,nan,1,7.7e-08,0.000881195068359375,0.08333333333333333,0.000204408392642626,0.0002126285554446636,1.991845552618759e-05,0.000174764684152198,0.00021761177552897883,1.7034032720218834e-05,1.7719046287055302e-05,1.659871293848969e-06,1.4563723679349833e-05,1.8134314627414904e-05,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.224), 'mean_duration_us': np.float64(4.556), 'median_duration_us': np.float64(4.3454999999999995), 'std_dev_duration_us': np.float64(0.42424108711910485), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.56)}]","[[1, 77], [1, 77], []]","['int', 'long int', 'Scalar']","[[77, 1], [77, 1], []]","['', '', 'False']",4.55615234375,4.345703125,0.48984807208769054,4.24609375,5.287109375,18.224609375,4,1401 +aten::copy_,"(256, 256)","('long int', 'bool')","(256, 1)","(256, 1)",nan,nan,1,6.5536e-05,,,,,,,,0.008676379506827888,0.008676379506827888,0.0005844485318503793,0.008263111986701963,0.009089647026953813,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(15.141), 'mean_duration_us': np.float64(7.5705), 'median_duration_us': np.float64(7.5705), 'std_dev_duration_us': np.float64(0.36050000000000004), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(7.931)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]","[[256, 256], [256, 256], []]","['long int', 'bool', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",7.570556640625,7.570556640625,0.5099593338928372,7.2099609375,7.93115234375,15.14111328125,2,5171 +aten::copy_,"(1, 77)","('long int', 'long int')","(77, 1)","(77, 1)",nan,nan,1,7.7e-08,0.0011749267578125,0.0625,0.00034795994099494283,0.00033264928894099143,4.661040970475972e-05,0.0003107310344827586,0.00041581015161502974,2.1747496312183927e-05,2.0790580558811965e-05,2.9131506065474824e-06,1.9420689655172414e-05,2.598813447593936e-05,python3,CPU,thread 416 (python3),,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.337000000000002), 'mean_duration_us': np.float64(3.5842500000000004), 'median_duration_us': np.float64(3.7045000000000003), 'std_dev_duration_us': np.float64(0.3765510423568098), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.965)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.58)}]","[[1, 77], [1, 77], []]","['long int', 'long int', 'Scalar']","[[77, 1], [77, 1], []]","['', '', 'False']",3.584228515625,3.70458984375,0.4348311081041389,2.962890625,3.96484375,14.3369140625,4,25 +aten::copy_,"(1, 16, 128, 128)","('float', 'c10::BFloat16')","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",nan,nan,1,0.000262144,1.5,0.16666666666666666,0.442202039589035,0.44890337639244104,0.02304089823211664,0.4090445043809524,0.46195690119030547,0.07370033993150582,0.07481722939874016,0.003840149705352772,0.06817408406349205,0.07699281686505091,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.258000000000001), 'mean_duration_us': np.float64(3.5645000000000002), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.16751193987295365), 'min_duration_us': np.float64(3.405), 'max_duration_us': np.float64(3.845)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.56)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['float', 'c10::BFloat16', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', 'False']",3.564453125,3.50390625,0.19360992946960456,3.40478515625,3.84521484375,14.2578125,4,20477 +aten::copy_,"(1, 16, 128, 128)","('c10::BFloat16', 'float')","(262144, 16384, 128, 1)","(262144, 16384, 128, 1)",nan,nan,1,0.000262144,1.5,0.16666666666666666,0.4649342648875561,0.4676212078152885,0.010455401439686662,0.451341666246322,0.47315297767332554,0.07748904414792601,0.07793686796921476,0.0017425669066144418,0.07522361104105366,0.07885882961222092,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536999999999999), 'mean_duration_us': np.float64(3.3842499999999998), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0667097256777451), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.485)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]","[[1, 16, 128, 128], [1, 16, 128, 128], []]","['c10::BFloat16', 'float', 'Scalar']","[[262144, 16384, 128, 1], [262144, 16384, 128, 1], []]","['', '', 'False']",3.38427734375,3.364013671875,0.07683981154707822,3.32421875,3.48486328125,13.537109375,4,20488 +aten::copy_,"(256, 256)","('float', 'long int')","(256, 1)","(256, 1)",nan,nan,1,6.5536e-05,0.75,0.08333333333333333,0.11866382322961364,0.11866382322961364,0.0025340510883724607,0.11687197852115232,0.12045566793807495,0.009888651935801136,0.009888651935801136,0.00021117092403103737,0.00973933154342936,0.010037972328172912,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.258), 'mean_duration_us': np.float64(6.629), 'median_duration_us': np.float64(6.629), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.63)}]","[[256, 256], [256, 256], []]","['float', 'long int', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",6.62890625,6.62890625,0.14155946303051,6.52880859375,6.72900390625,13.2578125,2,5182 +aten::copy_,"(256, 256)","('long int', 'float')","(256, 1)","(256, 1)",nan,nan,1,6.5536e-05,0.75,0.08333333333333333,0.14182547560451392,0.14182547560451392,0.0036194682899149014,0.13926612503242541,0.14438482617660242,0.011818789633709493,0.011818789633709493,0.00030162235749290847,0.011605510419368784,0.012032068848050201,python3,CPU,thread 416 (python3),,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.094000000000001), 'mean_duration_us': np.float64(5.547000000000001), 'median_duration_us': np.float64(5.547000000000001), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(5.447), 'max_duration_us': np.float64(5.647)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.55)}]","[[256, 256], [256, 256], []]","['long int', 'float', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",5.546875,5.546875,0.14155946303051,5.44677734375,5.64697265625,11.09375,2,5190 +aten::copy_,"(1, 77, 2048)","('c10::BFloat16', 'c10::BFloat16')","(315392, 4096, 1)","(157696, 2048, 1)",nan,nan,1,0.000157696,0.6015625,0.25,0.13146708067116858,0.13146708067116858,0.007753461466496543,0.1259845554905403,0.13694960585179689,0.032866770167792145,0.032866770167792145,0.0019383653666241358,0.031496138872635075,0.03423740146294922,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.613), 'mean_duration_us': np.float64(4.8065), 'median_duration_us': np.float64(4.8065), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","[[1, 77, 2048], [1, 77, 2048], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[315392, 4096, 1], [157696, 2048, 1], []]","['', '', 'False']",4.806396484375,4.806396484375,0.28346419304402126,4.60595703125,5.0068359375,9.61279296875,2,9179 +aten::copy_,"(1, 1, 1, 1, 256, 4096)","('c10::BFloat16', 'c10::BFloat16')","(1048576, 1048576, 4096, 1048576, 4096, 1)","(1048576, 1048576, 1048576, 1048576, 4096, 1)",nan,nan,1,0.001048576,4.0,0.25,1.286461166118709,1.286461166118709,0.05593962523760452,1.2469058777761648,1.3260164544612534,0.32161529152967727,0.32161529152967727,0.01398490630940113,0.3117264694440412,0.33150411361531334,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.526999999999999), 'mean_duration_us': np.float64(3.2634999999999996), 'median_duration_us': np.float64(3.2634999999999996), 'std_dev_duration_us': np.float64(0.10050000000000003), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(3.364)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.26)}]","[[1, 1, 1, 1, 256, 4096], [1, 1, 1, 1, 256, 4096], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1048576, 1048576, 4096, 1048576, 4096, 1], [1048576, 1048576, 1048576, 1048576, 4096, 1], []]","['', '', 'False']",3.263427734375,3.263427734375,0.14190473001351125,3.1630859375,3.36376953125,6.52685546875,2,9170 +aten::copy_,"(1, 1, 1, 1, 77, 768)","('c10::BFloat16', 'c10::BFloat16')","(59136, 59136, 768, 59136, 768, 1)","(59136, 59136, 59136, 59136, 768, 1)",nan,nan,1,5.9136e-05,0.2255859375,0.25,0.07881544776038232,0.07881544776038232,0.009602730785797826,0.07202529170383586,0.08560560381692879,0.01970386194009558,0.01970386194009558,0.002400682696449453,0.018006322925958964,0.021401400954232194,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.047), 'mean_duration_us': np.float64(3.0235), 'median_duration_us': np.float64(3.0235), 'std_dev_duration_us': np.float64(0.26049999999999995), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.284)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.02)}]","[[1, 1, 1, 1, 77, 768], [1, 1, 1, 1, 77, 768], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[59136, 59136, 768, 59136, 768, 1], [59136, 59136, 59136, 59136, 768, 1], []]","['', '', 'False']",3.023681640625,3.023681640625,0.36839987086232723,2.76318359375,3.2841796875,6.04736328125,2,1431 +aten::copy_,"(1, 1, 1, 1, 77, 1280)","('c10::BFloat16', 'c10::BFloat16')","(98560, 98560, 1280, 98560, 1280, 1)","(98560, 98560, 98560, 98560, 1280, 1)",nan,nan,1,9.856e-05,0.3759765625,0.25,0.13245858379797232,0.13245858379797232,0.008800490467240142,0.12623569731081927,0.1386814702851254,0.03311464594949308,0.03311464594949308,0.0022001226168100354,0.03155892432770482,0.03467036757128135,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.966), 'mean_duration_us': np.float64(2.983), 'median_duration_us': np.float64(2.983), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.123)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.98)}]","[[1, 1, 1, 1, 77, 1280], [1, 1, 1, 1, 77, 1280], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[98560, 98560, 1280, 98560, 1280, 1], [98560, 98560, 98560, 98560, 1280, 1], []]","['', '', 'False']",2.98291015625,2.98291015625,0.198183248242714,2.8427734375,3.123046875,5.9658203125,2,5032 +aten::copy_,"(1, 256)","('long int', 'long int')","(256, 1)","(256, 1)",nan,nan,1,2.56e-07,0.00390625,0.0625,0.001441005046664297,0.001441005046664297,2.8525194290411314e-05,0.0014208346883468833,0.0014611754049817106,9.006281541651856e-05,9.006281541651856e-05,1.782824643150707e-06,8.880216802168021e-05,9.132346281135691e-05,python3,CPU,thread 416 (python3),,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.686), 'mean_duration_us': np.float64(2.843), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(2.883)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","[[1, 256], [1, 256], []]","['long int', 'long int', 'Scalar']","[[256, 1], [256, 1], []]","['', '', 'False']",2.843017578125,2.843017578125,0.05627851822920276,2.80322265625,2.8828125,5.68603515625,2,5072 +aten::copy_,"(1,)","('float', 'float')","(1,)","(1,)",nan,nan,1,1e-09,7.62939453125e-06,0.125,4.745146984886265e-06,4.755878084179971e-06,6.621960788630501e-07,4.077650572424091e-06,5.401912298054731e-06,5.931433731107831e-07,5.944847605224964e-07,8.277450985788126e-08,5.097063215530114e-07,6.752390372568414e-07,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.125), 'mean_duration_us': np.float64(1.7083333333333333), 'median_duration_us': np.float64(1.682), 'std_dev_duration_us': np.float64(0.19724829248662426), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.962)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.71)}]","[[1], [1], []]","['float', 'float', 'Scalar']","[[1], [1], []]","['', '', 'False']",1.7083333333333333,1.68212890625,0.24154693224356558,1.48095703125,1.9619140625,5.125,3,20500 +aten::copy_,"(1, 1, 1, 768)","('c10::BFloat16', 'c10::BFloat16')","(768, 768, 768, 1)","(768, 768, 768, 1)",nan,nan,1,7.68e-07,0.0029296875,0.25,0.00204703168771126,0.00204703168771126,3.8611756340311866e-05,0.0020197290529695025,0.0020743343224530167,0.000511757921927815,0.000511757921927815,9.652939085077967e-06,0.0005049322632423756,0.0005185835806132542,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.002), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.501), 'std_dev_duration_us': np.float64(0.019999999999999907), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.521)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.5)}]","[[1, 1, 1, 768], [1, 1, 1, 768], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[768, 768, 768, 1], [768, 768, 768, 1], []]","['', '', 'False']",1.5009765625,1.5009765625,0.028311892606102,1.48095703125,1.52099609375,3.001953125,2,1445 +aten::copy_,"(1, 1, 1, 1280)","('c10::BFloat16', 'c10::BFloat16')","(1280, 1280, 1280, 1)","(1280, 1280, 1280, 1)",nan,nan,1,1.28e-06,0.0048828125,0.25,0.0035632188356983976,0.0035632188356983976,0.00028165994123286267,0.003364055181264036,0.003762382490132759,0.0008908047089245995,0.0008908047089245995,7.041498530821571e-05,0.0008410137953160091,0.0009405956225331899,python3,CPU,thread 416 (python3),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(2.883), 'mean_duration_us': np.float64(1.4415), 'median_duration_us': np.float64(1.4415), 'std_dev_duration_us': np.float64(0.08050000000000002), 'min_duration_us': np.float64(1.361), 'max_duration_us': np.float64(1.522)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.44)}]","[[1, 1, 1, 1280], [1, 1, 1, 1280], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1280, 1280, 1280, 1], [1280, 1280, 1280, 1], []]","['', '', 'False']",1.44140625,1.44140625,0.1139381043904105,1.36083984375,1.52197265625,2.8828125,2,5046 +aten::copy_,"(4,)","('float', 'double')","(1,)","(1,)",nan,nan,1,4e-09,4.57763671875e-05,0.08333333333333333,1.8167436703012383e-05,1.8167436703012383e-05,,1.8167436703012383e-05,1.8167436703012383e-05,1.513953058584365e-06,1.513953058584365e-06,,1.513953058584365e-06,1.513953058584365e-06,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]","[[4], [4], []]","['float', 'double', 'Scalar']","[[1], [1], []]","['', '', 'False']",2.64208984375,2.64208984375,,2.64208984375,2.64208984375,2.64208984375,1,18372 +aten::copy_,"(4,)","('float', 'float')","(1,)","(1,)",nan,nan,1,4e-09,3.0517578125e-05,0.125,1.211162446867492e-05,1.211162446867492e-05,,1.211162446867492e-05,1.211162446867492e-05,1.513953058584365e-06,1.513953058584365e-06,,1.513953058584365e-06,1.513953058584365e-06,python3,CPU,thread 416 (python3),vector_fp32,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]","[[4], [4], []]","['float', 'float', 'Scalar']","[[1], [1], []]","['', '', 'False']",2.64208984375,2.64208984375,,2.64208984375,2.64208984375,2.64208984375,1,18380 +aten::copy_,"(4,)","('float', 'double')","(1,)","(1,)",nan,nan,0,4e-09,4.57763671875e-05,0.08333333333333333,,,,,,,,,,,python3,CPU,thread 416 (python3),vector_fp32,[],,"[[4], [4], []]","['float', 'double', 'Scalar']","[[1], [1], []]","['', '', 'False']",0.0,0.0,,0.0,0.0,0.0,1,18376 +aten::copy_,"(1, 1024, 1024, 3)","('float', 'c10::BFloat16')","(3145728, 1024, 1, 1048576)","(3145728, 1024, 1, 1048576)",nan,nan,0,0.003145728,18.0,0.16666666666666666,,,,,,,,,,,python3,CPU,thread 416 (python3),vector_fp32,[],,"[[1, 1024, 1024, 3], [1, 1024, 1024, 3], []]","['float', 'c10::BFloat16', 'Scalar']","[[3145728, 1024, 1, 1048576], [3145728, 1024, 1, 1048576], []]","['', '', 'False']",0.0,0.0,,0.0,0.0,0.0,1,27354 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/gpu_timeline.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/gpu_timeline.csv index 8bdcc4cc0..2331f2fcc 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/gpu_timeline.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/gpu_timeline.csv @@ -1,9 +1,9 @@ type,time ms,percent -computation_time,712.0140288085937,60.771305422338564 +computation_time,712.0159106445312,60.771466039435815 exposed_comm_time,0.0,0.0 exposed_memcpy_time,0.47383935546875,0.040442793297906295 -busy_time,712.4878681640625,60.81174821563646 -idle_time,459.14078759765624,39.18825178436354 +busy_time,712.48975,60.81190883273372 +idle_time,459.1389057617188,39.18809116726628 total_time,1171.6286557617188,100.0 total_comm_time,0.0,0.0 total_memcpy_time,0.47383935546875,0.040442793297906295 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary.csv index 9704d39a6..f52c15efe 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary.csv @@ -1,101 +1,101 @@ name,parent_module,total_direct_kernel_time_sum,total_subtree_kernel_time_sum,total_subtree_kernel_time_count,total_direct_kernel_time_ms,Count,Categories,call_stack_first,Percentage (%),Cumulative Percentage (%) -aten::mm,nn.Module: SD3Transformer2DModel,322808.982421875,322808.982421875,1840,322.808982421875,1840,['GEMM'],"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']",45.30728086404518,45.30728086404518 -aten::_flash_attention_forward,nn.Module: SD3Transformer2DModel,204565.19189453125,204565.19189453125,152,204.56519189453124,152,['other'],"['aten::_flash_attention_forward', 'nn.Module: SD3Transformer2DModel_0']",28.71138384885527,74.01866471290046 -aten::miopen_convolution,nn.Module: Conv2d,33584.0244140625,37165.14599609375,35,33.5840244140625,35,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",4.713626043665412,78.73229075656587 -aten::addmm,nn.Module: SD3Transformer2DModel,31277.978515625,31277.978515625,304,31.277978515625,304,['GEMM'],"['aten::addmm', 'nn.Module: SD3Transformer2DModel_0']",4.389965071092652,83.12225582765852 -triton_poi_fused_addmm_gelu_view_15,nn.Module: SD3Transformer2DModel,21076.177734375,21076.177734375,152,21.076177734375,152,['triton'],"['triton_poi_fused_addmm_gelu_view_15', 'nn.Module: SD3Transformer2DModel_0']",2.958109458379046,86.08036528603756 -aten::mm,nn.Module: Linear,15631.6513671875,15631.6513671875,343,15.6316513671875,343,['GEMM'],"['aten::mm', 'nn.Module: Linear_72', 'nn.Module: CLIPTextModelWithProjection_0']",2.1939526389523643,88.27431792498993 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19,nn.Module: SD3Transformer2DModel,10034.64990234375,10034.64990234375,148,10.03464990234375,148,['triton'],"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'nn.Module: SD3Transformer2DModel_0']",1.408395448252072,89.682713373242 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,nn.Module: SD3Transformer2DModel,9653.2783203125,9653.2783203125,148,9.6532783203125,148,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: SD3Transformer2DModel_0']",1.3548687178277201,91.03758209106971 -triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8,nn.Module: SD3Transformer2DModel,6847.71875,6847.71875,304,6.84771875,304,['triton'],"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'nn.Module: SD3Transformer2DModel_0']",0.9610993918340681,91.99868148290378 -aten::addmm,nn.Module: Linear,4827.85302734375,4827.85302734375,529,4.82785302734375,529,['GEMM'],"['aten::addmm', 'nn.Module: Linear_0', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.6776047290850464,92.67628621198882 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20,nn.Module: SD3Transformer2DModel,4379.2470703125,4379.2470703125,144,4.3792470703125,144,['triton'],"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'nn.Module: SD3Transformer2DModel_0']",0.6146414374814194,93.29092764947025 -triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10,nn.Module: SD3Transformer2DModel,3977.47802734375,3977.47802734375,152,3.97747802734375,152,['triton'],"['triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'nn.Module: SD3Transformer2DModel_0']",0.5582518576881457,93.8491795071584 -aten::add_,nn.Module: Conv2d,3581.12158203125,3581.12158203125,35,3.58112158203125,35,['elementwise'],"['aten::add_', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",0.5026219534168354,94.35180146057523 -triton_poi_fused__unsafe_view_clone_slice_transpose_11,nn.Module: SD3Transformer2DModel,3575.7978515625,3575.7978515625,152,3.5757978515625,152,['triton'],"['triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'nn.Module: SD3Transformer2DModel_0']",0.5018747506909926,94.85367621126622 -aiter::_groupnorm_run,nn.Module: GroupNorm,3340.943359375,3593.11328125,30,3.340943359375,30,['NORM_fwd'],"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.46891216594539326,95.32258837721162 -triton_poi_fused_addmm_gelu_view_17,nn.Module: SD3Transformer2DModel,3220.39697265625,3220.39697265625,148,3.22039697265625,148,['triton'],"['triton_poi_fused_addmm_gelu_view_17', 'nn.Module: SD3Transformer2DModel_0']",0.4519930921351283,95.77458146934674 -aten::_flash_attention_forward,nn.Module: Attention,2961.35888671875,2961.35888671875,1,2.96135888671875,1,['other'],"['aten::_flash_attention_forward', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.4156362620803904,96.19021773142714 -aten::silu,nn.Module: SiLU,2588.7802734375,2588.7802734375,29,2.5887802734375,29,['elementwise'],"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.3633436531535139,96.55356138458066 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18,nn.Module: SD3Transformer2DModel,1995.73193359375,1995.73193359375,144,1.99573193359375,144,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'nn.Module: SD3Transformer2DModel_0']",0.28010740768825854,96.83366879226892 -triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9,nn.Module: SD3Transformer2DModel,1591.17578125,1591.17578125,304,1.59117578125,304,['triton'],"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'nn.Module: SD3Transformer2DModel_0']",0.22332664811335498,97.05699544038228 -aten::add_,nn.Module: T5Attention,1359.84814453125,1359.84814453125,50,1.35984814453125,50,['elementwise'],"['aten::add_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.19085906889731274,97.24785450927959 -aten::copy_,nn.Module: T5Attention,1230.19921875,1230.19921875,150,1.23019921875,150,['elementwise'],"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.17266242439869053,97.42051693367829 -aten::_flash_attention_forward,nn.Module: CLIPAttention,1195.17626953125,1362.69384765625,88,1.19517626953125,88,['other'],"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.1677468406220677,97.58826377430036 -aten::add,nn.Module: ResnetBlock2D,1154.9052734375,1154.9052734375,14,1.1549052734375,14,['elementwise'],"['aten::add', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.16209467655585874,97.75035845085621 -aten::mul,nn.Module: NewGELUActivation,1144.47119140625,1144.47119140625,192,1.14447119140625,192,['elementwise'],"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.16063021952123227,97.91098867037745 -aten::mul,nn.Module: T5LayerNorm,1068.99267578125,1068.99267578125,196,1.06899267578125,196,['elementwise'],"['aten::mul', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.15003656664030376,98.06102523701776 -aten::native_layer_norm,nn.Module: LayerNorm,848.966796875,848.966796875,180,0.848966796875,180,['NORM_fwd'],"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.11915522555068128,98.18018046256844 -aten::mean,nn.Module: T5LayerNorm,794.798828125,794.798828125,98,0.794798828125,98,['reduce'],"['aten::mean', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.11155257659222167,98.29173303916066 -triton_poi_fused__unsafe_view_clone_slice_transpose_13,nn.Module: SD3Transformer2DModel,776.6796875,776.6796875,148,0.7766796875,148,['triton'],"['triton_poi_fused__unsafe_view_clone_slice_transpose_13', 'nn.Module: SD3Transformer2DModel_0']",0.10900949682054685,98.40074253598121 -aten::bmm,nn.Module: T5Attention,758.4736328125,758.4736328125,96,0.7584736328125,96,['GEMM'],"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.10645421838013863,98.50719675436135 -aten::add,nn.Module: NewGELUActivation,723.099609375,723.099609375,96,0.723099609375,96,['elementwise'],"['aten::add', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.10148936020565456,98.60868611456699 -aten::copy_,nn.Module: T5LayerNorm,692.912109375,692.912109375,196,0.692912109375,196,['elementwise'],"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.09725244730805771,98.70593856187504 -aten::div,nn.Module: ResnetBlock2D,670.7421875,670.7421875,14,0.6707421875,14,['elementwise'],"['aten::div', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.09414082733519137,98.80007938921024 -aten::add,nn.Module: CLIPEncoderLayer,595.9111328125,595.9111328125,176,0.5959111328125,176,['elementwise'],"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.08363804768314181,98.88371743689338 -aten::upsample_nearest2d,nn.Module: Upsample2D,574.2900390625,638.30419921875,3,0.5742900390625,3,['elementwise'],"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']",0.08060345750609747,98.96432089439948 -aten::_softmax,nn.Module: T5Attention,567.8740234375,567.8740234375,48,0.5678740234375,48,['other'],"['aten::_softmax', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.07970294903892579,99.04402384343841 -aten::copy_,NA,496.5087890625,496.5087890625,28,0.4965087890625,28,['elementwise'],['aten::copy_'],0.06968660843558132,99.11371045187398 -aten::tanh,nn.Module: NewGELUActivation,461.7587890625,461.7587890625,48,0.4617587890625,48,['elementwise'],"['aten::tanh', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.06480933396132901,99.17851978583532 -aten::pow,nn.Module: T5LayerNorm,441.5234375,441.5234375,98,0.4415234375,98,['elementwise'],"['aten::pow', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.06196923716555052,99.24048902300088 -aten::add,nn.Module: T5LayerSelfAttention,435.95751953125,435.95751953125,48,0.43595751953125,48,['elementwise'],"['aten::add', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.061188042643686734,99.30167706564457 -triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12,nn.Module: SD3Transformer2DModel,434.0,434.0,4,0.434,4,['triton'],"['triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'nn.Module: SD3Transformer2DModel_0']",0.0609132984697985,99.36259036411437 -aten::gelu,nn.Module: GELUActivation,336.87744140625,336.87744140625,64,0.33687744140625,64,['elementwise'],"['aten::gelu', 'nn.Module: GELUActivation_0', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']",0.04728183441502526,99.4098721985294 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24,nn.Module: SD3Transformer2DModel,321.39404296875,321.39404296875,4,0.32139404296875,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'nn.Module: SD3Transformer2DModel_0']",0.045108689552467086,99.45498088808186 -triton_poi_fused_add_addmm_silu_3,nn.Module: SD3Transformer2DModel,296.0048828125,296.0048828125,72,0.2960048828125,72,['triton'],"['triton_poi_fused_add_addmm_silu_3', 'nn.Module: SD3Transformer2DModel_0']",0.041545239113538114,99.4965261271954 -aten::rsqrt,nn.Module: T5LayerNorm,283.32080078125,283.32080078125,98,0.28332080078125,98,['elementwise'],"['aten::rsqrt', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.03976498732878019,99.53629111452418 -aten::mul,nn.Module: QuickGELUActivation,277.0849609375,277.0849609375,48,0.2770849609375,48,['elementwise'],"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.03888976711308387,99.57518088163727 -aten::copy_,nn.Module: GroupNorm,252.169921875,252.169921875,4,0.252169921875,4,['elementwise'],"['aten::copy_', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.03539286109741393,99.61057374273469 -aten::pow,nn.Module: NewGELUActivation,231.0205078125,231.0205078125,48,0.2310205078125,48,['elementwise'],"['aten::pow', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.03242447268439454,99.64299821541908 -aten::mul,nn.Module: T5DenseGatedActDense,224.1689453125,224.1689453125,48,0.2241689453125,48,['elementwise'],"['aten::mul', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.03146283380986233,99.67446104922895 -aten::add,nn.Module: T5LayerNorm,193.9423828125,193.9423828125,98,0.1939423828125,98,['elementwise'],"['aten::add', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.027220438364520122,99.70168148759348 -aten::add,nn.Module: T5LayerFF,186.1904296875,186.1904296875,48,0.1861904296875,48,['elementwise'],"['aten::add', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.026132426764457883,99.72781391435794 -aten::miopen_convolution,nn.Module: SD3Transformer2DModel,172.27978515625,172.27978515625,4,0.17227978515625,4,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: SD3Transformer2DModel_0']",0.024180022980496357,99.75199393733844 -aten::fill_,nn.Module: CLIPAttention,167.517578125,167.517578125,88,0.167517578125,88,['elementwise'],"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.02351163187849289,99.77550556921693 -triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4,nn.Module: SD3Transformer2DModel,152.7431640625,152.7431640625,4,0.1527431640625,4,['triton'],"['triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'nn.Module: SD3Transformer2DModel_0']",0.02143799525751259,99.79694356447445 -aten::sigmoid,nn.Module: QuickGELUActivation,146.63427734375,146.63427734375,24,0.14663427734375,24,['elementwise'],"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.02058059332198861,99.81752415779644 -triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7,nn.Module: SD3Transformer2DModel,135.47802734375,135.47802734375,4,0.13547802734375,4,['triton'],"['triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'nn.Module: SD3Transformer2DModel_0']",0.019014777685920203,99.83653893548237 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14,nn.Module: SD3Transformer2DModel,115.1669921875,115.1669921875,4,0.1151669921875,4,['triton'],"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'nn.Module: SD3Transformer2DModel_0']",0.016164058453885116,99.85270299393625 -aten::gather,nn.Module: Embedding,106.4677734375,106.4677734375,12,0.1064677734375,12,['other'],"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.014943095070998438,99.86764608900725 -aten::add,nn.Module: Attention,92.93798828125,92.93798828125,1,0.09293798828125,1,['elementwise'],"['aten::add', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.013044146127553956,99.88069023513481 -aten::mul,NA,83.0341796875,83.0341796875,10,0.0830341796875,10,['elementwise'],['aten::mul'],0.011654114678570433,99.89234434981337 -aten::cat,NA,69.00927734375,69.00927734375,13,0.06900927734375,13,['other'],['aten::cat'],0.009685674442453796,99.90203002425582 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23,nn.Module: SD3Transformer2DModel,67.8974609375,67.8974609375,4,0.0678974609375,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'nn.Module: SD3Transformer2DModel_0']",0.009529627427252125,99.91155965168308 -aten::copy_,nn.Module: Upsample2D,64.01416015625,64.01416015625,1,0.06401416015625,1,['elementwise'],"['aten::copy_', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']",0.008984593649518756,99.9205442453326 -aten::add_,nn.Module: Linear,59.52490234375,59.52490234375,3,0.05952490234375,3,['elementwise'],"['aten::add_', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.008354511849885836,99.92889875718248 -aten::sub,NA,49.6259765625,49.6259765625,8,0.0496259765625,8,['elementwise'],['aten::sub'],0.006965165719370479,99.93586392290185 -aten::add,NA,41.0126953125,41.0126953125,10,0.0410126953125,10,['elementwise'],['aten::add'],0.005756263941523545,99.94162018684337 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6,nn.Module: SD3Transformer2DModel,33.966796875,33.966796875,4,0.033966796875,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'nn.Module: SD3Transformer2DModel_0']",0.004767349391958281,99.94638753623532 -triton_poi_fused_addmm_silu_2,nn.Module: SD3Transformer2DModel,24.8701171875,24.8701171875,8,0.0248701171875,8,['triton'],"['triton_poi_fused_addmm_silu_2', 'nn.Module: SD3Transformer2DModel_0']",0.0034906010857627956,99.94987813732108 -triton_poi_fused__to_copy_cat_slice_1,nn.Module: SD3Transformer2DModel,24.39306640625,24.39306640625,4,0.02439306640625,4,['triton'],"['triton_poi_fused__to_copy_cat_slice_1', 'nn.Module: SD3Transformer2DModel_0']",0.0034236454714228607,99.95330178279251 -triton_poi_fused_addmm_clone_permute_view_25,nn.Module: SD3Transformer2DModel,23.78955078125,23.78955078125,4,0.02378955078125,4,['triton'],"['triton_poi_fused_addmm_clone_permute_view_25', 'nn.Module: SD3Transformer2DModel_0']",0.003338940108757395,99.95664072290127 -aten::argmax,nn.Module: CLIPTextTransformer,22.390625,22.390625,4,0.022390625,4,['reduce'],"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.003142596367627494,99.9597833192689 -aten::index,nn.Module: CLIPTextTransformer,22.30908203125,22.30908203125,4,0.02230908203125,4,['elementwise'],"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0031311515492091014,99.9629144708181 -aten::copy_,nn.Module: CLIPTextTransformer,18.224609375,18.224609375,4,0.018224609375,4,['elementwise'],"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0025578826505872417,99.9654723534687 -aten::nonzero,NA,17.4609375,17.4609375,1,0.0174609375,1,['other'],['aten::nonzero'],0.0024506988421658924,99.96792305231087 -aten::add,nn.Module: T5Attention,17.10009765625,17.10009765625,6,0.01710009765625,6,['elementwise'],"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0024000538073683368,99.97032310611823 -triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0,nn.Module: SD3Transformer2DModel,16.580078125,16.580078125,4,0.016580078125,4,['triton'],"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'nn.Module: SD3Transformer2DModel_0']",0.0023270673905085304,99.97265017350874 -aten::add,nn.Module: CLIPTextEmbeddings,15.8603515625,15.8603515625,4,0.0158603515625,4,['elementwise'],"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.002226051448300686,99.97487622495704 -triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5,nn.Module: SD3Transformer2DModel,13.97705078125,13.97705078125,4,0.01397705078125,4,['triton'],"['triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'nn.Module: SD3Transformer2DModel_0']",0.0019617241151285983,99.97683794907218 -triton_poi_fused_add_addmm_silu_22,nn.Module: SD3Transformer2DModel,13.29443359375,13.29443359375,4,0.01329443359375,4,['triton'],"['triton_poi_fused_add_addmm_silu_22', 'nn.Module: SD3Transformer2DModel_0']",0.0018659165932788243,99.97870386566545 -triton_poi_fused_add_addmm_silu_21,nn.Module: SD3Transformer2DModel,12.41357421875,12.41357421875,4,0.01241357421875,4,['triton'],"['triton_poi_fused_add_addmm_silu_21', 'nn.Module: SD3Transformer2DModel_0']",0.001742285141621462,99.98044615080707 -aten::mul,nn.Module: T5Attention,11.61279296875,11.61279296875,4,0.01161279296875,4,['elementwise'],"['aten::mul', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.001629892912842042,99.98207604371991 -aten::clamp,NA,10.89501953125,10.89501953125,1,0.01089501953125,1,['elementwise'],['aten::clamp'],0.0015291510980214643,99.98360519481794 -aten::div,nn.Module: T5Attention,9.8896484375,9.8896484375,4,0.0098896484375,4,['elementwise'],"['aten::div', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0013880440254258387,99.98499323884337 -aten::div,nn.Module: Attention,9.4931640625,9.4931640625,1,0.0094931640625,1,['elementwise'],"['aten::div', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.0013323961658106623,99.98632563500918 -aten::sub,nn.Module: T5Attention,8.009765625,8.009765625,2,0.008009765625,2,['elementwise'],"['aten::sub', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.001124196415181468,99.98744983142436 -aten::lt,nn.Module: T5Attention,7.9697265625,7.9697265625,2,0.0079697265625,2,['elementwise'],"['aten::lt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.001118576803742497,99.9885684082281 -aten::where,nn.Module: T5Attention,7.72998046875,7.72998046875,2,0.00772998046875,2,['elementwise'],"['aten::where', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0010849276669554879,99.98965333589506 -aten::fill_,NA,6.88671875,6.88671875,3,0.00688671875,3,['elementwise'],['aten::fill_'],0.0009665731675030131,99.99061990906256 -aten::gt,nn.Module: T5Attention,6.84814453125,6.84814453125,2,0.00684814453125,2,['elementwise'],"['aten::gt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0009611591516044923,99.99158106821416 -aten::abs,nn.Module: T5Attention,6.84765625,6.84765625,2,0.00684765625,2,['elementwise'],"['aten::abs', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0009610906197576755,99.99254215883391 -aten::minimum,nn.Module: T5Attention,6.64794921875,6.64794921875,2,0.00664794921875,2,['elementwise'],"['aten::minimum', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0009330610944096372,99.99347521992833 -aten::fill_,nn.Module: T5Attention,6.126953125,6.126953125,2,0.006126953125,2,['elementwise'],"['aten::fill_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0008599376138561975,99.99433515754218 -aten::log,nn.Module: T5Attention,6.0869140625,6.0869140625,2,0.0060869140625,2,['elementwise'],"['aten::log', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0008543180024172264,99.99518947554459 -aten::arange,nn.Module: T5Attention,6.00390625,6.00390625,4,0.00600390625,4,['other'],"['aten::arange', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0008426675884583841,99.99603214313305 -aten::arange,nn.Module: CLIPTextTransformer,5.84326171875,5.84326171875,4,0.00584326171875,4,['other'],"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0008201206108556833,99.9968522637439 -aten::_local_scalar_dense,NA,5.80810546875,5.80810546875,1,0.00580810546875,1,['other'],['aten::_local_scalar_dense'],0.0008151863178848795,99.99766745006178 -aten::normal_,NA,5.2470703125,5.2470703125,1,0.0052470703125,1,['elementwise'],['aten::normal_'],0.0007364432258924687,99.99840389328767 -aten::copy_,nn.Module: SD3Transformer2DModel,5.125,5.125,3,0.005125,3,['elementwise'],"['aten::copy_', 'nn.Module: SD3Transformer2DModel_0']",0.0007193102641882888,99.99912320355186 -aten::eq,NA,3.52392578125,3.52392578125,1,0.00352392578125,1,['elementwise'],['aten::eq'],0.0004945943384762652,99.99961779789034 -aten::div,NA,2.72314453125,2.72314453125,1,0.00272314453125,1,['elementwise'],['aten::div'],0.00038220210969684514,100.00000000000003 +aten::mm,nn.Module: SD3Transformer2DModel,322808.982421875,322808.982421875,1840,322.808982421875,1840,['GEMM'],"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']",45.30716119798377,45.30716119798377 +aten::_flash_attention_forward,nn.Module: SD3Transformer2DModel,204565.19189453125,204565.19189453125,152,204.56519189453124,152,['other'],"['aten::_flash_attention_forward', 'nn.Module: SD3Transformer2DModel_0']",28.711308016049646,74.01846921403342 +aten::miopen_convolution,nn.Module: Conv2d,33584.0244140625,37165.14599609375,35,33.5840244140625,35,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",4.713613593987283,78.73208280802069 +aten::addmm,nn.Module: SD3Transformer2DModel,31277.978515625,31277.978515625,304,31.277978515625,304,['GEMM'],"['aten::addmm', 'nn.Module: SD3Transformer2DModel_0']",4.38995347627125,83.12203628429194 +triton_poi_fused_addmm_gelu_view_15,nn.Module: SD3Transformer2DModel,21076.177734375,21076.177734375,152,21.076177734375,152,['triton'],"['triton_poi_fused_addmm_gelu_view_15', 'nn.Module: SD3Transformer2DModel_0']",2.95810164538958,86.08013792968151 +aten::mm,nn.Module: Linear,15631.6513671875,15631.6513671875,343,15.6316513671875,343,['GEMM'],"['aten::mm', 'nn.Module: Linear_72', 'nn.Module: CLIPTextModelWithProjection_0']",2.1939468442618364,88.27408477394334 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19,nn.Module: SD3Transformer2DModel,10034.64990234375,10034.64990234375,148,10.03464990234375,148,['triton'],"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'nn.Module: SD3Transformer2DModel_0']",1.4083917283833667,89.68247650232671 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,nn.Module: SD3Transformer2DModel,9653.2783203125,9653.2783203125,148,9.6532783203125,148,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: SD3Transformer2DModel_0']",1.3548651393343718,91.03734164166107 +triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8,nn.Module: SD3Transformer2DModel,6847.71875,6847.71875,304,6.84771875,304,['triton'],"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'nn.Module: SD3Transformer2DModel_0']",0.9610968533683588,91.99843849502943 +aten::addmm,nn.Module: Linear,4827.85302734375,4827.85302734375,529,4.82785302734375,529,['GEMM'],"['aten::addmm', 'nn.Module: Linear_0', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.6776029393883887,92.67604143441783 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20,nn.Module: SD3Transformer2DModel,4379.2470703125,4379.2470703125,144,4.3792470703125,144,['triton'],"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'nn.Module: SD3Transformer2DModel_0']",0.6146398140840623,93.29068124850188 +triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10,nn.Module: SD3Transformer2DModel,3977.47802734375,3977.47802734375,152,3.97747802734375,152,['triton'],"['triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'nn.Module: SD3Transformer2DModel_0']",0.5582503832275333,93.84893163172941 +aten::add_,nn.Module: Conv2d,3581.12158203125,3581.12158203125,35,3.58112158203125,35,['elementwise'],"['aten::add_', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",0.5026206258865046,94.35155225761592 +triton_poi_fused__unsafe_view_clone_slice_transpose_11,nn.Module: SD3Transformer2DModel,3575.7978515625,3575.7978515625,152,3.5757978515625,152,['triton'],"['triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'nn.Module: SD3Transformer2DModel_0']",0.5018734251341815,94.8534256827501 +aiter::_groupnorm_run,nn.Module: GroupNorm,3340.943359375,3593.11328125,30,3.340943359375,30,['NORM_fwd'],"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.4689109274497038,95.3223366101998 +triton_poi_fused_addmm_gelu_view_17,nn.Module: SD3Transformer2DModel,3220.39697265625,3220.39697265625,148,3.22039697265625,148,['triton'],"['triton_poi_fused_addmm_gelu_view_17', 'nn.Module: SD3Transformer2DModel_0']",0.4519918983262725,95.77432850852607 +aten::_flash_attention_forward,nn.Module: Attention,2961.35888671875,2961.35888671875,1,2.96135888671875,1,['other'],"['aten::_flash_attention_forward', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.4156351642975724,96.18996367282364 +aten::silu,nn.Module: SiLU,2588.7802734375,2588.7802734375,29,2.5887802734375,29,['elementwise'],"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.36334269348647835,96.55330636631011 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18,nn.Module: SD3Transformer2DModel,1995.73193359375,1995.73193359375,144,1.99573193359375,144,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'nn.Module: SD3Transformer2DModel_0']",0.28010666786566013,96.83341303417578 +triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9,nn.Module: SD3Transformer2DModel,1591.17578125,1591.17578125,304,1.59117578125,304,['triton'],"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'nn.Module: SD3Transformer2DModel_0']",0.22332605826068935,97.05673909243647 +aten::add_,nn.Module: T5Attention,1359.84814453125,1359.84814453125,50,1.35984814453125,50,['elementwise'],"['aten::add_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.190858564798355,97.24759765723483 +aten::copy_,nn.Module: T5Attention,1230.19921875,1230.19921875,150,1.23019921875,150,['elementwise'],"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.1726619683608995,97.42025962559573 +aten::_flash_attention_forward,nn.Module: CLIPAttention,1195.17626953125,1362.69384765625,88,1.19517626953125,88,['other'],"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.16774639756736764,97.5880060231631 +aten::add,nn.Module: ResnetBlock2D,1154.9052734375,1154.9052734375,14,1.1549052734375,14,['elementwise'],"['aten::add', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.1620942484297132,97.75010027159281 +aten::mul,nn.Module: NewGELUActivation,1144.47119140625,1144.47119140625,192,1.14447119140625,192,['elementwise'],"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.16062979526302587,97.91073006685583 +aten::mul,nn.Module: T5LayerNorm,1068.99267578125,1068.99267578125,196,1.06899267578125,196,['elementwise'],"['aten::mul', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.15003617036216355,98.06076623721799 +aten::native_layer_norm,nn.Module: LayerNorm,848.966796875,848.966796875,180,0.848966796875,180,['NORM_fwd'],"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.11915491083666033,98.17992114805465 +aten::mean,nn.Module: T5LayerNorm,794.798828125,794.798828125,98,0.794798828125,98,['reduce'],"['aten::mean', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.11155228195839623,98.29147343001304 +triton_poi_fused__unsafe_view_clone_slice_transpose_13,nn.Module: SD3Transformer2DModel,776.6796875,776.6796875,148,0.7766796875,148,['triton'],"['triton_poi_fused__unsafe_view_clone_slice_transpose_13', 'nn.Module: SD3Transformer2DModel_0']",0.10900920890353015,98.40048263891657 +aten::bmm,nn.Module: T5Attention,758.4736328125,758.4736328125,96,0.7584736328125,96,['GEMM'],"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.10645393721214992,98.50693657612872 +aten::add,nn.Module: NewGELUActivation,723.099609375,723.099609375,96,0.723099609375,96,['elementwise'],"['aten::add', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.10148909215090089,98.60842566827962 +aten::copy_,nn.Module: T5LayerNorm,692.912109375,692.912109375,196,0.692912109375,196,['elementwise'],"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.09725219044388243,98.7056778587235 +aten::div,nn.Module: ResnetBlock2D,670.7421875,670.7421875,14,0.6707421875,14,['elementwise'],"['aten::div', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.09414057868945913,98.79981843741297 +aten::add,nn.Module: CLIPEncoderLayer,595.9111328125,595.9111328125,176,0.5959111328125,176,['elementwise'],"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.08363782677746043,98.88345626419043 +aten::upsample_nearest2d,nn.Module: Upsample2D,574.2900390625,638.30419921875,3,0.5742900390625,3,['elementwise'],"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']",0.08060324461540722,98.96405950880583 +aten::_softmax,nn.Module: T5Attention,567.8740234375,567.8740234375,48,0.5678740234375,48,['other'],"['aten::_softmax', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.07970273852666787,99.0437622473325 +aten::copy_,NA,496.5087890625,496.5087890625,28,0.4965087890625,28,['elementwise'],['aten::copy_'],0.06968642437858637,99.11344867171108 +aten::tanh,nn.Module: NewGELUActivation,461.7587890625,461.7587890625,48,0.4617587890625,48,['elementwise'],"['aten::tanh', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.06480916278624213,99.17825783449733 +aten::pow,nn.Module: T5LayerNorm,441.5234375,441.5234375,98,0.4415234375,98,['elementwise'],"['aten::pow', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.06196907349175683,99.24022690798908 +aten::add,nn.Module: T5LayerSelfAttention,435.95751953125,435.95751953125,48,0.43595751953125,48,['elementwise'],"['aten::add', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.06118788103319214,99.30141478902227 +triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12,nn.Module: SD3Transformer2DModel,434.0,434.0,4,0.434,4,['triton'],"['triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'nn.Module: SD3Transformer2DModel_0']",0.060913137584961086,99.36232792660724 +aten::gelu,nn.Module: GELUActivation,336.87744140625,336.87744140625,64,0.33687744140625,64,['elementwise'],"['aten::gelu', 'nn.Module: GELUActivation_0', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']",0.047281709533752464,99.40960963614098 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24,nn.Module: SD3Transformer2DModel,321.39404296875,321.39404296875,4,0.32139404296875,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'nn.Module: SD3Transformer2DModel_0']",0.045108570410927105,99.45471820655192 +triton_poi_fused_add_addmm_silu_3,nn.Module: SD3Transformer2DModel,296.0048828125,296.0048828125,72,0.2960048828125,72,['triton'],"['triton_poi_fused_add_addmm_silu_3', 'nn.Module: SD3Transformer2DModel_0']",0.04154512938382049,99.49626333593574 +aten::rsqrt,nn.Module: T5LayerNorm,283.32080078125,283.32080078125,98,0.28332080078125,98,['elementwise'],"['aten::rsqrt', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0397648823010821,99.53602821823682 +aten::mul,nn.Module: QuickGELUActivation,277.0849609375,277.0849609375,48,0.2770849609375,48,['elementwise'],"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.038889664397026506,99.57491788263386 +aten::copy_,nn.Module: GroupNorm,252.169921875,252.169921875,4,0.252169921875,4,['elementwise'],"['aten::copy_', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.035392767617421106,99.61031065025128 +aten::pow,nn.Module: NewGELUActivation,231.0205078125,231.0205078125,48,0.2310205078125,48,['elementwise'],"['aten::pow', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.032424387044540065,99.64273503729582 +aten::mul,nn.Module: T5DenseGatedActDense,224.1689453125,224.1689453125,48,0.2241689453125,48,['elementwise'],"['aten::mul', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.03146275070989846,99.67419778800571 +aten::add,nn.Module: T5LayerNorm,193.9423828125,193.9423828125,98,0.1939423828125,98,['elementwise'],"['aten::add', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.027220366469615218,99.70141815447533 +aten::add,nn.Module: T5LayerFF,186.1904296875,186.1904296875,48,0.1861904296875,48,['elementwise'],"['aten::add', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.02613235774322053,99.72755051221856 +aten::miopen_convolution,nn.Module: SD3Transformer2DModel,172.27978515625,172.27978515625,4,0.17227978515625,4,['CONV_fwd'],"['aten::miopen_convolution', 'nn.Module: SD3Transformer2DModel_0']",0.024179959115968184,99.75173047133453 +aten::fill_,nn.Module: CLIPAttention,167.517578125,167.517578125,88,0.167517578125,88,['elementwise'],"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.02351156977932625,99.77524204111386 +triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4,nn.Module: SD3Transformer2DModel,152.7431640625,152.7431640625,4,0.1527431640625,4,['triton'],"['triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'nn.Module: SD3Transformer2DModel_0']",0.021437938635256556,99.79667997974911 +aten::sigmoid,nn.Module: QuickGELUActivation,146.63427734375,146.63427734375,24,0.14663427734375,24,['elementwise'],"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.020580538964311487,99.81726051871343 +triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7,nn.Module: SD3Transformer2DModel,135.47802734375,135.47802734375,4,0.13547802734375,4,['triton'],"['triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'nn.Module: SD3Transformer2DModel_0']",0.01901472746389162,99.83627524617732 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14,nn.Module: SD3Transformer2DModel,115.1669921875,115.1669921875,4,0.1151669921875,4,['triton'],"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'nn.Module: SD3Transformer2DModel_0']",0.016164015761205817,99.85243926193853 +aten::gather,nn.Module: Embedding,106.4677734375,106.4677734375,12,0.1064677734375,12,['other'],"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.014943055603140328,99.86738231754167 +aten::add,nn.Module: Attention,92.93798828125,92.93798828125,1,0.09293798828125,1,['elementwise'],"['aten::add', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.013044111675219542,99.88042642921688 +aten::mul,NA,83.0341796875,83.0341796875,10,0.0830341796875,10,['elementwise'],['aten::mul'],0.011654083897601539,99.89208051311448 +aten::cat,NA,69.00927734375,69.00927734375,13,0.06900927734375,13,['other'],['aten::cat'],0.009685648860549725,99.90176616197503 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23,nn.Module: SD3Transformer2DModel,67.8974609375,67.8974609375,4,0.0678974609375,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'nn.Module: SD3Transformer2DModel_0']",0.009529602257501055,99.91129576423253 +aten::copy_,nn.Module: Upsample2D,64.01416015625,64.01416015625,1,0.06401416015625,1,['elementwise'],"['aten::copy_', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']",0.008984569919316567,99.92028033415185 +aten::add_,nn.Module: Linear,59.52490234375,59.52490234375,3,0.05952490234375,3,['elementwise'],"['aten::add_', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.008354489783862249,99.92863482393572 +aten::sub,NA,49.6259765625,49.6259765625,8,0.0496259765625,8,['elementwise'],['aten::sub'],0.006965147322902342,99.93559997125863 +aten::add,NA,41.0126953125,41.0126953125,10,0.0410126953125,10,['elementwise'],['aten::add'],0.005756248738019357,99.94135621999665 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6,nn.Module: SD3Transformer2DModel,33.966796875,33.966796875,4,0.033966796875,4,['triton'],"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'nn.Module: SD3Transformer2DModel_0']",0.004767336800385486,99.94612355679703 +triton_poi_fused_addmm_silu_2,nn.Module: SD3Transformer2DModel,24.8701171875,24.8701171875,8,0.0248701171875,8,['triton'],"['triton_poi_fused_addmm_silu_2', 'nn.Module: SD3Transformer2DModel_0']",0.0034905918663509046,99.94961414866339 +triton_poi_fused__to_copy_cat_slice_1,nn.Module: SD3Transformer2DModel,24.39306640625,24.39306640625,4,0.02439306640625,4,['triton'],"['triton_poi_fused__to_copy_cat_slice_1', 'nn.Module: SD3Transformer2DModel_0']",0.003423636428854835,99.95303778509223 +triton_poi_fused_addmm_clone_permute_view_25,nn.Module: SD3Transformer2DModel,23.78955078125,23.78955078125,4,0.02378955078125,4,['triton'],"['triton_poi_fused_addmm_clone_permute_view_25', 'nn.Module: SD3Transformer2DModel_0']",0.003338931289914054,99.95637671638215 +aten::argmax,nn.Module: CLIPTextTransformer,22.390625,22.390625,4,0.022390625,4,['reduce'],"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0031425880673692837,99.95951930444951 +aten::index,nn.Module: CLIPTextTransformer,22.30908203125,22.30908203125,4,0.02230908203125,4,['elementwise'],"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.003131143279179065,99.96265044772869 +aten::nonzero,NA,19.3427734375,19.3427734375,1,0.0193427734375,1,['other'],['aten::nonzero'],0.00271481340938518,99.96536526113807 +aten::copy_,nn.Module: CLIPTextTransformer,18.224609375,18.224609375,4,0.018224609375,4,['elementwise'],"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0025578758946809828,99.96792313703276 +aten::add,nn.Module: T5Attention,17.10009765625,17.10009765625,6,0.01710009765625,6,['elementwise'],"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.00240004746832126,99.97032318450108 +triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0,nn.Module: SD3Transformer2DModel,16.580078125,16.580078125,4,0.016580078125,4,['triton'],"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'nn.Module: SD3Transformer2DModel_0']",0.002327061244233937,99.97265024574531 +aten::add,nn.Module: CLIPTextEmbeddings,15.8603515625,15.8603515625,4,0.0158603515625,4,['elementwise'],"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.002226045568830449,99.97487629131415 +triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5,nn.Module: SD3Transformer2DModel,13.97705078125,13.97705078125,4,0.01397705078125,4,['triton'],"['triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'nn.Module: SD3Transformer2DModel_0']",0.001961718933802463,99.97683801024795 +triton_poi_fused_add_addmm_silu_22,nn.Module: SD3Transformer2DModel,13.29443359375,13.29443359375,4,0.01329443359375,4,['triton'],"['triton_poi_fused_add_addmm_silu_22', 'nn.Module: SD3Transformer2DModel_0']",0.0018659116650005122,99.97870392191295 +triton_poi_fused_add_addmm_silu_21,nn.Module: SD3Transformer2DModel,12.41357421875,12.41357421875,4,0.01241357421875,4,['triton'],"['triton_poi_fused_add_addmm_silu_21', 'nn.Module: SD3Transformer2DModel_0']",0.0017422805398798259,99.98044620245284 +aten::mul,nn.Module: T5Attention,11.61279296875,11.61279296875,4,0.01161279296875,4,['elementwise'],"['aten::mul', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0016298886079519296,99.98207609106079 +aten::clamp,NA,10.89501953125,10.89501953125,1,0.01089501953125,1,['elementwise'],['aten::clamp'],0.0015291470592116805,99.98360523812 +aten::div,nn.Module: T5Attention,9.8896484375,9.8896484375,4,0.0098896484375,4,['elementwise'],"['aten::div', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0013880403593095228,99.98499327847932 +aten::div,nn.Module: Attention,9.4931640625,9.4931640625,1,0.0094931640625,1,['elementwise'],"['aten::div', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.001332392646672052,99.986325671126 +aten::sub,nn.Module: T5Attention,8.009765625,8.009765625,2,0.008009765625,2,['elementwise'],"['aten::sub', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0011241934459422045,99.98744986457194 +aten::lt,nn.Module: T5Attention,7.9697265625,7.9697265625,2,0.0079697265625,2,['elementwise'],"['aten::lt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0011185738493458095,99.98856843842128 +aten::where,nn.Module: T5Attention,7.72998046875,7.72998046875,2,0.00772998046875,2,['elementwise'],"['aten::where', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0010849248014332504,99.98965336322271 +aten::fill_,NA,6.88671875,6.88671875,3,0.00688671875,3,['elementwise'],['aten::fill_'],0.0009665706145799104,99.9906199338373 +aten::gt,nn.Module: T5Attention,6.84814453125,6.84814453125,2,0.00684814453125,2,['elementwise'],"['aten::gt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0009611566129809449,99.99158109045028 +aten::abs,nn.Module: T5Attention,6.84765625,6.84765625,2,0.00684765625,2,['elementwise'],"['aten::abs', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.000961088081315135,99.9925421785316 +aten::minimum,nn.Module: T5Attention,6.64794921875,6.64794921875,2,0.00664794921875,2,['elementwise'],"['aten::minimum', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0009330586299989707,99.99347523716159 +aten::fill_,nn.Module: T5Attention,6.126953125,6.126953125,2,0.006126953125,2,['elementwise'],"['aten::fill_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0008599353425800282,99.99433517250417 +aten::log,nn.Module: T5Attention,6.0869140625,6.0869140625,2,0.0060869140625,2,['elementwise'],"['aten::log', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0008543157459836334,99.99518948825015 +aten::arange,nn.Module: T5Attention,6.00390625,6.00390625,4,0.00600390625,4,['other'],"['aten::arange', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.0008426653627959856,99.99603215361294 +aten::arange,nn.Module: CLIPTextTransformer,5.84326171875,5.84326171875,4,0.00584326171875,4,['other'],"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0008201184447445966,99.9968522720577 +aten::_local_scalar_dense,NA,5.80810546875,5.80810546875,1,0.00580810546875,1,['other'],['aten::_local_scalar_dense'],0.0008151841648062986,99.9976674562225 +aten::normal_,NA,5.2470703125,5.2470703125,1,0.0052470703125,1,['elementwise'],['aten::normal_'],0.0007364412807909615,99.9984038975033 +aten::copy_,nn.Module: SD3Transformer2DModel,5.125,5.125,3,0.005125,3,['elementwise'],"['aten::copy_', 'nn.Module: SD3Transformer2DModel_0']",0.0007193083643385382,99.99912320586763 +aten::eq,NA,3.52392578125,3.52392578125,1,0.00352392578125,1,['elementwise'],['aten::eq'],0.0004945930321485546,99.99961779889978 +aten::div,NA,2.72314453125,2.72314453125,1,0.00272314453125,1,['elementwise'],['aten::div'],0.00038220110022065803,100.0 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary_by_category.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary_by_category.csv index bff7754d9..8a046119a 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary_by_category.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_summary_by_category.csv @@ -1,39 +1,39 @@ op category,parent_module,Count,call_stack_first,total_direct_kernel_time_ms,Percentage (%),Cumulative Percentage (%) -GEMM,nn.Module: SD3Transformer2DModel,2144,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']",354.0869609375,49.69724593513785,49.69724593513785 -other,nn.Module: SD3Transformer2DModel,152,"['aten::_flash_attention_forward', 'nn.Module: SD3Transformer2DModel_0']",204.56519189453124,28.711383848855277,78.40862978399312 -triton,nn.Module: SD3Transformer2DModel,2076,"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'nn.Module: SD3Transformer2DModel_0']",68.81430126953126,9.658308922169567,88.06693870616269 -CONV_fwd,nn.Module: Conv2d,35,"['aten::miopen_convolution', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",33.5840244140625,4.713626043665413,92.7805647498281 -GEMM,nn.Module: Linear,872,"['aten::addmm', 'nn.Module: Linear_0', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",20.45950439453125,2.8715573680374114,95.65212211786552 -elementwise,nn.Module: Conv2d,35,"['aten::add_', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",3.58112158203125,0.5026219534168355,96.15474407128235 -NORM_fwd,nn.Module: GroupNorm,30,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",3.340943359375,0.4689121659453933,96.62365623722775 -other,nn.Module: Attention,1,"['aten::_flash_attention_forward', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",2.96135888671875,0.4156362620803905,97.03929249930815 -elementwise,nn.Module: T5Attention,230,"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",2.6849169921875,0.37683675140956424,97.41612925071772 -elementwise,nn.Module: T5LayerNorm,686,"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",2.68069140625,0.3762436768072123,97.79237292752492 -elementwise,nn.Module: SiLU,29,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",2.5887802734375,0.36334365315351397,98.15571658067844 -elementwise,nn.Module: NewGELUActivation,384,"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",2.56035009765625,0.35935338637261044,98.51506996705105 -elementwise,nn.Module: ResnetBlock2D,28,"['aten::add', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",1.8256474609375,0.25623550389105015,98.7713054709421 -other,nn.Module: CLIPAttention,88,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",1.19517626953125,0.1677468406220677,98.93905231156417 -NORM_fwd,nn.Module: LayerNorm,180,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.848966796875,0.1191552255506813,99.05820753711485 -reduce,nn.Module: T5LayerNorm,98,"['aten::mean', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.794798828125,0.11155257659222169,99.16976011370707 -GEMM,nn.Module: T5Attention,96,"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.7584736328125,0.10645421838013866,99.2762143320872 -elementwise,NA,63,['aten::copy_'],0.69945751953125,0.09817111671463585,99.37438544880185 -elementwise,nn.Module: Upsample2D,4,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']",0.63830419921875,0.08958805115561624,99.46397349995746 -elementwise,nn.Module: CLIPEncoderLayer,176,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.5959111328125,0.08363804768314183,99.5476115476406 -other,nn.Module: T5Attention,52,"['aten::arange', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.5738779296875,0.08054561662738417,99.62815716426799 -elementwise,nn.Module: T5LayerSelfAttention,48,"['aten::add', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.43595751953125,0.06118804264368675,99.68934520691168 -elementwise,nn.Module: QuickGELUActivation,72,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.42371923828125,0.059470360435072485,99.74881556734675 -elementwise,nn.Module: GELUActivation,64,"['aten::gelu', 'nn.Module: GELUActivation_0', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']",0.33687744140625,0.047281834415025266,99.79609740176178 -elementwise,nn.Module: GroupNorm,4,"['aten::copy_', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.252169921875,0.035392861097413936,99.8314902628592 -elementwise,nn.Module: T5DenseGatedActDense,48,"['aten::mul', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.2241689453125,0.03146283380986234,99.86295309666907 -elementwise,nn.Module: T5LayerFF,48,"['aten::add', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.1861904296875,0.026132426764457883,99.88908552343354 -CONV_fwd,nn.Module: SD3Transformer2DModel,4,"['aten::miopen_convolution', 'nn.Module: SD3Transformer2DModel_0']",0.17227978515625,0.02418002298049636,99.91326554641404 -elementwise,nn.Module: CLIPAttention,88,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.167517578125,0.023511631878492895,99.93677717829253 -other,nn.Module: Embedding,12,"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.1064677734375,0.014943095070998441,99.95172027336353 -elementwise,nn.Module: Attention,2,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.10243115234375,0.014376542293364622,99.9660968156569 -other,NA,15,['aten::cat'],0.0922783203125,0.012951559602504568,99.9790483752594 -elementwise,nn.Module: Linear,3,"['aten::add_', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.05952490234375,0.008354511849885836,99.98740288710928 -elementwise,nn.Module: CLIPTextTransformer,8,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.04053369140625,0.005689034199796344,99.99309192130907 -reduce,nn.Module: CLIPTextTransformer,4,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.022390625,0.003142596367627494,99.9962345176767 -elementwise,nn.Module: CLIPTextEmbeddings,4,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0158603515625,0.002226051448300686,99.998460569125 -other,nn.Module: CLIPTextTransformer,4,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.00584326171875,0.0008201206108556836,99.99928068973585 -elementwise,nn.Module: SD3Transformer2DModel,3,"['aten::copy_', 'nn.Module: SD3Transformer2DModel_0']",0.005125,0.000719310264188289,100.00000000000004 +GEMM,nn.Module: SD3Transformer2DModel,2144,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']",354.0869609375,49.69711467425502,49.69711467425502 +other,nn.Module: SD3Transformer2DModel,152,"['aten::_flash_attention_forward', 'nn.Module: SD3Transformer2DModel_0']",204.56519189453124,28.711308016049646,78.40842269030466 +triton,nn.Module: SD3Transformer2DModel,2076,"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'nn.Module: SD3Transformer2DModel_0']",68.81430126953126,9.658283412543593,88.06670610284826 +CONV_fwd,nn.Module: Conv2d,35,"['aten::miopen_convolution', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",33.5840244140625,4.713613593987283,92.78031969683553 +GEMM,nn.Module: Linear,872,"['aten::addmm', 'nn.Module: Linear_0', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",20.45950439453125,2.8715497836502255,95.65186948048576 +elementwise,nn.Module: Conv2d,35,"['aten::add_', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']",3.58112158203125,0.5026206258865046,96.15449010637226 +NORM_fwd,nn.Module: GroupNorm,30,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",3.340943359375,0.4689109274497038,96.62340103382196 +other,nn.Module: Attention,1,"['aten::_flash_attention_forward', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",2.96135888671875,0.4156351642975724,97.03903619811953 +elementwise,nn.Module: T5Attention,230,"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",2.6849169921875,0.3768357561044172,97.41587195422395 +elementwise,nn.Module: T5LayerNorm,686,"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",2.68069140625,0.37624268306850006,97.79211463729244 +elementwise,nn.Module: SiLU,29,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",2.5887802734375,0.36334269348647835,98.15545733077892 +elementwise,nn.Module: NewGELUActivation,384,"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",2.56035009765625,0.35935243724470894,98.51480976802362 +elementwise,nn.Module: ResnetBlock2D,28,"['aten::add', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",1.8256474609375,0.25623482711917234,98.7710445951428 +other,nn.Module: CLIPAttention,88,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",1.19517626953125,0.16774639756736764,98.93879099271017 +NORM_fwd,nn.Module: LayerNorm,180,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.848966796875,0.11915491083666033,99.05794590354682 +reduce,nn.Module: T5LayerNorm,98,"['aten::mean', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.794798828125,0.11155228195839623,99.16949818550522 +GEMM,nn.Module: T5Attention,96,"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.7584736328125,0.10645393721214992,99.27595212271737 +elementwise,NA,63,['aten::copy_'],0.69945751953125,0.09817085742406136,99.37412298014144 +elementwise,nn.Module: Upsample2D,4,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']",0.63830419921875,0.0895878145347238,99.46371079467616 +elementwise,nn.Module: CLIPEncoderLayer,176,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.5959111328125,0.08363782677746043,99.54734862145362 +other,nn.Module: T5Attention,52,"['aten::arange', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.5738779296875,0.08054540388946384,99.62789402534308 +elementwise,nn.Module: T5LayerSelfAttention,48,"['aten::add', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.43595751953125,0.06118788103319214,99.68908190637627 +elementwise,nn.Module: QuickGELUActivation,72,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.42371923828125,0.059470203361338,99.74855210973762 +elementwise,nn.Module: GELUActivation,64,"['aten::gelu', 'nn.Module: GELUActivation_0', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']",0.33687744140625,0.047281709533752464,99.79583381927137 +elementwise,nn.Module: GroupNorm,4,"['aten::copy_', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.252169921875,0.035392767617421106,99.83122658688879 +elementwise,nn.Module: T5DenseGatedActDense,48,"['aten::mul', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.2241689453125,0.03146275070989846,99.86268933759868 +elementwise,nn.Module: T5LayerFF,48,"['aten::add', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']",0.1861904296875,0.02613235774322053,99.8888216953419 +CONV_fwd,nn.Module: SD3Transformer2DModel,4,"['aten::miopen_convolution', 'nn.Module: SD3Transformer2DModel_0']",0.17227978515625,0.024179959115968184,99.91300165445787 +elementwise,nn.Module: CLIPAttention,88,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.167517578125,0.02351156977932625,99.9365132242372 +other,nn.Module: Embedding,12,"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.1064677734375,0.014943055603140328,99.95145627984034 +elementwise,nn.Module: Attention,2,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.10243115234375,0.014376504321891595,99.96583278416223 +other,NA,15,['aten::cat'],0.09416015625,0.013215646434741206,99.97904843059698 +elementwise,nn.Module: Linear,3,"['aten::add_', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']",0.05952490234375,0.008354489783862249,99.98740292038084 +elementwise,nn.Module: CLIPTextTransformer,8,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.04053369140625,0.005689019173860048,99.9930919395547 +reduce,nn.Module: CLIPTextTransformer,4,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.022390625,0.0031425880673692837,99.99623452762206 +elementwise,nn.Module: CLIPTextEmbeddings,4,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.0158603515625,0.002226045568830449,99.9984605731909 +other,nn.Module: CLIPTextTransformer,4,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']",0.00584326171875,0.0008201184447445966,99.99928069163565 +elementwise,nn.Module: SD3Transformer2DModel,3,"['aten::copy_', 'nn.Module: SD3Transformer2DModel_0']",0.005125,0.0007193083643385382,99.99999999999999 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_unique_args.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_unique_args.csv index 265743abc..c1e3c1012 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_unique_args.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/ops_unique_args.csv @@ -1,215 +1,215 @@ name,op category,parent_module,process_name,process_label,thread_name,Input Dims,Input type,Input Strides,Concrete Inputs,num_kernels,operation_count,total_direct_kernel_time_mean,total_subtree_kernel_time_mean,total_direct_kernel_time_median,total_subtree_kernel_time_median,total_direct_kernel_time_std,total_subtree_kernel_time_std,total_direct_kernel_time_min,total_subtree_kernel_time_min,total_direct_kernel_time_max,total_subtree_kernel_time_max,total_direct_kernel_time_sum,total_subtree_kernel_time_sum,ex_UID,call_stack,kernel_details_summary,trunc_kernel_details,Percentage (%),Cumulative Percentage (%) -aten::_flash_attention_forward,other,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4429, 38, 64), (2, 4429, 38, 64), (2, 4429, 38, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((10771328, 64, 283456, 1), (10771328, 64, 283456, 1), (10771328, 64, 283456, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '4429', '4429', '0.', 'False', 'False', '0.125', '', '', '', '')",1,152,1345.823630885074,1345.823630885074,1359.639404296875,1359.639404296875,62.46694869506643,62.46694869506643,1189.56591796875,1189.56591796875,1592.80615234375,1592.80615234375,204565.19189453125,204565.19189453125,18441,"['aten::_flash_attention_forward', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(204565.196), 'mean_duration_us': np.float64(1345.823657894737), 'median_duration_us': np.float64(1359.6395), 'std_dev_duration_us': np.float64(62.26112668073086), 'min_duration_us': np.float64(1189.566), 'max_duration_us': np.float64(1592.806)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1345.82)}]",28.711383848855277,28.711383848855277 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 9728), (8192, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",1,152,656.5875982987253,656.5875982987253,659.01904296875,659.01904296875,16.573010375012593,16.573010375012593,612.26904296875,612.26904296875,706.0078125,706.0078125,99801.31494140625,99801.31494140625,18467,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99801.31399999998), 'mean_duration_us': np.float64(656.5875921052631), 'median_duration_us': np.float64(659.019), 'std_dev_duration_us': np.float64(16.518400036958493), 'min_duration_us': np.float64(612.269), 'max_duration_us': np.float64(706.008)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(656.59)}]",14.007436139871524,42.7188199887268 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 9728), (9728, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",1,152,653.1063232421875,653.1063232421875,655.81396484375,655.81396484375,25.6982753947453,25.6982753947453,591.63818359375,591.63818359375,697.43603515625,697.43603515625,99272.1611328125,99272.1611328125,18469,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99272.159), 'mean_duration_us': np.float64(653.1063092105263), 'median_duration_us': np.float64(655.814), 'std_dev_duration_us': np.float64(25.61359189916083), 'min_duration_us': np.float64(591.638), 'max_duration_us': np.float64(697.436)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(653.11)}]",13.933167697753316,56.65198768648011 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",1,456,179.2197265625,179.2197265625,181.10791015625,181.10791015625,9.938501313517527,9.938501313517527,158.39404296875,158.39404296875,217.162109375,217.162109375,81724.1953125,81724.1953125,18423,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 456, 'total_duration_us': np.float64(81724.19200000001), 'mean_duration_us': np.float64(179.21971929824565), 'median_duration_us': np.float64(181.108), 'std_dev_duration_us': np.float64(9.927591429559296), 'min_duration_us': np.float64(158.394), 'max_duration_us': np.float64(217.162)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(179.22)}]",11.47025415040189,68.122241836882 -aten::addmm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2432,), (8192, 2432), (2432, 2432), (), (), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",1,152,180.276611328125,180.276611328125,183.61181640625,183.61181640625,11.302861072544887,11.302861072544887,158.7548828125,158.7548828125,214.7587890625,214.7587890625,27402.044921875,27402.044921875,18431,"['aten::addmm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(27402.047000000002), 'mean_duration_us': np.float64(180.27662500000002), 'median_duration_us': np.float64(183.61200000000002), 'std_dev_duration_us': np.float64(11.265613010286344), 'min_duration_us': np.float64(158.755), 'max_duration_us': np.float64(214.759)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(180.28)}]",3.8459653018640525,71.96820713874605 -triton_poi_fused_addmm_gelu_view_15,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((39845888, 9728, 1), (1,), ())","('', '', '79691776')",1,152,138.65906404194078,138.65906404194078,133.23681640625,133.23681640625,13.52017813104994,13.52017813104994,111.28515625,111.28515625,177.5029296875,177.5029296875,21076.177734375,21076.177734375,18468,"['triton_poi_fused_addmm_gelu_view_15', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(21076.175), 'mean_duration_us': np.float64(138.65904605263157), 'median_duration_us': np.float64(133.237), 'std_dev_duration_us': np.float64(13.47563314660304), 'min_duration_us': np.float64(111.285), 'max_duration_us': np.float64(177.503)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'mean_duration_us': np.float64(138.66)}]",2.9581094583790466,74.9263165971251 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",1,452,25.756830536158738,25.756830536158738,25.7568359375,25.7568359375,1.9186128143844703,1.9186128143844703,22.51318359375,22.51318359375,57.36376953125,57.36376953125,11642.08740234375,11642.08740234375,18425,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 452, 'total_duration_us': np.float64(11642.083999999999), 'mean_duration_us': np.float64(25.756823008849555), 'median_duration_us': np.float64(25.757), 'std_dev_duration_us': np.float64(1.9165006446350394), 'min_duration_us': np.float64(22.513), 'max_duration_us': np.float64(57.364)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.76)}]",1.6340044809918113,76.5603210781169 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 9728), (9728, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",1,148,76.79936919341216,76.79936919341216,76.6328125,76.6328125,2.8383699970808127,2.8383699970808127,71.10498046875,71.10498046875,90.453125,90.453125,11366.306640625,11366.306640625,18474,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(11366.307999999999), 'mean_duration_us': np.float64(76.79937837837838), 'median_duration_us': np.float64(76.633), 'std_dev_duration_us': np.float64(2.8287709713197278), 'min_duration_us': np.float64(71.105), 'max_duration_us': np.float64(90.453)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(76.8)}]",1.5952977624415747,78.15561884055847 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 9728), (666, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",1,148,69.05995301942568,69.05995301942568,69.58251953125,69.58251953125,5.874709039595645,5.874709039595645,61.41015625,61.41015625,100.18798828125,100.18798828125,10220.873046875,10220.873046875,18472,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10220.875), 'mean_duration_us': np.float64(69.05996621621621), 'median_duration_us': np.float64(69.5825), 'std_dev_duration_us': np.float64(5.8548305020997935), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(100.188)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(69.06)}]",1.4345324666502668,79.59015130720874 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '8192', '2432')",1,148,67.80168852934966,67.80168852934966,68.401123046875,68.401123046875,4.233686810115376,4.233686810115376,60.208984375,60.208984375,76.953125,76.953125,10034.64990234375,10034.64990234375,18515,"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10034.648000000001), 'mean_duration_us': np.float64(67.80167567567568), 'median_duration_us': np.float64(68.40100000000001), 'std_dev_duration_us': np.float64(4.219346669062954), 'min_duration_us': np.float64(60.209), 'max_duration_us': np.float64(76.953)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(67.8)}]",1.4083954482520722,80.99854675546081 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",1,148,65.224853515625,65.224853515625,65.677001953125,65.677001953125,3.2404804511629712,3.2404804511629712,59.9677734375,59.9677734375,73.26708984375,73.26708984375,9653.2783203125,9653.2783203125,18470,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(9653.279999999999), 'mean_duration_us': np.float64(65.22486486486486), 'median_duration_us': np.float64(65.67699999999999), 'std_dev_duration_us': np.float64(3.2295163131456124), 'min_duration_us': np.float64(59.968), 'max_duration_us': np.float64(73.267)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(65.22)}]",1.3548687178277201,82.35341547328852 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 14592), (2, 14592))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (14592, 1))","('', '', '')",1,300,27.6878955078125,27.6878955078125,25.9169921875,25.9169921875,3.025975736385473,3.025975736385473,23.47412109375,23.47412109375,34.0498046875,34.0498046875,8306.36865234375,8306.36865234375,18413,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 300, 'total_duration_us': np.float64(8306.373), 'mean_duration_us': np.float64(27.68791), 'median_duration_us': np.float64(25.917), 'std_dev_duration_us': np.float64(3.0209218607184574), 'min_duration_us': np.float64(23.474), 'max_duration_us': np.float64(34.05)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.69)}]",1.1658256058073568,83.51924107909588 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (128, 128, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 1048576, 1024, 1), (1152, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,5,1473.4486328125,1682.72666015625,1474.26611328125,1681.533203125,50.36787392237434,48.64372494307394,1402.119140625,1620.2021484375,1538.32080078125,1745.3876953125,7367.2431640625,8413.63330078125,27255,"['aten::miopen_convolution', 'nn.Module: Conv2d_28', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.674), 'mean_duration_us': np.float64(5.1348), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.18339945474291905), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(334.733), 'mean_duration_us': np.float64(66.9466), 'median_duration_us': np.float64(66.017), 'std_dev_duration_us': np.float64(4.425827588146652), 'min_duration_us': np.float64(62.292), 'max_duration_us': np.float64(74.269)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1126.509), 'mean_duration_us': np.float64(225.30180000000001), 'median_duration_us': np.float64(225.974), 'std_dev_duration_us': np.float64(2.497012647144582), 'min_duration_us': np.float64(221.168), 'max_duration_us': np.float64(228.138)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1583.9470000000001), 'mean_duration_us': np.float64(316.7894), 'median_duration_us': np.float64(316.67), 'std_dev_duration_us': np.float64(2.3336759500838977), 'min_duration_us': np.float64(313.985), 'max_duration_us': np.float64(320.755)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(4296.379999999999), 'mean_duration_us': np.float64(859.2759999999998), 'median_duration_us': np.float64(860.558), 'std_dev_duration_us': np.float64(38.63950000194101), 'min_duration_us': np.float64(799.788), 'max_duration_us': np.float64(914.678)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(66.95)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(225.3)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(316.79)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(859.28)}]",1.0340163174012025,84.55325739649707 -triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432,), (64,), (2, 38, 4096, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '311296', '64')",1,304,22.525390625,22.525390625,21.4912109375,21.4912109375,2.778457297323058,2.778457297323058,19.02783203125,19.02783203125,51.31494140625,51.31494140625,6847.71875,6847.71875,18424,"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(6847.722), 'mean_duration_us': np.float64(22.525401315789473), 'median_duration_us': np.float64(21.491), 'std_dev_duration_us': np.float64(2.7738832289577378), 'min_duration_us': np.float64(19.028), 'max_duration_us': np.float64(51.315)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(22.53)}]",0.9610993918340681,85.51435678833114 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,192,32.22358194986979,32.22358194986979,32.1865234375,32.1865234375,0.6864988052764409,0.6864988052764409,30.52392578125,30.52392578125,38.09521484375,38.09521484375,6186.927734375,6186.927734375,5111,"['aten::mm', 'nn.Module: Linear_266', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 192, 'total_duration_us': np.float64(6186.93), 'mean_duration_us': np.float64(32.22359375), 'median_duration_us': np.float64(32.1865), 'std_dev_duration_us': np.float64(0.6847003158031528), 'min_duration_us': np.float64(30.524), 'max_duration_us': np.float64(38.095)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(32.22)}]",0.8683552435370014,86.38271203186814 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 10240))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,96,63.48492431640625,63.48492431640625,63.29296875,63.29296875,1.0088001313002912,1.0088001313002912,61.41015625,61.41015625,66.5771484375,66.5771484375,6094.552734375,6094.552734375,5286,"['aten::mm', 'nn.Module: Linear_270', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(6094.553999999999), 'mean_duration_us': np.float64(63.484937499999994), 'median_duration_us': np.float64(63.293), 'std_dev_duration_us': np.float64(1.0035055203769856), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(66.577)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(63.48)}]",0.8553901146288272,87.23810214649697 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((33554432, 65536, 256, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,7,750.6759905133929,815.2283063616071,747.06494140625,814.68505859375,19.933292014321747,23.16508387604623,726.154296875,788.365234375,778.4716796875,849.095703125,5254.73193359375,5706.59814453125,27026,"['aten::miopen_convolution', 'nn.Module: Conv2d_11', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(62.446000000000005), 'mean_duration_us': np.float64(8.920857142857143), 'median_duration_us': np.float64(8.531), 'std_dev_duration_us': np.float64(0.6591703505319455), 'min_duration_us': np.float64(8.171), 'max_duration_us': np.float64(10.094)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(283.775), 'mean_duration_us': np.float64(40.53928571428571), 'median_duration_us': np.float64(40.379), 'std_dev_duration_us': np.float64(0.3694632068616445), 'min_duration_us': np.float64(40.099), 'max_duration_us': np.float64(41.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(370.262), 'mean_duration_us': np.float64(52.89457142857143), 'median_duration_us': np.float64(53.358), 'std_dev_duration_us': np.float64(1.4606747811633258), 'min_duration_us': np.float64(50.995), 'max_duration_us': np.float64(55.041)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(488.43899999999996), 'mean_duration_us': np.float64(69.777), 'median_duration_us': np.float64(69.943), 'std_dev_duration_us': np.float64(0.7438663474422981), 'min_duration_us': np.float64(68.1), 'max_duration_us': np.float64(70.504)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(4049.81), 'mean_duration_us': np.float64(578.5442857142857), 'median_duration_us': np.float64(573.09), 'std_dev_duration_us': np.float64(19.20403529554798), 'min_duration_us': np.float64(556.546), 'max_duration_us': np.float64(608.904)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(8.92)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(40.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(52.89)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(69.78)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(578.54)}]",0.7375185591008699,87.97562070559783 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((67108864, 262144, 512, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,5,1013.67744140625,1132.68525390625,1011.05712890625,1130.755859375,19.32632247488319,15.988691411278218,995.87451171875,1115.13134765625,1044.38671875,1157.4736328125,5068.38720703125,5663.42626953125,27150,"['aten::miopen_convolution', 'nn.Module: Conv2d_20', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(26.154), 'mean_duration_us': np.float64(5.2308), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.10632854743670675), 'min_duration_us': np.float64(5.126), 'max_duration_us': np.float64(5.407)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(176.538), 'mean_duration_us': np.float64(35.3076), 'median_duration_us': np.float64(35.011), 'std_dev_duration_us': np.float64(1.1099622696290183), 'min_duration_us': np.float64(34.33), 'max_duration_us': np.float64(37.335)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(531.463), 'mean_duration_us': np.float64(106.2926), 'median_duration_us': np.float64(107.198), 'std_dev_duration_us': np.float64(2.44941957206192), 'min_duration_us': np.float64(102.231), 'max_duration_us': np.float64(109.481)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(710.931), 'mean_duration_us': np.float64(142.1862), 'median_duration_us': np.float64(136.041), 'std_dev_duration_us': np.float64(10.643601409297508), 'min_duration_us': np.float64(130.112), 'max_duration_us': np.float64(155.47)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(3623.301), 'mean_duration_us': np.float64(724.6602), 'median_duration_us': np.float64(719.949), 'std_dev_duration_us': np.float64(21.340082974534106), 'min_duration_us': np.float64(696.755), 'max_duration_us': np.float64(762.052)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(35.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.29)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(142.19)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(724.66)}]",0.711364476272818,88.68698518187065 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '666', '2432')",1,144,30.41143798828125,30.41143798828125,28.260986328125,28.260986328125,4.391962936042957,4.391962936042957,25.47607421875,25.47607421875,40.4189453125,40.4189453125,4379.2470703125,4379.2470703125,18518,"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(4379.2480000000005), 'mean_duration_us': np.float64(30.41144444444445), 'median_duration_us': np.float64(28.261), 'std_dev_duration_us': np.float64(4.3766938876054), 'min_duration_us': np.float64(25.476), 'max_duration_us': np.float64(40.419)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(30.41)}]",0.6146414374814194,89.30162661935208 -triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (666, 2432), (2, 38, 4429, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (2432, 1), (10771328, 283456, 64, 1), ())","('', '', '', '21542656')",1,152,26.167618600945723,26.167618600945723,24.35498046875,24.35498046875,3.622186564873429,3.622186564873429,23.27294921875,23.27294921875,56.001953125,56.001953125,3977.47802734375,3977.47802734375,18433,"['triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3977.477), 'mean_duration_us': np.float64(26.167611842105263), 'median_duration_us': np.float64(24.355), 'std_dev_duration_us': np.float64(3.610260218149725), 'min_duration_us': np.float64(23.273), 'max_duration_us': np.float64(56.002)}]","[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpo...', 'stream': 0, 'mean_duration_us': np.float64(26.17)}]",0.5582518576881458,89.85987847704023 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,3882.00390625,4274.86572265625,3882.00390625,4274.86572265625,,,3882.00390625,4274.86572265625,3882.00390625,4274.86572265625,3882.00390625,4274.86572265625,27228,"['aten::miopen_convolution', 'nn.Module: Conv2d_26', 'nn.Module: Upsample2D_2', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.031), 'mean_duration_us': np.float64(129.031), 'median_duration_us': np.float64(129.031), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.031), 'max_duration_us': np.float64(129.031)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(453.353), 'mean_duration_us': np.float64(453.353), 'median_duration_us': np.float64(453.353), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(453.353), 'max_duration_us': np.float64(453.353)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(664.706), 'mean_duration_us': np.float64(664.706), 'median_duration_us': np.float64(664.706), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(664.706), 'max_duration_us': np.float64(664.706)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2629.787), 'mean_duration_us': np.float64(2629.787), 'median_duration_us': np.float64(2629.787), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2629.787), 'max_duration_us': np.float64(2629.787)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(129.03)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(453.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(664.71)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(2629.79)}]",0.5448517571482258,90.40473023418845 -aten::addmm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2432,), (666, 2432), (2432, 2432), (), (), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",1,152,25.499563116776315,25.499563116776315,25.55712890625,25.55712890625,1.9140762579445143,1.9140762579445143,22.6328125,22.6328125,31.64599609375,31.64599609375,3875.93359375,3875.93359375,18432,"['aten::addmm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3875.933), 'mean_duration_us': np.float64(25.499559210526314), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(1.9077830366462447), 'min_duration_us': np.float64(22.633), 'max_duration_us': np.float64(31.646)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.5)}]",0.5439997692286003,90.94873000341705 -triton_poi_fused__unsafe_view_clone_slice_transpose_11,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 4096, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((10771328, 283456, 64, 1), (9961472, 2432, 1), ())","('', '', '19922944')",1,152,23.524985865542764,23.524985865542764,22.19189453125,22.19189453125,3.330519637347333,3.330519637347333,20.47021484375,20.47021484375,56.1630859375,56.1630859375,3575.7978515625,3575.7978515625,18460,"['triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3575.8), 'mean_duration_us': np.float64(23.525000000000002), 'median_duration_us': np.float64(22.192), 'std_dev_duration_us': np.float64(3.31954295760251), 'min_duration_us': np.float64(20.47), 'max_duration_us': np.float64(56.163)}]","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'mean_duration_us': np.float64(23.52)}]",0.5018747506909927,91.45060475410804 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,3393.59814453125,3597.740234375,3393.59814453125,3597.740234375,,,3393.59814453125,3597.740234375,3393.59814453125,3597.740234375,3393.59814453125,3597.740234375,27123,"['aten::miopen_convolution', 'nn.Module: Conv2d_18', 'nn.Module: Upsample2D_1', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.934), 'mean_duration_us': np.float64(9.934), 'median_duration_us': np.float64(9.934), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(9.934)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(216.361), 'mean_duration_us': np.float64(216.361), 'median_duration_us': np.float64(216.361), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(216.361), 'max_duration_us': np.float64(216.361)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(292.594), 'mean_duration_us': np.float64(292.594), 'median_duration_us': np.float64(292.594), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(292.594), 'max_duration_us': np.float64(292.594)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(303.89), 'mean_duration_us': np.float64(303.89), 'median_duration_us': np.float64(303.89), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(303.89), 'max_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2570.819), 'mean_duration_us': np.float64(2570.819), 'median_duration_us': np.float64(2570.819), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2570.819), 'max_duration_us': np.float64(2570.819)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.93)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.36)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(292.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2570.82)}]",0.4763024347105679,91.9269071888186 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((256, 10240), (10240, 4096))","('c10::BFloat16', 'c10::BFloat16')","((10240, 1), (1, 10240))","('', '')",1,48,67.46939086914062,67.46939086914062,67.51953125,67.51953125,0.7553297493567382,0.7553297493567382,65.5361328125,65.5361328125,68.82177734375,68.82177734375,3238.53076171875,3238.53076171875,5316,"['aten::mm', 'nn.Module: Linear_272', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(3238.5289999999995), 'mean_duration_us': np.float64(67.46935416666666), 'median_duration_us': np.float64(67.5195), 'std_dev_duration_us': np.float64(0.7474217208060252), 'min_duration_us': np.float64(65.536), 'max_duration_us': np.float64(68.822)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(67.47)}]",0.45453822786220777,92.3814454166808 -triton_poi_fused_addmm_gelu_view_17,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3239424, 9728, 1), (1,), ())","('', '', '6478848')",1,148,21.75943900443412,21.75943900443412,21.87158203125,21.87158203125,1.5739936683940021,1.5739936683940021,18.10595703125,18.10595703125,26.47802734375,26.47802734375,3220.39697265625,3220.39697265625,18473,"['triton_poi_fused_addmm_gelu_view_17', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(3220.398), 'mean_duration_us': np.float64(21.75944594594595), 'median_duration_us': np.float64(21.8715), 'std_dev_duration_us': np.float64(1.5686506565240377), 'min_duration_us': np.float64(18.106), 'max_duration_us': np.float64(26.478)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'mean_duration_us': np.float64(21.76)}]",0.45199309213512834,92.83343850881593 -aten::_flash_attention_forward,other,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 16384, 1, 512), (1, 16384, 1, 512), (1, 16384, 1, 512), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((8388608, 512, 512, 1), (8388608, 512, 512, 1), (8388608, 512, 512, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '16384', '16384', '0.', 'False', 'False', '0.044194173824159216', '', '', '', '')",1,1,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,,,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,26841,"['aten::_flash_attention_forward', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2961.359), 'mean_duration_us': np.float64(2961.359), 'median_duration_us': np.float64(2961.359), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2961.359), 'max_duration_us': np.float64(2961.359)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(2961.36)}]",0.4156362620803905,93.24907477089633 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,2633.0283203125,2843.98046875,2633.0283203125,2843.98046875,,,2633.0283203125,2843.98046875,2633.0283203125,2843.98046875,2633.0283203125,2843.98046875,27241,"['aten::miopen_convolution', 'nn.Module: Conv2d_27', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(75.511), 'mean_duration_us': np.float64(75.511), 'median_duration_us': np.float64(75.511), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(75.511), 'max_duration_us': np.float64(75.511)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.063), 'mean_duration_us': np.float64(231.063), 'median_duration_us': np.float64(231.063), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.063), 'max_duration_us': np.float64(231.063)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(682.333), 'mean_duration_us': np.float64(682.333), 'median_duration_us': np.float64(682.333), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(682.333), 'max_duration_us': np.float64(682.333)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_wr2x2_ta1x8x4x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1638.393), 'mean_duration_us': np.float64(1638.393), 'median_duration_us': np.float64(1638.393), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1638.393), 'max_duration_us': np.float64(1638.393)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(75.51)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.06)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(682.33)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(1638.39)}]",0.36955400911204506,93.61862878000838 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1280,), (77, 1280), (1280, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (1280, 1), (1, 1280), (), ())","('', '', '', '1', '1')",1,256,8.526697158813477,8.526697158813477,8.4521484375,8.4521484375,0.2567364201120384,0.2567364201120384,8.130859375,8.130859375,9.93408203125,9.93408203125,2182.83447265625,2182.83447265625,1513,"['aten::addmm', 'nn.Module: Linear_73', 'nn.Module: CLIPAttention_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 256, 'total_duration_us': np.float64(2182.826), 'mean_duration_us': np.float64(8.5266640625), 'median_duration_us': np.float64(8.452), 'std_dev_duration_us': np.float64(0.25624840784089964), 'min_duration_us': np.float64(8.131), 'max_duration_us': np.float64(9.934)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.53)}]",0.30636785194257005,93.92499663195095 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((8388608, 16384, 128, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,10,217.62666015625,237.859375,212.6708984375,233.62109375,10.818745996807618,10.34699437589636,211.2685546875,231.61767578125,238.349609375,257.8974609375,2176.2666015625,2378.59375,26762,"['aten::miopen_convolution', 'nn.Module: Conv2d_1', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(76.905), 'mean_duration_us': np.float64(7.6905), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.4889914620931535), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.532)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(118.48700000000001), 'mean_duration_us': np.float64(11.848700000000001), 'median_duration_us': np.float64(11.837), 'std_dev_duration_us': np.float64(0.10417010127671), 'min_duration_us': np.float64(11.696), 'max_duration_us': np.float64(12.057)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.91000000000003), 'mean_duration_us': np.float64(13.491000000000003), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.54173148330146), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(14.621)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(165.03499999999997), 'mean_duration_us': np.float64(16.503499999999995), 'median_duration_us': np.float64(16.503), 'std_dev_duration_us': np.float64(0.3349988805951447), 'min_duration_us': np.float64(15.743), 'max_duration_us': np.float64(16.984)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1680.929), 'mean_duration_us': np.float64(168.09290000000001), 'median_duration_us': np.float64(163.482), 'std_dev_duration_us': np.float64(10.59933224736351), 'min_duration_us': np.float64(161.199), 'max_duration_us': np.float64(190.161)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(11.85)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.49)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(16.5)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(168.09)}]",0.3054460300710383,94.23044266202199 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '666', '2432')",1,144,13.859249538845486,13.859249538845486,13.779296875,13.779296875,0.9719595732811294,0.9719595732811294,10.93505859375,10.93505859375,18.5068359375,18.5068359375,1995.73193359375,1995.73193359375,18475,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(1995.7350000000001), 'mean_duration_us': np.float64(13.859270833333333), 'median_duration_us': np.float64(13.779499999999999), 'std_dev_duration_us': np.float64(0.9686016281987687), 'min_duration_us': np.float64(10.935), 'max_duration_us': np.float64(18.507)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(13.86)}]",0.28010740768825854,94.51055006971025 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,1988.951171875,2107.125,1988.951171875,2107.125,,,1988.951171875,2107.125,1988.951171875,2107.125,1988.951171875,2107.125,27136,"['aten::miopen_convolution', 'nn.Module: Conv2d_19', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(41.38), 'mean_duration_us': np.float64(41.38), 'median_duration_us': np.float64(41.38), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(41.38), 'max_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(106.478), 'mean_duration_us': np.float64(106.478), 'median_duration_us': np.float64(106.478), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(106.478), 'max_duration_us': np.float64(106.478)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(329.409), 'mean_duration_us': np.float64(329.409), 'median_duration_us': np.float64(329.409), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(329.409), 'max_duration_us': np.float64(329.409)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1505.636), 'mean_duration_us': np.float64(1505.636), 'median_duration_us': np.float64(1505.636), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1505.636), 'max_duration_us': np.float64(1505.636)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.48)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(329.41)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(1505.64)}]",0.27915570593151473,94.78970577564176 -triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (64,), (2, 38, 333, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '25308', '64')",1,304,5.234130859375,5.234130859375,5.2470703125,5.2470703125,0.6274760849170535,0.6274760849170535,3.80419921875,3.80419921875,10.69482421875,10.69482421875,1591.17578125,1591.17578125,18426,"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(1591.176), 'mean_duration_us': np.float64(5.234131578947368), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.6264542941723528), 'min_duration_us': np.float64(3.804), 'max_duration_us': np.float64(10.695)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]",0.22332664811335504,95.01303242375512 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (1, 128, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (128, 1, 1, 1), ())","('', '', '1')",1,7,209.6533203125,209.6533203125,210.23095703125,210.23095703125,6.200337293638209,6.200337293638209,198.89404296875,198.89404296875,218.0830078125,218.0830078125,1467.5732421875,1467.5732421875,27245,"['aten::add_', 'nn.Module: Conv2d_27', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(1467.5729999999999), 'mean_duration_us': np.float64(209.6532857142857), 'median_duration_us': np.float64(210.231), 'std_dev_duration_us': np.float64(5.740387411373299), 'min_duration_us': np.float64(198.894), 'max_duration_us': np.float64(218.083)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.65)}]",0.20597863347386428,95.21901105722898 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,231.535400390625,231.535400390625,230.600830078125,230.600830078125,9.740609604863426,9.740609604863426,222.64892578125,222.64892578125,249.2080078125,249.2080078125,1389.21240234375,1389.21240234375,27246,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_24', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(361.81), 'mean_duration_us': np.float64(60.30166666666667), 'median_duration_us': np.float64(60.147999999999996), 'std_dev_duration_us': np.float64(1.7322068454880177), 'min_duration_us': np.float64(58.405), 'max_duration_us': np.float64(63.413)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1027.403), 'mean_duration_us': np.float64(171.23383333333334), 'median_duration_us': np.float64(170.95350000000002), 'std_dev_duration_us': np.float64(7.346735406892563), 'min_duration_us': np.float64(163.362), 'max_duration_us': np.float64(185.795)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(60.3)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.23)}]",0.19498043710117666,95.41399149433016 -aten::add_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (64, 1, 16384, 64), ())","('', '', '1')",1,48,28.179982503255207,28.179982503255207,28.201171875,28.201171875,0.4890157762664813,0.4890157762664813,27.31982421875,27.31982421875,29.80322265625,29.80322265625,1352.63916015625,1352.63916015625,5219,"['aten::add_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(1352.64), 'mean_duration_us': np.float64(28.180000000000003), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4838763616186821), 'min_duration_us': np.float64(27.32), 'max_duration_us': np.float64(29.803)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.18)}]",0.1898472647109107,95.60383875904107 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024),)","('c10::BFloat16',)","((134217728, 1048576, 1024, 1),)","('',)",1,6,176.09407552083334,176.09407552083334,175.840576171875,175.840576171875,11.99649579488144,11.99649579488144,163.52197265625,163.52197265625,196.77197265625,196.77197265625,1056.564453125,1056.564453125,27250,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1056.564), 'mean_duration_us': np.float64(176.09400000000002), 'median_duration_us': np.float64(175.8405), 'std_dev_duration_us': np.float64(10.951276226997471), 'min_duration_us': np.float64(163.522), 'max_duration_us': np.float64(196.772)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(176.09)}]",0.1482922255432778,95.75213098458434 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((268435456, 1048576, 1024, 1), (256, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",1,1,891.72314453125,1101.9541015625,891.72314453125,1101.9541015625,,,891.72314453125,1101.9541015625,891.72314453125,1101.9541015625,891.72314453125,1101.9541015625,27263,"['aten::miopen_convolution', 'nn.Module: Conv2d_29', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(891.723), 'mean_duration_us': np.float64(891.723), 'median_duration_us': np.float64(891.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(891.723), 'max_duration_us': np.float64(891.723)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(891.72)}]",0.12515621671718735,95.87728720130153 -aten::_flash_attention_forward,other,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1, 77, 20, 64), (1, 77, 20, 64), (1, 77, 20, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((98560, 1280, 64, 1), (98560, 1280, 64, 1), (98560, 1280, 64, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '77', '77', '0.', 'True', 'False', '0.125', '', '', '', '')",1,64,13.733909606933594,15.265159606933594,13.740234375,15.100341796875,0.3578330651903923,0.9025663372159146,12.2578125,13.498046875,14.380859375,21.31005859375,878.97021484375,976.97021484375,1548,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'attn_fwd', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(878.968), 'mean_duration_us': np.float64(13.733875), 'median_duration_us': np.float64(13.74), 'std_dev_duration_us': np.float64(0.35501850744010516), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(14.381)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.73)}]",0.12336630194202827,96.00065350324356 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (1, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (256, 1, 1, 1), ())","('', '', '1')",1,7,118.40325055803571,118.40325055803571,115.93115234375,115.93115234375,5.8983346516891535,5.8983346516891535,112.88720703125,112.88720703125,127.7490234375,127.7490234375,828.82275390625,828.82275390625,27140,"['aten::add_', 'nn.Module: Conv2d_19', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(828.8230000000001), 'mean_duration_us': np.float64(118.40328571428573), 'median_duration_us': np.float64(115.931), 'std_dev_duration_us': np.float64(5.460850606539129), 'min_duration_us': np.float64(112.887), 'max_duration_us': np.float64(127.749)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(118.4)}]",0.11632794421025754,96.11698144745381 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1280,), (77, 5120), (5120, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (5120, 1), (1, 5120), (), ())","('', '', '', '1', '1')",1,64,12.647163391113281,12.647163391113281,12.61767578125,12.61767578125,0.23802573761036794,0.23802573761036794,12.2568359375,12.2568359375,13.89892578125,13.89892578125,809.41845703125,809.41845703125,1606,"['aten::addmm', 'nn.Module: Linear_78', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(809.4159999999999), 'mean_duration_us': np.float64(12.647124999999999), 'median_duration_us': np.float64(12.6175), 'std_dev_duration_us': np.float64(0.23618745865307908), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.899)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.65)}]",0.1136044886177611,96.23058593607158 -aten::mul,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'double')","((2621440, 10240, 1), ())","('', '')",1,144,5.530008951822917,5.530008951822917,4.92626953125,4.92626953125,1.0932611565836916,1.0932611565836916,2.962890625,2.962890625,7.73095703125,7.73095703125,796.3212890625,796.3212890625,5288,"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(796.32), 'mean_duration_us': np.float64(5.53), 'median_duration_us': np.float64(4.9265), 'std_dev_duration_us': np.float64(1.0894735923065477), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]",0.11176625889059622,96.34235219496217 -aten::mean,reduce,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1048576, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",1,98,8.11019212372449,8.11019212372449,8.0908203125,8.0908203125,0.13343169375155572,0.13343169375155572,7.89013671875,7.89013671875,8.89208984375,8.89208984375,794.798828125,794.798828125,5095,"['aten::mean', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(794.8029999999999), 'mean_duration_us': np.float64(8.11023469387755), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.13277860974004113), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",0.089160755090714,96.94634960865527 -aten::mul,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 1))","('c10::BFloat16', 'float')","((1048576, 4096, 1), (256, 1, 1))","('', '')",1,98,6.172662228954081,6.172662228954081,6.1279296875,6.1279296875,0.395586423329981,0.395586423329981,5.52685546875,5.52685546875,7.61083984375,7.61083984375,604.9208984375,604.9208984375,5098,"['aten::mul', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(604.921), 'mean_duration_us': np.float64(6.172663265306123), 'median_duration_us': np.float64(6.128), 'std_dev_duration_us': np.float64(0.3935874755317555), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(7.611)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.17)}]",0.08490259732060394,97.03125220597587 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,5,118.3177734375,118.3177734375,119.69580078125,119.69580078125,2.0926909657870496,2.0926909657870496,115.89013671875,115.89013671875,119.97607421875,119.97607421875,591.5888671875,591.5888671875,27141,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_18', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(178.62), 'mean_duration_us': np.float64(35.724000000000004), 'median_duration_us': np.float64(35.612), 'std_dev_duration_us': np.float64(0.5430587445203343), 'min_duration_us': np.float64(34.931), 'max_duration_us': np.float64(36.493)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(412.969), 'mean_duration_us': np.float64(82.5938), 'median_duration_us': np.float64(83.483), 'std_dev_duration_us': np.float64(1.7604830473480866), 'min_duration_us': np.float64(80.038), 'max_duration_us': np.float64(84.405)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(35.72)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(82.59)}]",0.08303140377512024,97.114283609751 -aten::_softmax,other,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (), ())","('float', 'Scalar', 'Scalar')","((4194304, 65536, 256, 1), (), ())","('', '-1', 'False')",1,48,11.830708821614584,11.830708821614584,12.13720703125,12.13720703125,0.6630237228890721,0.6630237228890721,10.4951171875,10.4951171875,12.89794921875,12.89794921875,567.8740234375,567.8740234375,5225,"['aten::_softmax', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void (anonymous namespace)::softmax_warp_forward(float*, float const*, int, int, int, bool const*, int, bool)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(567.874), 'mean_duration_us': np.float64(11.830708333333334), 'median_duration_us': np.float64(12.137), 'std_dev_duration_us': np.float64(0.6561059669981334), 'min_duration_us': np.float64(10.495), 'max_duration_us': np.float64(12.898)}]","[{'name': 'void (anonymous namespace)::softmax_warp_forward(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(164.163), 'mean_duration_us': np.float64(164.163), 'median_duration_us': np.float64(164.163), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(164.163), 'max_duration_us': np.float64(164.163)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(336.459), 'mean_duration_us': np.float64(336.459), 'median_duration_us': np.float64(336.459), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(336.459), 'max_duration_us': np.float64(336.459)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(164.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(336.46)}]",0.07026392071316537,97.26425047950309 -aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",1,48,10.319356282552084,10.319356282552084,10.4140625,10.4140625,0.6740310252108017,0.6740310252108017,8.05078125,8.05078125,11.69580078125,11.69580078125,495.3291015625,495.3291015625,5230,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(495.32899999999995), 'mean_duration_us': np.float64(10.319354166666665), 'median_duration_us': np.float64(10.414), 'std_dev_duration_us': np.float64(0.6669758394419588), 'min_duration_us': np.float64(8.051), 'max_duration_us': np.float64(11.696)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.32)}]",0.06952103549367213,97.33377151499677 -aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (1, 128, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (134217728, 1048576, 1024, 1), ())","('', '', '1')",1,3,160.34440104166666,160.34440104166666,160.67822265625,160.67822265625,0.9468266154769833,0.9468266154769833,159.27587890625,159.27587890625,161.0791015625,161.0791015625,481.033203125,481.033203125,27268,"['aten::add', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(481.033), 'mean_duration_us': np.float64(160.34433333333334), 'median_duration_us': np.float64(160.678), 'std_dev_duration_us': np.float64(0.7729606860780295), 'min_duration_us': np.float64(159.276), 'max_duration_us': np.float64(161.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(160.34)}]",0.06751456008257221,97.40128607507934 -aten::mul,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((4096,), (1, 256, 4096))","('c10::BFloat16', 'c10::BFloat16')","((1,), (1048576, 4096, 1))","('', '')",1,98,4.73542629942602,4.73542629942602,4.7060546875,4.7060546875,0.30576023168563127,0.30576023168563127,4.0048828125,4.0048828125,6.328125,6.328125,464.07177734375,464.07177734375,5103,"['aten::mul', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(464.06999999999994), 'mean_duration_us': np.float64(4.735408163265306), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.3041668727260965), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]",0.06513396931969982,97.46642004439904 -aten::tanh,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240),)","('c10::BFloat16',)","((2621440, 10240, 1),)","('',)",1,48,9.619974772135416,9.619974772135416,9.61328125,9.61328125,0.462344728681359,0.462344728681359,8.3310546875,8.3310546875,11.77587890625,11.77587890625,461.7587890625,461.7587890625,5295,"['aten::tanh', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(461.759), 'mean_duration_us': np.float64(9.619979166666667), 'median_duration_us': np.float64(9.6135), 'std_dev_duration_us': np.float64(0.45751723508443426), 'min_duration_us': np.float64(8.331), 'max_duration_us': np.float64(11.776)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ta...', 'stream': 0, 'mean_duration_us': np.float64(9.62)}]",0.06480933396132903,97.53122937836038 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 512, 512),)","('c10::BFloat16',)","((67108864, 262144, 512, 1),)","('',)",1,5,90.62138671875,90.62138671875,90.5732421875,90.5732421875,2.827936505522151,2.827936505522151,87.60888671875,87.60888671875,94.81982421875,94.81982421875,453.10693359375,453.10693359375,27145,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(453.1069999999999), 'mean_duration_us': np.float64(90.62139999999998), 'median_duration_us': np.float64(90.573), 'std_dev_duration_us': np.float64(2.5293653433223118), 'min_duration_us': np.float64(87.609), 'max_duration_us': np.float64(94.82)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(90.62)}]",0.06359501816758356,97.59482439652797 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (1, 512, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (512, 1, 1, 1), ())","('', '', '1')",1,7,64.55231584821429,64.55231584821429,63.1728515625,63.1728515625,4.22928109753556,4.22928109753556,59.408203125,59.408203125,70.6240234375,70.6240234375,451.8662109375,451.8662109375,27030,"['aten::add_', 'nn.Module: Conv2d_11', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(451.86600000000004), 'mean_duration_us': np.float64(64.55228571428572), 'median_duration_us': np.float64(63.173), 'std_dev_duration_us': np.float64(3.9155450893762884), 'min_duration_us': np.float64(59.408), 'max_duration_us': np.float64(70.624)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.55)}]",0.06342087874482229,97.65824527527279 -aten::pow,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), ())","('float', 'Scalar')","((1048576, 4096, 1), ())","('', '2')",1,98,4.5053411989795915,4.5053411989795915,4.0654296875,4.0654296875,1.1635621576041233,1.1635621576041233,3.244140625,3.244140625,6.52783203125,6.52783203125,441.5234375,441.5234375,5092,"['aten::pow', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(441.52500000000003), 'mean_duration_us': np.float64(4.505357142857143), 'median_duration_us': np.float64(4.0655), 'std_dev_duration_us': np.float64(1.1575871567662643), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.061969237165550535,97.72021451243835 -aten::add,elementwise,nn.Module: T5LayerSelfAttention,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', '1')",1,48,9.082448323567709,9.082448323567709,3.66455078125,3.66455078125,6.010822419117579,6.010822419117579,3.1630859375,3.1630859375,16.06298828125,16.06298828125,435.95751953125,435.95751953125,5262,"['aten::add', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(435.959), 'mean_duration_us': np.float64(9.082479166666667), 'median_duration_us': np.float64(3.6645000000000003), 'std_dev_duration_us': np.float64(5.94786024196091), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(16.063)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(9.08)}]",0.06118804264368675,97.78140255508204 -triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 14592), (14592,), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (14592, 1), (1,), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",1,4,108.5,108.5,98.926025390625,98.926025390625,22.329341551853997,22.329341551853997,94.5791015625,94.5791015625,141.56884765625,141.56884765625,434.0,434.0,18462,"['triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(434.0), 'mean_duration_us': np.float64(108.5), 'median_duration_us': np.float64(98.926), 'std_dev_duration_us': np.float64(19.33785150941024), 'min_duration_us': np.float64(94.579), 'max_duration_us': np.float64(141.569)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(108.5)}]",0.06091329846979851,97.84231585355184 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (1, 3, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 1048576, 1024, 1), (3145728, 1048576, 1024, 1), ())","('', '', 'False')",1,1,412.01123046875,412.01123046875,412.01123046875,412.01123046875,,,412.01123046875,412.01123046875,412.01123046875,412.01123046875,412.01123046875,412.01123046875,27348,['aten::copy_'],"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(412.011), 'mean_duration_us': np.float64(412.011), 'median_duration_us': np.float64(412.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(412.011), 'max_duration_us': np.float64(412.011)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(412.01)}]",0.057827103812101176,97.90014295736394 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (1, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((268435456, 1048576, 1024, 1), (256, 1, 1, 1), ())","('', '', '1')",1,1,392.86181640625,392.86181640625,392.86181640625,392.86181640625,,,392.86181640625,392.86181640625,392.86181640625,392.86181640625,392.86181640625,392.86181640625,27232,"['aten::add_', 'nn.Module: Conv2d_26', 'nn.Module: Upsample2D_2', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(392.862), 'mean_duration_us': np.float64(392.862), 'median_duration_us': np.float64(392.862), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(392.862), 'max_duration_us': np.float64(392.862)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(392.86)}]",0.05513942184364307,97.95528237920759 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024),)","('c10::BFloat16',)","((268435456, 1048576, 1024, 1),)","('',)",1,1,386.01318359375,386.01318359375,386.01318359375,386.01318359375,,,386.01318359375,386.01318359375,386.01318359375,386.01318359375,386.01318359375,386.01318359375,27237,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(386.013), 'mean_duration_us': np.float64(386.013), 'median_duration_us': np.float64(386.013), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(386.013), 'max_duration_us': np.float64(386.013)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(386.01)}]",0.05417819416019176,98.00946057336778 -aten::upsample_nearest2d,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((67108864, 262144, 512, 1), (), (), ())","('', '[1024, 1024]', '2.', '2.')",1,1,382.287109375,382.287109375,382.287109375,382.287109375,,,382.287109375,382.287109375,382.287109375,382.287109375,382.287109375,382.287109375,27224,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_2', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(382.287), 'mean_duration_us': np.float64(382.287), 'median_duration_us': np.float64(382.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(382.287), 'max_duration_us': np.float64(382.287)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(382.29)}]",0.053655227637133374,98.06311580100491 -aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",1,48,7.928293863932292,7.928293863932292,8.010986328125,8.010986328125,0.6323219764114211,0.6323219764114211,6.93017578125,6.93017578125,9.1728515625,9.1728515625,380.55810546875,380.55810546875,5223,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(380.557), 'mean_duration_us': np.float64(7.928270833333333), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.6257010647926363), 'min_duration_us': np.float64(6.93), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(7.93)}]",0.05341255636755537,98.11652835737247 -aten::bmm,GEMM,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((64, 256, 256), (64, 256, 64))","('c10::BFloat16', 'c10::BFloat16')","((65536, 256, 1), (64, 4096, 1))","('', '')",1,48,7.914967854817708,7.914967854817708,7.91064453125,7.91064453125,0.15546949489674314,0.15546949489674314,7.52978515625,7.52978515625,8.2919921875,8.2919921875,379.91845703125,379.91845703125,5241,"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB128_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(379.916), 'mean_duration_us': np.float64(7.914916666666667), 'median_duration_us': np.float64(7.9105), 'std_dev_duration_us': np.float64(0.15383430389726319), 'min_duration_us': np.float64(7.53), 'max_duration_us': np.float64(8.292)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(7.91)}]",0.05332277964822547,98.1698511370207 -aten::bmm,GEMM,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((64, 256, 64), (64, 64, 256))","('c10::BFloat16', 'c10::BFloat16')","((64, 4096, 1), (64, 1, 4096))","('', '')",1,48,7.886566162109375,7.886566162109375,7.89111328125,7.89111328125,0.1390650795704857,0.1390650795704857,7.53076171875,7.53076171875,8.3310546875,8.3310546875,378.55517578125,378.55517578125,5151,"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AFC0_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD0_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(378.553), 'mean_duration_us': np.float64(7.886520833333333), 'median_duration_us': np.float64(7.891), 'std_dev_duration_us': np.float64(0.13759345151316446), 'min_duration_us': np.float64(7.531), 'max_duration_us': np.float64(8.331)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AF...', 'stream': 0, 'mean_duration_us': np.float64(7.89)}]",0.05313143873191319,98.22298257575261 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,62.590901692708336,62.590901692708336,63.171630859375,63.171630859375,3.1680777446719164,3.1680777446719164,58.525390625,58.525390625,66.376953125,66.376953125,375.54541015625,375.54541015625,27031,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_11', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(111.75900000000001), 'mean_duration_us': np.float64(18.626500000000004), 'median_duration_us': np.float64(18.426000000000002), 'std_dev_duration_us': np.float64(0.5515921651606974), 'min_duration_us': np.float64(17.906), 'max_duration_us': np.float64(19.548)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(263.786), 'mean_duration_us': np.float64(43.964333333333336), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(2.4412839290468074), 'min_duration_us': np.float64(40.219), 'max_duration_us': np.float64(46.829)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(18.63)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(43.96)}]",0.05270900842813493,98.27569158418075 -aten::add,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((2621440, 10240, 1), (), ())","('', '', '1')",1,48,7.6912841796875,7.6912841796875,7.73095703125,7.73095703125,0.5368066733838069,0.5368066733838069,6.52783203125,6.52783203125,9.1728515625,9.1728515625,369.181640625,369.181640625,5296,"['aten::add', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(369.18199999999996), 'mean_duration_us': np.float64(7.6912916666666655), 'median_duration_us': np.float64(7.731), 'std_dev_duration_us': np.float64(0.5311947994197189), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.69)}]",0.05181583286857262,98.32750741704932 -aten::copy_,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",1,98,3.653773716517857,3.653773716517857,3.48388671875,3.48388671875,1.208679528258489,1.208679528258489,3.2041015625,3.2041015625,15.30078125,15.30078125,358.06982421875,358.06982421875,5091,"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(358.069), 'mean_duration_us': np.float64(3.653765306122449), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(1.202514761257105), 'min_duration_us': np.float64(3.204), 'max_duration_us': np.float64(15.301)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.65)}]",0.05025625363056453,98.37776367067988 -aten::add,elementwise,nn.Module: CLIPEncoderLayer,python3,CPU,thread 416 (python3),"((1, 77, 1280), (1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 1280, 1), (98560, 1280, 1), ())","('', '', '1')",1,128,2.774738311767578,2.774738311767578,2.76318359375,2.76318359375,0.136688569313187,0.136688569313187,2.36279296875,2.36279296875,3.083984375,3.083984375,355.16650390625,355.16650390625,1583,"['aten::add', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 128, 'total_duration_us': np.float64(355.16099999999994), 'mean_duration_us': np.float64(2.7746953124999996), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.13619704008541206), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(3.084)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.77)}]",0.049848763269392325,98.42761243394928 -aten::add,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2621440, 10240, 1), (2621440, 10240, 1), ())","('', '', '1')",1,48,7.373291015625,7.373291015625,7.2900390625,7.2900390625,0.4467926884954272,0.4467926884954272,6.68896484375,6.68896484375,9.0517578125,9.0517578125,353.91796875,353.91796875,5293,"['aten::add', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(353.918), 'mean_duration_us': np.float64(7.373291666666667), 'median_duration_us': np.float64(7.29), 'std_dev_duration_us': np.float64(0.4421139068127377), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.052)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.37)}]",0.04967352733708197,98.47728596128636 -aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), ())","('c10::BFloat16', 'double')","((134217728, 1048576, 1024, 1), ())","('', '')",1,3,117.052734375,117.052734375,117.4931640625,117.4931640625,1.1657288165048338,1.1657288165048338,115.73095703125,115.73095703125,117.93408203125,117.93408203125,351.158203125,351.158203125,27269,"['aten::div', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(351.158), 'mean_duration_us': np.float64(117.05266666666667), 'median_duration_us': np.float64(117.493), 'std_dev_duration_us': np.float64(0.951743079244021), 'min_duration_us': np.float64(115.731), 'max_duration_us': np.float64(117.934)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(117.05)}]",0.04928618533887386,98.52657214662523 -aten::mul,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240))","('c10::BFloat16', 'c10::BFloat16')","((2621440, 10240, 1), (2621440, 10240, 1))","('', '')",1,48,7.253122965494792,7.253122965494792,7.12890625,7.12890625,0.49468051239269506,0.49468051239269506,6.408203125,6.408203125,8.73193359375,8.73193359375,348.14990234375,348.14990234375,5297,"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(348.15), 'mean_duration_us': np.float64(7.253125), 'median_duration_us': np.float64(7.129), 'std_dev_duration_us': np.float64(0.4895399466591056), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(8.732)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(7.25)}]",0.04886396063063606,98.57543610725587 -aten::gelu,elementwise,nn.Module: GELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 5120), ())","('c10::BFloat16', '')","((394240, 5120, 1), ())","('', '')",1,64,5.263710021972656,5.263710021972656,5.16650390625,5.16650390625,0.3725945490820721,0.3725945490820721,4.80615234375,4.80615234375,6.96923828125,6.96923828125,336.87744140625,336.87744140625,1599,"['aten::gelu', 'nn.Module: GELUActivation_0', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(336.87699999999995), 'mean_duration_us': np.float64(5.263703124999999), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(0.369633588828497), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Ge...', 'stream': 0, 'mean_duration_us': np.float64(5.26)}]",0.047281834415025266,98.6227179416709 -aten::copy_,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",1,98,3.4167580117984695,3.4167580117984695,3.423828125,3.423828125,0.23546391148849397,0.23546391148849397,3.0029296875,3.0029296875,3.923828125,3.923828125,334.84228515625,334.84228515625,5102,"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(334.84000000000003), 'mean_duration_us': np.float64(3.4167346938775514), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.23425720867615366), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.924)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.046996193677493185,98.66971413534839 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4864), (4864,), (2, 4096, 2432), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (9961472, 2432, 1), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '8192', '2432')",1,4,80.3485107421875,80.3485107421875,72.0859375,72.0859375,16.725685280144965,16.725685280144965,71.7861328125,71.7861328125,105.43603515625,105.43603515625,321.39404296875,321.39404296875,20447,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(321.394), 'mean_duration_us': np.float64(80.3485), 'median_duration_us': np.float64(72.086), 'std_dev_duration_us': np.float64(14.484854805968892), 'min_duration_us': np.float64(71.786), 'max_duration_us': np.float64(105.436)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(80.35)}]",0.04510868955246709,98.71482282490085 -aten::_flash_attention_forward,other,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1, 77, 12, 64), (1, 77, 12, 64), (1, 77, 12, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((59136, 768, 64, 1), (59136, 768, 64, 1), (59136, 768, 64, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '77', '77', '0.', 'True', 'False', '0.125', '', '', '', '')",1,24,13.175252278645834,16.071818033854168,13.03857421875,14.439453125,0.5107849476978698,2.800457197961641,12.4169921875,14.05908203125,14.580078125,21.7109375,316.2060546875,385.7236328125,103,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(316.206), 'mean_duration_us': np.float64(13.17525), 'median_duration_us': np.float64(13.038499999999999), 'std_dev_duration_us': np.float64(0.5000066041230524), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(14.58)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.18)}]",0.044380538680039446,98.7592033635809 -aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 256, 64, 64), (1, 256, 64, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 64, 1), (1048576, 64, 16384, 1), ())","('', '', 'False')",1,48,6.558736165364583,6.558736165364583,6.54833984375,6.54833984375,0.31613188099540285,0.31613188099540285,6.0478515625,6.0478515625,7.1689453125,7.1689453125,314.8193359375,314.8193359375,5249,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(314.819), 'mean_duration_us': np.float64(6.558729166666667), 'median_duration_us': np.float64(6.5485), 'std_dev_duration_us': np.float64(0.31280177026775097), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.169)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.56)}]",0.04418590823507996,98.80338927181597 -triton_poi_fused_add_addmm_silu_3,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '', '4864')",1,72,4.111178927951389,4.111178927951389,4.14501953125,4.14501953125,1.1141597813731445,1.1141597813731445,2.60302734375,2.60302734375,8.05078125,8.05078125,296.0048828125,296.0048828125,18412,"['triton_poi_fused_add_addmm_silu_3', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'count': 72, 'total_duration_us': np.float64(296.005), 'mean_duration_us': np.float64(4.111180555555555), 'median_duration_us': np.float64(4.1450000000000005), 'std_dev_duration_us': np.float64(1.1063898665679002), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(8.051)}]","[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]",0.04154523911353812,98.8449345109295 -aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (8388608, 16384, 128, 1), ())","('', '', '1')",1,4,71.3955078125,71.3955078125,71.345458984375,71.345458984375,1.9844591418271784,1.9844591418271784,69.10205078125,69.10205078125,73.7890625,73.7890625,285.58203125,285.58203125,26912,"['aten::add', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(285.582), 'mean_duration_us': np.float64(71.3955), 'median_duration_us': np.float64(71.3455), 'std_dev_duration_us': np.float64(1.7186088123828527), 'min_duration_us': np.float64(69.102), 'max_duration_us': np.float64(73.789)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(71.4)}]",0.04008235831138843,98.8850168692409 -aten::rsqrt,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 1),)","('float',)","((256, 1, 1),)","('',)",1,98,2.89102857940051,2.89102857940051,2.8427734375,2.8427734375,0.4045436215443143,0.4045436215443143,2.64306640625,2.64306640625,6.72900390625,6.72900390625,283.32080078125,283.32080078125,5097,"['aten::rsqrt', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(283.322), 'mean_duration_us': np.float64(2.8910408163265306), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.40249580853103045), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(2.89)}]",0.0397649873287802,98.92478185656968 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 256, 256),)","('c10::BFloat16',)","((33554432, 65536, 256, 1),)","('',)",1,6,45.580403645833336,45.580403645833336,46.108154296875,46.108154296875,3.2794362265579236,3.2794362265579236,41.6611328125,41.6611328125,49.5927734375,49.5927734375,273.482421875,273.482421875,27035,"['aten::silu', 'nn.Module: SiLU_5', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(273.482), 'mean_duration_us': np.float64(45.580333333333336), 'median_duration_us': np.float64(46.108000000000004), 'std_dev_duration_us': np.float64(2.993738168614989), 'min_duration_us': np.float64(41.661), 'max_duration_us': np.float64(49.593)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(45.58)}]",0.03838413914727012,98.96316599571695 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,252.89404296875,252.89404296875,252.89404296875,252.89404296875,,,252.89404296875,252.89404296875,252.89404296875,252.89404296875,252.89404296875,252.89404296875,27128,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_17', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.455), 'mean_duration_us': np.float64(64.455), 'median_duration_us': np.float64(64.455), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.455), 'max_duration_us': np.float64(64.455)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(188.439), 'mean_duration_us': np.float64(188.439), 'median_duration_us': np.float64(188.439), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(188.439), 'max_duration_us': np.float64(188.439)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.46)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(188.44)}]",0.03549449382624313,98.9986604895432 -aten::copy_,elementwise,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (512, 1, 65536, 512), ())","('', '', 'False')",1,4,63.04248046875,63.04248046875,63.31298828125,63.31298828125,2.866291124304218,2.866291124304218,59.287109375,59.287109375,66.2568359375,66.2568359375,252.169921875,252.169921875,26885,"['aten::copy_', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(252.17000000000002), 'mean_duration_us': np.float64(63.042500000000004), 'median_duration_us': np.float64(63.313), 'std_dev_duration_us': np.float64(2.4823704900759695), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.04)}]",0.035392861097413936,99.03405335064062 -aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (1, 256, 512, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (67108864, 262144, 512, 1), ())","('', '', '1')",1,3,83.77734375,83.77734375,83.3232421875,83.3232421875,1.2263848242878954,1.2263848242878954,82.8427734375,82.8427734375,85.166015625,85.166015625,251.33203125,251.33203125,27163,"['aten::add', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(251.332), 'mean_duration_us': np.float64(83.77733333333333), 'median_duration_us': np.float64(83.323), 'std_dev_duration_us': np.float64(1.0012979354595477), 'min_duration_us': np.float64(82.843), 'max_duration_us': np.float64(85.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(83.78)}]",0.035275260448276446,99.06932861108889 -aten::add,elementwise,nn.Module: CLIPEncoderLayer,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,48,5.015513102213542,5.015513102213542,5.046875,5.046875,0.38265797592012546,0.38265797592012546,4.1650390625,4.1650390625,6.0078125,6.0078125,240.74462890625,240.74462890625,138,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(240.745), 'mean_duration_us': np.float64(5.015520833333333), 'median_duration_us': np.float64(5.047), 'std_dev_duration_us': np.float64(0.3786864902519042), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.02)}]",0.03378928441374952,99.10311789550263 -aten::pow,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'Scalar')","((2621440, 10240, 1), ())","('', '3.')",1,48,4.81292724609375,4.81292724609375,4.76611328125,4.76611328125,0.3375204223664483,0.3375204223664483,4.24609375,4.24609375,6.44921875,6.44921875,231.0205078125,231.0205078125,5289,"['aten::pow', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(231.017), 'mean_duration_us': np.float64(4.812854166666667), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.334003617095143), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",0.032424472684394544,99.13554236818703 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (512, 1, 1, 1), ())","('', '', '1')",1,11,20.443670099431817,20.443670099431817,20.34912109375,20.34912109375,1.265204583928953,1.265204583928953,18.466796875,18.466796875,22.55322265625,22.55322265625,224.88037109375,224.88037109375,26753,"['aten::add_', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(224.881), 'mean_duration_us': np.float64(20.443727272727273), 'median_duration_us': np.float64(20.349), 'std_dev_duration_us': np.float64(1.2062343425952518), 'min_duration_us': np.float64(18.467), 'max_duration_us': np.float64(22.553)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.44)}]",0.03156268471067429,99.16710505289771 -aten::mul,elementwise,nn.Module: T5DenseGatedActDense,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240))","('c10::BFloat16', 'c10::BFloat16')","((2621440, 10240, 1), (2621440, 10240, 1))","('', '')",1,48,4.670186360677083,4.670186360677083,4.64599609375,4.64599609375,0.08009262758675076,0.08009262758675076,4.56494140625,4.56494140625,4.88623046875,4.88623046875,224.1689453125,224.1689453125,5307,"['aten::mul', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(224.168), 'mean_duration_us': np.float64(4.670166666666667), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.07917973576336035), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.886)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.67)}]",0.03146283380986233,99.19856788670758 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 128, 128),)","('c10::BFloat16',)","((8388608, 16384, 128, 1),)","('',)",1,10,21.7033203125,21.7033203125,21.951416015625,21.951416015625,2.556412588605594,2.556412588605594,15.10205078125,15.10205078125,24.03515625,24.03515625,217.033203125,217.033203125,26758,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(217.03300000000002), 'mean_duration_us': np.float64(21.703300000000002), 'median_duration_us': np.float64(21.9515), 'std_dev_duration_us': np.float64(2.425225888448332), 'min_duration_us': np.float64(15.102), 'max_duration_us': np.float64(24.035)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(21.7)}]",0.03046130940048279,99.22902919610806 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",1,24,8.953898111979166,8.953898111979166,8.7919921875,8.7919921875,0.37142902420526336,0.37142902420526336,8.61181640625,8.61181640625,10.01416015625,10.01416015625,214.8935546875,214.8935546875,163,"['aten::addmm', 'nn.Module: Linear_5', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(214.894), 'mean_duration_us': np.float64(8.953916666666666), 'median_duration_us': np.float64(8.792), 'std_dev_duration_us': np.float64(0.36354767187017195), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(10.014)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.95)}]",0.03016100284773193,99.25919019895579 -aten::native_layer_norm,NORM_fwd,nn.Module: LayerNorm,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (), (1,), (1,), ())","('', '[768]', '', '', '1.0000000000000001e-05')",1,50,4.274140625,4.274140625,4.2451171875,4.2451171875,0.19483437471531076,0.19483437471531076,4.044921875,4.044921875,4.9658203125,4.9658203125,213.70703125,213.70703125,56,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]",0.0299944704599673,99.28918466941576 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 262144, 512, 1), (512, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",1,1,210.07177734375,325.681640625,210.07177734375,325.681640625,,,210.07177734375,325.681640625,210.07177734375,325.681640625,210.07177734375,325.681640625,27158,"['aten::miopen_convolution', 'nn.Module: Conv2d_21', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.072), 'mean_duration_us': np.float64(210.072), 'median_duration_us': np.float64(210.072), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.072), 'max_duration_us': np.float64(210.072)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(210.07)}]",0.029484250860416825,99.31866892027618 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (1, 512, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 262144, 512, 1), (512, 1, 1, 1), ())","('', '', '1')",1,1,204.14208984375,204.14208984375,204.14208984375,204.14208984375,,,204.14208984375,204.14208984375,204.14208984375,204.14208984375,204.14208984375,204.14208984375,27127,"['aten::add_', 'nn.Module: Conv2d_18', 'nn.Module: Upsample2D_1', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(204.142), 'mean_duration_us': np.float64(204.142), 'median_duration_us': np.float64(204.142), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(204.142), 'max_duration_us': np.float64(204.142)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(204.14)}]",0.02865200011267458,99.34732092038885 -aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 512, 512),)","('c10::BFloat16',)","((134217728, 262144, 512, 1),)","('',)",1,1,202.580078125,202.580078125,202.580078125,202.580078125,,,202.580078125,202.580078125,202.580078125,202.580078125,202.580078125,202.580078125,27132,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.58), 'mean_duration_us': np.float64(202.58), 'median_duration_us': np.float64(202.58), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.58), 'max_duration_us': np.float64(202.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.58)}]",0.028432766734707893,99.37575368712356 -aten::add,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 1), (), ())","('float', 'double', 'Scalar')","((256, 1, 1), (), ())","('', '', '1')",1,98,1.97900390625,1.97900390625,1.9619140625,1.9619140625,0.0625893259287263,0.0625893259287263,1.880859375,1.880859375,2.283203125,2.283203125,193.9423828125,193.9423828125,5096,"['aten::add', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(193.94899999999998), 'mean_duration_us': np.float64(1.9790714285714284), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.062211825439298846), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(2.283)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.98)}]",0.027220438364520122,99.40297412548809 -aten::add,elementwise,nn.Module: T5LayerFF,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', '1')",1,48,3.87896728515625,3.87896728515625,3.84521484375,3.84521484375,0.16891118836714863,0.16891118836714863,3.68408203125,3.68408203125,4.72607421875,4.72607421875,186.1904296875,186.1904296875,5319,"['aten::add', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(186.188), 'mean_duration_us': np.float64(3.8789166666666666), 'median_duration_us': np.float64(3.845), 'std_dev_duration_us': np.float64(0.16720245130446565), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(4.726)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.88)}]",0.026132426764457883,99.42910655225255 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",1,24,7.570332845052083,7.570332845052083,7.41015625,7.41015625,0.5188871878512363,0.5188871878512363,7.0888671875,7.0888671875,9.2529296875,9.2529296875,181.68798828125,181.68798828125,152,"['aten::addmm', 'nn.Module: Linear_4', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(181.688), 'mean_duration_us': np.float64(7.570333333333333), 'median_duration_us': np.float64(7.41), 'std_dev_duration_us': np.float64(0.5079509217324928), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(9.253)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]",0.025500494604960913,99.4546070468575 -aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), ())","('c10::BFloat16', 'double')","((67108864, 262144, 512, 1), ())","('', '')",1,3,60.088216145833336,60.088216145833336,59.20703125,59.20703125,1.7745229841248433,1.7745229841248433,58.9267578125,58.9267578125,62.130859375,62.130859375,180.2646484375,180.2646484375,27164,"['aten::div', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(180.265), 'mean_duration_us': np.float64(60.08833333333333), 'median_duration_us': np.float64(59.207), 'std_dev_duration_us': np.float64(1.448899659128341), 'min_duration_us': np.float64(58.927), 'max_duration_us': np.float64(62.131)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(60.09)}]",0.025300724271490174,99.47990777112899 -aten::miopen_convolution,CONV_fwd,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 16, 128, 128), (2432, 16, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((262144, 16384, 128, 1), (64, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",4,4,43.0699462890625,43.0699462890625,42.999755859375,42.999755859375,0.45408290154729514,0.45408290154729514,42.6591796875,42.6591796875,43.62109375,43.62109375,172.27978515625,172.27978515625,18416,"['aten::miopen_convolution', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.905), 'mean_duration_us': np.float64(4.97625), 'median_duration_us': np.float64(4.9864999999999995), 'std_dev_duration_us': np.float64(0.1425313561992589), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.166)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.806), 'mean_duration_us': np.float64(8.4515), 'median_duration_us': np.float64(8.4315), 'std_dev_duration_us': np.float64(0.5024542267709567), 'min_duration_us': np.float64(7.811), 'max_duration_us': np.float64(9.132)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(51.512), 'mean_duration_us': np.float64(12.878), 'median_duration_us': np.float64(12.838000000000001), 'std_dev_duration_us': np.float64(0.08246211251235361), 'min_duration_us': np.float64(12.818), 'max_duration_us': np.float64(13.018)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.05699999999999), 'mean_duration_us': np.float64(16.764249999999997), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(0.3003168118837177), 'min_duration_us': np.float64(16.304), 'max_duration_us': np.float64(17.145)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(4.98)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(8.45)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(12.88)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(16.76)}]",0.02418002298049636,99.5040877941095 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 4096), (4096, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (2432, 1))","('', '', '')",1,4,42.251708984375,42.251708984375,42.261962890625,42.261962890625,0.7774666796021822,0.7774666796021822,41.419921875,41.419921875,43.06298828125,43.06298828125,169.0068359375,169.0068359375,18420,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(169.007), 'mean_duration_us': np.float64(42.25175), 'median_duration_us': np.float64(42.262), 'std_dev_duration_us': np.float64(0.6732137012123276), 'min_duration_us': np.float64(41.42), 'max_duration_us': np.float64(43.063)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(42.25)}]",0.023720654011283888,99.52780844812078 -aten::fill_,elementwise,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1,), ())","('int', 'Scalar')","((1,), ())","('', '0')",1,88,1.9036088423295454,1.9036088423295454,1.36083984375,1.36083984375,1.7185595298411551,1.7185595298411551,1.12109375,1.12109375,8.4921875,8.4921875,167.517578125,167.517578125,121,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 88, 'total_duration_us': np.float64(167.526), 'mean_duration_us': np.float64(1.9037045454545456), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(1.7087313685829433), 'min_duration_us': np.float64(1.121), 'max_duration_us': np.float64(8.492)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.9)}]",0.023511631878492895,99.55132007999927 -aten::upsample_nearest2d,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((33554432, 65536, 256, 1), (), (), ())","('', '[512, 512]', '2.', '2.')",1,1,159.51611328125,159.51611328125,159.51611328125,159.51611328125,,,159.51611328125,159.51611328125,159.51611328125,159.51611328125,159.51611328125,159.51611328125,27119,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_1', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(159.516), 'mean_duration_us': np.float64(159.516), 'median_duration_us': np.float64(159.516), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(159.516), 'max_duration_us': np.float64(159.516)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(159.52)}]",0.02238860050470731,99.57370868050398 -aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",1,24,6.423543294270833,6.423543294270833,6.448486328125,6.448486328125,0.6604502574194904,0.6604502574194904,4.64599609375,4.64599609375,7.77099609375,7.77099609375,154.1650390625,154.1650390625,154,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(154.16500000000002), 'mean_duration_us': np.float64(6.423541666666668), 'median_duration_us': np.float64(6.4485), 'std_dev_duration_us': np.float64(0.6465522651705911), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(7.771)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.42)}]",0.021637559995442878,99.59534624049942 -triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (), (), ())","('', '', '', '', '', '', '8192', '19', '128')",1,4,38.185791015625,38.185791015625,38.296142578125,38.296142578125,0.6489508867729514,0.6489508867729514,37.333984375,37.333984375,38.81689453125,38.81689453125,152.7431640625,152.7431640625,18417,"['triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(152.743), 'mean_duration_us': np.float64(38.18575), 'median_duration_us': np.float64(38.296), 'std_dev_duration_us': np.float64(0.5620197394220234), 'min_duration_us': np.float64(37.334), 'max_duration_us': np.float64(38.817)}]","[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(38.19)}]",0.02143799525751259,99.61678423575694 -aten::sigmoid,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",1,24,6.109761555989583,6.109761555989583,6.0478515625,6.0478515625,0.38336007029338576,0.38336007029338576,5.4072265625,5.4072265625,6.92919921875,6.92919921875,146.63427734375,146.63427734375,155,"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(146.634), 'mean_duration_us': np.float64(6.109749999999999), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.37528314310664157), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(6.929)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.11)}]",0.02058059332198861,99.63736482907893 -triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1), (2, 4096, 1), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (4096, 1, 8192), (4096, 1, 8192), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",1,4,33.8695068359375,33.8695068359375,33.1484375,33.1484375,2.052704965445482,2.052704965445482,32.3671875,32.3671875,36.81396484375,36.81396484375,135.47802734375,135.47802734375,18422,"['triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(135.478), 'mean_duration_us': np.float64(33.8695), 'median_duration_us': np.float64(33.1485), 'std_dev_duration_us': np.float64(1.7777253021769148), 'min_duration_us': np.float64(32.367), 'max_duration_us': np.float64(36.814)}]","[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(33.87)}]",0.019014777685920203,99.65637960676486 -aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (1, 512, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (33554432, 65536, 256, 1), ())","('', '', '1')",1,3,41.40673828125,41.40673828125,41.6201171875,41.6201171875,0.9002729161043719,0.9002729161043719,40.4189453125,40.4189453125,42.18115234375,42.18115234375,124.22021484375,124.22021484375,27058,"['aten::add', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(124.22), 'mean_duration_us': np.float64(41.406666666666666), 'median_duration_us': np.float64(41.62), 'std_dev_duration_us': np.float64(0.7349804230197037), 'min_duration_us': np.float64(40.419), 'max_duration_us': np.float64(42.181)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(41.41)}]",0.017434707425713916,99.67381431419057 -aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",1,24,5.121663411458333,5.121663411458333,5.126953125,5.126953125,0.5496177307356938,0.5496177307356938,4.125,4.125,6.52783203125,6.52783203125,122.919921875,122.919921875,156,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(122.91999999999999), 'mean_duration_us': np.float64(5.121666666666666), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.5380385415769229), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]",0.017252207117640993,99.6910665213082 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,20.2880859375,20.2880859375,20.427978515625,20.427978515625,1.4392336798467016,1.4392336798467016,17.90380859375,17.90380859375,21.7109375,21.7109375,121.728515625,121.728515625,26754,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(40.815000000000005), 'mean_duration_us': np.float64(6.802500000000001), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.5678253105782916), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.851)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.91400000000002), 'mean_duration_us': np.float64(13.485666666666669), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8789754768415834), 'min_duration_us': np.float64(11.856), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.8)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.49)}]",0.017084989411408198,99.7081515107196 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2432,), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (1,), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '666', '2432')",1,4,28.791748046875,28.791748046875,28.842041015625,28.842041015625,0.9892329482443104,0.9892329482443104,27.60009765625,27.60009765625,29.8828125,29.8828125,115.1669921875,115.1669921875,18465,"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.167), 'mean_duration_us': np.float64(28.79175), 'median_duration_us': np.float64(28.842), 'std_dev_duration_us': np.float64(0.8567591187142386), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(29.883)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(28.79)}]",0.01616405845388512,99.72431556917348 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 4864), (2, 4864))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (4864, 1))","('', '', '')",1,8,12.38751220703125,12.38751220703125,12.4169921875,12.4169921875,0.27056156311034085,0.27056156311034085,11.97705078125,11.97705078125,12.77783203125,12.77783203125,99.10009765625,99.10009765625,20398,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(99.1), 'mean_duration_us': np.float64(12.3875), 'median_duration_us': np.float64(12.417), 'std_dev_duration_us': np.float64(0.253121018487205), 'min_duration_us': np.float64(11.977), 'max_duration_us': np.float64(12.778)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.39)}]",0.01390901803438096,99.73822458720787 -aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), ())","('c10::BFloat16', 'double')","((33554432, 65536, 256, 1), ())","('', '')",1,3,31.552897135416668,31.552897135416668,30.56494140625,30.56494140625,1.8162073388792004,1.8162073388792004,30.44482421875,30.44482421875,33.64892578125,33.64892578125,94.65869140625,94.65869140625,27059,"['aten::div', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(94.65899999999999), 'mean_duration_us': np.float64(31.552999999999997), 'median_duration_us': np.float64(30.565), 'std_dev_duration_us': np.float64(1.4829052565824967), 'min_duration_us': np.float64(30.445), 'max_duration_us': np.float64(33.649)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(31.55)}]",0.013285652355736078,99.7515102395636 -aten::add,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (8388608, 16384, 128, 1), ())","('', '', '1')",1,1,92.93798828125,92.93798828125,92.93798828125,92.93798828125,,,92.93798828125,92.93798828125,92.93798828125,92.93798828125,92.93798828125,92.93798828125,26878,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(92.938), 'mean_duration_us': np.float64(92.938), 'median_duration_us': np.float64(92.938), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(92.938), 'max_duration_us': np.float64(92.938)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(92.94)}]",0.01304414612755396,99.76455438569116 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,4,21.1595458984375,84.2020263671875,21.309814453125,85.16357421875,0.9941731905396719,3.5496797689210453,19.8271484375,79.1142578125,22.19140625,87.36669921875,84.63818359375,336.80810546875,26880,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.756999999999998), 'mean_duration_us': np.float64(6.9392499999999995), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.39939477650565214), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(7.491)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(56.881), 'mean_duration_us': np.float64(14.22025), 'median_duration_us': np.float64(14.381), 'std_dev_duration_us': np.float64(0.4814152962879343), 'min_duration_us': np.float64(13.419), 'max_duration_us': np.float64(14.7)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.94)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(14.22)}]",0.011879241795363359,99.77643362748653 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((16384, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 16384), (1, 512))","('', '')",1,3,27.146158854166668,27.146158854166668,25.55712890625,25.55712890625,3.616534916430768,3.616534916430768,24.59619140625,24.59619140625,31.28515625,31.28515625,81.4384765625,81.4384765625,26801,"['aten::mm', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA4_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB0_LBSPPM0_LPA4_LPB0_LPM0_LRVW4_LWPMn1_MIAV0_MIWT4_8_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB8_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(81.438), 'mean_duration_us': np.float64(27.146), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(2.952893609100516), 'min_duration_us': np.float64(24.596), 'max_duration_us': np.float64(31.285)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(27.15)}]",0.011430152603173396,99.7878637800897 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 64), (8192, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (64, 1))","('', '', '')",1,4,19.6181640625,19.6181640625,19.648193359375,19.648193359375,0.7299416556187925,0.7299416556187925,18.7470703125,18.7470703125,20.42919921875,20.42919921875,78.47265625,78.47265625,20448,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(78.472), 'mean_duration_us': np.float64(19.618), 'median_duration_us': np.float64(19.648), 'std_dev_duration_us': np.float64(0.6320921610018587), 'min_duration_us': np.float64(18.747), 'max_duration_us': np.float64(20.429)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(19.62)}]",0.01101389016560864,99.79887767025531 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",1,8,9.7286376953125,9.7286376953125,9.112548828125,9.112548828125,2.1861249338708104,2.1861249338708104,8.3720703125,8.3720703125,14.98193359375,14.98193359375,77.8291015625,77.8291015625,18408,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(77.829), 'mean_duration_us': np.float64(9.728625), 'median_duration_us': np.float64(9.1125), 'std_dev_duration_us': np.float64(2.0449552524138515), 'min_duration_us': np.float64(8.372), 'max_duration_us': np.float64(14.982)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.73)}]",0.010923565191504205,99.80980123544681 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((32, 64), (), (65536, 64), (), (65536, 64))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((64, 1), (), (1, 0), (), (64, 1))","('', '0', '', 'False', '')",1,2,34.950439453125,34.950439453125,34.950439453125,34.950439453125,0.8206996185939568,0.8206996185939568,34.3701171875,34.3701171875,35.53076171875,35.53076171875,69.90087890625,69.90087890625,5211,"['aten::gather', 'nn.Module: Embedding_5', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(69.901), 'mean_duration_us': np.float64(34.9505), 'median_duration_us': np.float64(34.9505), 'std_dev_duration_us': np.float64(0.5805000000000007), 'min_duration_us': np.float64(34.37), 'max_duration_us': np.float64(35.531)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(34.95)}]",0.009810813594741128,99.81961204904155 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 4864), (4864,), (2, 333, 2432), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (809856, 2432, 1), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '666', '2432')",1,4,16.974365234375,16.974365234375,16.945068359375,16.945068359375,0.2250174974772836,0.2250174974772836,16.7431640625,16.7431640625,17.26416015625,17.26416015625,67.8974609375,67.8974609375,20402,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.89699999999999), 'mean_duration_us': np.float64(16.974249999999998), 'median_duration_us': np.float64(16.945), 'std_dev_duration_us': np.float64(0.19489917265088666), 'min_duration_us': np.float64(16.743), 'max_duration_us': np.float64(17.264)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(16.97)}]",0.009529627427252127,99.82914167646881 -aten::copy_,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (512, 1, 65536, 512), ())","('', '', 'False')",1,1,64.01416015625,64.01416015625,64.01416015625,64.01416015625,,,64.01416015625,64.01416015625,64.01416015625,64.01416015625,64.01416015625,64.01416015625,27022,"['aten::copy_', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.014), 'mean_duration_us': np.float64(64.014), 'median_duration_us': np.float64(64.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.014), 'max_duration_us': np.float64(64.014)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}]",0.008984593649518756,99.83812627011832 -aten::add_,elementwise,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 16384, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 512, 1), (1,), ())","('', '', '1')",1,3,19.841634114583332,19.841634114583332,19.7080078125,19.7080078125,0.8098247697242251,0.8098247697242251,19.10693359375,19.10693359375,20.7099609375,20.7099609375,59.52490234375,59.52490234375,26803,"['aten::add_', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.525), 'mean_duration_us': np.float64(19.841666666666665), 'median_duration_us': np.float64(19.708), 'std_dev_duration_us': np.float64(0.6612121864844571), 'min_duration_us': np.float64(19.107), 'max_duration_us': np.float64(20.71)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(19.84)}]",0.008354511849885836,99.84648078196821 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((), (1, 16, 128, 128))","('float', 'c10::BFloat16')","((), (262144, 16384, 128, 1))","('', '')",1,4,14.8712158203125,14.8712158203125,14.801513671875,14.801513671875,0.4270736026430738,0.4270736026430738,14.4599609375,14.4599609375,15.421875,15.421875,59.48486328125,59.48486328125,20483,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(59.485), 'mean_duration_us': np.float64(14.87125), 'median_duration_us': np.float64(14.8015), 'std_dev_duration_us': np.float64(0.3699130810068764), 'min_duration_us': np.float64(14.46), 'max_duration_us': np.float64(15.422)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.87)}]",0.008348892238446865,99.85482967420666 -aten::sub,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",1,4,10.304443359375,10.304443359375,3.94482421875,3.94482421875,12.785824794055774,12.785824794055774,3.84521484375,3.84521484375,29.48291015625,29.48291015625,41.2177734375,41.2177734375,20458,['aten::sub'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(41.217999999999996), 'mean_duration_us': np.float64(10.304499999999999), 'median_duration_us': np.float64(3.945), 'std_dev_duration_us': np.float64(11.072868677537903), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(29.483)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(10.3)}]",0.005785047317186568,99.86061472152385 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '666', '2432')",1,4,8.49169921875,8.49169921875,8.49169921875,8.49169921875,0.0005638186222554939,0.0005638186222554939,8.4912109375,8.4912109375,8.4921875,8.4921875,33.966796875,33.966796875,18421,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.966), 'mean_duration_us': np.float64(8.4915), 'median_duration_us': np.float64(8.4915), 'std_dev_duration_us': np.float64(0.0005000000000006111), 'min_duration_us': np.float64(8.491), 'max_duration_us': np.float64(8.492)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(8.49)}]",0.004767349391958282,99.8653820709158 -aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (512, 16, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((262144, 16384, 128, 1), (144, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",2,1,32.76611328125,55.3193359375,32.76611328125,55.3193359375,,,32.76611328125,55.3193359375,32.76611328125,55.3193359375,32.76611328125,55.3193359375,26749,"['aten::miopen_convolution', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']","[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.568), 'mean_duration_us': np.float64(6.568), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.568), 'max_duration_us': np.float64(6.568)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA2_NLCB2_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU8_SUM0_SUS256_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.198), 'mean_duration_us': np.float64(26.198), 'median_duration_us': np.float64(26.198), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.198), 'max_duration_us': np.float64(26.198)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(6.57)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(26.2)}]",0.004598829580635969,99.86998090049643 -aten::upsample_nearest2d,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((512, 1, 65536, 512), (), (), ())","('', '[256, 256]', '2.', '2.')",1,1,32.48681640625,96.5009765625,32.48681640625,96.5009765625,,,32.48681640625,96.5009765625,32.48681640625,96.5009765625,32.48681640625,96.5009765625,27017,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.487), 'mean_duration_us': np.float64(32.487), 'median_duration_us': np.float64(32.487), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.487), 'max_duration_us': np.float64(32.487)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(32.49)}]",0.004559629364256805,99.87454052986068 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2048), (2048, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2048, 1), (1, 2048), (2432, 1))","('', '', '')",1,4,7.08935546875,7.08935546875,7.0693359375,7.0693359375,0.056164372579359176,0.056164372579359176,7.0498046875,7.0498046875,7.1689453125,7.1689453125,28.357421875,28.357421875,18409,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(28.358), 'mean_duration_us': np.float64(7.0895), 'median_duration_us': np.float64(7.0695), 'std_dev_duration_us': np.float64(0.04858240422210485), 'min_duration_us': np.float64(7.05), 'max_duration_us': np.float64(7.169)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]",0.003980055535727807,99.87852058539642 -aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((512,), (16384, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",1,1,27.60009765625,27.60009765625,27.60009765625,27.60009765625,,,27.60009765625,27.60009765625,27.60009765625,27.60009765625,27.60009765625,27.60009765625,26871,"['aten::addmm', 'nn.Module: Linear_437', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_7_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.6), 'mean_duration_us': np.float64(27.6), 'median_duration_us': np.float64(27.6), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(27.6)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.6)}]",0.0038737626413150755,99.88239434803774 -aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'double')","((512, 1, 65536, 512), ())","('', '')",1,3,8.865559895833334,8.865559895833334,8.85205078125,8.85205078125,0.22076919151973087,0.22076919151973087,8.65185546875,8.65185546875,9.0927734375,9.0927734375,26.5966796875,26.5966796875,26947,"['aten::div', 'nn.Module: ResnetBlock2D_2', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.596999999999998), 'mean_duration_us': np.float64(8.865666666666666), 'median_duration_us': np.float64(8.852), 'std_dev_duration_us': np.float64(0.18029666910092654), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(9.093)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]",0.003732929696106717,99.88612727773385 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 16, 128, 128), (1, 16, 128, 128)), ())","('TensorList', 'Scalar')","(((262144, 16384, 128, 1), (262144, 16384, 128, 1)), ())","('', '0')",1,4,6.358642578125,6.358642578125,6.569091796875,6.569091796875,0.7197509098981358,0.7197509098981358,5.3271484375,5.3271484375,6.96923828125,6.96923828125,25.4345703125,25.4345703125,18396,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 4, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(25.433999999999997), 'mean_duration_us': np.float64(6.358499999999999), 'median_duration_us': np.float64(6.569), 'std_dev_duration_us': np.float64(0.6233223483880552), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(6.36)}]",0.003569823900682924,99.88969710163452 -triton_poi_fused_addmm_silu_2,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), ())","('', '', '4864')",1,8,3.1087646484375,3.1087646484375,3.083984375,3.083984375,0.3277799647686495,0.3277799647686495,2.80322265625,2.80322265625,3.48388671875,3.48388671875,24.8701171875,24.8701171875,18407,"['triton_poi_fused_addmm_silu_2', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(24.87), 'mean_duration_us': np.float64(3.10875), 'median_duration_us': np.float64(3.0839999999999996), 'std_dev_duration_us': np.float64(0.30680235901961384), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(3.484)}]","[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'mean_duration_us': np.float64(3.11)}]",0.003490601085762796,99.89318770272028 -aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 16384), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,24.7138671875,24.7138671875,24.7138671875,24.7138671875,,,24.7138671875,24.7138671875,24.7138671875,24.7138671875,24.7138671875,24.7138671875,26788,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_2', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.809), 'mean_duration_us': np.float64(6.809), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(6.809)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(17.905), 'mean_duration_us': np.float64(17.905), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(17.905), 'max_duration_us': np.float64(17.905)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.81)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(17.9)}]",0.0034686708947814456,99.89665637361506 -triton_poi_fused__to_copy_cat_slice_1,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 256), (2, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '512')",1,4,6.0982666015625,6.0982666015625,6.14794921875,6.14794921875,0.23668209081633035,0.23668209081633035,5.76806640625,5.76806640625,6.3291015625,6.3291015625,24.39306640625,24.39306640625,18405,"['triton_poi_fused__to_copy_cat_slice_1', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(24.393), 'mean_duration_us': np.float64(6.09825), 'median_duration_us': np.float64(6.148), 'std_dev_duration_us': np.float64(0.20497606567597107), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(6.329)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'mean_duration_us': np.float64(6.1)}]",0.0034236454714228607,99.90008001908649 -triton_poi_fused_addmm_clone_permute_view_25,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 64), (64,), (2, 16, 64, 2, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((64, 1), (1,), (262144, 16384, 256, 128, 2, 1), (), ())","('', '', '', '32', '16384')",1,4,5.9473876953125,5.9473876953125,5.9873046875,5.9873046875,0.09534735954134627,0.09534735954134627,5.80712890625,5.80712890625,6.0078125,6.0078125,23.78955078125,23.78955078125,20449,"['triton_poi_fused_addmm_clone_permute_view_25', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(23.79), 'mean_duration_us': np.float64(5.9475), 'median_duration_us': np.float64(5.9875), 'std_dev_duration_us': np.float64(0.08270580390758536), 'min_duration_us': np.float64(5.807), 'max_duration_us': np.float64(6.008)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'mean_duration_us': np.float64(5.95)}]",0.0033389401087573958,99.90341895919525 -aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 256), (256, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (2432, 1))","('', '', '')",1,4,5.727294921875,5.727294921875,5.70751953125,5.70751953125,0.09820929015034323,0.09820929015034323,5.64697265625,5.64697265625,5.84716796875,5.84716796875,22.9091796875,22.9091796875,18406,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.909), 'mean_duration_us': np.float64(5.72725), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.08497168646084413), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.847)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}]",0.00321537718894685,99.9066343363842 -aten::argmax,reduce,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",1,4,5.59765625,5.59765625,5.547607421875,5.547607421875,0.26256004736612226,0.26256004736612226,5.3671875,5.3671875,5.92822265625,5.92822265625,22.390625,22.390625,1402,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.39), 'mean_duration_us': np.float64(5.5975), 'median_duration_us': np.float64(5.547499999999999), 'std_dev_duration_us': np.float64(0.22739887862520336), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.423000000000002), 'mean_duration_us': np.float64(4.6057500000000005), 'median_duration_us': np.float64(4.586), 'std_dev_duration_us': np.float64(0.13594185337856768), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]",0.0025857065803948304,99.91236263933222 -aten::copy_,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,4,4.55615234375,4.55615234375,4.345703125,4.345703125,0.48984807208769054,0.48984807208769054,4.24609375,4.24609375,5.287109375,5.287109375,18.224609375,18.224609375,1401,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.224), 'mean_duration_us': np.float64(4.556), 'median_duration_us': np.float64(4.3454999999999995), 'std_dev_duration_us': np.float64(0.42424108711910485), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.56)}]",0.0025578826505872425,99.91492052198281 -aten::nonzero,other,NA,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",5,1,17.4609375,17.4609375,17.4609375,17.4609375,,,17.4609375,17.4609375,17.4609375,17.4609375,17.4609375,17.4609375,20463,['aten::nonzero'],"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.922), 'mean_duration_us': np.float64(1.922), 'median_duration_us': np.float64(1.922), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.922), 'max_duration_us': np.float64(1.922)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.805), 'mean_duration_us': np.float64(3.805), 'median_duration_us': np.float64(3.805), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(3.805)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.965), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(3.965)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.92)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.8)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(15.141), 'mean_duration_us': np.float64(7.5705), 'median_duration_us': np.float64(7.5705), 'std_dev_duration_us': np.float64(0.36050000000000004), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(7.931)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]",0.002125104037939658,99.92412839238926 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",1,4,3.7847900390625,3.7847900390625,3.705078125,3.705078125,0.26663028995436494,0.26663028995436494,3.56396484375,3.56396484375,4.1650390625,4.1650390625,15.13916015625,15.13916015625,20459,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(15.139), 'mean_duration_us': np.float64(3.78475), 'median_duration_us': np.float64(3.705), 'std_dev_duration_us': np.float64(0.23088999003854627), 'min_duration_us': np.float64(3.564), 'max_duration_us': np.float64(4.165)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]",0.0021248299105523913,99.92625322229982 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,4,3.584228515625,3.584228515625,3.70458984375,3.70458984375,0.4348311081041389,0.4348311081041389,2.962890625,2.962890625,3.96484375,3.96484375,14.3369140625,14.3369140625,25,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.337000000000002), 'mean_duration_us': np.float64(3.5842500000000004), 'median_duration_us': np.float64(3.7045000000000003), 'std_dev_duration_us': np.float64(0.3765510423568098), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.965)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.58)}]",0.0020122320862325208,99.92826545438605 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('float', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",1,4,3.564453125,3.564453125,3.50390625,3.50390625,0.19360992946960456,0.19360992946960456,3.40478515625,3.40478515625,3.84521484375,3.84521484375,14.2578125,14.2578125,20477,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.258000000000001), 'mean_duration_us': np.float64(3.5645000000000002), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.16751193987295365), 'min_duration_us': np.float64(3.405), 'max_duration_us': np.float64(3.845)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.56)}]",0.0020011299270482124,99.9302665843131 -triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1), (2, 4096, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (4096, 1, 8192), (4096, 1, 8192), (), ())","('', '', '', '', '', '8192', '19')",1,4,3.4942626953125,3.4942626953125,3.54443359375,3.54443359375,0.11484846594160597,0.11484846594160597,3.32421875,3.32421875,3.56396484375,3.56396484375,13.97705078125,13.97705078125,18418,"['triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.977), 'mean_duration_us': np.float64(3.49425), 'median_duration_us': np.float64(3.5445), 'std_dev_duration_us': np.float64(0.09957503452171139), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}]",0.0019617241151285983,99.93222830842824 -aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 768), (768, 768))","('c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768))","('', '')",1,2,6.889404296875,6.889404296875,6.889404296875,6.889404296875,0.28346419304402126,0.28346419304402126,6.68896484375,6.68896484375,7.08984375,7.08984375,13.77880859375,13.77880859375,1415,"['aten::mm', 'nn.Module: Linear_72', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.779), 'mean_duration_us': np.float64(6.8895), 'median_duration_us': np.float64(6.8895), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.09)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(6.89)}]",0.0019339001853210104,99.93416220861356 -aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",1,4,3.4444580078125,3.4444580078125,3.4443359375,3.4443359375,0.2698734709293077,0.2698734709293077,3.1240234375,3.1240234375,3.76513671875,3.76513671875,13.77783203125,13.77783203125,20460,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.778), 'mean_duration_us': np.float64(3.4445), 'median_duration_us': np.float64(3.4444999999999997), 'std_dev_duration_us': np.float64(0.23366696386096175), 'min_duration_us': np.float64(3.124), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]",0.001933763121627377,99.93609597173518 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'float', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",1,4,3.38427734375,3.38427734375,3.364013671875,3.364013671875,0.07683981154707822,0.07683981154707822,3.32421875,3.32421875,3.48486328125,3.48486328125,13.537109375,13.537109375,20488,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536999999999999), 'mean_duration_us': np.float64(3.3842499999999998), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0667097256777451), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.485)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]",0.001899976921146734,99.93799594865634 -triton_poi_fused_add_addmm_silu_22,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '4864')",1,4,3.3236083984375,3.3236083984375,3.3837890625,3.3837890625,0.2555605086823307,0.2555605086823307,2.962890625,2.962890625,3.56396484375,3.56396484375,13.29443359375,13.29443359375,20392,"['triton_poi_fused_add_addmm_silu_22', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.295000000000002), 'mean_duration_us': np.float64(3.3237500000000004), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.22131467981134914), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]",0.0018659165932788247,99.93986186524961 -aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('float', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,6.62890625,6.62890625,6.62890625,6.62890625,0.14155946303051,0.14155946303051,6.52880859375,6.52880859375,6.72900390625,6.72900390625,13.2578125,13.2578125,5182,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.258), 'mean_duration_us': np.float64(6.629), 'median_duration_us': np.float64(6.629), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.63)}]",0.0018607767047675704,99.94172264195439 -aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (8388608, 16384, 128, 1), ())","('', '', '1')",1,1,12.73779296875,12.73779296875,12.73779296875,12.73779296875,,,12.73779296875,12.73779296875,12.73779296875,12.73779296875,12.73779296875,12.73779296875,26781,"['aten::add', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.738), 'mean_duration_us': np.float64(12.738), 'median_duration_us': np.float64(12.738), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.738), 'max_duration_us': np.float64(12.738)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(12.74)}]",0.0017877902879077643,99.94351043224229 -aten::add,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (), ())","('long int', 'long int', 'Scalar')","((256, 1), (), ())","('', '', '1')",1,4,3.1337890625,3.1337890625,3.1240234375,3.1240234375,0.177498125952915,0.177498125952915,2.962890625,2.962890625,3.32421875,3.32421875,12.53515625,12.53515625,5173,"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(3.13375), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.1535746968090772), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.324)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.13)}]",0.0017593495714788255,99.94526978181376 -triton_poi_fused_add_addmm_silu_21,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '4864')",1,4,3.1033935546875,3.1033935546875,3.0634765625,3.0634765625,0.18656449590027488,0.18656449590027488,2.9228515625,2.9228515625,3.36376953125,3.36376953125,12.41357421875,12.41357421875,20338,"['triton_poi_fused_add_addmm_silu_21', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.414000000000001), 'mean_duration_us': np.float64(3.1035000000000004), 'median_duration_us': np.float64(3.0635000000000003), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(2.923), 'max_duration_us': np.float64(3.364)}]","[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'mean_duration_us': np.float64(3.1)}]",0.0017422851416214625,99.94701206695538 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((32128, 4096), (), (256, 4096), (), (256, 4096))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((4096, 1), (), (1, 0), (), (4096, 1))","('', '0', '', 'False', '')",1,2,5.908203125,5.908203125,5.908203125,5.908203125,2.974129791572715,2.974129791572715,3.80517578125,3.80517578125,8.01123046875,8.01123046875,11.81640625,11.81640625,5083,"['aten::gather', 'nn.Module: Embedding_4', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.815999999999999), 'mean_duration_us': np.float64(5.9079999999999995), 'median_duration_us': np.float64(5.9079999999999995), 'std_dev_duration_us': np.float64(2.1029999999999993), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]",0.0016584706929646145,99.94867053764834 -aten::index,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77, 1280), ())","('c10::BFloat16', '')","((98560, 1280, 1), ())","('', '')",1,2,5.867431640625,5.867431640625,5.867431640625,5.867431640625,0.19852851522571524,0.19852851522571524,5.72705078125,5.72705078125,6.0078125,6.0078125,11.73486328125,11.73486328125,5005,"['aten::index', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.735), 'mean_duration_us': np.float64(5.8675), 'median_duration_us': np.float64(5.8675), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.87)}]",0.001647025874546222,99.95031756352289 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 77, 4096), (1, 256, 4096)), ())","('TensorList', 'Scalar')","(((315392, 4096, 1), (1048576, 4096, 1)), ())","('', '-2')",1,2,5.62744140625,5.62744140625,5.62744140625,5.62744140625,0.1988737822087165,0.1988737822087165,5.48681640625,5.48681640625,5.76806640625,5.76806640625,11.2548828125,11.2548828125,9180,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.254999999999999), 'mean_duration_us': np.float64(5.6274999999999995), 'median_duration_us': np.float64(5.6274999999999995), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.487), 'max_duration_us': np.float64(5.768)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(5.63)}]",0.0015796590691253868,99.95189722259201 -aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'float', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,5.546875,5.546875,5.546875,5.546875,0.14155946303051,0.14155946303051,5.44677734375,5.44677734375,5.64697265625,5.64697265625,11.09375,11.09375,5190,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.094000000000001), 'mean_duration_us': np.float64(5.547000000000001), 'median_duration_us': np.float64(5.547000000000001), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(5.447), 'max_duration_us': np.float64(5.647)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.55)}]",0.0015570435596758694,99.95345426615168 -aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (1, 3, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 1048576, 1024, 1), (3, 1, 1, 1), ())","('', '', '1')",1,1,10.97509765625,10.97509765625,10.97509765625,10.97509765625,,,10.97509765625,10.97509765625,10.97509765625,10.97509765625,10.97509765625,10.97509765625,27340,"['aten::add_', 'nn.Module: Conv2d_34', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.975), 'mean_duration_us': np.float64(10.975), 'median_duration_us': np.float64(10.975), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.975), 'max_duration_us': np.float64(10.975)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.98)}]",0.0015403903208994064,99.95499465647258 -aten::clamp,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((3145728, 1048576, 1024, 1), (), ())","('', '0', '1')",1,1,10.89501953125,10.89501953125,10.89501953125,10.89501953125,,,10.89501953125,10.89501953125,10.89501953125,10.89501953125,10.89501953125,10.89501953125,27343,['aten::clamp'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.895), 'mean_duration_us': np.float64(10.895), 'median_duration_us': np.float64(10.895), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(10.895)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(10.9)}]",0.0015291510980214643,99.9565238075706 -aten::index,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",1,2,5.287109375,5.287109375,5.287109375,5.287109375,0.16987135563661201,0.16987135563661201,5.1669921875,5.1669921875,5.4072265625,5.4072265625,10.57421875,10.57421875,1404,"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(10.574), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",0.0014841256746628796,99.95800793324527 -aten::add,elementwise,nn.Module: CLIPTextEmbeddings,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,2,5.2470703125,5.2470703125,5.2470703125,5.2470703125,0.113247570424408,0.113247570424408,5.1669921875,5.1669921875,5.3271484375,5.3271484375,10.494140625,10.494140625,54,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(10.494), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(5.327)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.0014728864517849377,99.95948081969705 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77, 2048), (1, 77, 2048), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((315392, 4096, 1), (157696, 2048, 1), ())","('', '', 'False')",1,2,4.806396484375,4.806396484375,4.806396484375,4.806396484375,0.28346419304402126,0.28346419304402126,4.60595703125,4.60595703125,5.0068359375,5.0068359375,9.61279296875,9.61279296875,9179,['aten::copy_'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.613), 'mean_duration_us': np.float64(4.8065), 'median_duration_us': np.float64(4.8065), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",0.0013491864682807588,99.96083000616532 -aten::div,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((512, 1, 65536, 512), ())","('', '')",1,1,9.4931640625,9.4931640625,9.4931640625,9.4931640625,,,9.4931640625,9.4931640625,9.4931640625,9.4931640625,9.4931640625,9.4931640625,26879,"['aten::div', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.493), 'mean_duration_us': np.float64(9.493), 'median_duration_us': np.float64(9.493), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.493), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.49)}]",0.0013323961658106623,99.96216240233113 -aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((8388608, 16384, 128, 1), ())","('', '')",1,1,9.171875,9.171875,9.171875,9.171875,,,9.171875,9.171875,9.171875,9.171875,9.171875,9.171875,26782,"['aten::div', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.172), 'mean_duration_us': np.float64(9.172), 'median_duration_us': np.float64(9.172), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.172), 'max_duration_us': np.float64(9.172)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.17)}]",0.001287302210605261,99.96344970454173 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 77, 768), (1, 77, 1280)), ())","('TensorList', 'Scalar')","(((59136, 768, 1), (98560, 1280, 1)), ())","('', '-1')",1,2,4.505859375,4.505859375,4.505859375,4.505859375,0.08493567781830601,0.08493567781830601,4.44580078125,4.44580078125,4.56591796875,4.56591796875,9.01171875,9.01171875,5048,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.012), 'mean_duration_us': np.float64(4.506), 'median_duration_us': np.float64(4.506), 'std_dev_duration_us': np.float64(0.06000000000000005), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(4.566)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.001264823764849377,99.96471452830659 -aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((512, 1, 65536, 512), ())","('', '')",1,1,8.89208984375,8.89208984375,8.89208984375,8.89208984375,,,8.89208984375,8.89208984375,8.89208984375,8.89208984375,8.89208984375,8.89208984375,26913,"['aten::div', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.892), 'mean_duration_us': np.float64(8.892), 'median_duration_us': np.float64(8.892), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.89)}]",0.0012480334623792807,99.96596256176896 -aten::sub,elementwise,NA,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",1,4,2.10205078125,2.10205078125,2.08203125,2.08203125,0.1007627642728192,0.1007627642728192,2.001953125,2.001953125,2.2421875,2.2421875,8.408203125,8.408203125,20482,['aten::sub'],"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.408), 'mean_duration_us': np.float64(2.102), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(2.002), 'max_duration_us': np.float64(2.242)}]","[{'name': 'void at::native::unrolled_elementwise_kernel, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.211), 'mean_duration_us': np.float64(8.211), 'median_duration_us': np.float64(8.211), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.211)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",0.0011524315360699569,99.96829511170722 -aten::sub,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 256), (256, 1), ())","('long int', 'long int', 'Scalar')","((256, 1), (1, 1), ())","('', '', '1')",1,2,4.0048828125,4.0048828125,4.0048828125,4.0048828125,0.113247570424408,0.113247570424408,3.9248046875,3.9248046875,4.0849609375,4.0849609375,8.009765625,8.009765625,5166,"['aten::sub', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.01), 'mean_duration_us': np.float64(4.005), 'median_duration_us': np.float64(4.005), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]",0.0011241964151814682,99.9694193081224 -aten::lt,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '8')",1,2,3.98486328125,3.98486328125,3.98486328125,3.98486328125,0.028311892606102,0.028311892606102,3.96484375,3.96484375,4.0048828125,4.0048828125,7.9697265625,7.9697265625,5178,"['aten::lt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.97), 'mean_duration_us': np.float64(3.985), 'median_duration_us': np.float64(3.985), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.005)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.98)}]",0.0011185768037424973,99.97053788492615 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 768), (1, 1280)), ())","('TensorList', 'Scalar')","(((768, 1), (1280, 1)), ())","('', '-1')",1,2,3.964599609375,3.964599609375,3.964599609375,3.964599609375,0.39671176346842923,0.39671176346842923,3.68408203125,3.68408203125,4.2451171875,4.2451171875,7.92919921875,7.92919921875,9181,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.929), 'mean_duration_us': np.float64(3.9645), 'median_duration_us': np.float64(3.9645), 'std_dev_duration_us': np.float64(0.28049999999999997), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(4.245)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.96)}]",0.0011128886604567095,99.9716507735866 -aten::where,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), (256, 256))","('bool', 'long int', 'long int')","((256, 1), (256, 1), (256, 1))","('', '', '')",1,2,3.864990234375,3.864990234375,3.864990234375,3.864990234375,0.027966625623100757,0.027966625623100757,3.84521484375,3.84521484375,3.884765625,3.884765625,7.72998046875,7.72998046875,5198,"['aten::where', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array >(int, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.73), 'mean_duration_us': np.float64(3.865), 'median_duration_us': np.float64(3.865), 'std_dev_duration_us': np.float64(0.019999999999999796), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.885)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.86)}]",0.001084927666955488,99.97273570125355 -aten::add_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', '1')",1,2,3.6044921875,3.6044921875,3.6044921875,3.6044921875,0.0006905339660024879,0.0006905339660024879,3.60400390625,3.60400390625,3.60498046875,3.60498046875,7.208984375,7.208984375,5201,"['aten::add_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.209), 'mean_duration_us': np.float64(3.6045), 'median_duration_us': np.float64(3.6045), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(3.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]",0.0010118041864020481,99.97374750543996 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((49408, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1,2,3.424560546875,3.424560546875,3.424560546875,3.424560546875,0.48164744128673526,0.48164744128673526,3.083984375,3.083984375,3.76513671875,3.76513671875,6.84912109375,6.84912109375,1482,"['aten::gather', 'nn.Module: Embedding_2', 'nn.Module: CLIPTextEmbeddings_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.849), 'mean_duration_us': np.float64(3.4245), 'median_duration_us': np.float64(3.4245), 'std_dev_duration_us': np.float64(0.3405), 'min_duration_us': np.float64(3.084), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.0009612962152981258,99.97470880165525 -aten::gt,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '0')",1,2,3.424072265625,3.424072265625,3.424072265625,3.424072265625,0.14121419604750876,0.14121419604750876,3.32421875,3.32421875,3.52392578125,3.52392578125,6.84814453125,6.84814453125,5167,"['aten::gt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.0009611591516044923,99.97566996080685 -aten::abs,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (0,))","('long int', 'long int')","((256, 1), (1,))","('', '')",1,2,3.423828125,3.423828125,3.423828125,3.423828125,0.028311892606102,0.028311892606102,3.40380859375,3.40380859375,3.44384765625,3.44384765625,6.84765625,6.84765625,5176,"['aten::abs', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AbsFunctor, std::array >(int, at::native::AbsFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.404), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Ab...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.0009610906197576757,99.97663105142661 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,2,3.343994140625,3.343994140625,3.343994140625,3.343994140625,0.14121419604750876,0.14121419604750876,3.244140625,3.244140625,3.44384765625,3.44384765625,6.68798828125,6.68798828125,37,"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.688000000000001), 'mean_duration_us': np.float64(3.3440000000000003), 'median_duration_us': np.float64(3.3440000000000003), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.34)}]",0.0009386807058486084,99.97756973213245 -aten::minimum,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256))","('long int', 'long int')","((256, 1), (256, 1))","('', '')",1,2,3.323974609375,3.323974609375,3.323974609375,3.323974609375,0.11290230344140675,0.11290230344140675,3.244140625,3.244140625,3.40380859375,3.40380859375,6.64794921875,6.64794921875,5197,"['aten::minimum', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BinaryFunctor, std::array >(int, at::native::BinaryFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.648), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.07999999999999985), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.404)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]",0.0009330610944096372,99.97850279322687 -aten::mul,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'long int')","((256, 1), ())","('', '')",1,2,3.283447265625,3.283447265625,3.283447265625,3.283447265625,0.3400879782562253,0.3400879782562253,3.04296875,3.04296875,3.52392578125,3.52392578125,6.56689453125,6.56689453125,5172,"['aten::mul', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.567), 'mean_duration_us': np.float64(3.2835), 'median_duration_us': np.float64(3.2835), 'std_dev_duration_us': np.float64(0.24049999999999994), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.28)}]",0.0009216848078380618,99.9794244780347 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1048576, 1048576, 1048576, 1048576, 4096, 1), ())","('', '', 'False')",1,2,3.263427734375,3.263427734375,3.263427734375,3.263427734375,0.14190473001351125,0.14190473001351125,3.1630859375,3.1630859375,3.36376953125,3.36376953125,6.52685546875,6.52685546875,9170,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.526999999999999), 'mean_duration_us': np.float64(3.2634999999999996), 'median_duration_us': np.float64(3.2634999999999996), 'std_dev_duration_us': np.float64(0.10050000000000003), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(3.364)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.26)}]",0.0009160651963990909,99.9803405432311 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), ())","('c10::BFloat16', 'double')","((3145728, 1048576, 1024, 1), ())","('', '')",1,1,6.44921875,6.44921875,6.44921875,6.44921875,,,6.44921875,6.44921875,6.44921875,6.44921875,6.44921875,6.44921875,27341,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.449), 'mean_duration_us': np.float64(6.449), 'median_duration_us': np.float64(6.449), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.449), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.45)}]",0.0009051686327552325,99.98124571186385 -aten::fill_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '15')",1,2,3.0634765625,3.0634765625,3.0634765625,3.0634765625,0.3121213526331245,0.3121213526331245,2.8427734375,2.8427734375,3.2841796875,3.2841796875,6.126953125,6.126953125,5195,"['aten::fill_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.127), 'mean_duration_us': np.float64(3.0635), 'median_duration_us': np.float64(3.0635), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.06)}]",0.0008599376138561975,99.9821056494777 -aten::log,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256),)","('float',)","((256, 1),)","('',)",1,2,3.04345703125,3.04345703125,3.04345703125,3.04345703125,0.0006905339660024879,0.0006905339660024879,3.04296875,3.04296875,3.0439453125,3.0439453125,6.0869140625,6.0869140625,5184,"['aten::log', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.087), 'mean_duration_us': np.float64(3.0435), 'median_duration_us': np.float64(3.0435), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::lo...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",0.0008543180024172265,99.98295996748011 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 768), (1, 1, 1, 1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 59136, 768, 59136, 768, 1), (59136, 59136, 59136, 59136, 768, 1), ())","('', '', 'False')",1,2,3.023681640625,3.023681640625,3.023681640625,3.023681640625,0.36839987086232723,0.36839987086232723,2.76318359375,2.76318359375,3.2841796875,3.2841796875,6.04736328125,6.04736328125,1431,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.047), 'mean_duration_us': np.float64(3.0235), 'median_duration_us': np.float64(3.0235), 'std_dev_duration_us': np.float64(0.26049999999999995), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.284)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.02)}]",0.0008487669228250723,99.98380873440294 -aten::arange,other,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '256', '1', '')",1,4,1.5009765625,1.5009765625,1.32080078125,1.32080078125,0.41580065693768986,0.41580065693768986,1.240234375,1.240234375,2.1220703125,2.1220703125,6.00390625,6.00390625,5155,"['aten::arange', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.004), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.321), 'std_dev_duration_us': np.float64(0.36005624560615523), 'min_duration_us': np.float64(1.24), 'max_duration_us': np.float64(2.122)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]",0.000837596231793947,99.98548899822319 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 1280), (1, 1, 1, 1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 98560, 1280, 98560, 1280, 1), (98560, 98560, 98560, 98560, 1280, 1), ())","('', '', 'False')",1,2,2.98291015625,2.98291015625,2.98291015625,2.98291015625,0.198183248242714,0.198183248242714,2.8427734375,2.8427734375,3.123046875,3.123046875,5.9658203125,5.9658203125,5032,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.966), 'mean_duration_us': np.float64(2.983), 'median_duration_us': np.float64(2.983), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.123)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.98)}]",0.00083732210440668,99.98632632032759 -aten::arange,other,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1,4,1.4608154296875,1.4608154296875,1.36083984375,1.36083984375,0.25613361444813626,0.25613361444813626,1.28076171875,1.28076171875,1.8408203125,1.8408203125,5.84326171875,5.84326171875,1396,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(5.843999999999999), 'mean_duration_us': np.float64(1.4609999999999999), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(0.22181073012818836), 'min_duration_us': np.float64(1.281), 'max_duration_us': np.float64(1.841)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.81)}]",0.0008151863178848795,99.98796162725633 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((77, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1,2,2.903564453125,2.903564453125,2.903564453125,2.903564453125,0.14052366208150627,0.14052366208150627,2.80419921875,2.80419921875,3.0029296875,3.0029296875,5.80712890625,5.80712890625,1495,"['aten::gather', 'nn.Module: Embedding_3', 'nn.Module: CLIPTextEmbeddings_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.807), 'mean_duration_us': np.float64(2.9035), 'median_duration_us': np.float64(2.9035), 'std_dev_duration_us': np.float64(0.09950000000000013), 'min_duration_us': np.float64(2.804), 'max_duration_us': np.float64(3.003)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.9)}]",0.0008150492541912462,99.98877667651051 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,2.843017578125,2.843017578125,2.843017578125,2.843017578125,0.05627851822920276,0.05627851822920276,2.80322265625,2.80322265625,2.8828125,2.8828125,5.68603515625,5.68603515625,5072,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.686), 'mean_duration_us': np.float64(2.843), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(2.883)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]",0.0007980533561806997,99.98957472986669 -aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,2,2.703125,2.703125,2.703125,2.703125,0.028311892606102,0.028311892606102,2.68310546875,2.68310546875,2.72314453125,2.72314453125,5.40625,5.40625,50,"['aten::gather', 'nn.Module: Embedding_1', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.406), 'mean_duration_us': np.float64(2.703), 'median_duration_us': np.float64(2.703), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(2.683), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.7)}]",0.0007587846079547194,99.99033351447464 -aten::add,elementwise,nn.Module: CLIPTextEmbeddings,python3,CPU,thread 416 (python3),"((1, 77, 1280), (1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 1280, 1), (98560, 1280, 1), ())","('', '', '1')",1,2,2.68310546875,2.68310546875,2.68310546875,2.68310546875,0.056623785212204,0.056623785212204,2.64306640625,2.64306640625,2.72314453125,2.72314453125,5.3662109375,5.3662109375,1499,"['aten::add', 'nn.Module: CLIPTextEmbeddings_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.366), 'mean_duration_us': np.float64(2.683), 'median_duration_us': np.float64(2.683), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.68)}]",0.0007531649965157484,99.99108667947115 -aten::normal_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), (), ())","('c10::BFloat16', 'Scalar', 'Scalar', '')","((262144, 16384, 128, 1), (), (), ())","('', '0.', '1.', '')",1,1,5.2470703125,5.2470703125,5.2470703125,5.2470703125,,,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,18366,['aten::normal_'],"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.0007364432258924688,99.99182312269704 -aten::copy_,elementwise,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,3,1.7083333333333333,1.7083333333333333,1.68212890625,1.68212890625,0.24154693224356558,0.24154693224356558,1.48095703125,1.48095703125,1.9619140625,1.9619140625,5.125,5.125,20500,"['aten::copy_', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.125), 'mean_duration_us': np.float64(1.7083333333333333), 'median_duration_us': np.float64(1.682), 'std_dev_duration_us': np.float64(0.19724829248662426), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.962)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.71)}]",0.0007193102641882889,99.99254243296123 -aten::div,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'double')","((256, 1), ())","('', '')",1,2,2.54296875,2.54296875,2.54296875,2.54296875,0.14155946303051,0.14155946303051,2.44287109375,2.44287109375,2.64306640625,2.64306640625,5.0859375,5.0859375,5185,"['aten::div', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.086), 'mean_duration_us': np.float64(2.543), 'median_duration_us': np.float64(2.543), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.643)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.54)}]",0.0007138277164429513,99.99325626067767 -aten::mul,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",1,2,2.52294921875,2.52294921875,2.52294921875,2.52294921875,0.113247570424408,0.113247570424408,2.44287109375,2.44287109375,2.60302734375,2.60302734375,5.0458984375,5.0458984375,5186,"['aten::mul', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.046), 'mean_duration_us': np.float64(2.523), 'median_duration_us': np.float64(2.523), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.603)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.52)}]",0.0007082081050039803,99.99396446878268 -aten::div,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",1,2,2.40185546875,2.40185546875,2.40185546875,2.40185546875,0.056623785212204,0.056623785212204,2.36181640625,2.36181640625,2.44189453125,2.44189453125,4.8037109375,4.8037109375,5183,"['aten::div', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.804), 'mean_duration_us': np.float64(2.402), 'median_duration_us': np.float64(2.402), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.442)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.4)}]",0.0006742163089828874,99.99463868509166 -aten::add,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 1), (), ())","('long int', 'long int', 'Scalar')","((1, 1), (), ())","('', '', '1')",1,2,2.282470703125,2.282470703125,2.282470703125,2.282470703125,0.17021662261961323,0.17021662261961323,2.162109375,2.162109375,2.40283203125,2.40283203125,4.56494140625,4.56494140625,5159,"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.5649999999999995), 'mean_duration_us': np.float64(2.2824999999999998), 'median_duration_us': np.float64(2.2824999999999998), 'std_dev_duration_us': np.float64(0.12050000000000005), 'min_duration_us': np.float64(2.162), 'max_duration_us': np.float64(2.403)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.28)}]",0.0006407042358895116,99.99527938932755 -aten::fill_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77, 4096), ())","('c10::BFloat16', 'Scalar')","((315392, 4096, 1), ())","('', '0.')",1,2,2.221923828125,2.221923828125,2.221923828125,2.221923828125,0.19783798125971275,0.19783798125971275,2.08203125,2.08203125,2.36181640625,2.36181640625,4.44384765625,4.44384765625,9175,['aten::fill_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.444), 'mean_duration_us': np.float64(2.222), 'median_duration_us': np.float64(2.222), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.22)}]",0.000623708337878965,99.99590309766543 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 2048), (1, 2048)), ())","('TensorList', 'Scalar')","(((2048, 1), (2048, 1)), ())","('', '0')",1,1,4.125,4.125,4.125,4.125,,,4.125,4.125,4.125,4.125,4.125,4.125,18363,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.125), 'mean_duration_us': np.float64(4.125), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.125)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.12)}]",0.0005789570419076472,99.99648205470734 -aten::eq,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",1,1,3.52392578125,3.52392578125,3.52392578125,3.52392578125,,,3.52392578125,3.52392578125,3.52392578125,3.52392578125,3.52392578125,3.52392578125,20462,['aten::eq'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",0.0004945943384762654,99.99697664904582 -aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",1,1,3.04296875,3.04296875,3.04296875,3.04296875,,,3.04296875,3.04296875,3.04296875,3.04296875,3.04296875,3.04296875,18386,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.043), 'mean_duration_us': np.float64(3.043), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.043)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",0.0004270904693617966,99.99740373951518 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",1,2,1.5009765625,1.5009765625,1.5009765625,1.5009765625,0.028311892606102,0.028311892606102,1.48095703125,1.48095703125,1.52099609375,1.52099609375,3.001953125,3.001953125,1445,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.002), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.501), 'std_dev_duration_us': np.float64(0.019999999999999907), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.521)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.5)}]",0.0004213337942291921,99.99782507330941 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1280), (1, 1, 1, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1280, 1280, 1280, 1), (1280, 1280, 1280, 1), ())","('', '', 'False')",1,2,1.44140625,1.44140625,1.44140625,1.44140625,0.1139381043904105,0.1139381043904105,1.36083984375,1.36083984375,1.52197265625,1.52197265625,2.8828125,2.8828125,5046,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(2.883), 'mean_duration_us': np.float64(1.4415), 'median_duration_us': np.float64(1.4415), 'std_dev_duration_us': np.float64(0.08050000000000002), 'min_duration_us': np.float64(1.361), 'max_duration_us': np.float64(1.522)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.44)}]",0.00040461202360591247,99.99822968533302 -aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), ())","('c10::BFloat16', 'double', 'Scalar')","((262144, 16384, 128, 1), (), ())","('', '', '1')",1,1,2.84423828125,2.84423828125,2.84423828125,2.84423828125,,,2.84423828125,2.84423828125,2.84423828125,2.84423828125,2.84423828125,2.84423828125,26745,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.844), 'mean_duration_us': np.float64(2.844), 'median_duration_us': np.float64(2.844), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.844), 'max_duration_us': np.float64(2.844)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]",0.0003991980077073917,99.99862888334073 -aten::div,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",1,1,2.72314453125,2.72314453125,2.72314453125,2.72314453125,,,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,26744,['aten::div'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",0.0003822021096968452,99.99901108545042 -aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,1,2.64208984375,2.64208984375,2.64208984375,2.64208984375,,,2.64208984375,2.64208984375,2.64208984375,2.64208984375,2.64208984375,2.64208984375,18380,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]",0.00037082582312526974,99.99938191127355 -aten::fill_,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",1,1,2.44287109375,2.44287109375,2.44287109375,2.44287109375,,,2.44287109375,2.44287109375,2.44287109375,2.44287109375,2.44287109375,2.44287109375,18385,['aten::fill_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.443), 'mean_duration_us': np.float64(2.443), 'median_duration_us': np.float64(2.443), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]",0.00034286482962404813,99.99972477610316 -aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",1,1,1.9609375,1.9609375,1.9609375,1.9609375,,,1.9609375,1.9609375,1.9609375,1.9609375,1.9609375,1.9609375,18381,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.961), 'mean_duration_us': np.float64(1.961), 'median_duration_us': np.float64(1.961), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(1.961)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.96)}]",0.0002752238968159459,99.99999999999999 +aten::_flash_attention_forward,other,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4429, 38, 64), (2, 4429, 38, 64), (2, 4429, 38, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((10771328, 64, 283456, 1), (10771328, 64, 283456, 1), (10771328, 64, 283456, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '4429', '4429', '0.', 'False', 'False', '0.125', '', '', '', '')",1,152,1345.823630885074,1345.823630885074,1359.639404296875,1359.639404296875,62.46694869506643,62.46694869506643,1189.56591796875,1189.56591796875,1592.80615234375,1592.80615234375,204565.19189453125,204565.19189453125,18441,"['aten::_flash_attention_forward', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(204565.196), 'mean_duration_us': np.float64(1345.823657894737), 'median_duration_us': np.float64(1359.6395), 'std_dev_duration_us': np.float64(62.26112668073086), 'min_duration_us': np.float64(1189.566), 'max_duration_us': np.float64(1592.806)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1345.82)}]",28.711308016049646,28.711308016049646 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 9728), (8192, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",1,152,656.5875982987253,656.5875982987253,659.01904296875,659.01904296875,16.573010375012593,16.573010375012593,612.26904296875,612.26904296875,706.0078125,706.0078125,99801.31494140625,99801.31494140625,18467,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99801.31399999998), 'mean_duration_us': np.float64(656.5875921052631), 'median_duration_us': np.float64(659.019), 'std_dev_duration_us': np.float64(16.518400036958493), 'min_duration_us': np.float64(612.269), 'max_duration_us': np.float64(706.008)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(656.59)}]",14.00739914328551,42.71870715933515 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 9728), (9728, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",1,152,653.1063232421875,653.1063232421875,655.81396484375,655.81396484375,25.6982753947453,25.6982753947453,591.63818359375,591.63818359375,697.43603515625,697.43603515625,99272.1611328125,99272.1611328125,18469,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99272.159), 'mean_duration_us': np.float64(653.1063092105263), 'median_duration_us': np.float64(655.814), 'std_dev_duration_us': np.float64(25.61359189916083), 'min_duration_us': np.float64(591.638), 'max_duration_us': np.float64(697.436)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(653.11)}]",13.933130897325885,56.651838056661035 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",1,456,179.2197265625,179.2197265625,181.10791015625,181.10791015625,9.938501313517527,9.938501313517527,158.39404296875,158.39404296875,217.162109375,217.162109375,81724.1953125,81724.1953125,18423,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 456, 'total_duration_us': np.float64(81724.19200000001), 'mean_duration_us': np.float64(179.21971929824565), 'median_duration_us': np.float64(181.108), 'std_dev_duration_us': np.float64(9.927591429559296), 'min_duration_us': np.float64(158.394), 'max_duration_us': np.float64(217.162)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(179.22)}]",11.470223855047337,68.12206191170837 +aten::addmm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2432,), (8192, 2432), (2432, 2432), (), (), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",1,152,180.276611328125,180.276611328125,183.61181640625,183.61181640625,11.302861072544887,11.302861072544887,158.7548828125,158.7548828125,214.7587890625,214.7587890625,27402.044921875,27402.044921875,18431,"['aten::addmm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(27402.047000000002), 'mean_duration_us': np.float64(180.27662500000002), 'median_duration_us': np.float64(183.61200000000002), 'std_dev_duration_us': np.float64(11.265613010286344), 'min_duration_us': np.float64(158.755), 'max_duration_us': np.float64(214.759)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(180.28)}]",3.8459551438604973,71.96801705556886 +triton_poi_fused_addmm_gelu_view_15,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((39845888, 9728, 1), (1,), ())","('', '', '79691776')",1,152,138.65906404194078,138.65906404194078,133.23681640625,133.23681640625,13.52017813104994,13.52017813104994,111.28515625,111.28515625,177.5029296875,177.5029296875,21076.177734375,21076.177734375,18468,"['triton_poi_fused_addmm_gelu_view_15', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(21076.175), 'mean_duration_us': np.float64(138.65904605263157), 'median_duration_us': np.float64(133.237), 'std_dev_duration_us': np.float64(13.47563314660304), 'min_duration_us': np.float64(111.285), 'max_duration_us': np.float64(177.503)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'mean_duration_us': np.float64(138.66)}]",2.9581016453895796,74.92611870095844 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",1,452,25.756830536158738,25.756830536158738,25.7568359375,25.7568359375,1.9186128143844703,1.9186128143844703,22.51318359375,22.51318359375,57.36376953125,57.36376953125,11642.08740234375,11642.08740234375,18425,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 452, 'total_duration_us': np.float64(11642.083999999999), 'mean_duration_us': np.float64(25.756823008849555), 'median_duration_us': np.float64(25.757), 'std_dev_duration_us': np.float64(1.9165006446350394), 'min_duration_us': np.float64(22.513), 'max_duration_us': np.float64(57.364)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.76)}]",1.634000165242182,76.56011886620063 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 9728), (9728, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",1,148,76.79936919341216,76.79936919341216,76.6328125,76.6328125,2.8383699970808127,2.8383699970808127,71.10498046875,71.10498046875,90.453125,90.453125,11366.306640625,11366.306640625,18474,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(11366.307999999999), 'mean_duration_us': np.float64(76.79937837837838), 'median_duration_us': np.float64(76.633), 'std_dev_duration_us': np.float64(2.8287709713197278), 'min_duration_us': np.float64(71.105), 'max_duration_us': np.float64(90.453)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(76.8)}]",1.5952935489245332,78.15541241512516 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 9728), (666, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",1,148,69.05995301942568,69.05995301942568,69.58251953125,69.58251953125,5.874709039595645,5.874709039595645,61.41015625,61.41015625,100.18798828125,100.18798828125,10220.873046875,10220.873046875,18472,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10220.875), 'mean_duration_us': np.float64(69.05996621621621), 'median_duration_us': np.float64(69.5825), 'std_dev_duration_us': np.float64(5.8548305020997935), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(100.188)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(69.06)}]",1.4345286777481963,79.58994109287335 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '8192', '2432')",1,148,67.80168852934966,67.80168852934966,68.401123046875,68.401123046875,4.233686810115376,4.233686810115376,60.208984375,60.208984375,76.953125,76.953125,10034.64990234375,10034.64990234375,18515,"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10034.648000000001), 'mean_duration_us': np.float64(67.80167567567568), 'median_duration_us': np.float64(68.40100000000001), 'std_dev_duration_us': np.float64(4.219346669062954), 'min_duration_us': np.float64(60.209), 'max_duration_us': np.float64(76.953)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(67.8)}]",1.4083917283833667,80.99833282125671 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",1,148,65.224853515625,65.224853515625,65.677001953125,65.677001953125,3.2404804511629712,3.2404804511629712,59.9677734375,59.9677734375,73.26708984375,73.26708984375,9653.2783203125,9653.2783203125,18470,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(9653.279999999999), 'mean_duration_us': np.float64(65.22486486486486), 'median_duration_us': np.float64(65.67699999999999), 'std_dev_duration_us': np.float64(3.2295163131456124), 'min_duration_us': np.float64(59.968), 'max_duration_us': np.float64(73.267)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(65.22)}]",1.3548651393343718,82.35319796059107 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 14592), (2, 14592))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (14592, 1))","('', '', '')",1,300,27.6878955078125,27.6878955078125,25.9169921875,25.9169921875,3.025975736385473,3.025975736385473,23.47412109375,23.47412109375,34.0498046875,34.0498046875,8306.36865234375,8306.36865234375,18413,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 300, 'total_duration_us': np.float64(8306.373), 'mean_duration_us': np.float64(27.68791), 'median_duration_us': np.float64(25.917), 'std_dev_duration_us': np.float64(3.0209218607184574), 'min_duration_us': np.float64(23.474), 'max_duration_us': np.float64(34.05)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.69)}]",1.1658225266166418,83.51902048720771 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (128, 128, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 1048576, 1024, 1), (1152, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,5,1473.4486328125,1682.72666015625,1474.26611328125,1681.533203125,50.36787392237434,48.64372494307394,1402.119140625,1620.2021484375,1538.32080078125,1745.3876953125,7367.2431640625,8413.63330078125,27255,"['aten::miopen_convolution', 'nn.Module: Conv2d_28', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.674), 'mean_duration_us': np.float64(5.1348), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.18339945474291905), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(334.733), 'mean_duration_us': np.float64(66.9466), 'median_duration_us': np.float64(66.017), 'std_dev_duration_us': np.float64(4.425827588146652), 'min_duration_us': np.float64(62.292), 'max_duration_us': np.float64(74.269)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1126.509), 'mean_duration_us': np.float64(225.30180000000001), 'median_duration_us': np.float64(225.974), 'std_dev_duration_us': np.float64(2.497012647144582), 'min_duration_us': np.float64(221.168), 'max_duration_us': np.float64(228.138)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1583.9470000000001), 'mean_duration_us': np.float64(316.7894), 'median_duration_us': np.float64(316.67), 'std_dev_duration_us': np.float64(2.3336759500838977), 'min_duration_us': np.float64(313.985), 'max_duration_us': np.float64(320.755)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(4296.379999999999), 'mean_duration_us': np.float64(859.2759999999998), 'median_duration_us': np.float64(860.558), 'std_dev_duration_us': np.float64(38.63950000194101), 'min_duration_us': np.float64(799.788), 'max_duration_us': np.float64(914.678)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(66.95)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(225.3)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(316.79)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(859.28)}]",1.0340135863465507,84.55303407355426 +triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432,), (64,), (2, 38, 4096, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '311296', '64')",1,304,22.525390625,22.525390625,21.4912109375,21.4912109375,2.778457297323058,2.778457297323058,19.02783203125,19.02783203125,51.31494140625,51.31494140625,6847.71875,6847.71875,18424,"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(6847.722), 'mean_duration_us': np.float64(22.525401315789473), 'median_duration_us': np.float64(21.491), 'std_dev_duration_us': np.float64(2.7738832289577378), 'min_duration_us': np.float64(19.028), 'max_duration_us': np.float64(51.315)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(22.53)}]",0.9610968533683588,85.51413092692262 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,192,32.22358194986979,32.22358194986979,32.1865234375,32.1865234375,0.6864988052764409,0.6864988052764409,30.52392578125,30.52392578125,38.09521484375,38.09521484375,6186.927734375,6186.927734375,5111,"['aten::mm', 'nn.Module: Linear_266', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 192, 'total_duration_us': np.float64(6186.93), 'mean_duration_us': np.float64(32.22359375), 'median_duration_us': np.float64(32.1865), 'std_dev_duration_us': np.float64(0.6847003158031528), 'min_duration_us': np.float64(30.524), 'max_duration_us': np.float64(38.095)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(32.22)}]",0.8683529500281012,86.38248387695072 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 10240))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",1,96,63.48492431640625,63.48492431640625,63.29296875,63.29296875,1.0088001313002912,1.0088001313002912,61.41015625,61.41015625,66.5771484375,66.5771484375,6094.552734375,6094.552734375,5286,"['aten::mm', 'nn.Module: Linear_270', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(6094.553999999999), 'mean_duration_us': np.float64(63.484937499999994), 'median_duration_us': np.float64(63.293), 'std_dev_duration_us': np.float64(1.0035055203769856), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(66.577)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(63.48)}]",0.8553878553635602,87.23787173231428 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((33554432, 65536, 256, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,7,750.6759905133929,815.2283063616071,747.06494140625,814.68505859375,19.933292014321747,23.16508387604623,726.154296875,788.365234375,778.4716796875,849.095703125,5254.73193359375,5706.59814453125,27026,"['aten::miopen_convolution', 'nn.Module: Conv2d_11', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(62.446000000000005), 'mean_duration_us': np.float64(8.920857142857143), 'median_duration_us': np.float64(8.531), 'std_dev_duration_us': np.float64(0.6591703505319455), 'min_duration_us': np.float64(8.171), 'max_duration_us': np.float64(10.094)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(283.775), 'mean_duration_us': np.float64(40.53928571428571), 'median_duration_us': np.float64(40.379), 'std_dev_duration_us': np.float64(0.3694632068616445), 'min_duration_us': np.float64(40.099), 'max_duration_us': np.float64(41.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(370.262), 'mean_duration_us': np.float64(52.89457142857143), 'median_duration_us': np.float64(53.358), 'std_dev_duration_us': np.float64(1.4606747811633258), 'min_duration_us': np.float64(50.995), 'max_duration_us': np.float64(55.041)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(488.43899999999996), 'mean_duration_us': np.float64(69.777), 'median_duration_us': np.float64(69.943), 'std_dev_duration_us': np.float64(0.7438663474422981), 'min_duration_us': np.float64(68.1), 'max_duration_us': np.float64(70.504)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(4049.81), 'mean_duration_us': np.float64(578.5442857142857), 'median_duration_us': np.float64(573.09), 'std_dev_duration_us': np.float64(19.20403529554798), 'min_duration_us': np.float64(556.546), 'max_duration_us': np.float64(608.904)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(8.92)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(40.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(52.89)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(69.78)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(578.54)}]",0.7375166111591812,87.97538834347345 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((67108864, 262144, 512, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,5,1013.67744140625,1132.68525390625,1011.05712890625,1130.755859375,19.32632247488319,15.988691411278218,995.87451171875,1115.13134765625,1044.38671875,1157.4736328125,5068.38720703125,5663.42626953125,27150,"['aten::miopen_convolution', 'nn.Module: Conv2d_20', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(26.154), 'mean_duration_us': np.float64(5.2308), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.10632854743670675), 'min_duration_us': np.float64(5.126), 'max_duration_us': np.float64(5.407)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(176.538), 'mean_duration_us': np.float64(35.3076), 'median_duration_us': np.float64(35.011), 'std_dev_duration_us': np.float64(1.1099622696290183), 'min_duration_us': np.float64(34.33), 'max_duration_us': np.float64(37.335)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(531.463), 'mean_duration_us': np.float64(106.2926), 'median_duration_us': np.float64(107.198), 'std_dev_duration_us': np.float64(2.44941957206192), 'min_duration_us': np.float64(102.231), 'max_duration_us': np.float64(109.481)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(710.931), 'mean_duration_us': np.float64(142.1862), 'median_duration_us': np.float64(136.041), 'std_dev_duration_us': np.float64(10.643601409297508), 'min_duration_us': np.float64(130.112), 'max_duration_us': np.float64(155.47)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(3623.301), 'mean_duration_us': np.float64(724.6602), 'median_duration_us': np.float64(719.949), 'std_dev_duration_us': np.float64(21.340082974534106), 'min_duration_us': np.float64(696.755), 'max_duration_us': np.float64(762.052)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(35.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.29)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(142.19)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(724.66)}]",0.7113625974095648,88.68675094088302 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '666', '2432')",1,144,30.41143798828125,30.41143798828125,28.260986328125,28.260986328125,4.391962936042957,4.391962936042957,25.47607421875,25.47607421875,40.4189453125,40.4189453125,4379.2470703125,4379.2470703125,18518,"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(4379.2480000000005), 'mean_duration_us': np.float64(30.41144444444445), 'median_duration_us': np.float64(28.261), 'std_dev_duration_us': np.float64(4.3766938876054), 'min_duration_us': np.float64(25.476), 'max_duration_us': np.float64(40.419)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(30.41)}]",0.6146398140840623,89.30139075496707 +triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (666, 2432), (2, 38, 4429, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (2432, 1), (10771328, 283456, 64, 1), ())","('', '', '', '21542656')",1,152,26.167618600945723,26.167618600945723,24.35498046875,24.35498046875,3.622186564873429,3.622186564873429,23.27294921875,23.27294921875,56.001953125,56.001953125,3977.47802734375,3977.47802734375,18433,"['triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3977.477), 'mean_duration_us': np.float64(26.167611842105263), 'median_duration_us': np.float64(24.355), 'std_dev_duration_us': np.float64(3.610260218149725), 'min_duration_us': np.float64(23.273), 'max_duration_us': np.float64(56.002)}]","[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpo...', 'stream': 0, 'mean_duration_us': np.float64(26.17)}]",0.5582503832275333,89.8596411381946 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,3882.00390625,4274.86572265625,3882.00390625,4274.86572265625,,,3882.00390625,4274.86572265625,3882.00390625,4274.86572265625,3882.00390625,4274.86572265625,27228,"['aten::miopen_convolution', 'nn.Module: Conv2d_26', 'nn.Module: Upsample2D_2', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.031), 'mean_duration_us': np.float64(129.031), 'median_duration_us': np.float64(129.031), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.031), 'max_duration_us': np.float64(129.031)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(453.353), 'mean_duration_us': np.float64(453.353), 'median_duration_us': np.float64(453.353), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(453.353), 'max_duration_us': np.float64(453.353)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(664.706), 'mean_duration_us': np.float64(664.706), 'median_duration_us': np.float64(664.706), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(664.706), 'max_duration_us': np.float64(664.706)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2629.787), 'mean_duration_us': np.float64(2629.787), 'median_duration_us': np.float64(2629.787), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2629.787), 'max_duration_us': np.float64(2629.787)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(129.03)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(453.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(664.71)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(2629.79)}]",0.5448503180800981,90.4044914562747 +aten::addmm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2432,), (666, 2432), (2432, 2432), (), (), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",1,152,25.499563116776315,25.499563116776315,25.55712890625,25.55712890625,1.9140762579445143,1.9140762579445143,22.6328125,22.6328125,31.64599609375,31.64599609375,3875.93359375,3875.93359375,18432,"['aten::addmm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3875.933), 'mean_duration_us': np.float64(25.499559210526314), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(1.9077830366462447), 'min_duration_us': np.float64(22.633), 'max_duration_us': np.float64(31.646)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.5)}]",0.543998332410752,90.94848978868545 +triton_poi_fused__unsafe_view_clone_slice_transpose_11,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 4096, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((10771328, 283456, 64, 1), (9961472, 2432, 1), ())","('', '', '19922944')",1,152,23.524985865542764,23.524985865542764,22.19189453125,22.19189453125,3.330519637347333,3.330519637347333,20.47021484375,20.47021484375,56.1630859375,56.1630859375,3575.7978515625,3575.7978515625,18460,"['triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3575.8), 'mean_duration_us': np.float64(23.525000000000002), 'median_duration_us': np.float64(22.192), 'std_dev_duration_us': np.float64(3.31954295760251), 'min_duration_us': np.float64(20.47), 'max_duration_us': np.float64(56.163)}]","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'mean_duration_us': np.float64(23.52)}]",0.5018734251341815,91.45036321381963 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,3393.59814453125,3597.740234375,3393.59814453125,3597.740234375,,,3393.59814453125,3597.740234375,3393.59814453125,3597.740234375,3393.59814453125,3597.740234375,27123,"['aten::miopen_convolution', 'nn.Module: Conv2d_18', 'nn.Module: Upsample2D_1', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.934), 'mean_duration_us': np.float64(9.934), 'median_duration_us': np.float64(9.934), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(9.934)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(216.361), 'mean_duration_us': np.float64(216.361), 'median_duration_us': np.float64(216.361), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(216.361), 'max_duration_us': np.float64(216.361)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(292.594), 'mean_duration_us': np.float64(292.594), 'median_duration_us': np.float64(292.594), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(292.594), 'max_duration_us': np.float64(292.594)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(303.89), 'mean_duration_us': np.float64(303.89), 'median_duration_us': np.float64(303.89), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(303.89), 'max_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2570.819), 'mean_duration_us': np.float64(2570.819), 'median_duration_us': np.float64(2570.819), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2570.819), 'max_duration_us': np.float64(2570.819)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.93)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.36)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(292.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2570.82)}]",0.47630117669562366,91.92666439051526 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((256, 10240), (10240, 4096))","('c10::BFloat16', 'c10::BFloat16')","((10240, 1), (1, 10240))","('', '')",1,48,67.46939086914062,67.46939086914062,67.51953125,67.51953125,0.7553297493567382,0.7553297493567382,65.5361328125,65.5361328125,68.82177734375,68.82177734375,3238.53076171875,3238.53076171875,5316,"['aten::mm', 'nn.Module: Linear_272', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(3238.5289999999995), 'mean_duration_us': np.float64(67.46935416666666), 'median_duration_us': np.float64(67.5195), 'std_dev_duration_us': np.float64(0.7474217208060252), 'min_duration_us': np.float64(65.536), 'max_duration_us': np.float64(68.822)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(67.47)}]",0.45453702733111295,92.38120141784637 +triton_poi_fused_addmm_gelu_view_17,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3239424, 9728, 1), (1,), ())","('', '', '6478848')",1,148,21.75943900443412,21.75943900443412,21.87158203125,21.87158203125,1.5739936683940021,1.5739936683940021,18.10595703125,18.10595703125,26.47802734375,26.47802734375,3220.39697265625,3220.39697265625,18473,"['triton_poi_fused_addmm_gelu_view_17', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(3220.398), 'mean_duration_us': np.float64(21.75944594594595), 'median_duration_us': np.float64(21.8715), 'std_dev_duration_us': np.float64(1.5686506565240377), 'min_duration_us': np.float64(18.106), 'max_duration_us': np.float64(26.478)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'mean_duration_us': np.float64(21.76)}]",0.4519918983262726,92.83319331617264 +aten::_flash_attention_forward,other,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 16384, 1, 512), (1, 16384, 1, 512), (1, 16384, 1, 512), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((8388608, 512, 512, 1), (8388608, 512, 512, 1), (8388608, 512, 512, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '16384', '16384', '0.', 'False', 'False', '0.044194173824159216', '', '', '', '')",1,1,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,,,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,2961.35888671875,26841,"['aten::_flash_attention_forward', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2961.359), 'mean_duration_us': np.float64(2961.359), 'median_duration_us': np.float64(2961.359), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2961.359), 'max_duration_us': np.float64(2961.359)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(2961.36)}]",0.4156351642975723,93.24882848047021 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,2633.0283203125,2843.98046875,2633.0283203125,2843.98046875,,,2633.0283203125,2843.98046875,2633.0283203125,2843.98046875,2633.0283203125,2843.98046875,27241,"['aten::miopen_convolution', 'nn.Module: Conv2d_27', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(75.511), 'mean_duration_us': np.float64(75.511), 'median_duration_us': np.float64(75.511), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(75.511), 'max_duration_us': np.float64(75.511)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.063), 'mean_duration_us': np.float64(231.063), 'median_duration_us': np.float64(231.063), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.063), 'max_duration_us': np.float64(231.063)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(682.333), 'mean_duration_us': np.float64(682.333), 'median_duration_us': np.float64(682.333), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(682.333), 'max_duration_us': np.float64(682.333)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_wr2x2_ta1x8x4x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1638.393), 'mean_duration_us': np.float64(1638.393), 'median_duration_us': np.float64(1638.393), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1638.393), 'max_duration_us': np.float64(1638.393)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(75.51)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.06)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(682.33)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(1638.39)}]",0.3695530330421527,93.61838151351236 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1280,), (77, 1280), (1280, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (1280, 1), (1, 1280), (), ())","('', '', '', '1', '1')",1,256,8.526697158813477,8.526697158813477,8.4521484375,8.4521484375,0.2567364201120384,0.2567364201120384,8.130859375,8.130859375,9.93408203125,9.93408203125,2182.83447265625,2182.83447265625,1513,"['aten::addmm', 'nn.Module: Linear_73', 'nn.Module: CLIPAttention_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 256, 'total_duration_us': np.float64(2182.826), 'mean_duration_us': np.float64(8.5266640625), 'median_duration_us': np.float64(8.452), 'std_dev_duration_us': np.float64(0.25624840784089964), 'min_duration_us': np.float64(8.131), 'max_duration_us': np.float64(9.934)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.53)}]",0.30636704276061316,93.92474855627297 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((8388608, 16384, 128, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,10,217.62666015625,237.859375,212.6708984375,233.62109375,10.818745996807618,10.34699437589636,211.2685546875,231.61767578125,238.349609375,257.8974609375,2176.2666015625,2378.59375,26762,"['aten::miopen_convolution', 'nn.Module: Conv2d_1', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(76.905), 'mean_duration_us': np.float64(7.6905), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.4889914620931535), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.532)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(118.48700000000001), 'mean_duration_us': np.float64(11.848700000000001), 'median_duration_us': np.float64(11.837), 'std_dev_duration_us': np.float64(0.10417010127671), 'min_duration_us': np.float64(11.696), 'max_duration_us': np.float64(12.057)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.91000000000003), 'mean_duration_us': np.float64(13.491000000000003), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.54173148330146), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(14.621)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(165.03499999999997), 'mean_duration_us': np.float64(16.503499999999995), 'median_duration_us': np.float64(16.503), 'std_dev_duration_us': np.float64(0.3349988805951447), 'min_duration_us': np.float64(15.743), 'max_duration_us': np.float64(16.984)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1680.929), 'mean_duration_us': np.float64(168.09290000000001), 'median_duration_us': np.float64(163.482), 'std_dev_duration_us': np.float64(10.59933224736351), 'min_duration_us': np.float64(161.199), 'max_duration_us': np.float64(190.161)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(11.85)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.49)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(16.5)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(168.09)}]",0.30544522332380697,94.23019377959677 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '666', '2432')",1,144,13.859249538845486,13.859249538845486,13.779296875,13.779296875,0.9719595732811294,0.9719595732811294,10.93505859375,10.93505859375,18.5068359375,18.5068359375,1995.73193359375,1995.73193359375,18475,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(1995.7350000000001), 'mean_duration_us': np.float64(13.859270833333333), 'median_duration_us': np.float64(13.779499999999999), 'std_dev_duration_us': np.float64(0.9686016281987687), 'min_duration_us': np.float64(10.935), 'max_duration_us': np.float64(18.507)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(13.86)}]",0.28010666786566013,94.51030044746244 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",5,1,1988.951171875,2107.125,1988.951171875,2107.125,,,1988.951171875,2107.125,1988.951171875,2107.125,1988.951171875,2107.125,27136,"['aten::miopen_convolution', 'nn.Module: Conv2d_19', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(41.38), 'mean_duration_us': np.float64(41.38), 'median_duration_us': np.float64(41.38), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(41.38), 'max_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(106.478), 'mean_duration_us': np.float64(106.478), 'median_duration_us': np.float64(106.478), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(106.478), 'max_duration_us': np.float64(106.478)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(329.409), 'mean_duration_us': np.float64(329.409), 'median_duration_us': np.float64(329.409), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(329.409), 'max_duration_us': np.float64(329.409)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1505.636), 'mean_duration_us': np.float64(1505.636), 'median_duration_us': np.float64(1505.636), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1505.636), 'max_duration_us': np.float64(1505.636)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.48)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(329.41)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(1505.64)}]",0.27915496862256095,94.789455416085 +triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (64,), (2, 38, 333, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '25308', '64')",1,304,5.234130859375,5.234130859375,5.2470703125,5.2470703125,0.6274760849170535,0.6274760849170535,3.80419921875,3.80419921875,10.69482421875,10.69482421875,1591.17578125,1591.17578125,18426,"['triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(1591.176), 'mean_duration_us': np.float64(5.234131578947368), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.6264542941723528), 'min_duration_us': np.float64(3.804), 'max_duration_us': np.float64(10.695)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]",0.22332605826068935,95.0127814743457 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (1, 128, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (128, 1, 1, 1), ())","('', '', '1')",1,7,209.6533203125,209.6533203125,210.23095703125,210.23095703125,6.200337293638209,6.200337293638209,198.89404296875,198.89404296875,218.0830078125,218.0830078125,1467.5732421875,1467.5732421875,27245,"['aten::add_', 'nn.Module: Conv2d_27', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(1467.5729999999999), 'mean_duration_us': np.float64(209.6532857142857), 'median_duration_us': np.float64(210.231), 'std_dev_duration_us': np.float64(5.740387411373299), 'min_duration_us': np.float64(198.894), 'max_duration_us': np.float64(218.083)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.65)}]",0.20597808944095528,95.21875956378666 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,231.535400390625,231.535400390625,230.600830078125,230.600830078125,9.740609604863426,9.740609604863426,222.64892578125,222.64892578125,249.2080078125,249.2080078125,1389.21240234375,1389.21240234375,27246,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_24', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(361.81), 'mean_duration_us': np.float64(60.30166666666667), 'median_duration_us': np.float64(60.147999999999996), 'std_dev_duration_us': np.float64(1.7322068454880177), 'min_duration_us': np.float64(58.405), 'max_duration_us': np.float64(63.413)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1027.403), 'mean_duration_us': np.float64(171.23383333333334), 'median_duration_us': np.float64(170.95350000000002), 'std_dev_duration_us': np.float64(7.346735406892563), 'min_duration_us': np.float64(163.362), 'max_duration_us': np.float64(185.795)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(60.3)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.23)}]",0.19497992211681833,95.41373948590348 +aten::add_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (64, 1, 16384, 64), ())","('', '', '1')",1,48,28.179982503255207,28.179982503255207,28.201171875,28.201171875,0.4890157762664813,0.4890157762664813,27.31982421875,27.31982421875,29.80322265625,29.80322265625,1352.63916015625,1352.63916015625,5219,"['aten::add_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(1352.64), 'mean_duration_us': np.float64(28.180000000000003), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4838763616186821), 'min_duration_us': np.float64(27.32), 'max_duration_us': np.float64(29.803)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.18)}]",0.1898467632843407,95.60358624918781 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024),)","('c10::BFloat16',)","((134217728, 1048576, 1024, 1),)","('',)",1,6,176.09407552083334,176.09407552083334,175.840576171875,175.840576171875,11.99649579488144,11.99649579488144,163.52197265625,163.52197265625,196.77197265625,196.77197265625,1056.564453125,1056.564453125,27250,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1056.564), 'mean_duration_us': np.float64(176.09400000000002), 'median_duration_us': np.float64(175.8405), 'std_dev_duration_us': np.float64(10.951276226997471), 'min_duration_us': np.float64(163.522), 'max_duration_us': np.float64(196.772)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(176.09)}]",0.14829183387230943,95.75187808306012 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((268435456, 1048576, 1024, 1), (256, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",1,1,891.72314453125,1101.9541015625,891.72314453125,1101.9541015625,,,891.72314453125,1101.9541015625,891.72314453125,1101.9541015625,891.72314453125,1101.9541015625,27263,"['aten::miopen_convolution', 'nn.Module: Conv2d_29', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(891.723), 'mean_duration_us': np.float64(891.723), 'median_duration_us': np.float64(891.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(891.723), 'max_duration_us': np.float64(891.723)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(891.72)}]",0.1251558861532861,95.8770339692134 +aten::_flash_attention_forward,other,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1, 77, 20, 64), (1, 77, 20, 64), (1, 77, 20, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((98560, 1280, 64, 1), (98560, 1280, 64, 1), (98560, 1280, 64, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '77', '77', '0.', 'True', 'False', '0.125', '', '', '', '')",1,64,13.733909606933594,15.265159606933594,13.740234375,15.100341796875,0.3578330651903923,0.9025663372159146,12.2578125,13.498046875,14.380859375,21.31005859375,878.97021484375,976.97021484375,1548,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'attn_fwd', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(878.968), 'mean_duration_us': np.float64(13.733875), 'median_duration_us': np.float64(13.74), 'std_dev_duration_us': np.float64(0.35501850744010516), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(14.381)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.73)}]",0.12336597610566853,96.00039994531907 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (1, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (256, 1, 1, 1), ())","('', '', '1')",1,7,118.40325055803571,118.40325055803571,115.93115234375,115.93115234375,5.8983346516891535,5.8983346516891535,112.88720703125,112.88720703125,127.7490234375,127.7490234375,828.82275390625,828.82275390625,27140,"['aten::add_', 'nn.Module: Conv2d_19', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(828.8230000000001), 'mean_duration_us': np.float64(118.40328571428573), 'median_duration_us': np.float64(115.931), 'std_dev_duration_us': np.float64(5.460850606539129), 'min_duration_us': np.float64(112.887), 'max_duration_us': np.float64(127.749)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(118.4)}]",0.11632763696368144,96.11672758228275 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1280,), (77, 5120), (5120, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (5120, 1), (1, 5120), (), ())","('', '', '', '1', '1')",1,64,12.647163391113281,12.647163391113281,12.61767578125,12.61767578125,0.23802573761036794,0.23802573761036794,12.2568359375,12.2568359375,13.89892578125,13.89892578125,809.41845703125,809.41845703125,1606,"['aten::addmm', 'nn.Module: Linear_78', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(809.4159999999999), 'mean_duration_us': np.float64(12.647124999999999), 'median_duration_us': np.float64(12.6175), 'std_dev_duration_us': np.float64(0.23618745865307908), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.899)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.65)}]",0.11360418856440424,96.23033177084716 +aten::mul,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'double')","((2621440, 10240, 1), ())","('', '')",1,144,5.530008951822917,5.530008951822917,4.92626953125,4.92626953125,1.0932611565836916,1.0932611565836916,2.962890625,2.962890625,7.73095703125,7.73095703125,796.3212890625,796.3212890625,5288,"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(796.32), 'mean_duration_us': np.float64(5.53), 'median_duration_us': np.float64(4.9265), 'std_dev_duration_us': np.float64(1.0894735923065477), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]",0.11176596369239084,96.34209773453955 +aten::mean,reduce,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1048576, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",1,98,8.11019212372449,8.11019212372449,8.0908203125,8.0908203125,0.13343169375155572,0.13343169375155572,7.89013671875,7.89013671875,8.89208984375,8.89208984375,794.798828125,794.798828125,5095,"['aten::mean', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(794.8029999999999), 'mean_duration_us': np.float64(8.11023469387755), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.13277860974004113), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",0.08916051959840035,96.94609355294838 +aten::mul,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 1))","('c10::BFloat16', 'float')","((1048576, 4096, 1), (256, 1, 1))","('', '')",1,98,6.172662228954081,6.172662228954081,6.1279296875,6.1279296875,0.395586423329981,0.395586423329981,5.52685546875,5.52685546875,7.61083984375,7.61083984375,604.9208984375,604.9208984375,5098,"['aten::mul', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(604.921), 'mean_duration_us': np.float64(6.172663265306123), 'median_duration_us': np.float64(6.128), 'std_dev_duration_us': np.float64(0.3935874755317555), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(7.611)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.17)}]",0.08490237307498089,97.03099592602337 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,5,118.3177734375,118.3177734375,119.69580078125,119.69580078125,2.0926909657870496,2.0926909657870496,115.89013671875,115.89013671875,119.97607421875,119.97607421875,591.5888671875,591.5888671875,27141,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_18', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(178.62), 'mean_duration_us': np.float64(35.724000000000004), 'median_duration_us': np.float64(35.612), 'std_dev_duration_us': np.float64(0.5430587445203343), 'min_duration_us': np.float64(34.931), 'max_duration_us': np.float64(36.493)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(412.969), 'mean_duration_us': np.float64(82.5938), 'median_duration_us': np.float64(83.483), 'std_dev_duration_us': np.float64(1.7604830473480866), 'min_duration_us': np.float64(80.038), 'max_duration_us': np.float64(84.405)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(35.72)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(82.59)}]",0.08303118447171302,97.11402711049507 +aten::_softmax,other,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (), ())","('float', 'Scalar', 'Scalar')","((4194304, 65536, 256, 1), (), ())","('', '-1', 'False')",1,48,11.830708821614584,11.830708821614584,12.13720703125,12.13720703125,0.6630237228890721,0.6630237228890721,10.4951171875,10.4951171875,12.89794921875,12.89794921875,567.8740234375,567.8740234375,5225,"['aten::_softmax', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void (anonymous namespace)::softmax_warp_forward(float*, float const*, int, int, int, bool const*, int, bool)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(567.874), 'mean_duration_us': np.float64(11.830708333333334), 'median_duration_us': np.float64(12.137), 'std_dev_duration_us': np.float64(0.6561059669981334), 'min_duration_us': np.float64(10.495), 'max_duration_us': np.float64(12.898)}]","[{'name': 'void (anonymous namespace)::softmax_warp_forward(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(164.163), 'mean_duration_us': np.float64(164.163), 'median_duration_us': np.float64(164.163), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(164.163), 'max_duration_us': np.float64(164.163)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(336.459), 'mean_duration_us': np.float64(336.459), 'median_duration_us': np.float64(336.459), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(336.459), 'max_duration_us': np.float64(336.459)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(164.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(336.46)}]",0.07026373513136722,97.2639935841531 +aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",1,48,10.319356282552084,10.319356282552084,10.4140625,10.4140625,0.6740310252108017,0.6740310252108017,8.05078125,8.05078125,11.69580078125,11.69580078125,495.3291015625,495.3291015625,5230,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(495.32899999999995), 'mean_duration_us': np.float64(10.319354166666665), 'median_duration_us': np.float64(10.414), 'std_dev_duration_us': np.float64(0.6669758394419588), 'min_duration_us': np.float64(8.051), 'max_duration_us': np.float64(11.696)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.32)}]",0.06952085187399014,97.33351443602709 +aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (1, 128, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (134217728, 1048576, 1024, 1), ())","('', '', '1')",1,3,160.34440104166666,160.34440104166666,160.67822265625,160.67822265625,0.9468266154769833,0.9468266154769833,159.27587890625,159.27587890625,161.0791015625,161.0791015625,481.033203125,481.033203125,27268,"['aten::add', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(481.033), 'mean_duration_us': np.float64(160.34433333333334), 'median_duration_us': np.float64(160.678), 'std_dev_duration_us': np.float64(0.7729606860780295), 'min_duration_us': np.float64(159.276), 'max_duration_us': np.float64(161.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(160.34)}]",0.06751438176241395,97.4010288177895 +aten::mul,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((4096,), (1, 256, 4096))","('c10::BFloat16', 'c10::BFloat16')","((1,), (1048576, 4096, 1))","('', '')",1,98,4.73542629942602,4.73542629942602,4.7060546875,4.7060546875,0.30576023168563127,0.30576023168563127,4.0048828125,4.0048828125,6.328125,6.328125,464.07177734375,464.07177734375,5103,"['aten::mul', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(464.06999999999994), 'mean_duration_us': np.float64(4.735408163265306), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.3041668727260965), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]",0.06513379728718265,97.46616261507668 +aten::tanh,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240),)","('c10::BFloat16',)","((2621440, 10240, 1),)","('',)",1,48,9.619974772135416,9.619974772135416,9.61328125,9.61328125,0.462344728681359,0.462344728681359,8.3310546875,8.3310546875,11.77587890625,11.77587890625,461.7587890625,461.7587890625,5295,"['aten::tanh', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(461.759), 'mean_duration_us': np.float64(9.619979166666667), 'median_duration_us': np.float64(9.6135), 'std_dev_duration_us': np.float64(0.45751723508443426), 'min_duration_us': np.float64(8.331), 'max_duration_us': np.float64(11.776)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ta...', 'stream': 0, 'mean_duration_us': np.float64(9.62)}]",0.06480916278624213,97.53097177786293 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 512, 512),)","('c10::BFloat16',)","((67108864, 262144, 512, 1),)","('',)",1,5,90.62138671875,90.62138671875,90.5732421875,90.5732421875,2.827936505522151,2.827936505522151,87.60888671875,87.60888671875,94.81982421875,94.81982421875,453.10693359375,453.10693359375,27145,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(453.1069999999999), 'mean_duration_us': np.float64(90.62139999999998), 'median_duration_us': np.float64(90.573), 'std_dev_duration_us': np.float64(2.5293653433223118), 'min_duration_us': np.float64(87.609), 'max_duration_us': np.float64(94.82)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(90.62)}]",0.06359485019976018,97.5945666280627 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (1, 512, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (512, 1, 1, 1), ())","('', '', '1')",1,7,64.55231584821429,64.55231584821429,63.1728515625,63.1728515625,4.22928109753556,4.22928109753556,59.408203125,59.408203125,70.6240234375,70.6240234375,451.8662109375,451.8662109375,27030,"['aten::add_', 'nn.Module: Conv2d_11', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(451.86600000000004), 'mean_duration_us': np.float64(64.55228571428572), 'median_duration_us': np.float64(63.173), 'std_dev_duration_us': np.float64(3.9155450893762884), 'min_duration_us': np.float64(59.408), 'max_duration_us': np.float64(70.624)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.55)}]",0.06342071123693775,97.65798733929964 +aten::pow,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), ())","('float', 'Scalar')","((1048576, 4096, 1), ())","('', '2')",1,98,4.5053411989795915,4.5053411989795915,4.0654296875,4.0654296875,1.1635621576041233,1.1635621576041233,3.244140625,3.244140625,6.52783203125,6.52783203125,441.5234375,441.5234375,5092,"['aten::pow', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(441.52500000000003), 'mean_duration_us': np.float64(4.505357142857143), 'median_duration_us': np.float64(4.0655), 'std_dev_duration_us': np.float64(1.1575871567662643), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.06196907349175683,97.71995641279139 +aten::add,elementwise,nn.Module: T5LayerSelfAttention,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', '1')",1,48,9.082448323567709,9.082448323567709,3.66455078125,3.66455078125,6.010822419117579,6.010822419117579,3.1630859375,3.1630859375,16.06298828125,16.06298828125,435.95751953125,435.95751953125,5262,"['aten::add', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(435.959), 'mean_duration_us': np.float64(9.082479166666667), 'median_duration_us': np.float64(3.6645000000000003), 'std_dev_duration_us': np.float64(5.94786024196091), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(16.063)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(9.08)}]",0.06118788103319214,97.78114429382458 +triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 14592), (14592,), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (14592, 1), (1,), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",1,4,108.5,108.5,98.926025390625,98.926025390625,22.329341551853997,22.329341551853997,94.5791015625,94.5791015625,141.56884765625,141.56884765625,434.0,434.0,18462,"['triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(434.0), 'mean_duration_us': np.float64(108.5), 'median_duration_us': np.float64(98.926), 'std_dev_duration_us': np.float64(19.33785150941024), 'min_duration_us': np.float64(94.579), 'max_duration_us': np.float64(141.569)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(108.5)}]",0.060913137584961086,97.84205743140954 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (1, 3, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 1048576, 1024, 1), (3145728, 1048576, 1024, 1), ())","('', '', 'False')",1,1,412.01123046875,412.01123046875,412.01123046875,412.01123046875,,,412.01123046875,412.01123046875,412.01123046875,412.01123046875,412.01123046875,412.01123046875,27348,['aten::copy_'],"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(412.011), 'mean_duration_us': np.float64(412.011), 'median_duration_us': np.float64(412.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(412.011), 'max_duration_us': np.float64(412.011)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(412.01)}]",0.05782695107855318,97.8998843824881 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (1, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((268435456, 1048576, 1024, 1), (256, 1, 1, 1), ())","('', '', '1')",1,1,392.86181640625,392.86181640625,392.86181640625,392.86181640625,,,392.86181640625,392.86181640625,392.86181640625,392.86181640625,392.86181640625,392.86181640625,27232,"['aten::add_', 'nn.Module: Conv2d_26', 'nn.Module: Upsample2D_2', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(392.862), 'mean_duration_us': np.float64(392.862), 'median_duration_us': np.float64(392.862), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(392.862), 'max_duration_us': np.float64(392.862)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(392.86)}]",0.05513927620882863,97.95502365869693 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024),)","('c10::BFloat16',)","((268435456, 1048576, 1024, 1),)","('',)",1,1,386.01318359375,386.01318359375,386.01318359375,386.01318359375,,,386.01318359375,386.01318359375,386.01318359375,386.01318359375,386.01318359375,386.01318359375,27237,"['aten::silu', 'nn.Module: SiLU_11', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(386.013), 'mean_duration_us': np.float64(386.013), 'median_duration_us': np.float64(386.013), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(386.013), 'max_duration_us': np.float64(386.013)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(386.01)}]",0.05417805106418188,98.00920170976111 +aten::upsample_nearest2d,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((67108864, 262144, 512, 1), (), (), ())","('', '[1024, 1024]', '2.', '2.')",1,1,382.287109375,382.287109375,382.287109375,382.287109375,,,382.287109375,382.287109375,382.287109375,382.287109375,382.287109375,382.287109375,27224,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_2', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(382.287), 'mean_duration_us': np.float64(382.287), 'median_duration_us': np.float64(382.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(382.287), 'max_duration_us': np.float64(382.287)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(382.29)}]",0.05365508592238811,98.0628567956835 +aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",1,48,7.928293863932292,7.928293863932292,8.010986328125,8.010986328125,0.6323219764114211,0.6323219764114211,6.93017578125,6.93017578125,9.1728515625,9.1728515625,380.55810546875,380.55810546875,5223,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(380.557), 'mean_duration_us': np.float64(7.928270833333333), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.6257010647926363), 'min_duration_us': np.float64(6.93), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(7.93)}]",0.05341241529375598,98.11626921097725 +aten::bmm,GEMM,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((64, 256, 256), (64, 256, 64))","('c10::BFloat16', 'c10::BFloat16')","((65536, 256, 1), (64, 4096, 1))","('', '')",1,48,7.914967854817708,7.914967854817708,7.91064453125,7.91064453125,0.15546949489674314,0.15546949489674314,7.52978515625,7.52978515625,8.2919921875,8.2919921875,379.91845703125,379.91845703125,5241,"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB128_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(379.916), 'mean_duration_us': np.float64(7.914916666666667), 'median_duration_us': np.float64(7.9105), 'std_dev_duration_us': np.float64(0.15383430389726319), 'min_duration_us': np.float64(7.53), 'max_duration_us': np.float64(8.292)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(7.91)}]",0.05332263881154529,98.1695918497888 +aten::bmm,GEMM,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((64, 256, 64), (64, 64, 256))","('c10::BFloat16', 'c10::BFloat16')","((64, 4096, 1), (64, 1, 4096))","('', '')",1,48,7.886566162109375,7.886566162109375,7.89111328125,7.89111328125,0.1390650795704857,0.1390650795704857,7.53076171875,7.53076171875,8.3310546875,8.3310546875,378.55517578125,378.55517578125,5151,"['aten::bmm', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AFC0_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD0_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(378.553), 'mean_duration_us': np.float64(7.886520833333333), 'median_duration_us': np.float64(7.891), 'std_dev_duration_us': np.float64(0.13759345151316446), 'min_duration_us': np.float64(7.531), 'max_duration_us': np.float64(8.331)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AF...', 'stream': 0, 'mean_duration_us': np.float64(7.89)}]",0.053131298400604626,98.2227231481894 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,62.590901692708336,62.590901692708336,63.171630859375,63.171630859375,3.1680777446719164,3.1680777446719164,58.525390625,58.525390625,66.376953125,66.376953125,375.54541015625,375.54541015625,27031,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_11', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(111.75900000000001), 'mean_duration_us': np.float64(18.626500000000004), 'median_duration_us': np.float64(18.426000000000002), 'std_dev_duration_us': np.float64(0.5515921651606974), 'min_duration_us': np.float64(17.906), 'max_duration_us': np.float64(19.548)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(263.786), 'mean_duration_us': np.float64(43.964333333333336), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(2.4412839290468074), 'min_duration_us': np.float64(40.219), 'max_duration_us': np.float64(46.829)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(18.63)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(43.96)}]",0.052708869212553675,98.27543201740195 +aten::add,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((2621440, 10240, 1), (), ())","('', '', '1')",1,48,7.6912841796875,7.6912841796875,7.73095703125,7.73095703125,0.5368066733838069,0.5368066733838069,6.52783203125,6.52783203125,9.1728515625,9.1728515625,369.181640625,369.181640625,5296,"['aten::add', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(369.18199999999996), 'mean_duration_us': np.float64(7.6912916666666655), 'median_duration_us': np.float64(7.731), 'std_dev_duration_us': np.float64(0.5311947994197189), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.69)}]",0.051815696012055955,98.32724771341401 +aten::copy_,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",1,98,3.653773716517857,3.653773716517857,3.48388671875,3.48388671875,1.208679528258489,1.208679528258489,3.2041015625,3.2041015625,15.30078125,15.30078125,358.06982421875,358.06982421875,5091,"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(358.069), 'mean_duration_us': np.float64(3.653765306122449), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(1.202514761257105), 'min_duration_us': np.float64(3.204), 'max_duration_us': np.float64(15.301)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.65)}]",0.05025612089322476,98.37750383430723 +aten::add,elementwise,nn.Module: CLIPEncoderLayer,python3,CPU,thread 416 (python3),"((1, 77, 1280), (1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 1280, 1), (98560, 1280, 1), ())","('', '', '1')",1,128,2.774738311767578,2.774738311767578,2.76318359375,2.76318359375,0.136688569313187,0.136688569313187,2.36279296875,2.36279296875,3.083984375,3.083984375,355.16650390625,355.16650390625,1583,"['aten::add', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 128, 'total_duration_us': np.float64(355.16099999999994), 'mean_duration_us': np.float64(2.7746953124999996), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.13619704008541206), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(3.084)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.77)}]",0.04984863160832033,98.42735246591556 +aten::add,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2621440, 10240, 1), (2621440, 10240, 1), ())","('', '', '1')",1,48,7.373291015625,7.373291015625,7.2900390625,7.2900390625,0.4467926884954272,0.4467926884954272,6.68896484375,6.68896484375,9.0517578125,9.0517578125,353.91796875,353.91796875,5293,"['aten::add', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(353.918), 'mean_duration_us': np.float64(7.373291666666667), 'median_duration_us': np.float64(7.29), 'std_dev_duration_us': np.float64(0.4421139068127377), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.052)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.37)}]",0.04967339613884494,98.4770258620544 +aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), ())","('c10::BFloat16', 'double')","((134217728, 1048576, 1024, 1), ())","('', '')",1,3,117.052734375,117.052734375,117.4931640625,117.4931640625,1.1657288165048338,1.1657288165048338,115.73095703125,115.73095703125,117.93408203125,117.93408203125,351.158203125,351.158203125,27269,"['aten::div', 'nn.Module: ResnetBlock2D_11', 'nn.Module: UpDecoderBlock2D_3', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(351.158), 'mean_duration_us': np.float64(117.05266666666667), 'median_duration_us': np.float64(117.493), 'std_dev_duration_us': np.float64(0.951743079244021), 'min_duration_us': np.float64(115.731), 'max_duration_us': np.float64(117.934)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(117.05)}]",0.04928605516368856,98.5263119172181 +aten::mul,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240))","('c10::BFloat16', 'c10::BFloat16')","((2621440, 10240, 1), (2621440, 10240, 1))","('', '')",1,48,7.253122965494792,7.253122965494792,7.12890625,7.12890625,0.49468051239269506,0.49468051239269506,6.408203125,6.408203125,8.73193359375,8.73193359375,348.14990234375,348.14990234375,5297,"['aten::mul', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(348.15), 'mean_duration_us': np.float64(7.253125), 'median_duration_us': np.float64(7.129), 'std_dev_duration_us': np.float64(0.4895399466591056), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(8.732)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(7.25)}]",0.048863831570635036,98.57517574878872 +aten::gelu,elementwise,nn.Module: GELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 5120), ())","('c10::BFloat16', '')","((394240, 5120, 1), ())","('', '')",1,64,5.263710021972656,5.263710021972656,5.16650390625,5.16650390625,0.3725945490820721,0.3725945490820721,4.80615234375,4.80615234375,6.96923828125,6.96923828125,336.87744140625,336.87744140625,1599,"['aten::gelu', 'nn.Module: GELUActivation_0', 'nn.Module: CLIPMLP_12', 'nn.Module: CLIPEncoderLayer_12', 'nn.Module: CLIPEncoder_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(336.87699999999995), 'mean_duration_us': np.float64(5.263703124999999), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(0.369633588828497), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Ge...', 'stream': 0, 'mean_duration_us': np.float64(5.26)}]",0.047281709533752464,98.62245745832247 +aten::copy_,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",1,98,3.4167580117984695,3.4167580117984695,3.423828125,3.423828125,0.23546391148849397,0.23546391148849397,3.0029296875,3.0029296875,3.923828125,3.923828125,334.84228515625,334.84228515625,5102,"['aten::copy_', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(334.84000000000003), 'mean_duration_us': np.float64(3.4167346938775514), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.23425720867615366), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.924)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.04699606955065767,98.66945352787313 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4864), (4864,), (2, 4096, 2432), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (9961472, 2432, 1), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '8192', '2432')",1,4,80.3485107421875,80.3485107421875,72.0859375,72.0859375,16.725685280144965,16.725685280144965,71.7861328125,71.7861328125,105.43603515625,105.43603515625,321.39404296875,321.39404296875,20447,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(321.394), 'mean_duration_us': np.float64(80.3485), 'median_duration_us': np.float64(72.086), 'std_dev_duration_us': np.float64(14.484854805968892), 'min_duration_us': np.float64(71.786), 'max_duration_us': np.float64(105.436)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(80.35)}]",0.0451085704109271,98.71456209828406 +aten::_flash_attention_forward,other,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1, 77, 12, 64), (1, 77, 12, 64), (1, 77, 12, 64), (), (), (), (), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar', '', '', '', '')","((59136, 768, 64, 1), (59136, 768, 64, 1), (59136, 768, 64, 1), (), (), (), (), (), (), (), (), (), (), (), ())","('', '', '', '', '', '77', '77', '0.', 'True', 'False', '0.125', '', '', '', '')",1,24,13.175252278645834,16.071818033854168,13.03857421875,14.439453125,0.5107849476978698,2.800457197961641,12.4169921875,14.05908203125,14.580078125,21.7109375,316.2060546875,385.7236328125,103,"['aten::_flash_attention_forward', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'attn_fwd', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(316.206), 'mean_duration_us': np.float64(13.17525), 'median_duration_us': np.float64(13.038499999999999), 'std_dev_duration_us': np.float64(0.5000066041230524), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(14.58)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.18)}]",0.04438042146169911,98.75894251974576 +aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 256, 64, 64), (1, 256, 64, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 64, 1), (1048576, 64, 16384, 1), ())","('', '', 'False')",1,48,6.558736165364583,6.558736165364583,6.54833984375,6.54833984375,0.31613188099540285,0.31613188099540285,6.0478515625,6.0478515625,7.1689453125,7.1689453125,314.8193359375,314.8193359375,5249,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(314.819), 'mean_duration_us': np.float64(6.558729166666667), 'median_duration_us': np.float64(6.5485), 'std_dev_duration_us': np.float64(0.31280177026775097), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.169)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.56)}]",0.04418579153079958,98.80312831127655 +triton_poi_fused_add_addmm_silu_3,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '', '4864')",1,72,4.111178927951389,4.111178927951389,4.14501953125,4.14501953125,1.1141597813731445,1.1141597813731445,2.60302734375,2.60302734375,8.05078125,8.05078125,296.0048828125,296.0048828125,18412,"['triton_poi_fused_add_addmm_silu_3', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'count': 72, 'total_duration_us': np.float64(296.005), 'mean_duration_us': np.float64(4.111180555555555), 'median_duration_us': np.float64(4.1450000000000005), 'std_dev_duration_us': np.float64(1.1063898665679002), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(8.051)}]","[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]",0.04154512938382049,98.84467344066037 +aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (8388608, 16384, 128, 1), ())","('', '', '1')",1,4,71.3955078125,71.3955078125,71.345458984375,71.345458984375,1.9844591418271784,1.9844591418271784,69.10205078125,69.10205078125,73.7890625,73.7890625,285.58203125,285.58203125,26912,"['aten::add', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(285.582), 'mean_duration_us': np.float64(71.3955), 'median_duration_us': np.float64(71.3455), 'std_dev_duration_us': np.float64(1.7186088123828527), 'min_duration_us': np.float64(69.102), 'max_duration_us': np.float64(73.789)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(71.4)}]",0.04008225244544679,98.88475569310582 +aten::rsqrt,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 1),)","('float',)","((256, 1, 1),)","('',)",1,98,2.89102857940051,2.89102857940051,2.8427734375,2.8427734375,0.4045436215443143,0.4045436215443143,2.64306640625,2.64306640625,6.72900390625,6.72900390625,283.32080078125,283.32080078125,5097,"['aten::rsqrt', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(283.322), 'mean_duration_us': np.float64(2.8910408163265306), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.40249580853103045), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(2.89)}]",0.0397648823010821,98.9245205754069 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 256, 256),)","('c10::BFloat16',)","((33554432, 65536, 256, 1),)","('',)",1,6,45.580403645833336,45.580403645833336,46.108154296875,46.108154296875,3.2794362265579236,3.2794362265579236,41.6611328125,41.6611328125,49.5927734375,49.5927734375,273.482421875,273.482421875,27035,"['aten::silu', 'nn.Module: SiLU_5', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(273.482), 'mean_duration_us': np.float64(45.580333333333336), 'median_duration_us': np.float64(46.108000000000004), 'std_dev_duration_us': np.float64(2.993738168614989), 'min_duration_us': np.float64(41.661), 'max_duration_us': np.float64(49.593)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(45.58)}]",0.03838403776668259,98.96290461317358 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,252.89404296875,252.89404296875,252.89404296875,252.89404296875,,,252.89404296875,252.89404296875,252.89404296875,252.89404296875,252.89404296875,252.89404296875,27128,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_17', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.455), 'mean_duration_us': np.float64(64.455), 'median_duration_us': np.float64(64.455), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.455), 'max_duration_us': np.float64(64.455)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(188.439), 'mean_duration_us': np.float64(188.439), 'median_duration_us': np.float64(188.439), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(188.439), 'max_duration_us': np.float64(188.439)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.46)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(188.44)}]",0.03549440007781689,98.9983990132514 +aten::copy_,elementwise,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (512, 1, 65536, 512), ())","('', '', 'False')",1,4,63.04248046875,63.04248046875,63.31298828125,63.31298828125,2.866291124304218,2.866291124304218,59.287109375,59.287109375,66.2568359375,66.2568359375,252.169921875,252.169921875,26885,"['aten::copy_', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(252.17000000000002), 'mean_duration_us': np.float64(63.042500000000004), 'median_duration_us': np.float64(63.313), 'std_dev_duration_us': np.float64(2.4823704900759695), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.04)}]",0.03539276761742111,99.03379178086882 +aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (1, 256, 512, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (67108864, 262144, 512, 1), ())","('', '', '1')",1,3,83.77734375,83.77734375,83.3232421875,83.3232421875,1.2263848242878954,1.2263848242878954,82.8427734375,82.8427734375,85.166015625,85.166015625,251.33203125,251.33203125,27163,"['aten::add', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(251.332), 'mean_duration_us': np.float64(83.77733333333333), 'median_duration_us': np.float64(83.323), 'std_dev_duration_us': np.float64(1.0012979354595477), 'min_duration_us': np.float64(82.843), 'max_duration_us': np.float64(85.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(83.78)}]",0.03527516727889168,99.06906694814772 +aten::add,elementwise,nn.Module: CLIPEncoderLayer,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,48,5.015513102213542,5.015513102213542,5.046875,5.046875,0.38265797592012546,0.38265797592012546,4.1650390625,4.1650390625,6.0078125,6.0078125,240.74462890625,240.74462890625,138,"['aten::add', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(240.745), 'mean_duration_us': np.float64(5.015520833333333), 'median_duration_us': np.float64(5.047), 'std_dev_duration_us': np.float64(0.3786864902519042), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.02)}]",0.033789195169140106,99.10285614331686 +aten::pow,elementwise,nn.Module: NewGELUActivation,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'Scalar')","((2621440, 10240, 1), ())","('', '3.')",1,48,4.81292724609375,4.81292724609375,4.76611328125,4.76611328125,0.3375204223664483,0.3375204223664483,4.24609375,4.24609375,6.44921875,6.44921875,231.0205078125,231.0205078125,5289,"['aten::pow', 'nn.Module: NewGELUActivation_0', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(231.017), 'mean_duration_us': np.float64(4.812854166666667), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.334003617095143), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",0.032424387044540065,99.1352805303614 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (512, 1, 1, 1), ())","('', '', '1')",1,11,20.443670099431817,20.443670099431817,20.34912109375,20.34912109375,1.265204583928953,1.265204583928953,18.466796875,18.466796875,22.55322265625,22.55322265625,224.88037109375,224.88037109375,26753,"['aten::add_', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 11, 'total_duration_us': np.float64(224.881), 'mean_duration_us': np.float64(20.443727272727273), 'median_duration_us': np.float64(20.349), 'std_dev_duration_us': np.float64(1.2062343425952518), 'min_duration_us': np.float64(18.467), 'max_duration_us': np.float64(22.553)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.44)}]",0.031562601346983174,99.16684313170838 +aten::mul,elementwise,nn.Module: T5DenseGatedActDense,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240))","('c10::BFloat16', 'c10::BFloat16')","((2621440, 10240, 1), (2621440, 10240, 1))","('', '')",1,48,4.670186360677083,4.670186360677083,4.64599609375,4.64599609375,0.08009262758675076,0.08009262758675076,4.56494140625,4.56494140625,4.88623046875,4.88623046875,224.1689453125,224.1689453125,5307,"['aten::mul', 'nn.Module: T5DenseGatedActDense_0', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(224.168), 'mean_duration_us': np.float64(4.670166666666667), 'median_duration_us': np.float64(4.646), 'std_dev_duration_us': np.float64(0.07917973576336035), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(4.886)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.67)}]",0.03146275070989846,99.19830588241827 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 128, 128),)","('c10::BFloat16',)","((8388608, 16384, 128, 1),)","('',)",1,10,21.7033203125,21.7033203125,21.951416015625,21.951416015625,2.556412588605594,2.556412588605594,15.10205078125,15.10205078125,24.03515625,24.03515625,217.033203125,217.033203125,26758,"['aten::silu', 'nn.Module: SiLU_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(217.03300000000002), 'mean_duration_us': np.float64(21.703300000000002), 'median_duration_us': np.float64(21.9515), 'std_dev_duration_us': np.float64(2.425225888448332), 'min_duration_us': np.float64(15.102), 'max_duration_us': np.float64(24.035)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(21.7)}]",0.030461228945755595,99.22876711136402 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",1,24,8.953898111979166,8.953898111979166,8.7919921875,8.7919921875,0.37142902420526336,0.37142902420526336,8.61181640625,8.61181640625,10.01416015625,10.01416015625,214.8935546875,214.8935546875,163,"['aten::addmm', 'nn.Module: Linear_5', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(214.894), 'mean_duration_us': np.float64(8.953916666666666), 'median_duration_us': np.float64(8.792), 'std_dev_duration_us': np.float64(0.36354767187017195), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(10.014)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.95)}]",0.03016092318617752,99.2589280345502 +aten::native_layer_norm,NORM_fwd,nn.Module: LayerNorm,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (), (1,), (1,), ())","('', '[768]', '', '', '1.0000000000000001e-05')",1,50,4.274140625,4.274140625,4.2451171875,4.2451171875,0.19483437471531076,0.19483437471531076,4.044921875,4.044921875,4.9658203125,4.9658203125,213.70703125,213.70703125,56,"['aten::native_layer_norm', 'nn.Module: LayerNorm_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]",0.02999439123825997,99.28892242578846 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((134217728, 262144, 512, 1), (512, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",1,1,210.07177734375,325.681640625,210.07177734375,325.681640625,,,210.07177734375,325.681640625,210.07177734375,325.681640625,210.07177734375,325.681640625,27158,"['aten::miopen_convolution', 'nn.Module: Conv2d_21', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.072), 'mean_duration_us': np.float64(210.072), 'median_duration_us': np.float64(210.072), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.072), 'max_duration_us': np.float64(210.072)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(210.07)}]",0.029484172986306803,99.31840659877476 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (1, 512, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 262144, 512, 1), (512, 1, 1, 1), ())","('', '', '1')",1,1,204.14208984375,204.14208984375,204.14208984375,204.14208984375,,,204.14208984375,204.14208984375,204.14208984375,204.14208984375,204.14208984375,204.14208984375,27127,"['aten::add_', 'nn.Module: Conv2d_18', 'nn.Module: Upsample2D_1', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(204.142), 'mean_duration_us': np.float64(204.142), 'median_duration_us': np.float64(204.142), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(204.142), 'max_duration_us': np.float64(204.142)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(204.14)}]",0.028651924436713893,99.34705852321147 +aten::silu,elementwise,nn.Module: SiLU,python3,CPU,thread 416 (python3),"((1, 512, 512, 512),)","('c10::BFloat16',)","((134217728, 262144, 512, 1),)","('',)",1,1,202.580078125,202.580078125,202.580078125,202.580078125,,,202.580078125,202.580078125,202.580078125,202.580078125,202.580078125,202.580078125,27132,"['aten::silu', 'nn.Module: SiLU_8', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.58), 'mean_duration_us': np.float64(202.58), 'median_duration_us': np.float64(202.58), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.58), 'max_duration_us': np.float64(202.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.58)}]",0.028432691637788682,99.37549121484926 +aten::add,elementwise,nn.Module: T5LayerNorm,python3,CPU,thread 416 (python3),"((1, 256, 1), (), ())","('float', 'double', 'Scalar')","((256, 1, 1), (), ())","('', '', '1')",1,98,1.97900390625,1.97900390625,1.9619140625,1.9619140625,0.0625893259287263,0.0625893259287263,1.880859375,1.880859375,2.283203125,2.283203125,193.9423828125,193.9423828125,5096,"['aten::add', 'nn.Module: T5LayerNorm_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(193.94899999999998), 'mean_duration_us': np.float64(1.9790714285714284), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.062211825439298846), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(2.283)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.98)}]",0.027220366469615218,99.40271158131888 +aten::add,elementwise,nn.Module: T5LayerFF,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', '1')",1,48,3.87896728515625,3.87896728515625,3.84521484375,3.84521484375,0.16891118836714863,0.16891118836714863,3.68408203125,3.68408203125,4.72607421875,4.72607421875,186.1904296875,186.1904296875,5319,"['aten::add', 'nn.Module: T5LayerFF_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(186.188), 'mean_duration_us': np.float64(3.8789166666666666), 'median_duration_us': np.float64(3.845), 'std_dev_duration_us': np.float64(0.16720245130446565), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(4.726)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.88)}]",0.02613235774322053,99.4288439390621 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",1,24,7.570332845052083,7.570332845052083,7.41015625,7.41015625,0.5188871878512363,0.5188871878512363,7.0888671875,7.0888671875,9.2529296875,9.2529296875,181.68798828125,181.68798828125,152,"['aten::addmm', 'nn.Module: Linear_4', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(181.688), 'mean_duration_us': np.float64(7.570333333333333), 'median_duration_us': np.float64(7.41), 'std_dev_duration_us': np.float64(0.5079509217324928), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(9.253)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]",0.02550042725278935,99.4543443663149 +aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), ())","('c10::BFloat16', 'double')","((67108864, 262144, 512, 1), ())","('', '')",1,3,60.088216145833336,60.088216145833336,59.20703125,59.20703125,1.7745229841248433,1.7745229841248433,58.9267578125,58.9267578125,62.130859375,62.130859375,180.2646484375,180.2646484375,27164,"['aten::div', 'nn.Module: ResnetBlock2D_8', 'nn.Module: UpDecoderBlock2D_2', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(180.265), 'mean_duration_us': np.float64(60.08833333333333), 'median_duration_us': np.float64(59.207), 'std_dev_duration_us': np.float64(1.448899659128341), 'min_duration_us': np.float64(58.927), 'max_duration_us': np.float64(62.131)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(60.09)}]",0.025300657446954096,99.47964502376185 +aten::miopen_convolution,CONV_fwd,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 16, 128, 128), (2432, 16, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((262144, 16384, 128, 1), (64, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",4,4,43.0699462890625,43.0699462890625,42.999755859375,42.999755859375,0.45408290154729514,0.45408290154729514,42.6591796875,42.6591796875,43.62109375,43.62109375,172.27978515625,172.27978515625,18416,"['aten::miopen_convolution', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.905), 'mean_duration_us': np.float64(4.97625), 'median_duration_us': np.float64(4.9864999999999995), 'std_dev_duration_us': np.float64(0.1425313561992589), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.166)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.806), 'mean_duration_us': np.float64(8.4515), 'median_duration_us': np.float64(8.4315), 'std_dev_duration_us': np.float64(0.5024542267709567), 'min_duration_us': np.float64(7.811), 'max_duration_us': np.float64(9.132)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(51.512), 'mean_duration_us': np.float64(12.878), 'median_duration_us': np.float64(12.838000000000001), 'std_dev_duration_us': np.float64(0.08246211251235361), 'min_duration_us': np.float64(12.818), 'max_duration_us': np.float64(13.018)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.05699999999999), 'mean_duration_us': np.float64(16.764249999999997), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(0.3003168118837177), 'min_duration_us': np.float64(16.304), 'max_duration_us': np.float64(17.145)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(4.98)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(8.45)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(12.88)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(16.76)}]",0.024179959115968184,99.50382498287782 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 4096), (4096, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (2432, 1))","('', '', '')",1,4,42.251708984375,42.251708984375,42.261962890625,42.261962890625,0.7774666796021822,0.7774666796021822,41.419921875,41.419921875,43.06298828125,43.06298828125,169.0068359375,169.0068359375,18420,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(169.007), 'mean_duration_us': np.float64(42.25175), 'median_duration_us': np.float64(42.262), 'std_dev_duration_us': np.float64(0.6732137012123276), 'min_duration_us': np.float64(41.42), 'max_duration_us': np.float64(43.063)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(42.25)}]",0.023720591360045812,99.52754557423786 +aten::fill_,elementwise,nn.Module: CLIPAttention,python3,CPU,thread 416 (python3),"((1,), ())","('int', 'Scalar')","((1,), ())","('', '0')",1,88,1.9036088423295454,1.9036088423295454,1.36083984375,1.36083984375,1.7185595298411551,1.7185595298411551,1.12109375,1.12109375,8.4921875,8.4921875,167.517578125,167.517578125,121,"['aten::fill_', 'nn.Module: CLIPAttention_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 88, 'total_duration_us': np.float64(167.526), 'mean_duration_us': np.float64(1.9037045454545456), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(1.7087313685829433), 'min_duration_us': np.float64(1.121), 'max_duration_us': np.float64(8.492)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.9)}]",0.02351156977932625,99.5510571440172 +aten::upsample_nearest2d,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((33554432, 65536, 256, 1), (), (), ())","('', '[512, 512]', '2.', '2.')",1,1,159.51611328125,159.51611328125,159.51611328125,159.51611328125,,,159.51611328125,159.51611328125,159.51611328125,159.51611328125,159.51611328125,159.51611328125,27119,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_1', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(159.516), 'mean_duration_us': np.float64(159.516), 'median_duration_us': np.float64(159.516), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(159.516), 'max_duration_us': np.float64(159.516)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(159.52)}]",0.02238854137170281,99.57344568538889 +aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",1,24,6.423543294270833,6.423543294270833,6.448486328125,6.448486328125,0.6604502574194904,0.6604502574194904,4.64599609375,4.64599609375,7.77099609375,7.77099609375,154.1650390625,154.1650390625,154,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(154.16500000000002), 'mean_duration_us': np.float64(6.423541666666668), 'median_duration_us': np.float64(6.4485), 'std_dev_duration_us': np.float64(0.6465522651705911), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(7.771)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.42)}]",0.02163750284609438,99.59508318823498 +triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (), (), ())","('', '', '', '', '', '', '8192', '19', '128')",1,4,38.185791015625,38.185791015625,38.296142578125,38.296142578125,0.6489508867729514,0.6489508867729514,37.333984375,37.333984375,38.81689453125,38.81689453125,152.7431640625,152.7431640625,18417,"['triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(152.743), 'mean_duration_us': np.float64(38.18575), 'median_duration_us': np.float64(38.296), 'std_dev_duration_us': np.float64(0.5620197394220234), 'min_duration_us': np.float64(37.334), 'max_duration_us': np.float64(38.817)}]","[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(38.19)}]",0.021437938635256556,99.61652112687024 +aten::sigmoid,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",1,24,6.109761555989583,6.109761555989583,6.0478515625,6.0478515625,0.38336007029338576,0.38336007029338576,5.4072265625,5.4072265625,6.92919921875,6.92919921875,146.63427734375,146.63427734375,155,"['aten::sigmoid', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(146.634), 'mean_duration_us': np.float64(6.109749999999999), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.37528314310664157), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(6.929)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.11)}]",0.020580538964311484,99.63710166583455 +triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1), (2, 4096, 1), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (4096, 1, 8192), (4096, 1, 8192), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",1,4,33.8695068359375,33.8695068359375,33.1484375,33.1484375,2.052704965445482,2.052704965445482,32.3671875,32.3671875,36.81396484375,36.81396484375,135.47802734375,135.47802734375,18422,"['triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(135.478), 'mean_duration_us': np.float64(33.8695), 'median_duration_us': np.float64(33.1485), 'std_dev_duration_us': np.float64(1.7777253021769148), 'min_duration_us': np.float64(32.367), 'max_duration_us': np.float64(36.814)}]","[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(33.87)}]",0.01901472746389162,99.65611639329845 +aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (1, 512, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (33554432, 65536, 256, 1), ())","('', '', '1')",1,3,41.40673828125,41.40673828125,41.6201171875,41.6201171875,0.9002729161043719,0.9002729161043719,40.4189453125,40.4189453125,42.18115234375,42.18115234375,124.22021484375,124.22021484375,27058,"['aten::add', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(124.22), 'mean_duration_us': np.float64(41.406666666666666), 'median_duration_us': np.float64(41.62), 'std_dev_duration_us': np.float64(0.7349804230197037), 'min_duration_us': np.float64(40.419), 'max_duration_us': np.float64(42.181)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(41.41)}]",0.017434661376983338,99.67355105467543 +aten::mul,elementwise,nn.Module: QuickGELUActivation,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",1,24,5.121663411458333,5.121663411458333,5.126953125,5.126953125,0.5496177307356938,0.5496177307356938,4.125,4.125,6.52783203125,6.52783203125,122.919921875,122.919921875,156,"['aten::mul', 'nn.Module: QuickGELUActivation_0', 'nn.Module: CLIPMLP_0', 'nn.Module: CLIPEncoderLayer_0', 'nn.Module: CLIPEncoder_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(122.91999999999999), 'mean_duration_us': np.float64(5.121666666666666), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.5380385415769229), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]",0.017252161550932125,99.69080321622636 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,6,20.2880859375,20.2880859375,20.427978515625,20.427978515625,1.4392336798467016,1.4392336798467016,17.90380859375,17.90380859375,21.7109375,21.7109375,121.728515625,121.728515625,26754,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_0', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(40.815000000000005), 'mean_duration_us': np.float64(6.802500000000001), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.5678253105782916), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.851)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.91400000000002), 'mean_duration_us': np.float64(13.485666666666669), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8789754768415834), 'min_duration_us': np.float64(11.856), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.8)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.49)}]",0.017084944286356474,99.70788816051271 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2432,), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (1,), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '666', '2432')",1,4,28.791748046875,28.791748046875,28.842041015625,28.842041015625,0.9892329482443104,0.9892329482443104,27.60009765625,27.60009765625,29.8828125,29.8828125,115.1669921875,115.1669921875,18465,"['triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.167), 'mean_duration_us': np.float64(28.79175), 'median_duration_us': np.float64(28.842), 'std_dev_duration_us': np.float64(0.8567591187142386), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(29.883)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(28.79)}]",0.016164015761205817,99.72405217627391 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 4864), (2, 4864))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (4864, 1))","('', '', '')",1,8,12.38751220703125,12.38751220703125,12.4169921875,12.4169921875,0.27056156311034085,0.27056156311034085,11.97705078125,11.97705078125,12.77783203125,12.77783203125,99.10009765625,99.10009765625,20398,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(99.1), 'mean_duration_us': np.float64(12.3875), 'median_duration_us': np.float64(12.417), 'std_dev_duration_us': np.float64(0.253121018487205), 'min_duration_us': np.float64(11.977), 'max_duration_us': np.float64(12.778)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.39)}]",0.01390898129773787,99.73796115757165 +aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), ())","('c10::BFloat16', 'double')","((33554432, 65536, 256, 1), ())","('', '')",1,3,31.552897135416668,31.552897135416668,30.56494140625,30.56494140625,1.8162073388792004,1.8162073388792004,30.44482421875,30.44482421875,33.64892578125,33.64892578125,94.65869140625,94.65869140625,27059,"['aten::div', 'nn.Module: ResnetBlock2D_5', 'nn.Module: UpDecoderBlock2D_1', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(94.65899999999999), 'mean_duration_us': np.float64(31.552999999999997), 'median_duration_us': np.float64(30.565), 'std_dev_duration_us': np.float64(1.4829052565824967), 'min_duration_us': np.float64(30.445), 'max_duration_us': np.float64(33.649)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(31.55)}]",0.0132856172655329,99.75124677483718 +aten::add,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (8388608, 16384, 128, 1), ())","('', '', '1')",1,1,92.93798828125,92.93798828125,92.93798828125,92.93798828125,,,92.93798828125,92.93798828125,92.93798828125,92.93798828125,92.93798828125,92.93798828125,26878,"['aten::add', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(92.938), 'mean_duration_us': np.float64(92.938), 'median_duration_us': np.float64(92.938), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(92.938), 'max_duration_us': np.float64(92.938)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(92.94)}]",0.013044111675219544,99.7642908865124 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,4,21.1595458984375,84.2020263671875,21.309814453125,85.16357421875,0.9941731905396719,3.5496797689210453,19.8271484375,79.1142578125,22.19140625,87.36669921875,84.63818359375,336.80810546875,26880,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_3', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.756999999999998), 'mean_duration_us': np.float64(6.9392499999999995), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.39939477650565214), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(7.491)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(56.881), 'mean_duration_us': np.float64(14.22025), 'median_duration_us': np.float64(14.381), 'std_dev_duration_us': np.float64(0.4814152962879343), 'min_duration_us': np.float64(13.419), 'max_duration_us': np.float64(14.7)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.94)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(14.22)}]",0.01187921041978638,99.77617009693219 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((16384, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 16384), (1, 512))","('', '')",1,3,27.146158854166668,27.146158854166668,25.55712890625,25.55712890625,3.616534916430768,3.616534916430768,24.59619140625,24.59619140625,31.28515625,31.28515625,81.4384765625,81.4384765625,26801,"['aten::mm', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA4_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB0_LBSPPM0_LPA4_LPB0_LPM0_LRVW4_LWPMn1_MIAV0_MIWT4_8_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB8_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(81.438), 'mean_duration_us': np.float64(27.146), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(2.952893609100516), 'min_duration_us': np.float64(24.596), 'max_duration_us': np.float64(31.285)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(27.15)}]",0.011430122413735462,99.78760021934593 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 64), (8192, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (64, 1))","('', '', '')",1,4,19.6181640625,19.6181640625,19.648193359375,19.648193359375,0.7299416556187925,0.7299416556187925,18.7470703125,18.7470703125,20.42919921875,20.42919921875,78.47265625,78.47265625,20448,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(78.472), 'mean_duration_us': np.float64(19.618), 'median_duration_us': np.float64(19.648), 'std_dev_duration_us': np.float64(0.6320921610018587), 'min_duration_us': np.float64(18.747), 'max_duration_us': np.float64(20.429)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(19.62)}]",0.011013861075607386,99.79861408042154 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",1,8,9.7286376953125,9.7286376953125,9.112548828125,9.112548828125,2.1861249338708104,2.1861249338708104,8.3720703125,8.3720703125,14.98193359375,14.98193359375,77.8291015625,77.8291015625,18408,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(77.829), 'mean_duration_us': np.float64(9.728625), 'median_duration_us': np.float64(9.1125), 'std_dev_duration_us': np.float64(2.0449552524138515), 'min_duration_us': np.float64(8.372), 'max_duration_us': np.float64(14.982)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.73)}]",0.010923536340070211,99.80953761676162 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((32, 64), (), (65536, 64), (), (65536, 64))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((64, 1), (), (1, 0), (), (64, 1))","('', '0', '', 'False', '')",1,2,34.950439453125,34.950439453125,34.950439453125,34.950439453125,0.8206996185939568,0.8206996185939568,34.3701171875,34.3701171875,35.53076171875,35.53076171875,69.90087890625,69.90087890625,5211,"['aten::gather', 'nn.Module: Embedding_5', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(69.901), 'mean_duration_us': np.float64(34.9505), 'median_duration_us': np.float64(34.9505), 'std_dev_duration_us': np.float64(0.5805000000000007), 'min_duration_us': np.float64(34.37), 'max_duration_us': np.float64(35.531)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(34.95)}]",0.009810787682318226,99.81934840444393 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 4864), (4864,), (2, 333, 2432), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (809856, 2432, 1), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '666', '2432')",1,4,16.974365234375,16.974365234375,16.945068359375,16.945068359375,0.2250174974772836,0.2250174974772836,16.7431640625,16.7431640625,17.26416015625,17.26416015625,67.8974609375,67.8974609375,20402,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.89699999999999), 'mean_duration_us': np.float64(16.974249999999998), 'median_duration_us': np.float64(16.945), 'std_dev_duration_us': np.float64(0.19489917265088666), 'min_duration_us': np.float64(16.743), 'max_duration_us': np.float64(17.264)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(16.97)}]",0.009529602257501055,99.82887800670143 +aten::copy_,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (512, 1, 65536, 512), ())","('', '', 'False')",1,1,64.01416015625,64.01416015625,64.01416015625,64.01416015625,,,64.01416015625,64.01416015625,64.01416015625,64.01416015625,64.01416015625,64.01416015625,27022,"['aten::copy_', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.014), 'mean_duration_us': np.float64(64.014), 'median_duration_us': np.float64(64.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.014), 'max_duration_us': np.float64(64.014)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}]",0.008984569919316567,99.83786257662075 +aten::add_,elementwise,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 16384, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 512, 1), (1,), ())","('', '', '1')",1,3,19.841634114583332,19.841634114583332,19.7080078125,19.7080078125,0.8098247697242251,0.8098247697242251,19.10693359375,19.10693359375,20.7099609375,20.7099609375,59.52490234375,59.52490234375,26803,"['aten::add_', 'nn.Module: Linear_434', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.525), 'mean_duration_us': np.float64(19.841666666666665), 'median_duration_us': np.float64(19.708), 'std_dev_duration_us': np.float64(0.6612121864844571), 'min_duration_us': np.float64(19.107), 'max_duration_us': np.float64(20.71)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(19.84)}]",0.008354489783862249,99.84621706640462 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((), (1, 16, 128, 128))","('float', 'c10::BFloat16')","((), (262144, 16384, 128, 1))","('', '')",1,4,14.8712158203125,14.8712158203125,14.801513671875,14.801513671875,0.4270736026430738,0.4270736026430738,14.4599609375,14.4599609375,15.421875,15.421875,59.48486328125,59.48486328125,20483,['aten::mul'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(59.485), 'mean_duration_us': np.float64(14.87125), 'median_duration_us': np.float64(14.8015), 'std_dev_duration_us': np.float64(0.3699130810068764), 'min_duration_us': np.float64(14.46), 'max_duration_us': np.float64(15.422)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.87)}]",0.008348870187265853,99.85456593659188 +aten::sub,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",1,4,10.304443359375,10.304443359375,3.94482421875,3.94482421875,12.785824794055774,12.785824794055774,3.84521484375,3.84521484375,29.48291015625,29.48291015625,41.2177734375,41.2177734375,20458,['aten::sub'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(41.217999999999996), 'mean_duration_us': np.float64(10.304499999999999), 'median_duration_us': np.float64(3.945), 'std_dev_duration_us': np.float64(11.072868677537903), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(29.483)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(10.3)}]",0.0057850320376594275,99.86035096862955 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '666', '2432')",1,4,8.49169921875,8.49169921875,8.49169921875,8.49169921875,0.0005638186222554939,0.0005638186222554939,8.4912109375,8.4912109375,8.4921875,8.4921875,33.966796875,33.966796875,18421,"['triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.966), 'mean_duration_us': np.float64(8.4915), 'median_duration_us': np.float64(8.4915), 'std_dev_duration_us': np.float64(0.0005000000000006111), 'min_duration_us': np.float64(8.491), 'max_duration_us': np.float64(8.492)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(8.49)}]",0.004767336800385487,99.86511830542993 +aten::miopen_convolution,CONV_fwd,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (512, 16, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((262144, 16384, 128, 1), (144, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', '1', 'False', 'False')",2,1,32.76611328125,55.3193359375,32.76611328125,55.3193359375,,,32.76611328125,55.3193359375,32.76611328125,55.3193359375,32.76611328125,55.3193359375,26749,"['aten::miopen_convolution', 'nn.Module: Conv2d_0', 'nn.Module: Decoder_0']","[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.568), 'mean_duration_us': np.float64(6.568), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.568), 'max_duration_us': np.float64(6.568)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA2_NLCB2_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU8_SUM0_SUS256_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.198), 'mean_duration_us': np.float64(26.198), 'median_duration_us': np.float64(26.198), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.198), 'max_duration_us': np.float64(26.198)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(6.57)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(26.2)}]",0.004598817434159451,99.86971712286409 +aten::upsample_nearest2d,elementwise,nn.Module: Upsample2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', 'Scalar')","((512, 1, 65536, 512), (), (), ())","('', '[256, 256]', '2.', '2.')",1,1,32.48681640625,96.5009765625,32.48681640625,96.5009765625,,,32.48681640625,96.5009765625,32.48681640625,96.5009765625,32.48681640625,96.5009765625,27017,"['aten::upsample_nearest2d', 'nn.Module: Upsample2D_0', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.487), 'mean_duration_us': np.float64(32.487), 'median_duration_us': np.float64(32.487), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.487), 'max_duration_us': np.float64(32.487)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(32.49)}]",0.004559617321316307,99.87427674018541 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2048), (2048, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2048, 1), (1, 2048), (2432, 1))","('', '', '')",1,4,7.08935546875,7.08935546875,7.0693359375,7.0693359375,0.056164372579359176,0.056164372579359176,7.0498046875,7.0498046875,7.1689453125,7.1689453125,28.357421875,28.357421875,18409,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(28.358), 'mean_duration_us': np.float64(7.0895), 'median_duration_us': np.float64(7.0695), 'std_dev_duration_us': np.float64(0.04858240422210485), 'min_duration_us': np.float64(7.05), 'max_duration_us': np.float64(7.169)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]",0.003980045023563732,99.87825678520898 +aten::addmm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((512,), (16384, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",1,1,27.60009765625,27.60009765625,27.60009765625,27.60009765625,,,27.60009765625,27.60009765625,27.60009765625,27.60009765625,27.60009765625,27.60009765625,26871,"['aten::addmm', 'nn.Module: Linear_437', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_7_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.6), 'mean_duration_us': np.float64(27.6), 'median_duration_us': np.float64(27.6), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(27.6)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.6)}]",0.003873752409892899,99.88213053761886 +aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'double')","((512, 1, 65536, 512), ())","('', '')",1,3,8.865559895833334,8.865559895833334,8.85205078125,8.85205078125,0.22076919151973087,0.22076919151973087,8.65185546875,8.65185546875,9.0927734375,9.0927734375,26.5966796875,26.5966796875,26947,"['aten::div', 'nn.Module: ResnetBlock2D_2', 'nn.Module: UpDecoderBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.596999999999998), 'mean_duration_us': np.float64(8.865666666666666), 'median_duration_us': np.float64(8.852), 'std_dev_duration_us': np.float64(0.18029666910092654), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(9.093)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]",0.0037329198366539795,99.88586345745551 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 16, 128, 128), (1, 16, 128, 128)), ())","('TensorList', 'Scalar')","(((262144, 16384, 128, 1), (262144, 16384, 128, 1)), ())","('', '0')",1,4,6.358642578125,6.358642578125,6.569091796875,6.569091796875,0.7197509098981358,0.7197509098981358,5.3271484375,5.3271484375,6.96923828125,6.96923828125,25.4345703125,25.4345703125,18396,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 4, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(25.433999999999997), 'mean_duration_us': np.float64(6.358499999999999), 'median_duration_us': np.float64(6.569), 'std_dev_duration_us': np.float64(0.6233223483880552), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(6.36)}]",0.0035698144720269103,99.88943327192754 +triton_poi_fused_addmm_silu_2,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), ())","('', '', '4864')",1,8,3.1087646484375,3.1087646484375,3.083984375,3.083984375,0.3277799647686495,0.3277799647686495,2.80322265625,2.80322265625,3.48388671875,3.48388671875,24.8701171875,24.8701171875,18407,"['triton_poi_fused_addmm_silu_2', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(24.87), 'mean_duration_us': np.float64(3.10875), 'median_duration_us': np.float64(3.0839999999999996), 'std_dev_duration_us': np.float64(0.30680235901961384), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(3.484)}]","[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'mean_duration_us': np.float64(3.11)}]",0.0034905918663509054,99.8929238637939 +aiter::_groupnorm_run,NORM_fwd,nn.Module: GroupNorm,python3,CPU,thread 416 (python3),"((1, 512, 16384), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",2,1,24.7138671875,24.7138671875,24.7138671875,24.7138671875,,,24.7138671875,24.7138671875,24.7138671875,24.7138671875,24.7138671875,24.7138671875,26788,"['aiter::_groupnorm_run', 'nn.Module: GroupNorm_2', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.809), 'mean_duration_us': np.float64(6.809), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(6.809)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(17.905), 'mean_duration_us': np.float64(17.905), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(17.905), 'max_duration_us': np.float64(17.905)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.81)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(17.9)}]",0.003468661733291803,99.89639252552719 +triton_poi_fused__to_copy_cat_slice_1,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 256), (2, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '512')",1,4,6.0982666015625,6.0982666015625,6.14794921875,6.14794921875,0.23668209081633035,0.23668209081633035,5.76806640625,5.76806640625,6.3291015625,6.3291015625,24.39306640625,24.39306640625,18405,"['triton_poi_fused__to_copy_cat_slice_1', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(24.393), 'mean_duration_us': np.float64(6.09825), 'median_duration_us': np.float64(6.148), 'std_dev_duration_us': np.float64(0.20497606567597107), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(6.329)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'mean_duration_us': np.float64(6.1)}]",0.003423636428854835,99.89981616195604 +triton_poi_fused_addmm_clone_permute_view_25,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((8192, 64), (64,), (2, 16, 64, 2, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((64, 1), (1,), (262144, 16384, 256, 128, 2, 1), (), ())","('', '', '', '32', '16384')",1,4,5.9473876953125,5.9473876953125,5.9873046875,5.9873046875,0.09534735954134627,0.09534735954134627,5.80712890625,5.80712890625,6.0078125,6.0078125,23.78955078125,23.78955078125,20449,"['triton_poi_fused_addmm_clone_permute_view_25', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(23.79), 'mean_duration_us': np.float64(5.9475), 'median_duration_us': np.float64(5.9875), 'std_dev_duration_us': np.float64(0.08270580390758536), 'min_duration_us': np.float64(5.807), 'max_duration_us': np.float64(6.008)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'mean_duration_us': np.float64(5.95)}]",0.0033389312899140544,99.90315509324596 +aten::mm,GEMM,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 256), (256, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (2432, 1))","('', '', '')",1,4,5.727294921875,5.727294921875,5.70751953125,5.70751953125,0.09820929015034323,0.09820929015034323,5.64697265625,5.64697265625,5.84716796875,5.84716796875,22.9091796875,22.9091796875,18406,"['aten::mm', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.909), 'mean_duration_us': np.float64(5.72725), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.08497168646084413), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.847)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}]",0.0032153686964591782,99.90637046194242 +aten::argmax,reduce,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",1,4,5.59765625,5.59765625,5.547607421875,5.547607421875,0.26256004736612226,0.26256004736612226,5.3671875,5.3671875,5.92822265625,5.92822265625,22.390625,22.390625,1402,"['aten::argmax', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.39), 'mean_duration_us': np.float64(5.5975), 'median_duration_us': np.float64(5.547499999999999), 'std_dev_duration_us': np.float64(0.22739887862520336), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.922), 'mean_duration_us': np.float64(1.922), 'median_duration_us': np.float64(1.922), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.922), 'max_duration_us': np.float64(1.922)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.805), 'mean_duration_us': np.float64(3.805), 'median_duration_us': np.float64(3.805), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(3.805)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.965), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(3.965)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}]","[{'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.92)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.8)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.423000000000002), 'mean_duration_us': np.float64(4.6057500000000005), 'median_duration_us': np.float64(4.586), 'std_dev_duration_us': np.float64(0.13594185337856768), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]",0.002585699750999718,99.91481356317016 +aten::copy_,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,4,4.55615234375,4.55615234375,4.345703125,4.345703125,0.48984807208769054,0.48984807208769054,4.24609375,4.24609375,5.287109375,5.287109375,18.224609375,18.224609375,1401,"['aten::copy_', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.224), 'mean_duration_us': np.float64(4.556), 'median_duration_us': np.float64(4.3454999999999995), 'std_dev_duration_us': np.float64(0.42424108711910485), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.56)}]",0.0025578758946809828,99.91737143906484 +triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2,), (2, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '512')",1,4,4.14501953125,4.14501953125,4.125,4.125,0.10076276427281922,0.10076276427281922,4.044921875,4.044921875,4.28515625,4.28515625,16.580078125,16.580078125,18404,"['triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.58), 'mean_duration_us': np.float64(4.145), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.285)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'stream': 0, 'mean_duration_us': np.float64(4.14)}]",0.0023270612442339365,99.91969850030907 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 1280), (1280, 1280))","('c10::BFloat16', 'c10::BFloat16')","((1280, 1), (1, 1280))","('', '')",1,2,8.21142578125,8.21142578125,8.21142578125,8.21142578125,0.11255703645840552,0.11255703645840552,8.1318359375,8.1318359375,8.291015625,8.291015625,16.4228515625,16.4228515625,5016,"['aten::mm', 'nn.Module: Linear_265', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(16.423000000000002), 'mean_duration_us': np.float64(8.211500000000001), 'median_duration_us': np.float64(8.211500000000001), 'std_dev_duration_us': np.float64(0.07950000000000035), 'min_duration_us': np.float64(8.132), 'max_duration_us': np.float64(8.291)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",0.0023049940478432154,99.92200349435691 +aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'bool', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,7.570556640625,7.570556640625,7.570556640625,7.570556640625,0.5099593338928372,0.5099593338928372,7.2099609375,7.2099609375,7.93115234375,7.93115234375,15.14111328125,15.14111328125,5171,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(15.141), 'mean_duration_us': np.float64(7.5705), 'median_duration_us': np.float64(7.5705), 'std_dev_duration_us': np.float64(0.36050000000000004), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(7.931)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]",0.0021250984250927715,99.92412859278201 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",1,4,3.7847900390625,3.7847900390625,3.705078125,3.705078125,0.26663028995436494,0.26663028995436494,3.56396484375,3.56396484375,4.1650390625,4.1650390625,15.13916015625,15.13916015625,20459,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(15.139), 'mean_duration_us': np.float64(3.78475), 'median_duration_us': np.float64(3.705), 'std_dev_duration_us': np.float64(0.23088999003854627), 'min_duration_us': np.float64(3.564), 'max_duration_us': np.float64(4.165)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]",0.002124824298429533,99.92625341708045 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1,4,3.584228515625,3.584228515625,3.70458984375,3.70458984375,0.4348311081041389,0.4348311081041389,2.962890625,2.962890625,3.96484375,3.96484375,14.3369140625,14.3369140625,25,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.337000000000002), 'mean_duration_us': np.float64(3.5842500000000004), 'median_duration_us': np.float64(3.7045000000000003), 'std_dev_duration_us': np.float64(0.3765510423568098), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.965)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.58)}]",0.0020122267715042066,99.92826564385194 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('float', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",1,4,3.564453125,3.564453125,3.50390625,3.50390625,0.19360992946960456,0.19360992946960456,3.40478515625,3.40478515625,3.84521484375,3.84521484375,14.2578125,14.2578125,20477,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.258000000000001), 'mean_duration_us': np.float64(3.5645000000000002), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.16751193987295365), 'min_duration_us': np.float64(3.405), 'max_duration_us': np.float64(3.845)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.56)}]",0.002001124641643037,99.93026676849358 +triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1), (2, 4096, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (4096, 1, 8192), (4096, 1, 8192), (), ())","('', '', '', '', '', '8192', '19')",1,4,3.4942626953125,3.4942626953125,3.54443359375,3.54443359375,0.11484846594160597,0.11484846594160597,3.32421875,3.32421875,3.56396484375,3.56396484375,13.97705078125,13.97705078125,18418,"['triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.977), 'mean_duration_us': np.float64(3.49425), 'median_duration_us': np.float64(3.5445), 'std_dev_duration_us': np.float64(0.09957503452171139), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}]",0.001961718933802463,99.93222848742738 +aten::mm,GEMM,nn.Module: Linear,python3,CPU,thread 416 (python3),"((1, 768), (768, 768))","('c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768))","('', '')",1,2,6.889404296875,6.889404296875,6.889404296875,6.889404296875,0.28346419304402126,0.28346419304402126,6.68896484375,6.68896484375,7.08984375,7.08984375,13.77880859375,13.77880859375,1415,"['aten::mm', 'nn.Module: Linear_72', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.779), 'mean_duration_us': np.float64(6.8895), 'median_duration_us': np.float64(6.8895), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.09)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(6.89)}]",0.001933895077483728,99.93416238250487 +aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",1,4,3.4444580078125,3.4444580078125,3.4443359375,3.4443359375,0.2698734709293077,0.2698734709293077,3.1240234375,3.1240234375,3.76513671875,3.76513671875,13.77783203125,13.77783203125,20460,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.778), 'mean_duration_us': np.float64(3.4445), 'median_duration_us': np.float64(3.4444999999999997), 'std_dev_duration_us': np.float64(0.23366696386096175), 'min_duration_us': np.float64(3.124), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]",0.0019337580141521084,99.93609614051901 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'float', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",1,4,3.38427734375,3.38427734375,3.364013671875,3.364013671875,0.07683981154707822,0.07683981154707822,3.32421875,3.32421875,3.48486328125,3.48486328125,13.537109375,13.537109375,20488,['aten::copy_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536999999999999), 'mean_duration_us': np.float64(3.3842499999999998), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0667097256777451), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.485)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]",0.0018999719029079297,99.93799611242191 +triton_poi_fused_add_addmm_silu_22,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '4864')",1,4,3.3236083984375,3.3236083984375,3.3837890625,3.3837890625,0.2555605086823307,0.2555605086823307,2.962890625,2.962890625,3.56396484375,3.56396484375,13.29443359375,13.29443359375,20392,"['triton_poi_fused_add_addmm_silu_22', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.295000000000002), 'mean_duration_us': np.float64(3.3237500000000004), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.22131467981134914), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]",0.0018659116650005122,99.93986202408692 +aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('float', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,6.62890625,6.62890625,6.62890625,6.62890625,0.14155946303051,0.14155946303051,6.52880859375,6.52880859375,6.72900390625,6.72900390625,13.2578125,13.2578125,5182,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.258), 'mean_duration_us': np.float64(6.629), 'median_duration_us': np.float64(6.629), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.63)}]",0.0018607717900647853,99.94172279587698 +aten::add,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (8388608, 16384, 128, 1), ())","('', '', '1')",1,1,12.73779296875,12.73779296875,12.73779296875,12.73779296875,,,12.73779296875,12.73779296875,12.73779296875,12.73779296875,12.73779296875,12.73779296875,26781,"['aten::add', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.738), 'mean_duration_us': np.float64(12.738), 'median_duration_us': np.float64(12.738), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.738), 'max_duration_us': np.float64(12.738)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(12.74)}]",0.001787785565977462,99.94351058144296 +aten::add,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (), ())","('long int', 'long int', 'Scalar')","((256, 1), (), ())","('', '', '1')",1,4,3.1337890625,3.1337890625,3.1240234375,3.1240234375,0.177498125952915,0.177498125952915,2.962890625,2.962890625,3.32421875,3.32421875,12.53515625,12.53515625,5173,"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(3.13375), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.1535746968090772), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.324)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.13)}]",0.0017593449246664395,99.94526992636763 +triton_poi_fused_add_addmm_silu_21,triton,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '4864')",1,4,3.1033935546875,3.1033935546875,3.0634765625,3.0634765625,0.18656449590027488,0.18656449590027488,2.9228515625,2.9228515625,3.36376953125,3.36376953125,12.41357421875,12.41357421875,20338,"['triton_poi_fused_add_addmm_silu_21', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.414000000000001), 'mean_duration_us': np.float64(3.1035000000000004), 'median_duration_us': np.float64(3.0635000000000003), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(2.923), 'max_duration_us': np.float64(3.364)}]","[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'mean_duration_us': np.float64(3.1)}]",0.0017422805398798259,99.94701220690752 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((32128, 4096), (), (256, 4096), (), (256, 4096))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((4096, 1), (), (1, 0), (), (4096, 1))","('', '0', '', 'False', '')",1,2,5.908203125,5.908203125,5.908203125,5.908203125,2.974129791572715,2.974129791572715,3.80517578125,3.80517578125,8.01123046875,8.01123046875,11.81640625,11.81640625,5083,"['aten::gather', 'nn.Module: Embedding_4', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.815999999999999), 'mean_duration_us': np.float64(5.9079999999999995), 'median_duration_us': np.float64(5.9079999999999995), 'std_dev_duration_us': np.float64(2.1029999999999993), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]",0.0016584663125945715,99.94867067322011 +aten::index,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77, 1280), ())","('c10::BFloat16', '')","((98560, 1280, 1), ())","('', '')",1,2,5.867431640625,5.867431640625,5.867431640625,5.867431640625,0.19852851522571524,0.19852851522571524,5.72705078125,5.72705078125,6.0078125,6.0078125,11.73486328125,11.73486328125,5005,"['aten::index', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.735), 'mean_duration_us': np.float64(5.8675), 'median_duration_us': np.float64(5.8675), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.87)}]",0.0016470215244043527,99.95031769474451 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 77, 4096), (1, 256, 4096)), ())","('TensorList', 'Scalar')","(((315392, 4096, 1), (1048576, 4096, 1)), ())","('', '-2')",1,2,5.62744140625,5.62744140625,5.62744140625,5.62744140625,0.1988737822087165,0.1988737822087165,5.48681640625,5.48681640625,5.76806640625,5.76806640625,11.2548828125,11.2548828125,9180,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.254999999999999), 'mean_duration_us': np.float64(5.6274999999999995), 'median_duration_us': np.float64(5.6274999999999995), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.487), 'max_duration_us': np.float64(5.768)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(5.63)}]",0.0015796548969134246,99.95189734964143 +aten::copy_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'float', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,5.546875,5.546875,5.546875,5.546875,0.14155946303051,0.14155946303051,5.44677734375,5.44677734375,5.64697265625,5.64697265625,11.09375,11.09375,5190,"['aten::copy_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.094000000000001), 'mean_duration_us': np.float64(5.547000000000001), 'median_duration_us': np.float64(5.547000000000001), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(5.447), 'max_duration_us': np.float64(5.647)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.55)}]",0.0015570394471962259,99.95345438908862 +aten::add_,elementwise,nn.Module: Conv2d,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (1, 3, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 1048576, 1024, 1), (3, 1, 1, 1), ())","('', '', '1')",1,1,10.97509765625,10.97509765625,10.97509765625,10.97509765625,,,10.97509765625,10.97509765625,10.97509765625,10.97509765625,10.97509765625,10.97509765625,27340,"['aten::add_', 'nn.Module: Conv2d_34', 'nn.Module: Decoder_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.975), 'mean_duration_us': np.float64(10.975), 'median_duration_us': np.float64(10.975), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.975), 'max_duration_us': np.float64(10.975)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.98)}]",0.0015403862524044705,99.95499477534102 +aten::clamp,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((3145728, 1048576, 1024, 1), (), ())","('', '0', '1')",1,1,10.89501953125,10.89501953125,10.89501953125,10.89501953125,,,10.89501953125,10.89501953125,10.89501953125,10.89501953125,10.89501953125,10.89501953125,27343,['aten::clamp'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.895), 'mean_duration_us': np.float64(10.895), 'median_duration_us': np.float64(10.895), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(10.895)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(10.9)}]",0.0015291470592116805,99.95652392240024 +aten::index,elementwise,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",1,2,5.287109375,5.287109375,5.287109375,5.287109375,0.16987135563661201,0.16987135563661201,5.1669921875,5.1669921875,5.4072265625,5.4072265625,10.57421875,10.57421875,1404,"['aten::index', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(10.574), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",0.0014841217547747125,99.95800804415501 +aten::add,elementwise,nn.Module: CLIPTextEmbeddings,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",1,2,5.2470703125,5.2470703125,5.2470703125,5.2470703125,0.113247570424408,0.113247570424408,5.1669921875,5.1669921875,5.3271484375,5.3271484375,10.494140625,10.494140625,54,"['aten::add', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(10.494), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(5.327)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.0014728825615819227,99.9594809267166 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77, 2048), (1, 77, 2048), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((315392, 4096, 1), (157696, 2048, 1), ())","('', '', 'False')",1,2,4.806396484375,4.806396484375,4.806396484375,4.806396484375,0.28346419304402126,0.28346419304402126,4.60595703125,4.60595703125,5.0068359375,5.0068359375,9.61279296875,9.61279296875,9179,['aten::copy_'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.613), 'mean_duration_us': np.float64(4.8065), 'median_duration_us': np.float64(4.8065), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]",0.001349182904795427,99.96083010962138 +aten::div,elementwise,nn.Module: Attention,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((512, 1, 65536, 512), ())","('', '')",1,1,9.4931640625,9.4931640625,9.4931640625,9.4931640625,,,9.4931640625,9.4931640625,9.4931640625,9.4931640625,9.4931640625,9.4931640625,26879,"['aten::div', 'nn.Module: Attention_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.493), 'mean_duration_us': np.float64(9.493), 'median_duration_us': np.float64(9.493), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.493), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.49)}]",0.001332392646672052,99.96216250226806 +aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((8388608, 16384, 128, 1), ())","('', '')",1,1,9.171875,9.171875,9.171875,9.171875,,,9.171875,9.171875,9.171875,9.171875,9.171875,9.171875,26782,"['aten::div', 'nn.Module: ResnetBlock2D_0', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.172), 'mean_duration_us': np.float64(9.172), 'median_duration_us': np.float64(9.172), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.172), 'max_duration_us': np.float64(9.172)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.17)}]",0.001287298810569274,99.96344980107862 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 77, 768), (1, 77, 1280)), ())","('TensorList', 'Scalar')","(((59136, 768, 1), (98560, 1280, 1)), ())","('', '-1')",1,2,4.505859375,4.505859375,4.505859375,4.505859375,0.08493567781830601,0.08493567781830601,4.44580078125,4.44580078125,4.56591796875,4.56591796875,9.01171875,9.01171875,5048,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.012), 'mean_duration_us': np.float64(4.506), 'median_duration_us': np.float64(4.506), 'std_dev_duration_us': np.float64(0.06000000000000005), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(4.566)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.0012648204241836947,99.96471462150281 +aten::div,elementwise,nn.Module: ResnetBlock2D,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((512, 1, 65536, 512), ())","('', '')",1,1,8.89208984375,8.89208984375,8.89208984375,8.89208984375,,,8.89208984375,8.89208984375,8.89208984375,8.89208984375,8.89208984375,8.89208984375,26913,"['aten::div', 'nn.Module: ResnetBlock2D_1', 'nn.Module: UNetMidBlock2D_0', 'nn.Module: Decoder_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.892), 'mean_duration_us': np.float64(8.892), 'median_duration_us': np.float64(8.892), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.89)}]",0.0012480301660603198,99.96596265166887 +aten::sub,elementwise,NA,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",1,4,2.10205078125,2.10205078125,2.08203125,2.08203125,0.1007627642728192,0.1007627642728192,2.001953125,2.001953125,2.2421875,2.2421875,8.408203125,8.408203125,20482,['aten::sub'],"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.408), 'mean_duration_us': np.float64(2.102), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(2.002), 'max_duration_us': np.float64(2.242)}]","[{'name': 'void at::native::unrolled_elementwise_kernel, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.211), 'mean_duration_us': np.float64(8.211), 'median_duration_us': np.float64(8.211), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.211)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",0.0011524284922557982,99.96829519544637 +aten::sub,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((1, 256), (256, 1), ())","('long int', 'long int', 'Scalar')","((256, 1), (1, 1), ())","('', '', '1')",1,2,4.0048828125,4.0048828125,4.0048828125,4.0048828125,0.113247570424408,0.113247570424408,3.9248046875,3.9248046875,4.0849609375,4.0849609375,8.009765625,8.009765625,5166,"['aten::sub', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.01), 'mean_duration_us': np.float64(4.005), 'median_duration_us': np.float64(4.005), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]",0.0011241934459422045,99.96941938889232 +aten::lt,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '8')",1,2,3.98486328125,3.98486328125,3.98486328125,3.98486328125,0.028311892606102,0.028311892606102,3.96484375,3.96484375,4.0048828125,4.0048828125,7.9697265625,7.9697265625,5178,"['aten::lt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.97), 'mean_duration_us': np.float64(3.985), 'median_duration_us': np.float64(3.985), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.005)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.98)}]",0.0011185738493458097,99.97053796274166 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 768), (1, 1280)), ())","('TensorList', 'Scalar')","(((768, 1), (1280, 1)), ())","('', '-1')",1,2,3.964599609375,3.964599609375,3.964599609375,3.964599609375,0.39671176346842923,0.39671176346842923,3.68408203125,3.68408203125,4.2451171875,4.2451171875,7.92919921875,7.92919921875,9181,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.929), 'mean_duration_us': np.float64(3.9645), 'median_duration_us': np.float64(3.9645), 'std_dev_duration_us': np.float64(0.28049999999999997), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(4.245)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.96)}]",0.0011128857210836052,99.97165084846274 +aten::where,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), (256, 256))","('bool', 'long int', 'long int')","((256, 1), (256, 1), (256, 1))","('', '', '')",1,2,3.864990234375,3.864990234375,3.864990234375,3.864990234375,0.027966625623100757,0.027966625623100757,3.84521484375,3.84521484375,3.884765625,3.884765625,7.72998046875,7.72998046875,5198,"['aten::where', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array >(int, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.73), 'mean_duration_us': np.float64(3.865), 'median_duration_us': np.float64(3.865), 'std_dev_duration_us': np.float64(0.019999999999999796), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.885)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.86)}]",0.0010849248014332504,99.97273577326418 +aten::add_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', '1')",1,2,3.6044921875,3.6044921875,3.6044921875,3.6044921875,0.0006905339660024879,0.0006905339660024879,3.60400390625,3.60400390625,3.60498046875,3.60498046875,7.208984375,7.208984375,5201,"['aten::add_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.209), 'mean_duration_us': np.float64(3.6045), 'median_duration_us': np.float64(3.6045), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(3.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]",0.001011801514014308,99.97374757477819 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((49408, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1,2,3.424560546875,3.424560546875,3.424560546875,3.424560546875,0.48164744128673526,0.48164744128673526,3.083984375,3.083984375,3.76513671875,3.76513671875,6.84912109375,6.84912109375,1482,"['aten::gather', 'nn.Module: Embedding_2', 'nn.Module: CLIPTextEmbeddings_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.849), 'mean_duration_us': np.float64(3.4245), 'median_duration_us': np.float64(3.4245), 'std_dev_duration_us': np.float64(0.3405), 'min_duration_us': np.float64(3.084), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.0009612936763125642,99.9747088684545 +aten::gt,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '0')",1,2,3.424072265625,3.424072265625,3.424072265625,3.424072265625,0.14121419604750876,0.14121419604750876,3.32421875,3.32421875,3.52392578125,3.52392578125,6.84814453125,6.84814453125,5167,"['aten::gt', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.0009611566129809448,99.97567002506749 +aten::abs,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (0,))","('long int', 'long int')","((256, 1), (1,))","('', '')",1,2,3.423828125,3.423828125,3.423828125,3.423828125,0.028311892606102,0.028311892606102,3.40380859375,3.40380859375,3.44384765625,3.44384765625,6.84765625,6.84765625,5176,"['aten::abs', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AbsFunctor, std::array >(int, at::native::AbsFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.404), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Ab...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",0.0009610880813151352,99.9766311131488 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,2,3.343994140625,3.343994140625,3.343994140625,3.343994140625,0.14121419604750876,0.14121419604750876,3.244140625,3.244140625,3.44384765625,3.44384765625,6.68798828125,6.68798828125,37,"['aten::gather', 'nn.Module: Embedding_0', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.688000000000001), 'mean_duration_us': np.float64(3.3440000000000003), 'median_duration_us': np.float64(3.3440000000000003), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.34)}]",0.0009386782265953655,99.97756979137539 +aten::minimum,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), (256, 256))","('long int', 'long int')","((256, 1), (256, 1))","('', '')",1,2,3.323974609375,3.323974609375,3.323974609375,3.323974609375,0.11290230344140675,0.11290230344140675,3.244140625,3.244140625,3.40380859375,3.40380859375,6.64794921875,6.64794921875,5197,"['aten::minimum', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BinaryFunctor, std::array >(int, at::native::BinaryFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.648), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.07999999999999985), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.404)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]",0.0009330586299989707,99.97850285000538 +aten::mul,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'long int')","((256, 1), ())","('', '')",1,2,3.283447265625,3.283447265625,3.283447265625,3.283447265625,0.3400879782562253,0.3400879782562253,3.04296875,3.04296875,3.52392578125,3.52392578125,6.56689453125,6.56689453125,5172,"['aten::mul', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.567), 'mean_duration_us': np.float64(3.2835), 'median_duration_us': np.float64(3.2835), 'std_dev_duration_us': np.float64(0.24049999999999994), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.28)}]",0.0009216823734745616,99.97942453237886 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1048576, 1048576, 1048576, 1048576, 4096, 1), ())","('', '', 'False')",1,2,3.263427734375,3.263427734375,3.263427734375,3.263427734375,0.14190473001351125,0.14190473001351125,3.1630859375,3.1630859375,3.36376953125,3.36376953125,6.52685546875,6.52685546875,9170,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.526999999999999), 'mean_duration_us': np.float64(3.2634999999999996), 'median_duration_us': np.float64(3.2634999999999996), 'std_dev_duration_us': np.float64(0.10050000000000003), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(3.364)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.26)}]",0.0009160627768781668,99.98034059515574 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), ())","('c10::BFloat16', 'double')","((3145728, 1048576, 1024, 1), ())","('', '')",1,1,6.44921875,6.44921875,6.44921875,6.44921875,,,6.44921875,6.44921875,6.44921875,6.44921875,6.44921875,6.44921875,27341,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.449), 'mean_duration_us': np.float64(6.449), 'median_duration_us': np.float64(6.449), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.449), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.45)}]",0.0009051662420144255,99.98124576139776 +aten::fill_,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '15')",1,2,3.0634765625,3.0634765625,3.0634765625,3.0634765625,0.3121213526331245,0.3121213526331245,2.8427734375,2.8427734375,3.2841796875,3.2841796875,6.126953125,6.126953125,5195,"['aten::fill_', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.127), 'mean_duration_us': np.float64(3.0635), 'median_duration_us': np.float64(3.0635), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.06)}]",0.0008599353425800282,99.98210569674033 +aten::log,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256),)","('float',)","((256, 1),)","('',)",1,2,3.04345703125,3.04345703125,3.04345703125,3.04345703125,0.0006905339660024879,0.0006905339660024879,3.04296875,3.04296875,3.0439453125,3.0439453125,6.0869140625,6.0869140625,5184,"['aten::log', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.087), 'mean_duration_us': np.float64(3.0435), 'median_duration_us': np.float64(3.0435), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::lo...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",0.0008543157459836334,99.98296001248632 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 768), (1, 1, 1, 1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 59136, 768, 59136, 768, 1), (59136, 59136, 59136, 59136, 768, 1), ())","('', '', 'False')",1,2,3.023681640625,3.023681640625,3.023681640625,3.023681640625,0.36839987086232723,0.36839987086232723,2.76318359375,2.76318359375,3.2841796875,3.2841796875,6.04736328125,6.04736328125,1431,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.047), 'mean_duration_us': np.float64(3.0235), 'median_duration_us': np.float64(3.0235), 'std_dev_duration_us': np.float64(0.26049999999999995), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.284)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.02)}]",0.0008487646810530482,99.98380877716737 +aten::arange,other,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '256', '1', '')",1,4,1.5009765625,1.5009765625,1.32080078125,1.32080078125,0.41580065693768986,0.41580065693768986,1.240234375,1.240234375,2.1220703125,2.1220703125,6.00390625,6.00390625,5155,"['aten::arange', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.004), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.321), 'std_dev_duration_us': np.float64(0.36005624560615523), 'min_duration_us': np.float64(1.24), 'max_duration_us': np.float64(2.122)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]",0.0008375940195260683,99.9854890365497 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 1280), (1, 1, 1, 1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 98560, 1280, 98560, 1280, 1), (98560, 98560, 98560, 98560, 1280, 1), ())","('', '', 'False')",1,2,2.98291015625,2.98291015625,2.98291015625,2.98291015625,0.198183248242714,0.198183248242714,2.8427734375,2.8427734375,3.123046875,3.123046875,5.9658203125,5.9658203125,5032,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.966), 'mean_duration_us': np.float64(2.983), 'median_duration_us': np.float64(2.983), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.123)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.98)}]",0.0008373198928628295,99.98632635644256 +aten::arange,other,nn.Module: CLIPTextTransformer,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1,4,1.4608154296875,1.4608154296875,1.36083984375,1.36083984375,0.25613361444813626,0.25613361444813626,1.28076171875,1.28076171875,1.8408203125,1.8408203125,5.84326171875,5.84326171875,1396,"['aten::arange', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(5.843999999999999), 'mean_duration_us': np.float64(1.4609999999999999), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(0.22181073012818836), 'min_duration_us': np.float64(1.281), 'max_duration_us': np.float64(1.841)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.81)}]",0.0008151841648062986,99.98796165905212 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((77, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1,2,2.903564453125,2.903564453125,2.903564453125,2.903564453125,0.14052366208150627,0.14052366208150627,2.80419921875,2.80419921875,3.0029296875,3.0029296875,5.80712890625,5.80712890625,1495,"['aten::gather', 'nn.Module: Embedding_3', 'nn.Module: CLIPTextEmbeddings_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.807), 'mean_duration_us': np.float64(2.9035), 'median_duration_us': np.float64(2.9035), 'std_dev_duration_us': np.float64(0.09950000000000013), 'min_duration_us': np.float64(2.804), 'max_duration_us': np.float64(3.003)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.9)}]",0.0008150471014746793,99.98877670615359 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",1,2,2.843017578125,2.843017578125,2.843017578125,2.843017578125,0.05627851822920276,0.05627851822920276,2.80322265625,2.80322265625,2.8828125,2.8828125,5.68603515625,5.68603515625,5072,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.686), 'mean_duration_us': np.float64(2.843), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(2.883)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]",0.0007980512483538754,99.98957475740194 +aten::gather,other,nn.Module: Embedding,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",1,2,2.703125,2.703125,2.703125,2.703125,0.028311892606102,0.028311892606102,2.68310546875,2.68310546875,2.72314453125,2.72314453125,5.40625,5.40625,50,"['aten::gather', 'nn.Module: Embedding_1', 'nn.Module: CLIPTextEmbeddings_0', 'nn.Module: CLIPTextTransformer_0', 'nn.Module: CLIPTextModelWithProjection_0']","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.406), 'mean_duration_us': np.float64(2.703), 'median_duration_us': np.float64(2.703), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(2.683), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.7)}]",0.0007587826038449213,99.99033354000578 +aten::add,elementwise,nn.Module: CLIPTextEmbeddings,python3,CPU,thread 416 (python3),"((1, 77, 1280), (1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 1280, 1), (98560, 1280, 1), ())","('', '', '1')",1,2,2.68310546875,2.68310546875,2.68310546875,2.68310546875,0.056623785212204,0.056623785212204,2.64306640625,2.64306640625,2.72314453125,2.72314453125,5.3662109375,5.3662109375,1499,"['aten::add', 'nn.Module: CLIPTextEmbeddings_1', 'nn.Module: CLIPTextTransformer_1', 'nn.Module: CLIPTextModelWithProjection_1']","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.366), 'mean_duration_us': np.float64(2.683), 'median_duration_us': np.float64(2.683), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.68)}]",0.0007531630072485264,99.99108670301302 +aten::normal_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), (), ())","('c10::BFloat16', 'Scalar', 'Scalar', '')","((262144, 16384, 128, 1), (), (), ())","('', '0.', '1.', '')",1,1,5.2470703125,5.2470703125,5.2470703125,5.2470703125,,,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,5.2470703125,18366,['aten::normal_'],"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",0.0007364412807909613,99.99182314429382 +aten::copy_,elementwise,nn.Module: SD3Transformer2DModel,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,3,1.7083333333333333,1.7083333333333333,1.68212890625,1.68212890625,0.24154693224356558,0.24154693224356558,1.48095703125,1.48095703125,1.9619140625,1.9619140625,5.125,5.125,20500,"['aten::copy_', 'nn.Module: SD3Transformer2DModel_0']","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.125), 'mean_duration_us': np.float64(1.7083333333333333), 'median_duration_us': np.float64(1.682), 'std_dev_duration_us': np.float64(0.19724829248662426), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.962)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.71)}]",0.0007193083643385382,99.99254245265816 +aten::div,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'double')","((256, 1), ())","('', '')",1,2,2.54296875,2.54296875,2.54296875,2.54296875,0.14155946303051,0.14155946303051,2.44287109375,2.44287109375,2.64306640625,2.64306640625,5.0859375,5.0859375,5185,"['aten::div', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.086), 'mean_duration_us': np.float64(2.543), 'median_duration_us': np.float64(2.543), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.643)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.54)}]",0.0007138258310737626,99.99325627848923 +aten::mul,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",1,2,2.52294921875,2.52294921875,2.52294921875,2.52294921875,0.113247570424408,0.113247570424408,2.44287109375,2.44287109375,2.60302734375,2.60302734375,5.0458984375,5.0458984375,5186,"['aten::mul', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.046), 'mean_duration_us': np.float64(2.523), 'median_duration_us': np.float64(2.523), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.603)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.52)}]",0.0007082062344773678,99.9939644847237 +aten::div,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",1,2,2.40185546875,2.40185546875,2.40185546875,2.40185546875,0.056623785212204,0.056623785212204,2.36181640625,2.36181640625,2.44189453125,2.44189453125,4.8037109375,4.8037109375,5183,"['aten::div', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.804), 'mean_duration_us': np.float64(2.402), 'median_duration_us': np.float64(2.402), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.442)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.4)}]",0.0006742145282357601,99.99463869925194 +aten::add,elementwise,nn.Module: T5Attention,python3,CPU,thread 416 (python3),"((256, 1), (), ())","('long int', 'long int', 'Scalar')","((1, 1), (), ())","('', '', '1')",1,2,2.282470703125,2.282470703125,2.282470703125,2.282470703125,0.17021662261961323,0.17021662261961323,2.162109375,2.162109375,2.40283203125,2.40283203125,4.56494140625,4.56494140625,5159,"['aten::add', 'nn.Module: T5Attention_0', 'nn.Module: T5LayerSelfAttention_0', 'nn.Module: T5Block_0', 'nn.Module: T5Stack_0', 'nn.Module: T5EncoderModel_0']","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.5649999999999995), 'mean_duration_us': np.float64(2.2824999999999998), 'median_duration_us': np.float64(2.2824999999999998), 'std_dev_duration_us': np.float64(0.12050000000000005), 'min_duration_us': np.float64(2.162), 'max_duration_us': np.float64(2.403)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.28)}]",0.0006407025436548202,99.99527940179559 +aten::fill_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 77, 4096), ())","('c10::BFloat16', 'Scalar')","((315392, 4096, 1), ())","('', '0.')",1,2,2.221923828125,2.221923828125,2.221923828125,2.221923828125,0.19783798125971275,0.19783798125971275,2.08203125,2.08203125,2.36181640625,2.36181640625,4.44384765625,4.44384765625,9175,['aten::fill_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.444), 'mean_duration_us': np.float64(2.222), 'median_duration_us': np.float64(2.222), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.22)}]",0.0006237066905340163,99.99590310848612 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((1, 2048), (1, 2048)), ())","('TensorList', 'Scalar')","(((2048, 1), (2048, 1)), ())","('', '0')",1,1,4.125,4.125,4.125,4.125,,,4.125,4.125,4.125,4.125,4.125,4.125,18363,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.125), 'mean_duration_us': np.float64(4.125), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.125)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.12)}]",0.0005789555127602867,99.99648206399888 +aten::eq,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",1,1,3.52392578125,3.52392578125,3.52392578125,3.52392578125,,,3.52392578125,3.52392578125,3.52392578125,3.52392578125,3.52392578125,3.52392578125,20462,['aten::eq'],"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",0.0004945930321485546,99.99697665703103 +aten::cat,other,NA,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",1,1,3.04296875,3.04296875,3.04296875,3.04296875,,,3.04296875,3.04296875,3.04296875,3.04296875,3.04296875,3.04296875,18386,['aten::cat'],"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.043), 'mean_duration_us': np.float64(3.043), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.043)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",0.000427089341326007,99.99740374637236 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",1,2,1.5009765625,1.5009765625,1.5009765625,1.5009765625,0.028311892606102,0.028311892606102,1.48095703125,1.48095703125,1.52099609375,1.52099609375,3.001953125,3.001953125,1445,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.002), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.501), 'std_dev_duration_us': np.float64(0.019999999999999907), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.521)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.5)}]",0.0004213326813979928,99.99782507905375 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 1, 1, 1280), (1, 1, 1, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1280, 1280, 1280, 1), (1280, 1280, 1280, 1), ())","('', '', 'False')",1,2,1.44140625,1.44140625,1.44140625,1.44140625,0.1139381043904105,0.1139381043904105,1.36083984375,1.36083984375,1.52197265625,1.52197265625,2.8828125,2.8828125,5046,['aten::copy_'],"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(2.883), 'mean_duration_us': np.float64(1.4415), 'median_duration_us': np.float64(1.4415), 'std_dev_duration_us': np.float64(0.08050000000000002), 'min_duration_us': np.float64(1.361), 'max_duration_us': np.float64(1.522)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.44)}]",0.0004046109549404277,99.9982296900087 +aten::add,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), ())","('c10::BFloat16', 'double', 'Scalar')","((262144, 16384, 128, 1), (), ())","('', '', '1')",1,1,2.84423828125,2.84423828125,2.84423828125,2.84423828125,,,2.84423828125,2.84423828125,2.84423828125,2.84423828125,2.84423828125,2.84423828125,26745,['aten::add'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.844), 'mean_duration_us': np.float64(2.844), 'median_duration_us': np.float64(2.844), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.844), 'max_duration_us': np.float64(2.844)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]",0.00039919695334146197,99.99862888696204 +aten::div,elementwise,NA,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",1,1,2.72314453125,2.72314453125,2.72314453125,2.72314453125,,,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,2.72314453125,26744,['aten::div'],"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",0.00038220110022065803,99.99901108806226 +aten::copy_,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",1,1,2.64208984375,2.64208984375,2.64208984375,2.64208984375,,,2.64208984375,2.64208984375,2.64208984375,2.64208984375,2.64208984375,2.64208984375,18380,['aten::copy_'],"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]",0.000370824843696249,99.99938191290596 +aten::fill_,elementwise,NA,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",1,1,2.44287109375,2.44287109375,2.44287109375,2.44287109375,,,2.44287109375,2.44287109375,2.44287109375,2.44287109375,2.44287109375,2.44287109375,18385,['aten::fill_'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.443), 'mean_duration_us': np.float64(2.443), 'median_duration_us': np.float64(2.443), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]",0.00034286392404589427,99.99972477683 +aten::mul,elementwise,NA,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",1,1,1.9609375,1.9609375,1.9609375,1.9609375,,,1.9609375,1.9609375,1.9609375,1.9609375,1.9609375,1.9609375,18381,['aten::mul'],"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.961), 'mean_duration_us': np.float64(1.961), 'median_duration_us': np.float64(1.961), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(1.961)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.96)}]",0.00027522316989172726,99.9999999999999 diff --git a/tests/traces/inference/xdit_sd_3.5/perf_csvs/unified_perf_summary.csv b/tests/traces/inference/xdit_sd_3.5/perf_csvs/unified_perf_summary.csv index b84b77523..34552f899 100644 --- a/tests/traces/inference/xdit_sd_3.5/perf_csvs/unified_perf_summary.csv +++ b/tests/traces/inference/xdit_sd_3.5/perf_csvs/unified_perf_summary.csv @@ -1,199 +1,199 @@ name,op category,process_name,process_label,thread_name,Input Dims,Input type,Input Strides,Concrete Inputs,ex_UID,operation_count,total_duration_us,mean_duration_us,std_duration_us,GFLOPS,Data Moved (MB),FLOPS/Byte,Compute Spec,TB/s_mean,TB/s_std,TFLOPS/s_mean,TFLOPS/s_std,Kernel Time (µs)_mean,Kernel Time (µs)_std,Kernel Time (µs)_sum,duration_us_median,duration_us_min,duration_us_max,TB/s_median,TB/s_min,TB/s_max,TFLOPS/s_median,TFLOPS/s_min,TFLOPS/s_max,Kernel Time (µs)_median,Kernel Time (µs)_min,Kernel Time (µs)_max,kernel_details_summary,trunc_kernel_details,perf_params,has_perf_model,entry_point,call_stack_full,Percentage (%),Cumulative Percentage (%) -aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 38, 4429, 64), (2, 38, 4429, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((10771328, 283456, 64, 1), (10771328, 283456, 64, 1), (10771328, 283456, 64, 1), (), (), (), ())","('', '', '', '0.', 'False', 'False', '0.125')",18434,152,9721.546,63.957539473684214,11.041440813746393,381.649693696,164.357421875,2214.5,matrix_bf16,0.12832931058926547,0.00593861311360147,284.1852582999284,13.151058740070466,1345.823630885074,62.46694869506643,204565.19189453125,63.179,54.351,165.907,0.12675511756012922,0.10819976288163302,0.1448774257876203,280.6992078369061,239.60837490137632,320.8310594066852,1359.639404296875,1189.56591796875,1592.80615234375,"[{'name': 'attn_fwd', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(204565.196), 'mean_duration_us': np.float64(1345.823657894737), 'median_duration_us': np.float64(1359.6395), 'std_dev_duration_us': np.float64(62.26112668073086), 'min_duration_us': np.float64(1189.566), 'max_duration_us': np.float64(1592.806)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1345.82)}]","{'B': 2, 'N_Q': 4429, 'H_Q': 38, 'N_KV': 4429, 'H_KV': 38, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': False, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_ops.py(840): __call__', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', 'attn_fwd']",28.711383848855277,28.711383848855277 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 9728), (8192, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",18467,152,3549.873,23.354427631578947,3.628111176626195,387.620798464,235.125,1572.20202020202,matrix_bf16,0.37573691256232084,0.009589873844826936,590.7343329949505,15.077219032319348,656.5875982987253,16.573010375012593,99801.31494140625,22.829,19.61,52.628,0.3741112423692925,0.3492120450154367,0.4026766253027489,588.1784510332892,549.0318826521484,633.0890037891137,659.01904296875,612.26904296875,706.0078125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99801.31399999998), 'mean_duration_us': np.float64(656.5875921052631), 'median_duration_us': np.float64(659.019), 'std_dev_duration_us': np.float64(16.518400036958493), 'min_duration_us': np.float64(612.269), 'max_duration_us': np.float64(706.008)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(656.59)}]","{'M': 8192, 'N': 9728, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",14.007436139871524,42.7188199887268 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 9728), (9728, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",18469,152,4341.809,28.564532894736843,6.448483371071854,387.620798464,235.125,1572.20202020202,matrix_bf16,0.37809134204199957,0.01519286001944795,594.4359717793246,23.88624521522257,653.1063232421875,25.6982753947453,99272.1611328125,27.726,24.257,100.439,0.37593960099575574,0.3535040054888546,0.41671825591515876,591.0530001594684,555.7797115790833,655.165283804875,655.81396484375,591.63818359375,697.43603515625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99272.159), 'mean_duration_us': np.float64(653.1063092105263), 'median_duration_us': np.float64(655.814), 'std_dev_duration_us': np.float64(25.61359189916083), 'min_duration_us': np.float64(591.638), 'max_duration_us': np.float64(697.436)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(653.11)}]","{'M': 8192, 'N': 2432, 'K': 9728, 'bias': False, 'stride_A': (9728, 1), 'stride_B': (1, 9728), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",13.933167697753316,56.65198768648011 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",18423,456,14436.133,31.658186403508772,9.781613829988565,96.905199616,87.28125,1058.8299319727892,matrix_bf16,0.5122289411392601,0.028356864043551637,542.3633349009765,30.025096426195386,179.2197265625,9.938501313517527,81724.1953125,28.4725,22.824,136.002,0.5053397387283673,0.4214410343655284,0.5778059722742,535.0688411809042,446.23438174779426,611.7982583165624,181.10791015625,158.39404296875,217.162109375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 456, 'total_duration_us': np.float64(81724.19200000001), 'mean_duration_us': np.float64(179.21971929824565), 'median_duration_us': np.float64(181.108), 'std_dev_duration_us': np.float64(9.927591429559296), 'min_duration_us': np.float64(158.394), 'max_duration_us': np.float64(217.162)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(179.22)}]","{'M': 8192, 'N': 2432, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",11.47025415040189,68.122241836882 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((2432,), (8192, 2432), (2432, 2432), (), (), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",18431,152,4716.264,31.028052631578948,7.76335211171415,96.92512256,87.285888671875,1058.9913376202371,matrix_bf16,0.509699810811785,0.03225672185541874,539.7676844363539,34.15958902491378,180.276611328125,11.302861072544887,27402.044921875,29.764,25.898,95.823,0.49847493957332634,0.42617994075839083,0.5765232941408053,527.8806430289237,451.3208655306417,610.5331744313968,183.61181640625,158.7548828125,214.7587890625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(27402.047000000002), 'mean_duration_us': np.float64(180.27662500000002), 'median_duration_us': np.float64(183.61200000000002), 'std_dev_duration_us': np.float64(11.265613010286344), 'min_duration_us': np.float64(158.755), 'max_duration_us': np.float64(214.759)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(180.28)}]","{'M': 8192, 'N': 2432, 'K': 2432, 'bias': True, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",3.8459653018640525,71.96820713874605 -triton_poi_fused_addmm_gelu_view_15,triton,python3,CPU,thread 416 (python3),"((2, 4096, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((39845888, 9728, 1), (1,), ())","('', '', '79691776')",18468,152,3065.261,20.166190789473685,1.9089934164424363,0.637534208,304.0185546875,1.9998779371376258,vector_bfloat16,2.3194788692892745,0.2120218580425448,4.638674616348549,0.4240178360902115,138.65906404194078,13.52017813104994,21076.177734375,19.884500000000003,17.596,31.967,2.3926313866320115,1.7959509770415318,2.864591925304503,4.784970721828365,3.591682735166123,5.728834190319071,133.23681640625,111.28515625,177.5029296875,"[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(21076.175), 'mean_duration_us': np.float64(138.65904605263157), 'median_duration_us': np.float64(133.237), 'std_dev_duration_us': np.float64(13.47563314660304), 'min_duration_us': np.float64(111.285), 'max_duration_us': np.float64(177.503)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'mean_duration_us': np.float64(138.66)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 79691776, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_15']",2.9581094583790466,74.9263165971251 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",18425,452,13391.991,29.628298672566373,7.565547330170742,7.878279168,17.4599609375,430.31668437832093,matrix_bf16,0.7134676613950346,0.03877063111647788,307.01703846266577,16.68364943329775,25.756830536158738,1.9186128143844703,11642.08740234375,28.4125,23.475,114.861,0.7108053195829385,0.3191578264400201,0.813216661418006,305.8713883614028,137.33893766706103,349.94069742260393,25.7568359375,22.51318359375,57.36376953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 452, 'total_duration_us': np.float64(11642.083999999999), 'mean_duration_us': np.float64(25.756823008849555), 'median_duration_us': np.float64(25.757), 'std_dev_duration_us': np.float64(1.9165006446350394), 'min_duration_us': np.float64(22.513), 'max_duration_us': np.float64(57.364)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.76)}]","{'M': 666, 'N': 2432, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",1.6340044809918113,76.5603210781169 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 9728), (9728, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",18474,148,4140.771,27.97818243243243,7.661350314400288,31.513116672,60.57177734375,496.159289324552,matrix_bf16,0.8281003899847463,0.02968211018330037,410.8697009842161,14.727054694199342,76.79936919341216,2.8383699970808127,11366.306640625,27.0,23.635,113.528,0.828810922214293,0.7021770889618242,0.8932442085110182,411.22223815027013,348.3916854392814,443.1914116880987,76.6328125,71.10498046875,90.453125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(11366.307999999999), 'mean_duration_us': np.float64(76.79937837837838), 'median_duration_us': np.float64(76.633), 'std_dev_duration_us': np.float64(2.8287709713197278), 'min_duration_us': np.float64(71.105), 'max_duration_us': np.float64(90.453)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(76.8)}]","{'M': 666, 'N': 2432, 'K': 9728, 'bias': False, 'stride_A': (9728, 1), 'stride_B': (1, 9728), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2']",1.5952977624415747,78.15561884055847 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 9728), (666, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",18472,148,3407.557,23.024033783783782,5.634611697823147,31.513116672,60.57177734375,496.159289324552,matrix_bf16,0.9255567601214649,0.07043225400423828,459.2235843314009,34.945617092269174,69.05995301942568,5.874709039595645,10220.873046875,22.083,19.188,84.736,0.9127883329174789,0.6339493694763262,1.0342607131861843,452.8884105640788,314.53986862712185,513.1580604307615,69.58251953125,61.41015625,100.18798828125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10220.875), 'mean_duration_us': np.float64(69.05996621621621), 'median_duration_us': np.float64(69.5825), 'std_dev_duration_us': np.float64(5.8548305020997935), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(100.188)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(69.06)}]","{'M': 666, 'N': 9728, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1']",1.4345324666502668,79.59015130720874 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '8192', '2432')",18515,148,3319.121,22.426493243243243,2.1597031778187863,0.039845888,114.088134765625,0.33307582842041067,vector_bfloat16,1.771300603735816,0.11124950471299291,0.5899774159708805,0.037054520943640486,67.80168852934966,4.233686810115376,10034.64990234375,21.9725,19.639,37.966,1.748992546601461,1.55458378071066,1.9869140999772925,0.5825471413604054,0.5177942806091371,0.6617930598501315,68.401123046875,60.208984375,76.953125,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10034.648000000001), 'mean_duration_us': np.float64(67.80167567567568), 'median_duration_us': np.float64(68.40100000000001), 'std_dev_duration_us': np.float64(4.219346669062954), 'min_duration_us': np.float64(60.209), 'max_duration_us': np.float64(76.953)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(67.8)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19']",1.4083954482520722,80.99854675546081 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",18470,148,3449.976,23.310648648648648,1.8970177126856393,0.039845888,114.171630859375,0.3328322431235526,vector_bfloat16,1.8399238265538633,0.0905979508886018,0.6123859743683927,0.030153919216650865,65.224853515625,3.2404804511629712,9653.2783203125,23.205,20.411,35.923,1.8228244178874216,1.6339891792523877,1.9963661336329734,0.6066947398258546,0.5438442837701849,0.6644550183529565,65.677001953125,59.9677734375,73.26708984375,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(9653.279999999999), 'mean_duration_us': np.float64(65.22486486486486), 'median_duration_us': np.float64(65.67699999999999), 'std_dev_duration_us': np.float64(3.2295163131456124), 'min_duration_us': np.float64(59.968), 'max_duration_us': np.float64(73.267)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(65.22)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16']",1.3548687178277201,82.35341547328852 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (128, 128, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 1048576, 1024, 1), (1152, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27253,5,396.80899999999997,79.36179999999999,8.414502136193201,309.237645312,512.28125,575.6837674617215,matrix_bf16,0.3194370659361453,0.009239061430023855,183.89473358503847,5.318777691846403,1682.72666015625,48.64372494307394,8413.63330078125,75.392,73.97,94.1,0.3194500251328482,0.3077630405225379,0.33154247111574014,183.90219398421968,177.17418665348907,190.86361884547827,1681.533203125,1620.2021484375,1745.3876953125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.674), 'mean_duration_us': np.float64(5.1348), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.18339945474291905), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(334.733), 'mean_duration_us': np.float64(66.9466), 'median_duration_us': np.float64(66.017), 'std_dev_duration_us': np.float64(4.425827588146652), 'min_duration_us': np.float64(62.292), 'max_duration_us': np.float64(74.269)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1046.3899999999999), 'mean_duration_us': np.float64(209.27799999999996), 'median_duration_us': np.float64(207.267), 'std_dev_duration_us': np.float64(6.751884536927449), 'min_duration_us': np.float64(198.894), 'max_duration_us': np.float64(218.083)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1126.509), 'mean_duration_us': np.float64(225.30180000000001), 'median_duration_us': np.float64(225.974), 'std_dev_duration_us': np.float64(2.497012647144582), 'min_duration_us': np.float64(221.168), 'max_duration_us': np.float64(228.138)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1583.9470000000001), 'mean_duration_us': np.float64(316.7894), 'median_duration_us': np.float64(316.67), 'std_dev_duration_us': np.float64(2.3336759500838977), 'min_duration_us': np.float64(313.985), 'max_duration_us': np.float64(320.755)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(4296.379999999999), 'mean_duration_us': np.float64(859.2759999999998), 'median_duration_us': np.float64(860.558), 'std_dev_duration_us': np.float64(38.63950000194101), 'min_duration_us': np.float64(799.788), 'max_duration_us': np.float64(914.678)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(66.95)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(225.3)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(316.79)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(859.28)}]","{'convNd': 'conv2d', 'input_shape': (1, 128, 1024, 1024), 'filter_shape': (128, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 1048576, 1024, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64']]",1.1808805448523603,83.53429601814088 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 14592), (2, 14592))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (14592, 1))","('', '', '')",18413,300,8768.494,29.228313333333336,6.617911988847339,0.141950976,67.75244140625,1.9980829795974258,matrix_bf16,2.5946450811213326,0.2646247974416752,5.184316174684716,0.5287423037476275,27.6878955078125,3.025975736385473,8306.36865234375,28.127000000000002,24.126,99.388,2.741197106748559,2.0864608373533713,3.0264640672282894,5.477139282716004,4.168921886712364,6.047126341092044,25.9169921875,23.47412109375,34.0498046875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 300, 'total_duration_us': np.float64(8306.373), 'mean_duration_us': np.float64(27.68791), 'median_duration_us': np.float64(25.917), 'std_dev_duration_us': np.float64(3.0209218607184574), 'min_duration_us': np.float64(23.474), 'max_duration_us': np.float64(34.05)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.69)}]","{'M': 2, 'N': 14592, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2']",1.1658256058073568,84.70012162394823 -triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8,triton,python3,CPU,thread 416 (python3),"((8192, 2432), (2432,), (64,), (2, 38, 4096, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '311296', '64')",18424,304,6149.486,20.22857236842105,2.407726575438387,0.139460608,76.0047607421875,1.74989038451346,vector_bfloat16,3.5804589032745655,0.3626115685727799,6.26541060698577,0.6345304971588508,22.525390625,2.778457297323058,6847.71875,20.07,16.114,47.731,3.7083455831006753,1.5530908896310884,4.188431339372322,6.489198278320831,2.717738814040897,7.329295726962458,21.4912109375,19.02783203125,51.31494140625,"[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(6847.722), 'mean_duration_us': np.float64(22.525401315789473), 'median_duration_us': np.float64(21.491), 'std_dev_duration_us': np.float64(2.7738832289577378), 'min_duration_us': np.float64(19.028), 'max_duration_us': np.float64(51.315)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(22.53)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.transpose, aten.view', 'xnumel': 311296, 'rnumel': 64}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8']",0.9610993918340681,85.6612210157823 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",5111,192,6207.894,32.332781250000004,8.839132001998642,8.589934592,36.0,227.55555555555554,matrix_bf16,1.1719624301788094,0.02364293246762278,266.68656188957794,5.3800806326323425,32.22358194986979,0.6864988052764409,6186.927734375,29.839,22.683,72.348,1.1728122788188526,0.9909049248003691,1.2366933490314014,266.8799496690011,225.48592066568398,281.41644209070114,32.1865234375,30.52392578125,38.09521484375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 192, 'total_duration_us': np.float64(6186.93), 'mean_duration_us': np.float64(32.22359375), 'median_duration_us': np.float64(32.1865), 'std_dev_duration_us': np.float64(0.6847003158031528), 'min_duration_us': np.float64(30.524), 'max_duration_us': np.float64(38.095)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(32.22)}]","{'M': 256, 'N': 4096, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.8683552435370014,86.5295762593193 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 10240))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",5286,96,3498.243,36.44003125,9.181457586901209,21.47483648,87.0,235.4022988505747,matrix_bf16,1.4373282893677226,0.022610314012308376,338.350383520126,5.322519896230754,63.48492431640625,1.0088001313002912,6094.552734375,34.341,28.212,83.203,1.4413309061284947,1.3702315905830582,1.4855215744545514,339.2926087070296,322.5556663809315,349.6951936187266,63.29296875,61.41015625,66.5771484375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(6094.553999999999), 'mean_duration_us': np.float64(63.484937499999994), 'median_duration_us': np.float64(63.293), 'std_dev_duration_us': np.float64(1.0035055203769856), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(66.577)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(63.48)}]","{'M': 256, 'N': 10240, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.8553901146288272,87.38496637394813 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((33554432, 65536, 256, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27024,7,520.623,74.37471428571429,3.874985579082229,309.237645312,132.5,2225.7509433962264,matrix_bf16,0.17054299033315715,0.004793147775292346,379.586221623638,10.668353182694432,815.2283063616071,23.16508387604623,5706.59814453125,72.608,71.035,81.07,0.17053991420908315,0.1636285750695248,0.17623344351320352,379.57937493757834,364.19645532757505,392.2517531574783,814.68505859375,788.365234375,849.095703125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(62.446000000000005), 'mean_duration_us': np.float64(8.920857142857143), 'median_duration_us': np.float64(8.531), 'std_dev_duration_us': np.float64(0.6591703505319455), 'min_duration_us': np.float64(8.171), 'max_duration_us': np.float64(10.094)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(283.775), 'mean_duration_us': np.float64(40.53928571428571), 'median_duration_us': np.float64(40.379), 'std_dev_duration_us': np.float64(0.3694632068616445), 'min_duration_us': np.float64(40.099), 'max_duration_us': np.float64(41.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(370.262), 'mean_duration_us': np.float64(52.89457142857143), 'median_duration_us': np.float64(53.358), 'std_dev_duration_us': np.float64(1.4606747811633258), 'min_duration_us': np.float64(50.995), 'max_duration_us': np.float64(55.041)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(451.86600000000004), 'mean_duration_us': np.float64(64.55228571428572), 'median_duration_us': np.float64(63.173), 'std_dev_duration_us': np.float64(3.9155450893762884), 'min_duration_us': np.float64(59.408), 'max_duration_us': np.float64(70.624)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(488.43899999999996), 'mean_duration_us': np.float64(69.777), 'median_duration_us': np.float64(69.943), 'std_dev_duration_us': np.float64(0.7438663474422981), 'min_duration_us': np.float64(68.1), 'max_duration_us': np.float64(70.504)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(4049.81), 'mean_duration_us': np.float64(578.5442857142857), 'median_duration_us': np.float64(573.09), 'std_dev_duration_us': np.float64(19.20403529554798), 'min_duration_us': np.float64(556.546), 'max_duration_us': np.float64(608.904)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(8.92)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(40.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(52.89)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.55)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(69.78)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(578.54)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 256, 256), 'filter_shape': (512, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (33554432, 65536, 256, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_']]",0.8009394378456922,88.18590581179383 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((67108864, 262144, 512, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27148,5,397.34,79.46799999999999,3.7312853683415876,309.237645312,257.125,1146.9596499756929,matrix_bf16,0.2380694526897961,0.0033349777892934247,273.05605612699327,3.8250849578846604,1132.68525390625,15.988691411278218,5663.42626953125,78.466,75.362,84.736,0.23843794552523803,0.23293412165672644,0.2417787864780853,273.47870254055033,267.16603864279443,277.31051231045245,1130.755859375,1115.13134765625,1157.4736328125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(26.154), 'mean_duration_us': np.float64(5.2308), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.10632854743670675), 'min_duration_us': np.float64(5.126), 'max_duration_us': np.float64(5.407)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(176.538), 'mean_duration_us': np.float64(35.3076), 'median_duration_us': np.float64(35.011), 'std_dev_duration_us': np.float64(1.1099622696290183), 'min_duration_us': np.float64(34.33), 'max_duration_us': np.float64(37.335)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(531.463), 'mean_duration_us': np.float64(106.2926), 'median_duration_us': np.float64(107.198), 'std_dev_duration_us': np.float64(2.44941957206192), 'min_duration_us': np.float64(102.231), 'max_duration_us': np.float64(109.481)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(595.039), 'mean_duration_us': np.float64(119.0078), 'median_duration_us': np.float64(115.931), 'std_dev_duration_us': np.float64(6.309738834531901), 'min_duration_us': np.float64(112.887), 'max_duration_us': np.float64(127.749)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(710.931), 'mean_duration_us': np.float64(142.1862), 'median_duration_us': np.float64(136.041), 'std_dev_duration_us': np.float64(10.643601409297508), 'min_duration_us': np.float64(130.112), 'max_duration_us': np.float64(155.47)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(3623.301), 'mean_duration_us': np.float64(724.6602), 'median_duration_us': np.float64(719.949), 'std_dev_duration_us': np.float64(21.340082974534106), 'min_duration_us': np.float64(696.755), 'max_duration_us': np.float64(762.052)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(35.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.29)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(119.01)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(142.19)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(724.66)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 512, 512), 'filter_shape': (256, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (67108864, 262144, 512, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64']]",0.7948801260775452,88.98078593787137 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '666', '2432')",18518,144,2987.602,20.74723611111111,1.512158513660232,0.003239424,9.356201171875,0.330193356470005,vector_bfloat16,0.3287943986642104,0.043410560115431006,0.10856572608347254,0.014333878550757082,30.41143798828125,4.391962936042957,4379.2470703125,20.5205,17.967,27.631,0.34714615724253417,0.24272498760540237,0.3850941834978438,0.11462535484557647,0.08014617835656816,0.12715554100622903,28.260986328125,25.47607421875,40.4189453125,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(4379.2480000000005), 'mean_duration_us': np.float64(30.41144444444445), 'median_duration_us': np.float64(28.261), 'std_dev_duration_us': np.float64(4.3766938876054), 'min_duration_us': np.float64(25.476), 'max_duration_us': np.float64(40.419)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(30.41)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20']",0.6146414374814194,89.5954273753528 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27226,1,78.577,78.577,,1236.950581248,1025.125,1150.735763931228,matrix_bf16,0.2514515172495481,,289.3542537938251,,4274.86572265625,,4274.86572265625,78.577,78.577,78.577,0.2514515172495481,0.2514515172495481,0.2514515172495481,289.3542537938251,289.3542537938251,289.3542537938251,4274.86572265625,4274.86572265625,4274.86572265625,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.031), 'mean_duration_us': np.float64(129.031), 'median_duration_us': np.float64(129.031), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.031), 'max_duration_us': np.float64(129.031)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(392.862), 'mean_duration_us': np.float64(392.862), 'median_duration_us': np.float64(392.862), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(392.862), 'max_duration_us': np.float64(392.862)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(453.353), 'mean_duration_us': np.float64(453.353), 'median_duration_us': np.float64(453.353), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(453.353), 'max_duration_us': np.float64(453.353)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(664.706), 'mean_duration_us': np.float64(664.706), 'median_duration_us': np.float64(664.706), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(664.706), 'max_duration_us': np.float64(664.706)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2629.787), 'mean_duration_us': np.float64(2629.787), 'median_duration_us': np.float64(2629.787), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2629.787), 'max_duration_us': np.float64(2629.787)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(129.03)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(392.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(453.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(664.71)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(2629.79)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 1024, 1024), 'filter_shape': (256, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (268435456, 1048576, 1024, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64']]",0.5999911789918688,90.19541855434467 -triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10,triton,python3,CPU,thread 416 (python3),"((8192, 2432), (666, 2432), (2, 38, 4429, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (2432, 1), (10771328, 283456, 64, 1), ())","('', '', '', '21542656')",18433,152,3118.999,20.519730263157893,2.510095721164674,0.0,123.26806640625,0.0,vector_bfloat16,5.008577530463113,0.5273303511437225,0.0,0.0,26.167618600945723,3.622186564873429,3977.47802734375,20.175,17.546,37.035,5.307166481445097,2.3080612154989013,5.5539130337578415,0.0,0.0,0.0,24.35498046875,23.27294921875,56.001953125,"[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3977.477), 'mean_duration_us': np.float64(26.167611842105263), 'median_duration_us': np.float64(24.355), 'std_dev_duration_us': np.float64(3.610260218149725), 'min_duration_us': np.float64(23.273), 'max_duration_us': np.float64(56.002)}]","[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpo...', 'stream': 0, 'mean_duration_us': np.float64(26.17)}]","{'fused_ops': 'aten._scaled_dot_product_flash_attention, aten.cat, aten.transpose, aten.view', 'xnumel': 21542656, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10']",0.5582518576881458,90.75367041203282 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((2432,), (666, 2432), (2432, 2432), (), (), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",18432,152,3476.724,22.87318421052632,6.942242827485621,7.87989888,17.464599609375,430.29083665338646,matrix_bf16,0.7219844426313035,0.05145801866718306,310.66328987055243,22.141913904827778,25.499563116776315,1.9140762579445143,3875.93359375,21.692,19.229,77.044,0.7165499719149424,0.5786817373593989,0.8091331998619261,308.3248869192411,249.001448924411,348.16260153261993,25.55712890625,22.6328125,31.64599609375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3875.933), 'mean_duration_us': np.float64(25.499559210526314), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(1.9077830366462447), 'min_duration_us': np.float64(22.633), 'max_duration_us': np.float64(31.646)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.5)}]","{'M': 666, 'N': 2432, 'K': 2432, 'bias': True, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.5439997692286003,91.29767018126142 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27121,1,84.245,84.245,,1236.950581248,516.5,2283.9264278799615,matrix_bf16,0.15053602225789517,,343.8131995827328,,3597.740234375,,3597.740234375,84.245,84.245,84.245,0.15053602225789517,0.15053602225789517,0.15053602225789517,343.8131995827328,343.8131995827328,343.8131995827328,3597.740234375,3597.740234375,3597.740234375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.934), 'mean_duration_us': np.float64(9.934), 'median_duration_us': np.float64(9.934), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(9.934)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(204.142), 'mean_duration_us': np.float64(204.142), 'median_duration_us': np.float64(204.142), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(204.142), 'max_duration_us': np.float64(204.142)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(216.361), 'mean_duration_us': np.float64(216.361), 'median_duration_us': np.float64(216.361), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(216.361), 'max_duration_us': np.float64(216.361)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(292.594), 'mean_duration_us': np.float64(292.594), 'median_duration_us': np.float64(292.594), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(292.594), 'max_duration_us': np.float64(292.594)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(303.89), 'mean_duration_us': np.float64(303.89), 'median_duration_us': np.float64(303.89), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(303.89), 'max_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2570.819), 'mean_duration_us': np.float64(2570.819), 'median_duration_us': np.float64(2570.819), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2570.819), 'max_duration_us': np.float64(2570.819)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.93)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(204.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.36)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(292.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2570.82)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 512, 512), 'filter_shape': (512, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 262144, 512, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.5049544348232425,91.80262461608467 -triton_poi_fused__unsafe_view_clone_slice_transpose_11,triton,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 4096, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((10771328, 283456, 64, 1), (9961472, 2432, 1), ())","('', '', '19922944')",18460,152,3078.333,20.252190789473683,1.593594623574472,0.0,117.08935546875,0.0,vector_bfloat16,5.283046754825653,0.49220577107192903,0.0,0.0,23.524985865542764,3.330519637347333,3575.7978515625,20.215,17.496,28.822,5.532519444300204,2.1860815863400043,5.99784071330773,0.0,0.0,0.0,22.19189453125,20.47021484375,56.1630859375,"[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3575.8), 'mean_duration_us': np.float64(23.525000000000002), 'median_duration_us': np.float64(22.192), 'std_dev_duration_us': np.float64(3.31954295760251), 'min_duration_us': np.float64(20.47), 'max_duration_us': np.float64(56.163)}]","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'mean_duration_us': np.float64(23.52)}]","{'fused_ops': 'aten._unsafe_view, aten.clone, aten.slice, aten.transpose', 'xnumel': 19922944, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__unsafe_view_clone_slice_transpose', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__unsafe_view_clone_slice_transpose_11']",0.5018747506909927,92.30449936677566 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 10240), (10240, 4096))","('c10::BFloat16', 'c10::BFloat16')","((10240, 1), (1, 10240))","('', '')",5316,48,1486.231,30.963145833333332,8.2187466197442,21.47483648,87.0,235.4022988505747,matrix_bf16,1.35227774767847,0.015204273040601275,318.32929048798934,3.579120826109363,67.46939086914062,0.7553297493567382,3238.53076171875,28.783,25.318,63.665,1.3511071232954182,1.3255413550909207,1.3919971790370889,318.05372281712835,312.03548220990876,327.6793359388458,67.51953125,65.5361328125,68.82177734375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(3238.5289999999995), 'mean_duration_us': np.float64(67.46935416666666), 'median_duration_us': np.float64(67.5195), 'std_dev_duration_us': np.float64(0.7474217208060252), 'min_duration_us': np.float64(65.536), 'max_duration_us': np.float64(68.822)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(67.47)}]","{'M': 256, 'N': 4096, 'K': 10240, 'bias': False, 'stride_A': (10240, 1), 'stride_B': (1, 10240), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.45453822786220777,92.75903759463786 -triton_poi_fused_addmm_gelu_view_17,triton,python3,CPU,thread 416 (python3),"((2, 333, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3239424, 9728, 1), (1,), ())","('', '', '6478848')",18473,148,2947.73,19.917094594594595,1.9654001352577701,0.051830784,24.7333984375,1.9984996249062266,vector_bfloat16,1.1982032825590174,0.08825420622537715,2.394608810755605,0.17637599803781281,21.75943900443412,1.5739936683940021,3220.39697265625,19.85,16.875,37.556,1.18578220681806,0.9794856566654987,1.4323931043930853,2.36978529554637,1.9575017174470282,2.862637081847846,21.87158203125,18.10595703125,26.47802734375,"[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(3220.398), 'mean_duration_us': np.float64(21.75944594594595), 'median_duration_us': np.float64(21.8715), 'std_dev_duration_us': np.float64(1.5686506565240377), 'min_duration_us': np.float64(18.106), 'max_duration_us': np.float64(26.478)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'mean_duration_us': np.float64(21.76)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 6478848, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_17']",0.45199309213512834,93.21103068677299 -aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 1, 16384, 512), (1, 1, 16384, 512), (1, 1, 16384, 512), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((8388608, 512, 512, 1), (8388608, 512, 512, 1), (8388608, 512, 512, 1), (), (), (), ())","('', '', '', '0.', 'False', 'False', '0.044194173824159216')",26834,1,51.657,51.657,,549.755813888,64.0,8192.0,matrix_bf16,0.022661509991569472,,185.64308985093712,,2961.35888671875,,2961.35888671875,51.657,51.657,51.657,0.022661509991569472,0.022661509991569472,0.022661509991569472,185.64308985093712,185.64308985093712,185.64308985093712,2961.35888671875,2961.35888671875,2961.35888671875,"[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2961.359), 'mean_duration_us': np.float64(2961.359), 'median_duration_us': np.float64(2961.359), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2961.359), 'max_duration_us': np.float64(2961.359)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(2961.36)}]","{'B': 1, 'N_Q': 16384, 'H_Q': 1, 'N_KV': 16384, 'H_KV': 1, 'd_h_qk': 512, 'd_h_v': 512, 'dropout': 0.0, 'causal': False, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', 'attn_fwd']",0.4156362620803905,93.62666694885338 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27239,1,77.104,77.104,,618.475290624,768.5625,767.4379116857771,matrix_bf16,0.28336910216342354,,217.46819200057138,,2843.98046875,,2843.98046875,77.104,77.104,77.104,0.28336910216342354,0.28336910216342354,0.28336910216342354,217.46819200057138,217.46819200057138,217.46819200057138,2843.98046875,2843.98046875,2843.98046875,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(75.511), 'mean_duration_us': np.float64(75.511), 'median_duration_us': np.float64(75.511), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(75.511), 'max_duration_us': np.float64(75.511)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.952), 'mean_duration_us': np.float64(210.952), 'median_duration_us': np.float64(210.952), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.952), 'max_duration_us': np.float64(210.952)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.063), 'mean_duration_us': np.float64(231.063), 'median_duration_us': np.float64(231.063), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.063), 'max_duration_us': np.float64(231.063)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(682.333), 'mean_duration_us': np.float64(682.333), 'median_duration_us': np.float64(682.333), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(682.333), 'max_duration_us': np.float64(682.333)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_wr2x2_ta1x8x4x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1638.393), 'mean_duration_us': np.float64(1638.393), 'median_duration_us': np.float64(1638.393), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1638.393), 'max_duration_us': np.float64(1638.393)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(75.51)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(210.95)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.06)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(682.33)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(1638.39)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 1024, 1024), 'filter_shape': (128, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (268435456, 1048576, 1024, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_wr2x2_ta1x8x4x1_1x4x1x64_tb1x8x2x1_1x4x1x64']]",0.3991618228922724,94.02582877174565 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((8388608, 16384, 128, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",26760,10,796.183,79.6183,7.356471875536235,77.309411328,36.5,2019.945205479452,matrix_bf16,0.16116491665298904,0.006611202032220845,325.5443006847007,13.354265847440471,237.859375,10.34699437589636,2378.59375,77.8555,70.685,97.265,0.16382520681525575,0.14840403570035632,0.1652422418578569,330.91794104315545,299.76802038673617,333.7802741834541,233.62109375,231.61767578125,257.8974609375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(76.905), 'mean_duration_us': np.float64(7.6905), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.4889914620931535), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.532)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(118.48700000000001), 'mean_duration_us': np.float64(11.848700000000001), 'median_duration_us': np.float64(11.837), 'std_dev_duration_us': np.float64(0.10417010127671), 'min_duration_us': np.float64(11.696), 'max_duration_us': np.float64(12.057)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.91000000000003), 'mean_duration_us': np.float64(13.491000000000003), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.54173148330146), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(14.621)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(165.03499999999997), 'mean_duration_us': np.float64(16.503499999999995), 'median_duration_us': np.float64(16.503), 'std_dev_duration_us': np.float64(0.3349988805951447), 'min_duration_us': np.float64(15.743), 'max_duration_us': np.float64(16.984)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(202.328), 'mean_duration_us': np.float64(20.2328), 'median_duration_us': np.float64(20.188499999999998), 'std_dev_duration_us': np.float64(1.0540910586851595), 'min_duration_us': np.float64(18.467), 'max_duration_us': np.float64(21.791)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1680.929), 'mean_duration_us': np.float64(168.09290000000001), 'median_duration_us': np.float64(163.482), 'std_dev_duration_us': np.float64(10.59933224736351), 'min_duration_us': np.float64(161.199), 'max_duration_us': np.float64(190.161)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(11.85)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.49)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(16.5)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.23)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(168.09)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 128, 128), 'filter_shape': (512, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (8388608, 16384, 128, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_']]",0.3338432973090952,94.35967206905475 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((1280,), (77, 1280), (1280, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (1280, 1), (1, 1280), (), ())","('', '', '', '1', '1')",1513,256,7815.374,30.5288046875,8.263595687543871,0.25241216,3.50341796875,68.70975609756097,matrix_bf16,0.431207267070061,0.012431324195834014,29.62814614787973,0.8541532534654629,8.526697158813477,0.2567364201120384,2182.83447265625,30.69,21.092,77.385,0.43463505488157134,0.36979763086753503,0.45180956041316356,29.863668612362797,25.40870502236422,31.04372469853471,8.4521484375,8.130859375,9.93408203125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 256, 'total_duration_us': np.float64(2182.826), 'mean_duration_us': np.float64(8.5266640625), 'median_duration_us': np.float64(8.452), 'std_dev_duration_us': np.float64(0.25624840784089964), 'min_duration_us': np.float64(8.131), 'max_duration_us': np.float64(9.934)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.53)}]","{'M': 77, 'N': 1280, 'K': 1280, 'bias': True, 'stride_A': (1280, 1), 'stride_B': (1, 1280), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.30636785194257005,94.66603992099732 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27134,1,95.602,95.602,,618.475290624,386.25,1527.052427184466,matrix_bf16,0.19221094144865633,,293.51618467058194,,2107.125,,2107.125,95.602,95.602,95.602,0.19221094144865633,0.19221094144865633,0.19221094144865633,293.51618467058194,293.51618467058194,293.51618467058194,2107.125,2107.125,2107.125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(41.38), 'mean_duration_us': np.float64(41.38), 'median_duration_us': np.float64(41.38), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(41.38), 'max_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(106.478), 'mean_duration_us': np.float64(106.478), 'median_duration_us': np.float64(106.478), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(106.478), 'max_duration_us': np.float64(106.478)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(118.174), 'mean_duration_us': np.float64(118.174), 'median_duration_us': np.float64(118.174), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(118.174), 'max_duration_us': np.float64(118.174)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(329.409), 'mean_duration_us': np.float64(329.409), 'median_duration_us': np.float64(329.409), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(329.409), 'max_duration_us': np.float64(329.409)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1505.636), 'mean_duration_us': np.float64(1505.636), 'median_duration_us': np.float64(1505.636), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1505.636), 'max_duration_us': np.float64(1505.636)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.48)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(118.17)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(329.41)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(1505.64)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 512, 512), 'filter_shape': (256, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 262144, 512, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64']]",0.2957417834980972,94.96178170449542 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '666', '2432')",18475,144,3273.897,22.73539583333333,2.36958740682506,0.003239424,9.439697265625,0.32727272727272727,vector_bfloat16,0.7175581068318017,0.048741067275081526,0.23483719859949867,0.01595162201729941,13.859249538845486,0.9719595732811294,1995.73193359375,22.378,19.539,41.762,0.7183414438502853,0.5348423703234658,0.9051839928555481,0.23509356344191149,0.1750393211967706,0.2962420340254521,13.779296875,10.93505859375,18.5068359375,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(1995.7350000000001), 'mean_duration_us': np.float64(13.859270833333333), 'median_duration_us': np.float64(13.779499999999999), 'std_dev_duration_us': np.float64(0.9686016281987687), 'min_duration_us': np.float64(10.935), 'max_duration_us': np.float64(18.507)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(13.86)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18']",0.28010740768825854,95.24188911218369 -triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9,triton,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (64,), (2, 38, 333, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '25308', '64')",18426,304,5872.773,19.318332236842107,2.4236315995172375,0.011337984,6.1834716796875,1.7486526502813147,vector_bfloat16,1.253189766906519,0.12791340685967362,2.191393607206508,0.22367611791168043,5.234130859375,0.6274760849170535,1591.17578125,18.948,15.723,40.46,1.23570671133445,0.6062596137515409,1.7043902348864073,2.160821815745394,1.0601374803451582,2.980386501347709,5.2470703125,3.80419921875,10.69482421875,"[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(1591.176), 'mean_duration_us': np.float64(5.234131578947368), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.6264542941723528), 'min_duration_us': np.float64(3.804), 'max_duration_us': np.float64(10.695)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.transpose, aten.view', 'xnumel': 25308, 'rnumel': 64}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9']",0.22332664811335504,95.46521576029704 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27246,6,184.624,30.770666666666667,0.9884777522365727,0.671089408,512.00146484375,1.2499978542389272,vector_bf16,2.3220529179169467,0.09431026455339626,2.902561164825423,0.11788762832445064,231.535400390625,9.740609604863426,1389.21240234375,30.736,29.363,32.147,2.3282250635427584,2.1543145933092727,2.4112959275063877,2.910276333613738,2.692888618992198,3.014114735318048,230.600830078125,222.64892578125,249.2080078125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(361.81), 'mean_duration_us': np.float64(60.30166666666667), 'median_duration_us': np.float64(60.147999999999996), 'std_dev_duration_us': np.float64(1.7322068454880177), 'min_duration_us': np.float64(58.405), 'max_duration_us': np.float64(63.413)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1027.403), 'mean_duration_us': np.float64(171.23383333333334), 'median_duration_us': np.float64(170.95350000000002), 'std_dev_duration_us': np.float64(7.346735406892563), 'min_duration_us': np.float64(163.362), 'max_duration_us': np.float64(185.795)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(60.3)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.23)}]","{'op_shape': (1, 128, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 1048576, 1024, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.19498043710117666,95.66019619739822 -aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (64, 1, 16384, 64), ())","('', '', '1')",5219,48,536.131,11.169395833333333,1.2174860694660832,0.004194304,24.0,0.16666666666666666,vector_bf16,0.8932989719901001,0.01530507743233117,0.14888316199835,0.0025508462387218603,28.179982503255207,0.4890157762664813,1352.63916015625,11.016,8.362,16.034,0.8923680232703096,0.8443994225142127,0.9211561464853175,0.14872800387838492,0.14073323708570212,0.1535260244142196,28.201171875,27.31982421875,29.80322265625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(1352.64), 'mean_duration_us': np.float64(28.180000000000003), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4838763616186821), 'min_duration_us': np.float64(27.32), 'max_duration_us': np.float64(29.803)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.18)}]","{'shape_in1': (1, 64, 256, 256), 'shape_in2': (1, 64, 256, 256), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (4194304, 65536, 256, 1), 'stride_input2': (64, 1, 16384, 64), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.1898472647109107,95.85004346210913 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((268435456, 1048576, 1024, 1), (256, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",27261,1,66.639,66.639,,68.719476736,768.0625,85.32638945398324,matrix_bf16,0.7308579394169271,,62.36146917422441,,1101.9541015625,,1101.9541015625,66.639,66.639,66.639,0.7308579394169271,0.7308579394169271,0.7308579394169271,62.36146917422441,62.36146917422441,62.36146917422441,1101.9541015625,1101.9541015625,1101.9541015625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.231), 'mean_duration_us': np.float64(210.231), 'median_duration_us': np.float64(210.231), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.231), 'max_duration_us': np.float64(210.231)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(891.723), 'mean_duration_us': np.float64(891.723), 'median_duration_us': np.float64(891.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(891.723), 'max_duration_us': np.float64(891.723)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(210.23)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(891.72)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 1024, 1024), 'filter_shape': (128, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (268435456, 1048576, 1024, 1), 'weight_stride': (256, 1, 1, 1), 'bias': False, 'stride': (1, 1), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.15466280895966641,96.0047062710688 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024),)","('c10::BFloat16',)","((134217728, 1048576, 1024, 1),)","('',)",27250,6,53.229,8.8715,0.8245427217555191,0.134217728,512.0,0.25,vector_bf16,3.060151396175012,0.2008227131970654,0.765037849043753,0.05020567829926635,176.09407552083334,11.99649579488144,1056.564453125,8.488,8.242,10.305,3.05344141829577,2.728391166448712,3.2831729172481956,0.7633603545739425,0.682097791612178,0.8207932293120489,175.840576171875,163.52197265625,196.77197265625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1056.564), 'mean_duration_us': np.float64(176.09400000000002), 'median_duration_us': np.float64(175.8405), 'std_dev_duration_us': np.float64(10.951276226997471), 'min_duration_us': np.float64(163.522), 'max_duration_us': np.float64(196.772)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(176.09)}]","{'op_shape': (1, 128, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 1048576, 1024, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.1482922255432778,96.15299849661207 -aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 20, 77, 64), (1, 20, 77, 64), (1, 20, 77, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((98560, 64, 1280, 1), (98560, 64, 1280, 1), (98560, 64, 1280, 1), (), (), (), ())","('', '', '', '0.', 'True', 'False', '0.125')",1541,64,4525.486,70.71071875,16.127880050878225,0.01517824,0.751953125,19.25,matrix_bf16,0.051794181616539106,0.0024706959580987346,0.9970379961183778,0.04756089719340058,15.265159606933594,0.9025663372159146,976.97021484375,66.4585,60.901,144.735,0.05221603672694067,0.03700036752743854,0.05841437708001737,1.0051587069936079,0.7122570749031918,1.1244767587903344,15.100341796875,13.498046875,21.31005859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(98.007), 'mean_duration_us': np.float64(1.531359375), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(0.8389537078853692), 'min_duration_us': np.float64(1.121), 'max_duration_us': np.float64(7.651)}, {'name': 'attn_fwd', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(878.968), 'mean_duration_us': np.float64(13.733875), 'median_duration_us': np.float64(13.74), 'std_dev_duration_us': np.float64(0.35501850744010516), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(14.381)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.53)}, {'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.73)}]","{'B': 1, 'N_Q': 77, 'H_Q': 20, 'N_KV': 77, 'H_KV': 20, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': True, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', ['aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)'], ['attn_fwd']]",0.13712091772553114,96.2901194143376 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((1280,), (77, 5120), (5120, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (5120, 1), (1, 5120), (), ())","('', '', '', '1', '1')",1606,64,1870.578,29.22778125,7.522269474475571,1.00935296,13.4423828125,71.60888122048674,matrix_bf16,1.114879926117181,0.020116756124396066,79.83530420443023,1.44053839985338,12.647163391113281,0.23802573761036794,809.41845703125,26.945,24.166,56.684,1.1171122372675293,1.0141330504127877,1.1499998916421001,79.9951575084427,72.62093314877919,82.35020564417177,12.61767578125,12.2568359375,13.89892578125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(809.4159999999999), 'mean_duration_us': np.float64(12.647124999999999), 'median_duration_us': np.float64(12.6175), 'std_dev_duration_us': np.float64(0.23618745865307908), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.899)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.65)}]","{'M': 77, 'N': 1280, 'K': 5120, 'bias': True, 'stride_A': (5120, 1), 'stride_B': (1, 5120), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.1136044886177611,96.40372390295536 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'double')","((2621440, 10240, 1), ())","('', '')",5288,144,1256.962,8.728902777777778,3.0458010654574728,0.00262144,10.000007629394531,0.24999980926528223,vector_bf16,1.9659441249296883,0.36292666417321007,0.4914856562586243,0.09073159682058766,5.530008951822917,1.0932611565836916,796.3212890625,6.88,5.598,17.616,2.1285412900164973,1.3563350510958125,3.5390331021753463,0.5321349165174021,0.33908350407377,0.8847576005273567,4.92626953125,2.962890625,7.73095703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(796.32), 'mean_duration_us': np.float64(5.53), 'median_duration_us': np.float64(4.9265), 'std_dev_duration_us': np.float64(1.0894735923065477), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.11176625889059622,96.51549016184596 -aten::mean,reduce,python3,CPU,thread 416 (python3),"((1, 256, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1048576, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",5095,98,1112.483,11.351867346938775,2.141622988170156,0.001048576,4.000003814697266,0.24999976158164827,vector_fp32,0.5172989462393036,0.008229361463212305,0.1293246132262638,0.0020573384037722835,8.11019212372449,0.13343169375155572,794.798828125,10.636,9.684,22.253,0.518403306216053,0.47168979100543623,0.5315887606906368,0.12960070295715145,0.11792233529185656,0.13289706343214308,8.0908203125,7.89013671875,8.89208984375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(794.8029999999999), 'mean_duration_us': np.float64(8.11023469387755), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.13277860974004113), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::mean', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)']",0.11155257659222169,96.62704273843818 -triton_poi_fused__unsafe_view_clone_slice_transpose_13,triton,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 333, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((10771328, 283456, 64, 1), (809856, 2432, 1), ())","('', '', '1619712')",18463,148,2446.49,16.530337837837838,1.7095139960749801,0.0,47.26806640625,0.0,vector_bfloat16,9.524988997960184,0.9054188797215983,0.0,0.0,5.247835726351352,0.4718245491979532,776.6796875,16.284,14.311,30.355,9.59427218147448,8.30530188839797,12.37593266032675,0.0,0.0,0.0,5.166015625,4.0048828125,5.9677734375,"[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_13', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(776.6790000000001), 'mean_duration_us': np.float64(5.247831081081082), 'median_duration_us': np.float64(5.166), 'std_dev_duration_us': np.float64(0.470211631314194), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.968)}]","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_13', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]","{'fused_ops': 'aten._unsafe_view, aten.clone, aten.slice, aten.transpose', 'xnumel': 1619712, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__unsafe_view_clone_slice_transpose', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__unsafe_view_clone_slice_transpose_13']",0.10900949682054686,96.73605223525873 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((5120,), (77, 1280), (1280, 5120), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (1280, 1), (1, 1280), (), ())","('', '', '', '1', '1')",1597,64,2172.078,33.93871875,7.240565060534525,1.00964864,13.44970703125,71.59085133418043,matrix_bf16,1.2714808682337337,0.05973446799758913,91.02639781197588,4.276441417941762,11.121826171875,0.6552373406785019,711.796875,31.442,28.502,61.882,1.284889270875039,0.9097589114274915,1.3386645309603262,91.9863167720984,65.13041497795138,95.83613342232108,10.97607421875,10.53515625,15.501953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x80x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(711.797), 'mean_duration_us': np.float64(11.121828125), 'median_duration_us': np.float64(10.976), 'std_dev_duration_us': np.float64(0.6501138014486267), 'min_duration_us': np.float64(10.535), 'max_duration_us': np.float64(15.502)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x80x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(11.12)}]","{'M': 77, 'N': 5120, 'K': 1280, 'bias': True, 'stride_A': (1280, 1), 'stride_B': (1, 1280), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x80x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.09990298501554115,96.83595522027427 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 768), (768, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",68,96,3109.546,32.391104166666665,11.741692560210758,0.090892032,1.35205078125,64.11105092091007,matrix_bf16,0.19472810359160286,0.005842449367897683,12.484223365093506,0.3745655689281276,7.2877248128255205,0.2425620764988777,699.62158203125,31.747,21.502,125.226,0.19502471138707173,0.16088585050146836,0.20821132621011113,12.503239202572349,10.314560953953565,13.348646936966654,7.26953125,6.80908203125,8.81201171875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(699.621), 'mean_duration_us': np.float64(7.28771875), 'median_duration_us': np.float64(7.2695), 'std_dev_duration_us': np.float64(0.24125560024264206), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(8.812)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","{'M': 77, 'N': 768, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.09819414341516626,96.93414936368944 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (3, 128, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 1048576, 1024, 1), (1152, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27334,1,84.546,84.546,,7.247757312,262.006591796875,26.381015655356656,matrix_bf16,0.39460322367107914,,10.410033821320944,,696.22802734375,,696.22802734375,84.546,84.546,84.546,0.39460322367107914,0.39460322367107914,0.39460322367107914,10.410033821320944,10.410033821320944,10.410033821320944,696.22802734375,696.22802734375,696.22802734375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.087), 'mean_duration_us': np.float64(5.087), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.087), 'max_duration_us': np.float64(5.087)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.251), 'mean_duration_us': np.float64(8.251), 'median_duration_us': np.float64(8.251), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.251), 'max_duration_us': np.float64(8.251)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.092), 'mean_duration_us': np.float64(9.092), 'median_duration_us': np.float64(9.092), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.092), 'max_duration_us': np.float64(9.092)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.975), 'mean_duration_us': np.float64(10.975), 'median_duration_us': np.float64(10.975), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.975), 'max_duration_us': np.float64(10.975)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(287.826), 'mean_duration_us': np.float64(287.826), 'median_duration_us': np.float64(287.826), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(287.826), 'max_duration_us': np.float64(287.826)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(374.997), 'mean_duration_us': np.float64(374.997), 'median_duration_us': np.float64(374.997), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(374.997), 'max_duration_us': np.float64(374.997)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.09)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(8.25)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(9.09)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.98)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(287.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(375.0)}]","{'convNd': 'conv2d', 'input_shape': (1, 128, 1024, 1024), 'filter_shape': (3, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 1048576, 1024, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['batched_transpose_4x256_half'], ['batched_transpose_256x4_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.09771784707979006,97.03186721076924 -aten::layer_norm,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 77, 1280), (), (1280,), (1280,), (), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((98560, 1280, 1), (), (1,), (1,), (), ())","('', '[1280]', '', '', '1.0000000000000001e-05', 'True')",1500,130,2884.221,22.186315384615384,5.742365510784853,0.00050048,0.390625,1.221875,vector_bf16,0.08385900993368818,0.001796481186491025,0.10246522776272524,0.002195075449743723,4.886613581730769,0.10469760256131358,635.259765625,20.381,18.438,57.255,0.0838274008194264,0.07927242487242488,0.08816193378875462,0.10242660537623663,0.09686099414099414,0.10772286284813454,4.88623046875,4.64599609375,5.1669921875,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","{'op_shape': (1, 77, 1280), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (98560, 1280, 1), 'stride_output': None, 'num_channels': 1280, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,torch/nn/functional.py(2880): layer_norm,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/normalization.py(228): forward', 'torch/nn/functional.py(2880): layer_norm', 'aten::layer_norm', 'aten::native_layer_norm', 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)']",0.089160755090714,97.12102796585995 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', '1')",5262,96,1157.729,12.059677083333334,2.1962370282145955,0.001048576,6.0,0.16666666666666666,vector_bf16,1.3954191507413258,0.5661557267697908,0.23256985845688763,0.09435928779496518,6.4807078043619795,4.972852050214373,622.14794921875,11.536999999999999,9.784,21.582,1.6361780175238096,0.3916740702191689,1.9890246816918802,0.2726963362539682,0.06527901170319482,0.33150411361531334,3.84521484375,3.1630859375,16.06298828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(622.1469999999999), 'mean_duration_us': np.float64(6.480697916666666), 'median_duration_us': np.float64(3.845), 'std_dev_duration_us': np.float64(4.946894453256743), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(16.063)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.48)}]","{'shape_in1': (1, 256, 4096), 'shape_in2': (1, 256, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1048576, 4096, 1), 'stride_input2': (1048576, 4096, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(356): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.08732046940814463,97.20834843526809 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 1))","('c10::BFloat16', 'float')","((1048576, 4096, 1), (256, 1, 1))","('', '')",5098,98,858.087,8.755989795918367,2.526214434886481,0.001048576,6.0009765625,0.16663954434499592,vector_bf16,1.023365961807252,0.06258853332057247,0.17053323757373895,0.010429724673761803,6.172662228954081,0.395586423329981,604.9208984375,8.027000000000001,7.171,25.638,1.0268525131474102,0.8267786642715083,1.1385280537149924,0.1711142349003984,0.13777401988836852,0.1897237960950614,6.1279296875,5.52685546875,7.61083984375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(604.921), 'mean_duration_us': np.float64(6.172663265306123), 'median_duration_us': np.float64(6.128), 'std_dev_duration_us': np.float64(0.3935874755317555), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(7.611)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.17)}]","{'shape_in1': (1, 256, 4096), 'shape_in2': (1, 256, 1), 'dtype_in1_in2_out': ('c10::BFloat16', 'float', None), 'stride_input1': (1048576, 4096, 1), 'stride_input2': (256, 1, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})']",0.08490259732060394,97.2932510325887 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27141,5,157.063,31.412599999999998,1.2964433269526294,0.335545856,256.0029296875,1.2499914170293767,vector_bf16,2.269364568268366,0.04039953532870862,2.836686232446034,0.050499072412860564,118.3177734375,2.0926909657870496,591.5888671875,30.695,30.515,33.54,2.2426728945202075,2.2374338362710664,2.316319020758986,2.8033218693546873,2.796773091509944,2.8953788950506225,119.69580078125,115.89013671875,119.97607421875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(178.62), 'mean_duration_us': np.float64(35.724000000000004), 'median_duration_us': np.float64(35.612), 'std_dev_duration_us': np.float64(0.5430587445203343), 'min_duration_us': np.float64(34.931), 'max_duration_us': np.float64(36.493)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(412.969), 'mean_duration_us': np.float64(82.5938), 'median_duration_us': np.float64(83.483), 'std_dev_duration_us': np.float64(1.7604830473480866), 'min_duration_us': np.float64(80.038), 'max_duration_us': np.float64(84.405)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(35.72)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(82.59)}]","{'op_shape': (1, 256, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (67108864, 262144, 512, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.08303140377512024,97.37628243636382 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240))","('c10::BFloat16', 'c10::BFloat16')","((2621440, 10240, 1), (2621440, 10240, 1))","('', '')",5297,96,763.997,7.958302083333333,1.8334902415011174,0.00262144,15.0,0.16666666666666666,vector_bf16,2.7734013735868164,0.608155849747016,0.4622335622644694,0.10135930829116938,5.9616546630859375,1.3452461606471542,572.31884765625,8.317,5.488,14.822,2.8367131118865982,1.8012780137560813,3.4455294384426143,0.4727855186477665,0.3002130022926802,0.5742549064071024,5.647216796875,4.56494140625,8.73193359375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(572.318), 'mean_duration_us': np.float64(5.961645833333333), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(1.33823683737196), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(8.732)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.96)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (1, 256, 10240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (2621440, 10240, 1), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.0803267944404984,97.45660923080432 -aten::_softmax,other,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (), ())","('float', 'Scalar', 'Scalar')","((4194304, 65536, 256, 1), (), ())","('', '-1', 'False')",5225,48,411.223,8.567145833333333,1.836050142892702,,,,,,,,,11.830708821614584,0.6630237228890721,567.8740234375,8.077,7.11,15.984,,,,,,,12.13720703125,10.4951171875,12.89794921875,"[{'name': 'void (anonymous namespace)::softmax_warp_forward(float*, float const*, int, int, int, bool const*, int, bool)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(567.874), 'mean_duration_us': np.float64(11.830708333333334), 'median_duration_us': np.float64(12.137), 'std_dev_duration_us': np.float64(0.6561059669981334), 'min_duration_us': np.float64(10.495), 'max_duration_us': np.float64(12.898)}]","[{'name': 'void (anonymous namespace)::softmax_warp_forward', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'torch/nn/functional.py(2096): softmax', 'aten::softmax', 'aten::_softmax', 'void (anonymous namespace)::softmax_warp_forward(float*, float const*, int, int, int, bool const*, int, bool)']",0.07970294903892579,97.53631217984325 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((268435456, 1048576, 1024, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27233,1,33.33,33.33,,1.342178816,1024.0029296875,1.2499978542389272,vector_bf16,2.144821332646688,,2.6810220635342357,,500.6220703125,,500.6220703125,33.33,33.33,33.33,2.144821332646688,2.144821332646688,2.144821332646688,2.6810220635342357,2.6810220635342357,2.6810220635342357,500.6220703125,500.6220703125,500.6220703125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(164.163), 'mean_duration_us': np.float64(164.163), 'median_duration_us': np.float64(164.163), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(164.163), 'max_duration_us': np.float64(164.163)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(336.459), 'mean_duration_us': np.float64(336.459), 'median_duration_us': np.float64(336.459), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(336.459), 'max_duration_us': np.float64(336.459)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(164.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(336.46)}]","{'op_shape': (1, 256, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (268435456, 1048576, 1024, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.07026392071316537,97.60657610055641 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",5230,48,282.79200000000003,5.891500000000001,0.6596871276468704,0.004194304,24.0,0.16666666666666666,vector_bf16,2.4496158621719375,0.17195036303672756,0.4082693103619896,0.028658393839454614,10.319356282552084,0.6740310252108017,495.3291015625,5.769,5.188,8.282,2.4165232348087025,2.151697388719576,3.1258859505094616,0.402753872468117,0.35861623145326266,0.520980991751577,10.4140625,8.05078125,11.69580078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(495.32899999999995), 'mean_duration_us': np.float64(10.319354166666665), 'median_duration_us': np.float64(10.414), 'std_dev_duration_us': np.float64(0.6669758394419588), 'min_duration_us': np.float64(8.051), 'max_duration_us': np.float64(11.696)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.32)}]","{'op_shape': (1, 64, 256, 256), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (4194304, 65536, 256, 1), 'stride_output': (4194304, 65536, 256, 1)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::type_as', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.06952103549367213,97.67609713605009 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (1, 128, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (134217728, 1048576, 1024, 1), ())","('', '', '1')",27268,3,25.848,8.616,0.9193193134053035,0.134217728,768.0,0.16666666666666666,vector_bf16,5.022471221335316,0.029738981350048137,0.8370785368892193,0.004956496891674644,160.34440104166666,0.9468266154769833,481.033203125,8.162,8.012,9.674,5.011919815187697,4.999446608457364,5.056047240360886,0.8353199691979494,0.8332411014095608,0.8426745400601476,160.67822265625,159.27587890625,161.0791015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(481.033), 'mean_duration_us': np.float64(160.34433333333334), 'median_duration_us': np.float64(160.678), 'std_dev_duration_us': np.float64(0.7729606860780295), 'min_duration_us': np.float64(159.276), 'max_duration_us': np.float64(161.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(160.34)}]","{'shape_in1': (1, 128, 1024, 1024), 'shape_in2': (1, 128, 1024, 1024), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (134217728, 1048576, 1024, 1), 'stride_input2': (134217728, 1048576, 1024, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.06751456008257221,97.74361169613266 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4096,), (1, 256, 4096))","('c10::BFloat16', 'c10::BFloat16')","((1,), (1048576, 4096, 1))","('', '')",5103,98,772.446,7.882102040816327,1.8123350290499731,0.001048576,4.0078125,0.24951267056530213,vector_bf16,0.8907988689554314,0.05272997979301834,0.2222656047296203,0.013156798077010416,4.73542629942602,0.30576023168563127,464.07177734375,7.286,6.429,14.372,0.8930138578461777,0.6640981333333333,1.0493430636430139,0.2228182725230229,0.1657008987654321,0.2618243901487442,4.7060546875,4.0048828125,6.328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(464.06999999999994), 'mean_duration_us': np.float64(4.735408163265306), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.3041668727260965), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","{'shape_in1': (4096,), 'shape_in2': (1, 256, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1,), 'stride_input2': (1048576, 4096, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.06513396931969982,97.80874566545236 -aten::tanh,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240),)","('c10::BFloat16',)","((2621440, 10240, 1),)","('',)",5295,48,358.523,7.4692291666666675,1.3283991203553966,,,,,,,,,9.619974772135416,0.462344728681359,461.7587890625,7.035,6.32,12.539,,,,,,,9.61328125,8.3310546875,11.77587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(461.759), 'mean_duration_us': np.float64(9.619979166666667), 'median_duration_us': np.float64(9.6135), 'std_dev_duration_us': np.float64(0.45751723508443426), 'min_duration_us': np.float64(8.331), 'max_duration_us': np.float64(11.776)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ta...', 'stream': 0, 'mean_duration_us': np.float64(9.62)}]",,False,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::tanh', 'void at::native::vectorized_elementwise_kernel<8, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.06480933396132903,97.8735549994137 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512),)","('c10::BFloat16',)","((67108864, 262144, 512, 1),)","('',)",27145,5,43.426,8.6852,0.4451850177173528,0.067108864,256.0,0.25,vector_bf16,2.964445182785716,0.09138310205874534,0.741111295696429,0.022845775514686334,90.62138671875,2.827936505522151,453.10693359375,8.633,8.112,9.234,2.9637390637325196,2.831005627902426,3.0640208551189088,0.7409347659331299,0.7077514069756065,0.7660052137797272,90.5732421875,87.60888671875,94.81982421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(453.1069999999999), 'mean_duration_us': np.float64(90.62139999999998), 'median_duration_us': np.float64(90.573), 'std_dev_duration_us': np.float64(2.5293653433223118), 'min_duration_us': np.float64(87.609), 'max_duration_us': np.float64(94.82)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(90.62)}]","{'op_shape': (1, 256, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (67108864, 262144, 512, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.06359501816758356,97.93715001758129 -aten::pow,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), ())","('float', 'Scalar')","((1048576, 4096, 1), ())","('', '2')",5092,98,1055.055,10.765867346938776,2.785685718160984,0.001048576,8.0,0.125,vector_fp32,1.9879502095622998,0.496119610033179,0.24849377619528748,0.062014951254147375,4.5053411989795915,1.1635621576041233,441.5234375,10.04,9.193,30.185,2.063857867340539,1.2850526728999925,2.585772002408188,0.2579822334175674,0.16063158411249906,0.3232215003010235,4.0654296875,3.244140625,6.52783203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(441.52500000000003), 'mean_duration_us': np.float64(4.505357142857143), 'median_duration_us': np.float64(4.0655), 'std_dev_duration_us': np.float64(1.1575871567662643), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","{'op_shape': (1, 256, 4096), 'dtype_in_out': ('float', None), 'stride_input': (1048576, 4096, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::pow', 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)']",0.061969237165550535,97.99911925474684 -triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 14592), (14592,), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (14592, 1), (1,), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",18462,4,109.733,27.43325,2.211230181746502,0.039845888,285.0927734375,0.1332899446794663,vector_bfloat16,2.830974345109082,0.4917999574155184,0.37734041384857797,0.06555198911727832,108.5,22.329341551853997,434.0,26.384,26.219,30.746,3.0257543474499813,2.111632925951858,3.160755759584508,0.40330262958526275,0.2814594358834628,0.4212969603403236,98.926025390625,94.5791015625,141.56884765625,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(434.0), 'mean_duration_us': np.float64(108.5), 'median_duration_us': np.float64(98.926), 'std_dev_duration_us': np.float64(19.33785150941024), 'min_duration_us': np.float64(94.579), 'max_duration_us': np.float64(141.569)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(108.5)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.clone, aten.convolution, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12']",0.06091329846979851,98.06003255321664 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (1, 3, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 1048576, 1024, 1), (3145728, 1048576, 1024, 1), ())","('', '', 'False')",27348,1,42105.819,42105.819,,0.003145728,12.0,0.25,vector_bf16,0.030540216065674412,,0.007635054016418603,,412.01123046875,,412.01123046875,42105.819,42105.819,42105.819,0.030540216065674412,0.030540216065674412,0.030540216065674412,0.007635054016418603,0.007635054016418603,0.007635054016418603,412.01123046875,412.01123046875,412.01123046875,"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(412.011), 'mean_duration_us': np.float64(412.011), 'median_duration_us': np.float64(412.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(412.011), 'max_duration_us': np.float64(412.011)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(412.01)}]","{'op_shape': (1, 3, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (3145728, 1048576, 1024, 1), 'stride_output': (3145728, 1048576, 1024, 1)}",True,diffusers/image_processor.py(190): pt_to_numpy,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(190): pt_to_numpy', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy DtoH (Device -> Host)']",0.057827103812101176,98.11785965702875 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024),)","('c10::BFloat16',)","((268435456, 1048576, 1024, 1),)","('',)",27237,1,10.205,10.205,,0.268435456,1024.0,0.25,vector_bf16,2.78161956543441,,0.6954048913586025,,386.01318359375,,386.01318359375,10.205,10.205,10.205,2.78161956543441,2.78161956543441,2.78161956543441,0.6954048913586025,0.6954048913586025,0.6954048913586025,386.01318359375,386.01318359375,386.01318359375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(386.013), 'mean_duration_us': np.float64(386.013), 'median_duration_us': np.float64(386.013), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(386.013), 'max_duration_us': np.float64(386.013)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(386.01)}]","{'op_shape': (1, 256, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (268435456, 1048576, 1024, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.05417819416019176,98.17203785118893 -aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 12, 77, 64), (1, 12, 77, 64), (1, 12, 77, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((59136, 64, 768, 1), (59136, 64, 768, 1), (59136, 64, 768, 1), (), (), (), ())","('', '', '', '0.', 'True', 'False', '0.125')",96,24,1704.529,71.02204166666667,11.41202741382269,0.009106944,0.451171875,19.25,matrix_bf16,0.030169183412463132,0.004406723040204032,0.5807567806899153,0.0848294185239276,16.071818033854168,2.800457197961641,385.7236328125,68.7475,63.254,119.918,0.03276362764384427,0.021790307304785896,0.03364999215087001,0.6306998321440023,0.4194634156171286,0.6477623489042477,14.439453125,14.05908203125,21.7109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(69.519), 'mean_duration_us': np.float64(2.8966250000000002), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(2.7337303392449543), 'min_duration_us': np.float64(1.201), 'max_duration_us': np.float64(8.492)}, {'name': 'attn_fwd', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(316.206), 'mean_duration_us': np.float64(13.17525), 'median_duration_us': np.float64(13.038499999999999), 'std_dev_duration_us': np.float64(0.5000066041230524), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(14.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.9)}, {'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.18)}]","{'B': 1, 'N_Q': 77, 'H_Q': 12, 'N_KV': 77, 'H_KV': 12, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': True, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', ['aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)'], ['attn_fwd']]",0.054137554775029455,98.22617540596396 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), ())","('c10::BFloat16', '', 'ScalarList')","((67108864, 262144, 512, 1), (), ())","('', '', '[2., 2.]')",27223,1,10.786,10.786,,,,,,,,,,382.287109375,,382.287109375,10.786,10.786,10.786,,,,,,,382.287109375,382.287109375,382.287109375,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(382.287), 'mean_duration_us': np.float64(382.287), 'median_duration_us': np.float64(382.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(382.287), 'max_duration_us': np.float64(382.287)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(382.29)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']",0.053655227637133374,98.2798306336011 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",5223,48,379.655,7.909479166666666,1.9989198358601163,0.004194304,24.0,0.16666666666666666,vector_fp32,3.1941074188111482,0.25569355103516106,0.5323512364685247,0.04261559183919351,7.928293863932292,0.6323219764114211,380.55810546875,7.371,6.85,19.368,3.141491445453812,2.7435115273075694,3.631339924751638,0.5235819075756354,0.45725192121792824,0.6052233207919396,8.010986328125,6.93017578125,9.1728515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(380.557), 'mean_duration_us': np.float64(7.928270833333333), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.6257010647926363), 'min_duration_us': np.float64(6.93), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(7.93)}]","{'op_shape': (1, 64, 256, 256), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (4194304, 65536, 256, 1), 'stride_output': (4194304, 65536, 256, 1)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.05341255636755537,98.33324318996866 -aten::bmm,GEMM,python3,CPU,thread 416 (python3),"((64, 256, 256), (64, 256, 64))","('c10::BFloat16', 'c10::BFloat16')","((65536, 256, 1), (64, 4096, 1))","('', '')",5241,48,1673.868,34.87225,10.354268959267527,0.536870912,12.0,42.666666666666664,matrix_bf16,1.5903609938038132,0.031180263929752077,67.85540240229604,1.330357927669424,7.914967854817708,0.15546949489674314,379.91845703125,31.517000000000003,29.414,83.224,1.5906401374337105,1.5174775512896008,1.6710851291096556,67.86731253050498,64.74570885502297,71.29963217534531,7.91064453125,7.52978515625,8.2919921875,"[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB128_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(379.916), 'mean_duration_us': np.float64(7.914916666666667), 'median_duration_us': np.float64(7.9105), 'std_dev_duration_us': np.float64(0.15383430389726319), 'min_duration_us': np.float64(7.53), 'max_duration_us': np.float64(8.292)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(7.91)}]","{'B': 64, 'M': 256, 'N': 64, 'K': 256, 'bias': False, 'stride_A': (65536, 256, 1), 'stride_B': (64, 4096, 1), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'transpose': (False, False)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::matmul', 'aten::bmm', 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB128_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.05332277964822547,98.38656596961688 -aten::bmm,GEMM,python3,CPU,thread 416 (python3),"((64, 256, 64), (64, 64, 256))","('c10::BFloat16', 'c10::BFloat16')","((64, 4096, 1), (64, 1, 4096))","('', '')",5151,48,1340.282,27.922541666666664,4.7320771021143155,0.536870912,12.0,42.666666666666664,matrix_bf16,1.595970085635309,0.028005931689523502,68.09472365377317,1.1949197520863348,7.886566162109375,0.1390650795704857,378.55517578125,26.683999999999997,23.755,44.816,1.5945674015221833,1.5103624297268785,1.670868428710368,68.03487579827981,64.44213033501347,71.29038629164235,7.89111328125,7.53076171875,8.3310546875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AFC0_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD0_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(378.553), 'mean_duration_us': np.float64(7.886520833333333), 'median_duration_us': np.float64(7.891), 'std_dev_duration_us': np.float64(0.13759345151316446), 'min_duration_us': np.float64(7.531), 'max_duration_us': np.float64(8.331)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AF...', 'stream': 0, 'mean_duration_us': np.float64(7.89)}]","{'B': 64, 'M': 256, 'N': 256, 'K': 64, 'bias': False, 'stride_A': (64, 4096, 1), 'stride_B': (64, 1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'transpose': (True, False)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::matmul', 'aten::bmm', 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AFC0_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD0_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.05313143873191319,98.43969740834879 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (8388608, 16384, 128, 1), ())","('', '', '1')",26878,5,47.261,9.452200000000001,3.0552757976981386,0.008388608,48.0,0.16666666666666666,vector_bf16,0.6726143662492617,0.07519814684310595,0.11210239437487694,0.012533024473850997,75.70400390625,9.7861765523355,378.52001953125,8.173,7.852,14.912,0.6991881751917899,0.5415616254538004,0.7283669215452123,0.11653136253196497,0.09026027090896672,0.12139448692420206,71.98583984375,69.10205078125,92.93798828125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(378.52), 'mean_duration_us': np.float64(75.704), 'median_duration_us': np.float64(71.986), 'std_dev_duration_us': np.float64(8.753032731573668), 'min_duration_us': np.float64(69.102), 'max_duration_us': np.float64(92.938)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(75.7)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (1, 512, 128, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (512, 1, 65536, 512), 'stride_input2': (8388608, 16384, 128, 1), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.05312650443894238,98.49282391278773 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27031,6,190.485,31.747500000000002,1.7667491898965197,0.167775232,128.005859375,1.2499656692961443,vector_bf16,2.149101927696643,0.11003496193377399,2.6863036294389686,0.13753992483952507,62.590901692708336,3.1680777446719164,375.54541015625,31.451999999999998,30.005,34.231,2.125241709245668,2.0221457249963217,2.293429750175205,2.6564791755133426,2.5276127345593644,2.866708452661438,63.171630859375,58.525390625,66.376953125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(111.75900000000001), 'mean_duration_us': np.float64(18.626500000000004), 'median_duration_us': np.float64(18.426000000000002), 'std_dev_duration_us': np.float64(0.5515921651606974), 'min_duration_us': np.float64(17.906), 'max_duration_us': np.float64(19.548)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(263.786), 'mean_duration_us': np.float64(43.964333333333336), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(2.4412839290468074), 'min_duration_us': np.float64(40.219), 'max_duration_us': np.float64(46.829)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(18.63)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(43.96)}]","{'op_shape': (1, 512, 256, 256), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33554432, 65536, 256, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.05270900842813493,98.54553292121587 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((2621440, 10240, 1), (), ())","('', '', '1')",5296,48,373.585,7.783020833333333,2.560760072418521,0.00262144,10.000007629394531,0.24999980926528223,vector_bf16,1.3699063380734053,0.09661753073931967,0.34247632322965266,0.024154364256512472,7.6912841796875,0.5368066733838069,369.181640625,7.0255,6.259,22.033,1.3563714325383884,1.1431306751836474,1.60631706664672,0.33909259942747483,0.2857824507612052,0.4015789602812477,7.73095703125,6.52783203125,9.1728515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(369.18199999999996), 'mean_duration_us': np.float64(7.6912916666666655), 'median_duration_us': np.float64(7.731), 'std_dev_duration_us': np.float64(0.5311947994197189), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.69)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.05181583286857262,98.59734875408444 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 1280), (1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 1280, 1), (98560, 1280, 1), ())","('', '', '1')",1499,130,1438.233,11.063330769230769,1.7957760620237115,9.856e-05,0.56396484375,0.16666666666666666,vector_bf16,0.21374836252903948,0.010641487638759984,0.03562472708817325,0.0017735812731266625,2.7733285757211537,0.1361878321358302,360.53271484375,11.422,8.633,17.606,0.21401400954232197,0.19175194426852438,0.25028007439553623,0.035669001590386995,0.031958657378087396,0.04171334573258938,2.76318359375,2.36279296875,3.083984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(360.52700000000004), 'mean_duration_us': np.float64(2.7732846153846156), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.13570642718271758), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(3.084)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.77)}]","{'shape_in1': (1, 77, 1280), 'shape_in2': (1, 77, 1280), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (98560, 1280, 1), 'stride_input2': (98560, 1280, 1), 'stride_output': None}",True,transformers/models/clip/modeling_clip.py(234): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.050601928265908064,98.64795068235034 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",5091,98,851.584,8.689632653061224,1.5716419701133448,0.001048576,6.0,0.16666666666666666,vector_fp32,1.772961286208643,0.17509553373520487,0.2954935477014405,0.029182588955867478,3.653773716517857,1.208679528258489,358.06982421875,8.247,7.24,16.565,1.8058727243167485,0.41118527852948683,1.9635632258457787,0.3009787873861247,0.06853087975491447,0.32726053764096313,3.48388671875,3.2041015625,15.30078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(358.069), 'mean_duration_us': np.float64(3.653765306122449), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(1.202514761257105), 'min_duration_us': np.float64(3.204), 'max_duration_us': np.float64(15.301)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.65)}]","{'op_shape': (1, 256, 4096), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (1048576, 4096, 1), 'stride_output': (1048576, 4096, 1)}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.05025625363056453,98.6982069359809 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2621440, 10240, 1), (2621440, 10240, 1), ())","('', '', '1')",5293,48,362.679,7.555812499999999,1.2632263262494912,0.00262144,15.0,0.16666666666666666,vector_bf16,2.1403600581760758,0.12136864503662081,0.3567266763626793,0.020228107506103484,7.373291015625,0.4467926884954272,353.91796875,7.1555,6.409,12.199,2.1575522250502344,1.7376337641601036,2.35143110592014,0.35959203750837243,0.2896056273600173,0.3919051843200234,7.2900390625,6.68896484375,9.0517578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(353.918), 'mean_duration_us': np.float64(7.373291666666667), 'median_duration_us': np.float64(7.29), 'std_dev_duration_us': np.float64(0.4421139068127377), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.052)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.37)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (1, 256, 10240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (2621440, 10240, 1), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.04967352733708197,98.74788046331798 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), ())","('c10::BFloat16', 'double')","((134217728, 1048576, 1024, 1), ())","('', '')",27269,3,25.979,8.659666666666666,0.5040171954738586,0.134217728,512.0000076293945,0.24999999627470976,vector_bf16,4.586877843701335,0.04590349744788913,1.1467194438378827,0.01147587419096851,117.052734375,1.1657288165048338,351.158203125,8.733,8.123,9.123,4.569380051033554,4.552296594446215,4.638956885624237,1.1423449957361216,1.138074131652928,1.1597392041245986,117.4931640625,115.73095703125,117.93408203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(351.158), 'mean_duration_us': np.float64(117.05266666666667), 'median_duration_us': np.float64(117.493), 'std_dev_duration_us': np.float64(0.951743079244021), 'min_duration_us': np.float64(115.731), 'max_duration_us': np.float64(117.934)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(117.05)}]","{'shape_in1': (1, 128, 1024, 1024), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (134217728, 1048576, 1024, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.04928618533887386,98.79716664865686 -aten::gelu,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 5120), ())","('c10::BFloat16', '')","((394240, 5120, 1), ())","('', '')",1599,64,746.145,11.658515625,2.0393301109284105,,,,,,,,,5.263710021972656,0.3725945490820721,336.87744140625,11.142,10.165,22.304,,,,,,,5.16650390625,4.80615234375,6.96923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(336.87699999999995), 'mean_duration_us': np.float64(5.263703124999999), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(0.369633588828497), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Ge...', 'stream': 0, 'mean_duration_us': np.float64(5.26)}]",,False,transformers/activations.py(88): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: GELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(88): forward', 'aten::gelu', 'void at::native::vectorized_elementwise_kernel<8, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.047281834415025266,98.84444848307189 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",26880,4,201.75900000000001,50.439750000000004,5.458195206903715,0.041946112,32.005859375,1.2498626960395436,vector_bf16,0.39912130302732496,0.017376149938031805,0.49884682784854806,0.021717801608335786,84.2020263671875,3.5496797689210453,336.80810546875,48.2565,46.82,58.426,0.39407333797801747,0.3841346451234302,0.4242038910298347,0.4925375646425072,0.4801155631961638,0.530196618913014,85.16357421875,79.1142578125,87.36669921875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.756999999999998), 'mean_duration_us': np.float64(6.9392499999999995), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.39939477650565214), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(7.491)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(56.881), 'mean_duration_us': np.float64(14.22025), 'median_duration_us': np.float64(14.381), 'std_dev_duration_us': np.float64(0.4814152962879343), 'min_duration_us': np.float64(13.419), 'max_duration_us': np.float64(14.7)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(252.17000000000002), 'mean_duration_us': np.float64(63.042500000000004), 'median_duration_us': np.float64(63.313), 'std_dev_duration_us': np.float64(2.4823704900759695), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.94)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(14.22)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.04)}]","{'op_shape': (1, 512, 128, 128), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (512, 1, 65536, 512), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']]",0.04727210289277729,98.89172058596466 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",5102,98,631.281,6.441642857142857,1.4747967272129192,0.001048576,6.0,0.16666666666666666,vector_bf16,1.8500109098074213,0.12718544383168334,0.3083351516345702,0.021197573971947235,3.4167580117984695,0.23546391148849397,334.84228515625,6.089,5.418,19.218,1.83761300947469,1.6033974474863117,2.0951059980487807,0.3062688349124484,0.26723290791438525,0.34918433300813007,3.423828125,3.0029296875,3.923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(334.84000000000003), 'mean_duration_us': np.float64(3.4167346938775514), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.23425720867615366), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.924)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]","{'op_shape': (1, 256, 4096), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (1048576, 4096, 1), 'stride_output': (1048576, 4096, 1)}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.046996193677493185,98.93871677964215 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 262144, 512, 1), (512, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",27156,1,77.585,77.585,,68.719476736,384.25,170.55562784645414,matrix_bf16,1.2371447381153708,,211.00199754620417,,325.681640625,,325.681640625,77.585,77.585,77.585,1.2371447381153708,1.2371447381153708,1.2371447381153708,211.00199754620417,211.00199754620417,211.00199754620417,325.681640625,325.681640625,325.681640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(115.61), 'mean_duration_us': np.float64(115.61), 'median_duration_us': np.float64(115.61), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(115.61), 'max_duration_us': np.float64(115.61)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.072), 'mean_duration_us': np.float64(210.072), 'median_duration_us': np.float64(210.072), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.072), 'max_duration_us': np.float64(210.072)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(115.61)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(210.07)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 512, 512), 'filter_shape': (256, 512, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 262144, 512, 1), 'weight_stride': (512, 1, 1, 1), 'bias': False, 'stride': (1, 1), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.04571046769936471,98.98442724734151 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4864), (4864,), (2, 4096, 2432), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (9961472, 2432, 1), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '8192', '2432')",20447,4,110.533,27.63325,1.2336110610723305,0.039845888,114.115966796875,0.3329945937157026,vector_bfloat16,1.5304232034612713,0.2637053812120767,0.5096226528496702,0.08781246627735999,80.3485107421875,16.725685280144965,321.39404296875,27.4905,26.279,29.273,1.6599540938307058,1.1348991245988338,1.6668855015848398,0.5527557390618733,0.37791527290409527,0.555063860370839,72.0859375,71.7861328125,105.43603515625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(321.394), 'mean_duration_us': np.float64(80.3485), 'median_duration_us': np.float64(72.086), 'std_dev_duration_us': np.float64(14.484854805968892), 'min_duration_us': np.float64(71.786), 'max_duration_us': np.float64(105.436)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(80.35)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24']",0.04510868955246709,99.02953593689398 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 64, 64), (1, 256, 64, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 64, 1), (1048576, 64, 16384, 1), ())","('', '', 'False')",5249,48,443.65,9.242708333333333,1.6096055147521606,0.001048576,4.0,0.25,vector_bf16,0.6409524591891147,0.030831353206344933,0.16023811479727867,0.007707838301586233,6.558736165364583,0.31613188099540285,314.8193359375,8.863,8.132,18.267,0.6405197978707994,0.5850656989510965,0.6935196667204909,0.16012994946769984,0.14626642473777413,0.17337991668012273,6.54833984375,6.0478515625,7.1689453125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(314.819), 'mean_duration_us': np.float64(6.558729166666667), 'median_duration_us': np.float64(6.5485), 'std_dev_duration_us': np.float64(0.31280177026775097), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.169)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.56)}]","{'op_shape': (1, 256, 64, 64), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1048576, 4096, 64, 1), 'stride_output': (1048576, 64, 16384, 1)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.04418590823507996,99.07372184512906 -triton_poi_fused_add_addmm_silu_3,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '', '4864')",18412,72,1541.699,21.41248611111111,4.5781927764562225,2.432e-05,0.07421875,0.3125,vector_bfloat16,0.020345975762088866,0.005449940679810506,0.006358117425652772,0.0017031064624407834,4.111178927951389,1.1141597813731445,296.0048828125,20.4805,17.466,54.261,0.018874042542095834,0.009666639495390587,0.02989749615456762,0.00589813829440495,0.003020824842309559,0.009342967548302383,4.14501953125,2.60302734375,8.05078125,"[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'count': 72, 'total_duration_us': np.float64(296.005), 'mean_duration_us': np.float64(4.111180555555555), 'median_duration_us': np.float64(4.1450000000000005), 'std_dev_duration_us': np.float64(1.1063898665679002), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(8.051)}]","[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_3']",0.04154523911353812,99.11526708424259 -aten::rsqrt,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 1),)","('float',)","((256, 1, 1),)","('',)",5097,98,768.239,7.839173469387755,2.5000466099799774,2.56e-07,0.001953125,0.125,vector_fp32,0.0007148460470941715,4.830387704882627e-05,8.935575588677144e-05,6.037984631103284e-06,2.89102857940051,0.4045436215443143,283.32080078125,7.161,6.28,25.899,0.0007204232222603916,0.0003043541107321675,0.0007748575651210049,9.005290278254895e-05,3.8044263841520934e-05,9.685719564012561e-05,2.8427734375,2.64306640625,6.72900390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(283.322), 'mean_duration_us': np.float64(2.8910408163265306), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.40249580853103045), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(2.89)}]","{'op_shape': (1, 256, 1), 'dtype_in_out': ('float', None), 'stride_input': (256, 1, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::rsqrt', 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.0397649873287802,99.15503207157137 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256),)","('c10::BFloat16',)","((33554432, 65536, 256, 1),)","('',)",27035,6,51.627,8.6045,0.5049533641832682,0.033554432,128.0,0.25,vector_bf16,2.957530060564024,0.21523914482639145,0.739382515141006,0.05380978620659786,45.580403645833336,3.2794362265579236,273.482421875,8.3875,8.203,9.544,2.913184611115289,2.706396894078727,3.2216533478352596,0.7282961527788222,0.6765992235196817,0.8054133369588149,46.108154296875,41.6611328125,49.5927734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(273.482), 'mean_duration_us': np.float64(45.580333333333336), 'median_duration_us': np.float64(46.108000000000004), 'std_dev_duration_us': np.float64(2.993738168614989), 'min_duration_us': np.float64(41.661), 'max_duration_us': np.float64(49.593)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(45.58)}]","{'op_shape': (1, 512, 256, 256), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33554432, 65536, 256, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.03838413914727012,99.19341621071864 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27128,1,40.3,40.3,,0.671091712,512.005859375,1.2499914170293767,vector_bf16,2.1229327891536838,,2.6536477653723396,,252.89404296875,,252.89404296875,40.3,40.3,40.3,2.1229327891536838,2.1229327891536838,2.1229327891536838,2.6536477653723396,2.6536477653723396,2.6536477653723396,252.89404296875,252.89404296875,252.89404296875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.455), 'mean_duration_us': np.float64(64.455), 'median_duration_us': np.float64(64.455), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.455), 'max_duration_us': np.float64(64.455)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(188.439), 'mean_duration_us': np.float64(188.439), 'median_duration_us': np.float64(188.439), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(188.439), 'max_duration_us': np.float64(188.439)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.46)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(188.44)}]","{'op_shape': (1, 512, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 262144, 512, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.03549449382624313,99.22891070454489 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (1, 256, 512, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (67108864, 262144, 512, 1), ())","('', '', '1')",27163,3,24.807,8.269,0.9348844848429142,0.067108864,384.0,0.16666666666666666,vector_bf16,4.806911957597861,0.06987866686866041,0.8011519929329768,0.011646444478110094,83.77734375,1.2263848242878954,251.33203125,7.981,7.512,9.314,4.832423384269189,4.7278621765393885,4.860450311985005,0.8054038973781982,0.7879770294232313,0.8100750519975009,83.3232421875,82.8427734375,85.166015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(251.332), 'mean_duration_us': np.float64(83.77733333333333), 'median_duration_us': np.float64(83.323), 'std_dev_duration_us': np.float64(1.0012979354595477), 'min_duration_us': np.float64(82.843), 'max_duration_us': np.float64(85.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(83.78)}]","{'shape_in1': (1, 256, 512, 512), 'shape_in2': (1, 256, 512, 512), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (67108864, 262144, 512, 1), 'stride_input2': (67108864, 262144, 512, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.035275260448276446,99.26418596499316 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",54,50,553.635,11.0727,2.5819875452204384,5.9136e-05,0.33837890625,0.16666666666666666,vector_bf16,0.07100890361360628,0.005397594404611995,0.011834817268934377,0.000899599067435332,5.024775390625,0.37790636847342857,251.23876953125,11.0415,8.814,26.019,0.07030409907120744,0.059059100130039004,0.08518911699882767,0.011717349845201237,0.0098431833550065,0.014198186166471278,5.046875,4.1650390625,6.0078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(251.23900000000003), 'mean_duration_us': np.float64(5.024780000000001), 'median_duration_us': np.float64(5.047), 'std_dev_duration_us': np.float64(0.37414020313246205), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.02)}]","{'shape_in1': (1, 77, 768), 'shape_in2': (1, 77, 768), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (59136, 768, 1), 'stride_input2': (59136, 768, 1), 'stride_output': None}",True,transformers/models/clip/modeling_clip.py(234): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.03526217086553445,99.2994481358587 -aten::pow,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'Scalar')","((2621440, 10240, 1), ())","('', '3.')",5289,48,552.571,11.511895833333334,2.5602263134638084,0.00262144,10.0,0.25,vector_bf16,2.1873946560920685,0.12845204619245754,0.5468486640230172,0.03211301154811437,4.81292724609375,0.3375204223664483,231.0205078125,10.461,9.173,18.558,2.200065206433767,1.625896159903089,2.4695074149034038,0.5500163016084417,0.4064740399757723,0.6173768537258509,4.76611328125,4.24609375,6.44921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(231.017), 'mean_duration_us': np.float64(4.812854166666667), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.334003617095143), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","{'op_shape': (1, 256, 10240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2621440, 10240, 1), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::pow', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)']",0.032424472684394544,99.3318726085431 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128),)","('c10::BFloat16',)","((8388608, 16384, 128, 1),)","('',)",26758,10,98.417,9.8417,2.7845479206187536,0.008388608,32.0,0.25,vector_bf16,1.5712199540858873,0.23950682265366277,0.39280498852147183,0.05987670566341569,21.7033203125,2.556412588605594,217.033203125,9.0485,8.052,17.546,1.528658727505411,1.3960563289452301,2.221846058262472,0.3821646818763528,0.34901408223630753,0.555461514565618,21.951416015625,15.10205078125,24.03515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(217.03300000000002), 'mean_duration_us': np.float64(21.703300000000002), 'median_duration_us': np.float64(21.9515), 'std_dev_duration_us': np.float64(2.425225888448332), 'min_duration_us': np.float64(15.102), 'max_duration_us': np.float64(24.035)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(21.7)}]","{'op_shape': (1, 512, 128, 128), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (8388608, 16384, 128, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.03046130940048279,99.36233391794357 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",163,24,748.493,31.187208333333334,3.7659750048717617,0.36339072,5.0654296875,68.41599190283401,matrix_bf16,0.5941187059367797,0.02303644922778071,40.647220574692945,1.5760615238378917,8.953898111979166,0.37142902420526336,214.8935546875,31.522,26.61,43.515,0.6041310576656731,0.5303977485006584,0.6167674448035381,41.33222554950524,36.28768806670242,42.19675650961048,8.7919921875,8.61181640625,10.01416015625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(214.894), 'mean_duration_us': np.float64(8.953916666666666), 'median_duration_us': np.float64(8.792), 'std_dev_duration_us': np.float64(0.36354767187017195), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(10.014)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.95)}]","{'M': 77, 'N': 768, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.03016100284773193,99.39249492079131 -aten::layer_norm,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), (), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((59136, 768, 1), (), (1,), (1,), (), ())","('', '[768]', '', '', '1.0000000000000001e-05', 'True')",55,50,1110.339,22.20678,4.586332434038138,0.000300288,0.234375,1.221875,vector_bf16,0.057607321869964326,0.0024247130139245644,0.07038894640986265,0.0029626962138890687,4.274140625,0.19483437471531076,213.70703125,21.1715,18.998,48.081,0.05789239475500345,0.04949031268436578,0.06075766296475133,0.07073726984126984,0.060470975811209436,0.07423826943505553,4.2451171875,4.044921875,4.9658203125,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]","{'op_shape': (1, 77, 768), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (59136, 768, 1), 'stride_output': None, 'num_channels': 768, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,torch/nn/functional.py(2880): layer_norm,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/normalization.py(228): forward', 'torch/nn/functional.py(2880): layer_norm', 'aten::layer_norm', 'aten::native_layer_norm', 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)']",0.0299944704599673,99.42248939125128 -aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 512, 512),)","('c10::BFloat16',)","((134217728, 262144, 512, 1),)","('',)",27132,1,9.824,9.824,,0.134217728,512.0,0.25,vector_bf16,2.650166378496158,,0.6625415946240395,,202.580078125,,202.580078125,9.824,9.824,9.824,2.650166378496158,2.650166378496158,2.650166378496158,0.6625415946240395,0.6625415946240395,0.6625415946240395,202.580078125,202.580078125,202.580078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.58), 'mean_duration_us': np.float64(202.58), 'median_duration_us': np.float64(202.58), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.58), 'max_duration_us': np.float64(202.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.58)}]","{'op_shape': (1, 512, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 262144, 512, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.028432766734707893,99.45092215798599 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 1), (), ())","('float', 'double', 'Scalar')","((256, 1, 1), (), ())","('', '', '1')",5096,98,866.399,8.84080612244898,2.567299213314213,2.56e-07,0.00196075439453125,0.1245136186770428,vector_fp32,0.0010399005747285341,3.1825317628982755e-05,0.00012948178362378636,3.962685463530916e-06,1.97900390625,0.0625893259287263,193.9423828125,8.142,7.05,22.604,0.0010479561971129916,0.0009004893071000856,0.0010931173416407062,0.00013048481831757092,0.00011212318220701456,0.0001361079958463136,1.9619140625,1.880859375,2.283203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(193.94899999999998), 'mean_duration_us': np.float64(1.9790714285714284), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.062211825439298846), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(2.283)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.98)}]","{'shape_in1': (1, 256, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (256, 1, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.027220438364520122,99.47814259635051 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",152,24,827.36,34.473333333333336,4.787860025438126,0.363568128,5.06982421875,68.39006067610516,matrix_bf16,0.7049808681361566,0.04202993484253143,48.21368434732506,2.8744297940934724,7.570332845052083,0.5188871878512363,181.68798828125,34.396,29.203,52.719,0.7174067348444912,0.5745311138786279,0.749921794186527,49.06349012546126,39.29221773846965,51.28719700675025,7.41015625,7.0888671875,9.2529296875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(181.688), 'mean_duration_us': np.float64(7.570333333333333), 'median_duration_us': np.float64(7.41), 'std_dev_duration_us': np.float64(0.5079509217324928), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(9.253)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]","{'M': 77, 'N': 3072, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.025500494604960913,99.50364309095546 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), ())","('c10::BFloat16', 'double')","((67108864, 262144, 512, 1), ())","('', '')",27164,3,25.487000000000002,8.495666666666667,0.16254332755709514,0.067108864,256.00000762939453,0.24999999254941963,vector_bf16,4.469912772646585,0.12985639942242433,1.1174781598582018,0.03246409888810058,60.088216145833336,1.7745229841248433,180.2646484375,8.412,8.392,8.683,4.533844348089992,4.320485290245513,4.555408679604249,1.133461053242726,1.0801212903712551,1.1388521359606238,59.20703125,58.9267578125,62.130859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(180.265), 'mean_duration_us': np.float64(60.08833333333333), 'median_duration_us': np.float64(59.207), 'std_dev_duration_us': np.float64(1.448899659128341), 'min_duration_us': np.float64(58.927), 'max_duration_us': np.float64(62.131)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(60.09)}]","{'shape_in1': (1, 256, 512, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (67108864, 262144, 512, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.025300724271490174,99.52894381522695 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((2, 16, 128, 128), (2432, 16, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((262144, 16384, 128, 1), (64, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",18414,4,949.711,237.42775,1.2800599920837124,2.550136832,39.296875,61.88787276341948,matrix_bf16,0.9567967968133243,0.010061874400333954,59.214118421630346,0.6227080026493774,43.0699462890625,0.45408290154729514,172.27978515625,237.82350000000002,235.58,238.484,0.9583142321704221,0.9446292253962569,0.9659294975161963,59.30802926793712,58.46109330993105,59.77932184071607,42.999755859375,42.6591796875,43.62109375,"[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.905), 'mean_duration_us': np.float64(4.97625), 'median_duration_us': np.float64(4.9864999999999995), 'std_dev_duration_us': np.float64(0.1425313561992589), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.166)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.806), 'mean_duration_us': np.float64(8.4515), 'median_duration_us': np.float64(8.4315), 'std_dev_duration_us': np.float64(0.5024542267709567), 'min_duration_us': np.float64(7.811), 'max_duration_us': np.float64(9.132)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(51.512), 'mean_duration_us': np.float64(12.878), 'median_duration_us': np.float64(12.838000000000001), 'std_dev_duration_us': np.float64(0.08246211251235361), 'min_duration_us': np.float64(12.818), 'max_duration_us': np.float64(13.018)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.05699999999999), 'mean_duration_us': np.float64(16.764249999999997), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(0.3003168118837177), 'min_duration_us': np.float64(16.304), 'max_duration_us': np.float64(17.145)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(4.98)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(8.45)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(12.88)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(16.76)}]","{'convNd': 'conv2d', 'input_shape': (2, 16, 128, 128), 'filter_shape': (2432, 16, 2, 2), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (262144, 16384, 128, 1), 'weight_stride': (64, 4, 2, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['Im2d2Col_v2'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32']]",0.02418002298049636,99.55312383820745 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 4096), (4096, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (2432, 1))","('', '', '')",18420,4,110.85300000000001,27.713250000000002,1.621800927980989,13.268680704,27.29248046875,463.6441899991055,matrix_bf16,0.6774995134895065,0.012472136455825294,314.11871315663024,5.782633604619402,42.251708984375,0.7774666796021822,169.0068359375,28.016,25.568,29.253,0.6772508591693622,0.6645669783316136,0.690929357287688,314.0034260257771,308.1226183687141,320.3453822062526,42.261962890625,41.419921875,43.06298828125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(169.007), 'mean_duration_us': np.float64(42.25175), 'median_duration_us': np.float64(42.262), 'std_dev_duration_us': np.float64(0.6732137012123276), 'min_duration_us': np.float64(41.42), 'max_duration_us': np.float64(43.063)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(42.25)}]","{'M': 666, 'N': 2432, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.023720654011283888,99.57684449221874 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), ())","('c10::BFloat16', '', 'ScalarList')","((33554432, 65536, 256, 1), (), ())","('', '', '[2., 2.]')",27118,1,10.336,10.336,,,,,,,,,,159.51611328125,,159.51611328125,10.336,10.336,10.336,,,,,,,159.51611328125,159.51611328125,159.51611328125,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(159.516), 'mean_duration_us': np.float64(159.516), 'median_duration_us': np.float64(159.516), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(159.516), 'max_duration_us': np.float64(159.516)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(159.52)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']",0.02238860050470731,99.59923309272345 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",154,24,334.505,13.937708333333333,2.8549099046039617,0.000236544,0.9023513793945312,0.24999788624622696,vector_bf16,0.14903961514748587,0.017924786857637046,0.03725958875382261,0.00448115882582341,6.423543294270833,0.6604502574194904,154.1650390625,13.1995,12.348,27.011,0.14673507991585708,0.12175839346528433,0.20365578896479244,0.03668345981713545,0.030439340999057492,0.05091351676300578,6.448486328125,4.64599609375,7.77099609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(154.16500000000002), 'mean_duration_us': np.float64(6.423541666666668), 'median_duration_us': np.float64(6.4485), 'std_dev_duration_us': np.float64(0.6465522651705911), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(7.771)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.42)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.021637559995442878,99.62087065271889 -triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4,triton,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (), (), ())","('', '', '', '', '', '', '8192', '19', '128')",18417,4,156.513,39.12825,0.708237895531345,2.432e-06,209.004638671875,1.1097054841645027e-05,vector_bfloat16,5.740487575802279,0.09823798442072894,6.370250544645981e-05,1.090152300649496e-06,38.185791015625,0.6489508867729514,152.7431640625,39.3685,38.127,39.649,5.722922472324457,5.6459242978225594,5.87018106073764,6.350758452986724e-05,6.265313156471314e-05,6.514172116139158e-05,38.296142578125,37.333984375,38.81689453125,"[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(152.743), 'mean_duration_us': np.float64(38.18575), 'median_duration_us': np.float64(38.296), 'std_dev_duration_us': np.float64(0.5620197394220234), 'min_duration_us': np.float64(37.334), 'max_duration_us': np.float64(38.817)}]","[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(38.19)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.clone, aten.convolution, aten.native_layer_norm, aten.slice, aten.transpose, aten.view', 'xnumel': 19, 'rnumel': 128}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4']",0.02143799525751259,99.6423086479764 -aten::sigmoid,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",155,24,197.116,8.213166666666668,2.1981834529341766,0.000236544,0.90234375,0.25,vector_bf16,0.1554287062821396,0.009436700801585865,0.03885717657053489,0.002359175200396465,6.109761555989583,0.38336007029338576,146.63427734375,7.386,7.041,15.934,0.1564482841918295,0.13654911197237685,0.174983605562579,0.03911207104795737,0.03413727799309421,0.04374590139064475,6.0478515625,5.4072265625,6.92919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(146.634), 'mean_duration_us': np.float64(6.109749999999999), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.37528314310664157), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(6.929)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.11)}]","{'op_shape': (1, 77, 3072), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::sigmoid', 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.02058059332198861,99.6628892412984 -triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7,triton,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1), (2, 4096, 1), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (4096, 1, 8192), (4096, 1, 8192), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",18422,4,98.977,24.74425,0.7730917905828956,4.864e-06,247.0927734375,1.8772996921228504e-05,vector_bfloat16,7.670023327737122,0.4447054603016994,0.00014398932431735983,8.348454237097304e-06,33.8695068359375,2.052704965445482,135.47802734375,24.6915,23.866,25.728,7.818620491115268,7.037969235307381,8.004883093410573,0.00014677893840796103,0.00013212377478612642,0.0001502756456673908,33.1484375,32.3671875,36.81396484375,"[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(135.478), 'mean_duration_us': np.float64(33.8695), 'median_duration_us': np.float64(33.1485), 'std_dev_duration_us': np.float64(1.7777253021769148), 'min_duration_us': np.float64(32.367), 'max_duration_us': np.float64(36.814)}]","[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(33.87)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.clone, aten.convolution, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 2432, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7']",0.019014777685920203,99.68190401898433 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (1, 512, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (33554432, 65536, 256, 1), ())","('', '', '1')",27058,3,23.405,7.801666666666667,0.41332956987533936,0.033554432,192.0,0.16666666666666666,vector_bf16,4.863714008193326,0.10654152556180534,0.8106190013655542,0.017756920926967516,41.40673828125,0.9002729161043719,124.22021484375,7.631,7.501,8.273,4.837242314648397,4.7729040297266945,4.980995680204885,0.8062070524413995,0.7954840049544492,0.8301659467008141,41.6201171875,40.4189453125,42.18115234375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(124.22), 'mean_duration_us': np.float64(41.406666666666666), 'median_duration_us': np.float64(41.62), 'std_dev_duration_us': np.float64(0.7349804230197037), 'min_duration_us': np.float64(40.419), 'max_duration_us': np.float64(42.181)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(41.41)}]","{'shape_in1': (1, 512, 256, 256), 'shape_in2': (1, 512, 256, 256), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (33554432, 65536, 256, 1), 'stride_input2': (33554432, 65536, 256, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.017434707425713916,99.69933872641003 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",156,24,167.869,6.994541666666667,0.9124549770508829,0.000236544,1.353515625,0.16666666666666666,vector_bf16,0.28015792972435755,0.029938919474100666,0.04669298828739291,0.004989819912350111,5.121663411458333,0.5496177307356938,122.919921875,6.69,6.279,10.546,0.27684094815905147,0.21741735896476921,0.344064,0.046140158026508574,0.0362362264941282,0.05734399999999999,5.126953125,4.125,6.52783203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(122.91999999999999), 'mean_duration_us': np.float64(5.121666666666666), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.5380385415769229), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (1, 77, 3072), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.017252207117640993,99.71659093352767 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",26754,6,236.452,39.40866666666667,18.4690841859218,0.041946112,32.005859375,1.2498626960395436,vector_bf16,1.6614942822631178,0.12358495556463041,2.0766397230836664,0.1544642257519363,20.2880859375,1.4392336798467016,121.728515625,32.0125,30.886,77.075,1.6444940762585691,1.54579119395466,1.8744936768211198,2.055391799773594,1.9320267491903564,2.342859720620722,20.427978515625,17.90380859375,21.7109375,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(40.815000000000005), 'mean_duration_us': np.float64(6.802500000000001), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.5678253105782916), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.851)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.91400000000002), 'mean_duration_us': np.float64(13.485666666666669), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8789754768415834), 'min_duration_us': np.float64(11.856), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.8)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.49)}]","{'op_shape': (1, 512, 128, 128), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (8388608, 16384, 128, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.017084989411408198,99.73367592293907 -triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2432,), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (1,), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '666', '2432')",18465,4,108.38,27.095,2.0221168775979974,0.003239424,9.36083984375,0.33002973240832506,vector_bfloat16,0.3412189619247622,0.011781128502206408,0.11261240269667572,0.0038881226870512717,28.791748046875,0.9892329482443104,115.1669921875,27.009500000000003,24.877,29.484,0.3403865093210463,0.32846814535947716,0.355634683697479,0.11233766858662875,0.10840425411764705,0.11737001949579831,28.842041015625,27.60009765625,29.8828125,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.167), 'mean_duration_us': np.float64(28.79175), 'median_duration_us': np.float64(28.842), 'std_dev_duration_us': np.float64(0.8567591187142386), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(29.883)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(28.79)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14']",0.01616405845388512,99.74983998139295 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 4864), (2, 4864))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (4864, 1))","('', '', '')",20398,8,268.69100000000003,33.586375000000004,2.892712465958947,0.047316992,22.59033203125,1.997535934291581,matrix_bf16,1.9130246613125643,0.0419805222067827,3.8213355041578287,0.08385760164837419,12.38751220703125,0.27056156311034085,99.10009765625,34.4215,29.244,37.065,1.907682604797483,1.853810563644006,1.9777556622773045,3.8106645543059376,3.7030532162482324,3.95063800464756,12.4169921875,11.97705078125,12.77783203125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(99.1), 'mean_duration_us': np.float64(12.3875), 'median_duration_us': np.float64(12.417), 'std_dev_duration_us': np.float64(0.253121018487205), 'min_duration_us': np.float64(11.977), 'max_duration_us': np.float64(12.778)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.39)}]","{'M': 2, 'N': 4864, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.01390901803438096,99.76374899942734 -aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), ())","('c10::BFloat16', '', 'ScalarList')","((512, 1, 65536, 512), (), ())","('', '', '[2., 2.]')",27016,1,45.798,45.798,,,,,,,,,,96.5009765625,,96.5009765625,45.798,45.798,45.798,,,,,,,96.5009765625,96.5009765625,96.5009765625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.487), 'mean_duration_us': np.float64(32.487), 'median_duration_us': np.float64(32.487), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.487), 'max_duration_us': np.float64(32.487)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.014), 'mean_duration_us': np.float64(64.014), 'median_duration_us': np.float64(64.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.014), 'max_duration_us': np.float64(64.014)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(32.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']]",0.013544223013775562,99.77729322244112 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), ())","('c10::BFloat16', 'double')","((33554432, 65536, 256, 1), ())","('', '')",27059,3,24.947,8.315666666666667,0.5741866711561093,0.033554432,128.00000762939453,0.2499999850988397,vector_bf16,4.2628518963360476,0.23752221117813557,1.0657129105625724,0.05938054925517739,31.552897135416668,1.8162073388792004,94.65869140625,8.062,7.912,8.973,4.391231581832995,3.9887673345812833,4.4085567725938635,1.097807830023803,0.9971917742080594,1.1021391274558547,30.56494140625,30.44482421875,33.64892578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(94.65899999999999), 'mean_duration_us': np.float64(31.552999999999997), 'median_duration_us': np.float64(30.565), 'std_dev_duration_us': np.float64(1.4829052565824967), 'min_duration_us': np.float64(30.445), 'max_duration_us': np.float64(33.649)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(31.55)}]","{'shape_in1': (1, 512, 256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (33554432, 65536, 256, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.013285652355736078,99.79057887479685 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((16384, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 16384), (1, 512))","('', '')",26801,3,115.902,38.634,14.048248538518957,8.589934592,32.5,252.06153846153848,matrix_bf16,1.2694183170035318,0.15815236098516106,319.9715339351672,39.86412742124429,27.146158854166668,3.616534916430768,81.4384765625,31.797,29.313,54.792,1.333433036434153,1.089293584717193,1.3855283298592498,336.10718259903325,274.56901680009986,349.2384024063685,25.55712890625,24.59619140625,31.28515625,"[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA4_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB0_LBSPPM0_LPA4_LPB0_LPM0_LRVW4_LWPMn1_MIAV0_MIWT4_8_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB8_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(81.438), 'mean_duration_us': np.float64(27.146), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(2.952893609100516), 'min_duration_us': np.float64(24.596), 'max_duration_us': np.float64(31.285)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(27.15)}]","{'M': 16384, 'N': 512, 'K': 512, 'bias': False, 'stride_A': (1, 16384), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, True)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA4_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB0_LBSPPM0_LPA4_LPB0_LPM0_LRVW4_LWPMn1_MIAV0_MIWT4_8_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB8_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.011430152603173396,99.80200902740002 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 64), (8192, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (64, 1))","('', '', '')",20448,4,143.603,35.90075,2.4016489300756136,2.550136832,39.296875,61.88787276341948,matrix_bf16,2.102580412527132,0.07858303974522783,130.12422904533722,4.863337165115389,19.6181640625,0.7299416556187925,78.47265625,35.206999999999994,33.921,39.268,2.097667245727664,2.0170031903248167,2.197983968328385,129.82016360358625,124.82803680623343,136.02855216794293,19.648193359375,18.7470703125,20.42919921875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(78.472), 'mean_duration_us': np.float64(19.618), 'median_duration_us': np.float64(19.648), 'std_dev_duration_us': np.float64(0.6320921610018587), 'min_duration_us': np.float64(18.747), 'max_duration_us': np.float64(20.429)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(19.62)}]","{'M': 8192, 'N': 64, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.01101389016560864,99.81302291756563 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",18408,8,246.877,30.859625,4.84119129192392,0.023658496,11.2998046875,1.9967159277504105,matrix_bf16,1.2575011956583773,0.20337447445741427,2.5108726665362675,0.4060810524469881,9.7286376953125,2.1861249338708104,77.8291015625,31.006,25.928,36.184,1.3030390292017253,0.7908661405990288,1.4152657058205995,2.601798784087517,1.5791350196525764,2.825883576810918,9.112548828125,8.3720703125,14.98193359375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(77.829), 'mean_duration_us': np.float64(9.728625), 'median_duration_us': np.float64(9.1125), 'std_dev_duration_us': np.float64(2.0449552524138515), 'min_duration_us': np.float64(8.372), 'max_duration_us': np.float64(14.982)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.73)}]","{'M': 2, 'N': 2432, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.010923565191504205,99.82394648275714 -aten::gather,other,python3,CPU,thread 416 (python3),"((32, 64), (), (65536, 64), (), (65536, 64))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((64, 1), (), (1, 0), (), (64, 1))","('', '0', '', 'False', '')",5211,2,26.83,13.415,0.1767766952966369,,,,,,,,,34.950439453125,0.8206996185939568,69.90087890625,13.415,13.29,13.54,,,,,,,34.950439453125,34.3701171875,35.53076171875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(69.901), 'mean_duration_us': np.float64(34.9505), 'median_duration_us': np.float64(34.9505), 'std_dev_duration_us': np.float64(0.5805000000000007), 'min_duration_us': np.float64(34.37), 'max_duration_us': np.float64(35.531)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(34.95)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.009810813594741128,99.83375729635188 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 4864), (4864,), (2, 333, 2432), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (809856, 2432, 1), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '666', '2432')",20402,4,128.74200000000002,32.185500000000005,1.8335569257593287,0.003239424,9.384033203125,0.3292140385565991,vector_bfloat16,0.5797662294255786,0.007654402123810458,0.1908671818079265,0.0025199366359158408,16.974365234375,0.2250174974772836,67.8974609375,32.338,29.805,34.261,0.5807052653385005,0.5699594947535142,0.5876948922717994,0.19117632561316922,0.18763866708148313,0.1934774089238845,16.945068359375,16.7431640625,17.26416015625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.89699999999999), 'mean_duration_us': np.float64(16.974249999999998), 'median_duration_us': np.float64(16.945), 'std_dev_duration_us': np.float64(0.19489917265088666), 'min_duration_us': np.float64(16.743), 'max_duration_us': np.float64(17.264)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(16.97)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23']",0.009529627427252127,99.84328692377913 -aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 16384, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 512, 1), (1,), ())","('', '', '1')",26803,3,29.774,9.924666666666667,3.295674488376141,0.008388608,32.0009765625,0.2499923708382923,vector_bf16,1.6930266731505812,0.06847488706448931,0.4232437519133803,0.01711819936013603,19.841634114583332,0.8098247697242251,59.52490234375,8.362,7.701,13.711,1.7026305408057083,1.6202568465129439,1.7561926321330914,0.42564464555770276,0.40505185042674585,0.4390347597556924,19.7080078125,19.10693359375,20.7099609375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.525), 'mean_duration_us': np.float64(19.841666666666665), 'median_duration_us': np.float64(19.708), 'std_dev_duration_us': np.float64(0.6612121864844571), 'min_duration_us': np.float64(19.107), 'max_duration_us': np.float64(20.71)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(19.84)}]","{'shape_in1': (1, 16384, 512), 'shape_in2': (512,), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (8388608, 512, 1), 'stride_input2': (1,), 'stride_output': None}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.008354511849885836,99.85164143562902 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((), (1, 16, 128, 128))","('float', 'c10::BFloat16')","((), (262144, 16384, 128, 1))","('', '')",20483,4,54.0,13.5,5.319032242805077,0.000262144,1.5000038146972656,0.16666624281249284,vector_fp32,0.10583075101983144,0.0030098973109926094,0.017638413646499703,0.0005016482760745645,14.8712158203125,0.4270736026430738,59.48486328125,10.931000000000001,10.666,21.472,0.10627978761983532,0.10198941438703141,0.10877401445262375,0.017713252889507643,0.016998192502532927,0.018128956304450595,14.801513671875,14.4599609375,15.421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(59.485), 'mean_duration_us': np.float64(14.87125), 'median_duration_us': np.float64(14.8015), 'std_dev_duration_us': np.float64(0.3699130810068764), 'min_duration_us': np.float64(14.46), 'max_duration_us': np.float64(15.422)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.87)}]","{'shape_in1': (), 'shape_in2': (1, 16, 128, 128), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (), 'stride_input2': (262144, 16384, 128, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})']",0.008348892238446865,99.85999032786746 -aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (512, 16, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((262144, 16384, 128, 1), (144, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",26747,1,259.465,259.465,,2.415919104,16.640625,138.456338028169,matrix_bf16,0.31542244143555703,,43.67223617307182,,55.3193359375,,55.3193359375,259.465,259.465,259.465,0.31542244143555703,0.31542244143555703,0.31542244143555703,43.67223617307182,43.67223617307182,43.67223617307182,55.3193359375,55.3193359375,55.3193359375,"[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.568), 'mean_duration_us': np.float64(6.568), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.568), 'max_duration_us': np.float64(6.568)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.553), 'mean_duration_us': np.float64(22.553), 'median_duration_us': np.float64(22.553), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.553), 'max_duration_us': np.float64(22.553)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA2_NLCB2_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU8_SUM0_SUS256_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.198), 'mean_duration_us': np.float64(26.198), 'median_duration_us': np.float64(26.198), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.198), 'max_duration_us': np.float64(26.198)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(6.57)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.55)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(26.2)}]","{'convNd': 'conv2d', 'input_shape': (1, 16, 128, 128), 'filter_shape': (512, 16, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (262144, 16384, 128, 1), 'weight_stride': (144, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['Im2d2Col_v2'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA2_NLCB2_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU8_SUM0_SUS256_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM1']]",0.0077642470532534305,99.86775457492072 -aten::sub,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",20458,4,208.71099999999998,52.177749999999996,0.7364606235230786,,,,,,,,,10.304443359375,12.785824794055774,41.2177734375,52.1075,51.407,53.089,,,,,,,3.94482421875,3.84521484375,29.48291015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(41.217999999999996), 'mean_duration_us': np.float64(10.304499999999999), 'median_duration_us': np.float64(3.945), 'std_dev_duration_us': np.float64(11.072868677537903), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(29.483)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(10.3)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::sub', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.005785047317186568,99.87353962223791 -triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6,triton,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '666', '2432')",18421,4,106.88,26.72,1.0263017749830354,0.003239424,6.266845703125,0.4929681717246484,vector_bfloat16,0.7738455934964579,5.1380594757869256e-05,0.3814812474231243,2.5328997859885855e-05,8.49169921875,0.0005638186222554939,33.966796875,26.3795,25.939,28.182,0.7738455934964579,0.773801096596136,0.7738900903967798,0.3814812474231243,0.38145931186752524,0.3815031829787234,8.49169921875,8.4912109375,8.4921875,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.966), 'mean_duration_us': np.float64(8.4915), 'median_duration_us': np.float64(8.4915), 'std_dev_duration_us': np.float64(0.0005000000000006111), 'min_duration_us': np.float64(8.491), 'max_duration_us': np.float64(8.492)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(8.49)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6']",0.004767349391958282,99.87830697162987 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2048), (2048, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2048, 1), (1, 2048), (2432, 1))","('', '', '')",18409,4,100.66,25.165,0.9785216740914153,0.019922944,9.51708984375,1.9964085988404905,matrix_bf16,1.4077244654612895,0.011089861041594647,2.8103932276450516,0.022139893943385655,7.08935546875,0.056164372579359176,28.357421875,24.947,24.236,26.53,1.4116556721646571,1.392030705353494,1.4155558121623493,2.8182415225114745,2.779062070017709,2.8260277955395487,7.0693359375,7.0498046875,7.1689453125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(28.358), 'mean_duration_us': np.float64(7.0895), 'median_duration_us': np.float64(7.0695), 'std_dev_duration_us': np.float64(0.04858240422210485), 'min_duration_us': np.float64(7.05), 'max_duration_us': np.float64(7.169)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]","{'M': 2, 'N': 2432, 'K': 2048, 'bias': False, 'stride_A': (2048, 1), 'stride_B': (1, 2048), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.003980055535727807,99.8822870271656 -aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((512,), (16384, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",26871,1,46.109,46.109,,8.5983232,32.5009765625,252.30011117454404,matrix_bf16,1.234768964387439,,311.5323469898275,,27.60009765625,,27.60009765625,46.109,46.109,46.109,1.234768964387439,1.234768964387439,1.234768964387439,311.5323469898275,311.5323469898275,311.5323469898275,27.60009765625,27.60009765625,27.60009765625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_7_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.6), 'mean_duration_us': np.float64(27.6), 'median_duration_us': np.float64(27.6), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(27.6)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.6)}]","{'M': 16384, 'N': 512, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_7_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.0038737626413150755,99.88616078980692 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'double')","((512, 1, 65536, 512), ())","('', '')",26947,3,25.569,8.523,0.12767145334803726,0.008388608,32.00000762939453,0.24999994039536944,vector_bf16,3.7863698265084067,0.09410203192276984,0.9465922309419269,0.023525502371775572,8.865559895833334,0.22076919151973087,26.5966796875,8.553,8.383,8.633,3.7905837674444265,3.69023161421974,3.8782940978610534,0.9476457159247614,0.922557683600043,0.9695732933009764,8.85205078125,8.65185546875,9.0927734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.596999999999998), 'mean_duration_us': np.float64(8.865666666666666), 'median_duration_us': np.float64(8.852), 'std_dev_duration_us': np.float64(0.18029666910092654), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(9.093)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (512, 1, 65536, 512), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.003732929696106717,99.88989371950304 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 16, 128, 128), (1, 16, 128, 128)), ())","('TensorList', 'Scalar')","(((262144, 16384, 128, 1), (262144, 16384, 128, 1)), ())","('', '0')",18396,4,110.723,27.68075,5.0079809221548235,,,,,,,,,6.358642578125,0.7197509098981358,25.4345703125,29.5735,20.27,31.306,,,,,,,6.569091796875,5.3271484375,6.96923828125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 4, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(25.433999999999997), 'mean_duration_us': np.float64(6.358499999999999), 'median_duration_us': np.float64(6.569), 'std_dev_duration_us': np.float64(0.6233223483880552), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(6.36)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 4, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.003569823900682924,99.89346354340371 -triton_poi_fused_addmm_silu_2,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), ())","('', '', '4864')",18407,8,176.935,22.116875,4.010765457312536,1.9456e-05,0.023193359375,0.8,vector_bfloat16,0.007899680204024272,0.000830827446175292,0.0063197441632194176,0.0006646619569402334,3.1087646484375,0.3277799647686495,24.8701171875,21.612499999999997,17.786,29.273,0.00795134583830203,0.006980709180098107,0.008675728967078907,0.006361076670641624,0.005584567344078487,0.006940583173663127,3.083984375,2.80322265625,3.48388671875,"[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(24.87), 'mean_duration_us': np.float64(3.10875), 'median_duration_us': np.float64(3.0839999999999996), 'std_dev_duration_us': np.float64(0.30680235901961384), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(3.484)}]","[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'mean_duration_us': np.float64(3.11)}]","{'fused_ops': 'aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_silu_2']",0.003490601085762796,99.89695414448947 -aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 16384), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",26788,1,43.284,43.284,,0.041946112,32.005859375,1.2498626960395436,vector_bf16,1.3579653781167267,,1.6972702686213301,,24.7138671875,,24.7138671875,43.284,43.284,43.284,1.3579653781167267,1.3579653781167267,1.3579653781167267,1.6972702686213301,1.6972702686213301,1.6972702686213301,24.7138671875,24.7138671875,24.7138671875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.809), 'mean_duration_us': np.float64(6.809), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(6.809)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(17.905), 'mean_duration_us': np.float64(17.905), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(17.905), 'max_duration_us': np.float64(17.905)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.81)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(17.9)}]","{'op_shape': (1, 512, 16384), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (8388608, 16384, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.0034686708947814456,99.90042281538425 -triton_poi_fused__to_copy_cat_slice_1,triton,python3,CPU,thread 416 (python3),"((2, 256), (2, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '512')",18405,4,89.864,22.466,0.6811436461324936,0.0,0.0009765625,0.0,vector_bfloat16,0.0001681110557934964,6.683776053354772e-06,0.0,0.0,6.0982666015625,0.23668209081633035,24.39306640625,22.378500000000003,21.752,23.355,0.00016656137219330403,0.00016179231600061718,0.00017752916278676034,0.0,0.0,0.0,6.14794921875,5.76806640625,6.3291015625,"[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(24.393), 'mean_duration_us': np.float64(6.09825), 'median_duration_us': np.float64(6.148), 'std_dev_duration_us': np.float64(0.20497606567597107), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(6.329)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'mean_duration_us': np.float64(6.1)}]","{'fused_ops': 'aten._to_copy, aten.cat, aten.slice', 'xnumel': 512, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_cat_slice', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_cat_slice_1']",0.0034236454714228607,99.90384646085568 -triton_poi_fused_addmm_clone_permute_view_25,triton,python3,CPU,thread 416 (python3),"((8192, 64), (64,), (2, 16, 64, 2, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((64, 1), (1,), (262144, 16384, 256, 128, 2, 1), (), ())","('', '', '', '32', '16384')",20449,4,123.213,30.80325,2.846714056006796,0.0,2.0313720703125,0.0,vector_bfloat16,0.3582185588680935,0.005826493818347321,0.0,0.0,5.9473876953125,0.09534735954134627,23.78955078125,29.609,28.953,35.042,0.3557645348010273,0.35454635110533156,0.36679881476498777,0.0,0.0,0.0,5.9873046875,5.80712890625,6.0078125,"[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(23.79), 'mean_duration_us': np.float64(5.9475), 'median_duration_us': np.float64(5.9875), 'std_dev_duration_us': np.float64(0.08270580390758536), 'min_duration_us': np.float64(5.807), 'max_duration_us': np.float64(6.008)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'mean_duration_us': np.float64(5.95)}]","{'fused_ops': 'aten.addmm, aten.clone, aten.permute, aten.view', 'xnumel': 16384, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_clone_permute_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_clone_permute_view_25']",0.0033389401087573958,99.90718540096444 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 256), (256, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (2432, 1))","('', '', '')",18406,4,303.76,75.94,2.2629047704223013,0.002490368,1.19775390625,1.9828781084386466,matrix_bf16,0.21933771753860043,0.003744450834736281,0.4349199584621902,0.00742478958832337,5.727294921875,0.09820929015034323,22.9091796875,75.2415,74.05,79.227,0.2200741225895731,0.214793897954071,0.2224087270211846,0.43638015991670753,0.425910118079332,0.44100939593601385,5.70751953125,5.64697265625,5.84716796875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.909), 'mean_duration_us': np.float64(5.72725), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.08497168646084413), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.847)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}]","{'M': 2, 'N': 2432, 'K': 256, 'bias': False, 'stride_A': (256, 1), 'stride_B': (1, 256), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.00321537718894685,99.91040077815339 -aten::argmax,reduce,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",1402,4,81.482,20.3705,3.974949098206583,,,,,,,,,5.59765625,0.26256004736612226,22.390625,19.4295,16.915,25.708,,,,,,,5.547607421875,5.3671875,5.92822265625,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.39), 'mean_duration_us': np.float64(5.5975), 'median_duration_us': np.float64(5.547499999999999), 'std_dev_duration_us': np.float64(0.22739887862520336), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::argmax', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)']",0.003142596367627494,99.91354337452101 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('float', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",20484,4,44.095,11.02375,0.30319451951951,0.000262144,2.5,0.1,vector_fp32,0.5696638661689855,0.01925345978273532,0.05696638661689855,0.0019253459782735385,4.605712890625,0.15711709075500374,18.4228515625,10.886,10.846,11.477,0.5717238154840321,0.5454342294016052,0.5897736043062726,0.0571723815484032,0.05454342294016052,0.05897736043062726,4.5859375,4.44482421875,4.80615234375,"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.423000000000002), 'mean_duration_us': np.float64(4.6057500000000005), 'median_duration_us': np.float64(4.586), 'std_dev_duration_us': np.float64(0.13594185337856768), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (1, 16, 128, 128), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (262144, 16384, 128, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::add', 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)']",0.0025857065803948304,99.9161290811014 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((512, 1, 65536, 512), ())","('', '')",26879,2,19.069,9.5345,0.9623723291948917,0.008388608,32.00000762939453,0.24999994039536944,vector_bf16,3.6540526689465587,0.16894613833063338,0.9135129494381802,0.04223652451268619,9.192626953125,0.42502365607453124,18.38525390625,9.5345,8.854,10.215,3.6540526689465587,3.5345897088776876,3.77351562901543,0.9135129494381802,0.883647216541508,0.9433786823348524,9.192626953125,8.89208984375,9.4931640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(18.384999999999998), 'mean_duration_us': np.float64(9.192499999999999), 'median_duration_us': np.float64(9.192499999999999), 'std_dev_duration_us': np.float64(0.30050000000000043), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.19)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'long int', None), 'stride_input1': (512, 1, 65536, 512), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.002580429628189943,99.9187095107296 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1401,4,47.852000000000004,11.963000000000001,0.9144663288862344,7.7e-08,0.000881195068359375,0.08333333333333333,,0.000204408392642626,1.991845552618759e-05,1.7034032720218834e-05,1.659871293848969e-06,4.55615234375,0.48984807208769054,18.224609375,11.7925,11.047,13.22,0.0002126285554446636,0.000174764684152198,0.00021761177552897883,1.7719046287055302e-05,1.4563723679349833e-05,1.8134314627414904e-05,4.345703125,4.24609375,5.287109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.224), 'mean_duration_us': np.float64(4.556), 'median_duration_us': np.float64(4.3454999999999995), 'std_dev_duration_us': np.float64(0.42424108711910485), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.56)}]","{'op_shape': (1, 77), 'dtype_in_out': ('int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.0025578826505872425,99.92126739338019 -aten::nonzero,other,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",20463,1,144.725,144.725,,,,,,,,,,17.4609375,,17.4609375,144.725,144.725,144.725,,,,,,,17.4609375,17.4609375,17.4609375,"[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.922), 'mean_duration_us': np.float64(1.922), 'median_duration_us': np.float64(1.922), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.922), 'max_duration_us': np.float64(1.922)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.805), 'mean_duration_us': np.float64(3.805), 'median_duration_us': np.float64(3.805), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(3.805)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.965), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(3.965)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}]","[{'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.92)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.8)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::nonzero', ['void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})'], ['Memcpy DtoD (Device -> Device)'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})']]",0.002450698842165893,99.92371809222236 -triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0,triton,python3,CPU,thread 416 (python3),"((2,), (2, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '512')",18404,4,213.96800000000002,53.492000000000004,13.28275034270639,3.072e-06,0.0,,,0.0,0.0,0.0007414546695004077,1.7788188898982248e-05,4.14501953125,0.10076276427281922,16.580078125,47.435500000000005,45.718,73.379,0.0,0.0,0.0,0.0007447272727272727,0.0007168933454876937,0.0007594707870593917,4.125,4.044921875,4.28515625,"[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.58), 'mean_duration_us': np.float64(4.145), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.285)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'stream': 0, 'mean_duration_us': np.float64(4.14)}]","{'fused_ops': 'aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 512, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0']",0.0023270673905085304,99.92604515961287 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 1280), (1280, 1280))","('c10::BFloat16', 'c10::BFloat16')","((1280, 1), (1, 1280))","('', '')",5016,2,88.441,44.2205,3.4627019074705245,0.0032768,3.1298828125,0.9984399375975039,matrix_bf16,0.3997147924815793,0.005479037827151149,0.3990912124621072,0.00547049018623518,8.21142578125,0.11255703645840552,16.4228515625,44.2205,41.772,46.669,0.3997147924815793,0.39584052767962313,0.4035890572835355,0.3990912124621072,0.39522299175500586,0.40295943316920857,8.21142578125,8.1318359375,8.291015625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(16.423000000000002), 'mean_duration_us': np.float64(8.211500000000001), 'median_duration_us': np.float64(8.211500000000001), 'std_dev_duration_us': np.float64(0.07950000000000035), 'min_duration_us': np.float64(8.132), 'max_duration_us': np.float64(8.291)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]","{'M': 1, 'N': 1280, 'K': 1280, 'bias': False, 'stride_A': (1280, 1), 'stride_B': (1, 1280), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.002305000135833547,99.9283501597487 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'bool', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5171,2,17.887,8.9435,0.013435028842543864,6.5536e-05,,,,,,0.008676379506827888,0.0005844485318503793,7.570556640625,0.5099593338928372,15.14111328125,8.9435,8.934,8.953,,,,0.008676379506827888,0.008263111986701963,0.009089647026953813,7.570556640625,7.2099609375,7.93115234375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(15.141), 'mean_duration_us': np.float64(7.5705), 'median_duration_us': np.float64(7.5705), 'std_dev_duration_us': np.float64(0.36050000000000004), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(7.931)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]","{'op_shape': (256, 256), 'dtype_in_out': ('long int', 'bool'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})']",0.002125104037939658,99.93047526378665 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",20459,4,95.543,23.88575,0.3737649662555347,0.000262144,1.0000076293945312,0.249998092665919,vector_bf16,0.27803774295407285,0.01866830191289951,0.06950890542765527,0.004667039871536402,3.7847900390625,0.26663028995436494,15.13916015625,23.911,23.435,24.286,0.2830870390932726,0.25175850316529896,0.2942183904644472,0.0707712198317606,0.06293914560375147,0.0735540364433484,3.705078125,3.56396484375,4.1650390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(15.139), 'mean_duration_us': np.float64(3.78475), 'median_duration_us': np.float64(3.705), 'std_dev_duration_us': np.float64(0.23088999003854627), 'min_duration_us': np.float64(3.564), 'max_duration_us': np.float64(4.165)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0021248299105523913,99.9326000936972 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",25,4,189.452,47.363,22.981442498967144,7.7e-08,0.0011749267578125,0.0625,,0.00034795994099494283,4.661040970475972e-05,2.1747496312183927e-05,2.9131506065474824e-06,3.584228515625,0.4348311081041389,14.3369140625,37.8365,32.548,81.231,0.00033264928894099143,0.0003107310344827586,0.00041581015161502974,2.0790580558811965e-05,1.9420689655172414e-05,2.598813447593936e-05,3.70458984375,2.962890625,3.96484375,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.337000000000002), 'mean_duration_us': np.float64(3.5842500000000004), 'median_duration_us': np.float64(3.7045000000000003), 'std_dev_duration_us': np.float64(0.3765510423568098), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.965)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.58)}]","{'op_shape': (1, 77), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.0020122320862325208,99.93461232578343 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('float', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",20477,4,79.65,19.9125,0.27813366091383684,0.000262144,1.5,0.16666666666666666,vector_fp32,0.442202039589035,0.02304089823211664,0.07370033993150582,0.003840149705352772,3.564453125,0.19360992946960456,14.2578125,19.86,19.64,20.29,0.44890337639244104,0.4090445043809524,0.46195690119030547,0.07481722939874016,0.06817408406349205,0.07699281686505091,3.50390625,3.40478515625,3.84521484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.258000000000001), 'mean_duration_us': np.float64(3.5645000000000002), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.16751193987295365), 'min_duration_us': np.float64(3.405), 'max_duration_us': np.float64(3.845)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.56)}]","{'op_shape': (1, 16, 128, 128), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (262144, 16384, 128, 1), 'stride_output': (262144, 16384, 128, 1)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.0020011299270482124,99.93661345571049 -triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5,triton,python3,CPU,thread 416 (python3),"((2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1), (2, 4096, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (4096, 1, 8192), (4096, 1, 8192), (), ())","('', '', '', '', '', '8192', '19')",18418,4,100.35900000000001,25.089750000000002,1.2790182107121606,0.000155648,0.0,,,0.0,0.0,0.044581133166009465,0.001511515479090946,3.4942626953125,0.11484846594160597,13.97705078125,25.192500000000003,23.755,26.219,0.0,0.0,0.0,0.043914696721771784,0.04367270913823812,0.04682243008225618,3.54443359375,3.32421875,3.56396484375,"[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.977), 'mean_duration_us': np.float64(3.49425), 'median_duration_us': np.float64(3.5445), 'std_dev_duration_us': np.float64(0.09957503452171139), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.clone, aten.convolution, aten.native_layer_norm, aten.slice, aten.transpose, aten.view', 'xnumel': 8192, 'rnumel': 19}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5']",0.0019617241151285983,99.93857517982562 -aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 768), (768, 768))","('c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768))","('', '')",1415,2,94.88,47.44,8.42729861818127,0.001179648,1.1279296875,0.9974025974025974,matrix_bf16,0.17181775296139734,0.007069432797830054,0.1713714730835755,0.007051070634718818,6.889404296875,0.28346419304402126,13.77880859375,47.44,41.481,53.399,0.17181775296139734,0.1668189090909091,0.17681659683188555,0.1713714730835755,0.1663856132231405,0.17635733294401051,6.889404296875,6.68896484375,7.08984375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.779), 'mean_duration_us': np.float64(6.8895), 'median_duration_us': np.float64(6.8895), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.09)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(6.89)}]","{'M': 1, 'N': 768, 'K': 768, 'bias': False, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0019339001853210104,99.94050908001094 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",20460,4,40.211,10.05275,0.29292817663493387,0.000262144,1.5,0.16666666666666666,vector_bf16,0.4587556569474247,0.03613384601984402,0.07645927615790411,0.006022307669974005,3.4444580078125,0.2698734709293077,13.77783203125,10.025500000000001,9.785,10.375,0.45690230962562683,0.4177441929710803,0.5034738155673648,0.07615038493760448,0.0696240321618467,0.0839123025945608,3.4443359375,3.1240234375,3.76513671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.778), 'mean_duration_us': np.float64(3.4445), 'median_duration_us': np.float64(3.4444999999999997), 'std_dev_duration_us': np.float64(0.23366696386096175), 'min_duration_us': np.float64(3.124), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (1, 16, 128, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (262144, 16384, 128, 1), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.001933763121627377,99.94244284313257 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'float', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",20488,4,32.077,8.01925,0.19403672332834324,0.000262144,1.5,0.16666666666666666,vector_bf16,0.4649342648875561,0.010455401439686662,0.07748904414792601,0.0017425669066144418,3.38427734375,0.07683981154707822,13.537109375,8.036999999999999,7.781,8.222,0.4676212078152885,0.451341666246322,0.47315297767332554,0.07793686796921476,0.07522361104105366,0.07885882961222092,3.364013671875,3.32421875,3.48486328125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536999999999999), 'mean_duration_us': np.float64(3.3842499999999998), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0667097256777451), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.485)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]","{'op_shape': (1, 16, 128, 128), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (262144, 16384, 128, 1), 'stride_output': (262144, 16384, 128, 1)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.001899976921146734,99.94434282005372 -triton_poi_fused_add_addmm_silu_22,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '4864')",20392,4,102.68299999999999,25.670749999999998,2.1531769357548547,2.432e-05,0.06494140625,0.35714285714285715,vector_bfloat16,0.020584887980653954,0.0016720264371797874,0.0073517457073764125,0.0005971522989927814,3.3236083984375,0.2555605086823307,13.29443359375,25.512999999999998,23.735,27.922,0.02012489028359386,0.019106810247979177,0.022982961107448914,0.007187460815569236,0.006823860802849706,0.00820820039551747,3.3837890625,2.962890625,3.56396484375,"[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.295000000000002), 'mean_duration_us': np.float64(3.3237500000000004), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.22131467981134914), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_22']",0.0018659165932788247,99.946208736647 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('float', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5182,2,14.350999999999999,7.1754999999999995,0.6583164132846755,6.5536e-05,0.75,0.08333333333333333,vector_fp32,0.11866382322961364,0.0025340510883724607,0.009888651935801136,0.00021117092403103737,6.62890625,0.14155946303051,13.2578125,7.1754999999999995,6.71,7.641,0.11866382322961364,0.11687197852115232,0.12045566793807495,0.009888651935801136,0.00973933154342936,0.010037972328172912,6.62890625,6.52880859375,6.72900390625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.258), 'mean_duration_us': np.float64(6.629), 'median_duration_us': np.float64(6.629), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.63)}]","{'op_shape': (256, 256), 'dtype_in_out': ('float', 'long int'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})']",0.0018607767047675704,99.94806951335177 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (8388608, 16384, 128, 1), ())","('', '', '1')",26781,1,8.593,8.593,,0.008388608,48.0,0.16666666666666666,vector_bf16,3.9513633267144557,,0.6585605544524092,,12.73779296875,,12.73779296875,8.593,8.593,8.593,3.9513633267144557,3.9513633267144557,3.9513633267144557,0.6585605544524092,0.6585605544524092,0.6585605544524092,12.73779296875,12.73779296875,12.73779296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.738), 'mean_duration_us': np.float64(12.738), 'median_duration_us': np.float64(12.738), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.738), 'max_duration_us': np.float64(12.738)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(12.74)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (1, 512, 128, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (8388608, 16384, 128, 1), 'stride_input2': (8388608, 16384, 128, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0017877902879077643,99.94985730363967 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (), ())","('long int', 'long int', 'Scalar')","((256, 1), (), ())","('', '', '1')",5173,4,28.461,7.11525,0.49590077972648244,6.5536e-05,1.0000076293945312,0.06249952316647975,,0.3354102272086957,0.018940029952049627,0.02096297926570411,0.0011837428407619468,3.1337890625,0.177498125952915,12.53515625,7.0455000000000005,6.599,7.771,0.3361487217642716,0.3154377250293772,0.3539057402768622,0.021009134823288648,0.01971470740305523,0.022118940013183916,3.1240234375,2.962890625,3.32421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(3.13375), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.1535746968090772), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.324)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.13)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0017593495714788255,99.95161665321115 -triton_poi_fused_add_addmm_silu_21,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '4864')",20338,4,104.155,26.03875,3.840230754785444,2.432e-05,0.0556640625,0.4166666666666667,vector_bfloat16,0.01885723387272625,0.0010973936284998697,0.007857180780302606,0.0004572473452082783,3.1033935546875,0.18656449590027488,12.41357421875,24.5565,23.415,31.627,0.019053717110242667,0.017351961678037448,0.019969539592382225,0.007939048795934444,0.007229984032515605,0.008320641496825928,3.0634765625,2.9228515625,3.36376953125,"[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.414000000000001), 'mean_duration_us': np.float64(3.1035000000000004), 'median_duration_us': np.float64(3.0635000000000003), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(2.923), 'max_duration_us': np.float64(3.364)}]","[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'mean_duration_us': np.float64(3.1)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_21']",0.0017422851416214625,99.95335893835276 -aten::gather,other,python3,CPU,thread 416 (python3),"((32128, 4096), (), (256, 4096), (), (256, 4096))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((4096, 1), (), (1, 0), (), (4096, 1))","('', '0', '', 'False', '')",5083,2,40.138999999999996,20.069499999999998,1.2042028483606888,,,,,,,,,5.908203125,2.974129791572715,11.81640625,20.069499999999998,19.218,20.921,,,,,,,5.908203125,3.80517578125,8.01123046875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.815999999999999), 'mean_duration_us': np.float64(5.9079999999999995), 'median_duration_us': np.float64(5.9079999999999995), 'std_dev_duration_us': np.float64(2.1029999999999993), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0016584706929646145,99.95501740904572 -aten::index,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 1280), ())","('c10::BFloat16', '')","((98560, 1280, 1), ())","('', '')",5005,2,47.150999999999996,23.575499999999998,2.153140148713037,,,,,,,,,5.867431640625,0.19852851522571524,11.73486328125,23.575499999999998,22.053,25.098,,,,,,,5.867431640625,5.72705078125,6.0078125,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.735), 'mean_duration_us': np.float64(5.8675), 'median_duration_us': np.float64(5.8675), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.87)}]",,False,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::index', 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.001647025874546222,99.95666443492027 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 77, 4096), (1, 256, 4096)), ())","('TensorList', 'Scalar')","(((315392, 4096, 1), (1048576, 4096, 1)), ())","('', '-2')",9180,2,42.772999999999996,21.386499999999998,1.0839946955589745,,,,,,,,,5.62744140625,0.1988737822087165,11.2548828125,21.386499999999998,20.62,22.153,,,,,,,5.62744140625,5.48681640625,5.76806640625,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.254999999999999), 'mean_duration_us': np.float64(5.6274999999999995), 'median_duration_us': np.float64(5.6274999999999995), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.487), 'max_duration_us': np.float64(5.768)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(5.63)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0015796590691253868,99.95824409398939 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'float', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5190,2,10.846,5.423,0.049497474683058526,6.5536e-05,0.75,0.08333333333333333,,0.14182547560451392,0.0036194682899149014,0.011818789633709493,0.00030162235749290847,5.546875,0.14155946303051,11.09375,5.423,5.388,5.458,0.14182547560451392,0.13926612503242541,0.14438482617660242,0.011818789633709493,0.011605510419368784,0.012032068848050201,5.546875,5.44677734375,5.64697265625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.094000000000001), 'mean_duration_us': np.float64(5.547000000000001), 'median_duration_us': np.float64(5.547000000000001), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(5.447), 'max_duration_us': np.float64(5.647)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.55)}]","{'op_shape': (256, 256), 'dtype_in_out': ('long int', 'float'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})']",0.0015570435596758694,99.95980113754906 -aten::clamp,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((3145728, 1048576, 1024, 1), (), ())","('', '0', '1')",27343,1,23.875,23.875,,,,,,,,,,10.89501953125,,10.89501953125,23.875,23.875,23.875,,,,,,,10.89501953125,10.89501953125,10.89501953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.895), 'mean_duration_us': np.float64(10.895), 'median_duration_us': np.float64(10.895), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(10.895)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(10.9)}]",,False,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::clamp', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0015291510980214643,99.96133028864709 -aten::index,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",1404,2,58.266000000000005,29.133000000000003,6.8264088655749315,,,,,,,,,5.287109375,0.16987135563661201,10.57421875,29.133000000000003,24.306,33.96,,,,,,,5.287109375,5.1669921875,5.4072265625,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(10.574), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",,False,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::index', 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.0014841256746628796,99.96281441432176 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 2048), (1, 77, 2048), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((315392, 4096, 1), (157696, 2048, 1), ())","('', '', 'False')",9179,2,14.832,7.416,0.261629509039023,0.000157696,0.6015625,0.25,vector_bf16,0.13146708067116858,0.007753461466496543,0.032866770167792145,0.0019383653666241358,4.806396484375,0.28346419304402126,9.61279296875,7.416,7.231,7.601,0.13146708067116858,0.1259845554905403,0.13694960585179689,0.032866770167792145,0.031496138872635075,0.03423740146294922,4.806396484375,4.60595703125,5.0068359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.613), 'mean_duration_us': np.float64(4.8065), 'median_duration_us': np.float64(4.8065), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","{'op_shape': (1, 77, 2048), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (315392, 4096, 1), 'stride_output': (157696, 2048, 1)}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.0013491864682807588,99.96416360079003 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((8388608, 16384, 128, 1), ())","('', '')",26782,1,8.703,8.703,,0.008388608,32.00000762939453,0.24999994039536944,vector_bf16,3.6584057240204433,,0.9146012129471891,,9.171875,,9.171875,8.703,8.703,8.703,3.6584057240204433,3.6584057240204433,3.6584057240204433,0.9146012129471891,0.9146012129471891,0.9146012129471891,9.171875,9.171875,9.171875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.172), 'mean_duration_us': np.float64(9.172), 'median_duration_us': np.float64(9.172), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.172), 'max_duration_us': np.float64(9.172)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.17)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'long int', None), 'stride_input1': (8388608, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.001287302210605261,99.96545090300063 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 77, 768), (1, 77, 1280)), ())","('TensorList', 'Scalar')","(((59136, 768, 1), (98560, 1280, 1)), ())","('', '-1')",5048,2,46.71,23.355,0.2687005768508899,,,,,,,,,4.505859375,0.08493567781830601,9.01171875,23.355,23.165,23.545,,,,,,,4.505859375,4.44580078125,4.56591796875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.012), 'mean_duration_us': np.float64(4.506), 'median_duration_us': np.float64(4.506), 'std_dev_duration_us': np.float64(0.06000000000000005), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(4.566)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.001264823764849377,99.96671572676549 -aten::sub,elementwise,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",20482,4,53.568,13.392,0.5482420390058885,,,,,,,,,2.10205078125,0.1007627642728192,8.408203125,13.179,13.009,14.201,,,,,,,2.08203125,2.001953125,2.2421875,"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.408), 'mean_duration_us': np.float64(2.102), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(2.002), 'max_duration_us': np.float64(2.242)}]","[{'name': 'void at::native::unrolled_elementwise_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::sub', 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)']",0.0011801184021839114,99.96789584516767 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 333, 4096), (1, 333, 4096)), ())","('TensorList', 'Scalar')","(((1363968, 4096, 1), (1363968, 4096, 1)), ())","('', '0')",18362,1,9.123,9.123,,,,,,,,,,8.2109375,,8.2109375,9.123,9.123,9.123,,,,,,,8.2109375,8.2109375,8.2109375,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.211), 'mean_duration_us': np.float64(8.211), 'median_duration_us': np.float64(8.211), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.211)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0011524315360699569,99.96904827670375 -aten::sub,elementwise,python3,CPU,thread 416 (python3),"((1, 256), (256, 1), ())","('long int', 'long int', 'Scalar')","((256, 1), (1, 1), ())","('', '', '1')",5166,2,26.78,13.39,0.38325187540310923,,,,,,,,,4.0048828125,0.113247570424408,8.009765625,13.39,13.119,13.661,,,,,,,4.0048828125,3.9248046875,4.0849609375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.01), 'mean_duration_us': np.float64(4.005), 'median_duration_us': np.float64(4.005), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]",,False,transformers/models/t5/modeling_t5.py(236): compute_bias,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'aten::sub', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.0011241964151814682,99.97017247311892 -aten::lt,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '8')",5178,2,22.474,11.237,0.0848528137423864,,,,,,,,,3.98486328125,0.028311892606102,7.9697265625,11.237,11.177,11.297,,,,,,,3.98486328125,3.96484375,4.0048828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.97), 'mean_duration_us': np.float64(3.985), 'median_duration_us': np.float64(3.985), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.005)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.98)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::lt', 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)']",0.0011185768037424973,99.97129104992267 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 768), (1, 1280)), ())","('TensorList', 'Scalar')","(((768, 1), (1280, 1)), ())","('', '-1')",9181,2,18.978,9.489,0.28991378028648457,,,,,,,,,3.964599609375,0.39671176346842923,7.92919921875,9.489,9.284,9.694,,,,,,,3.964599609375,3.68408203125,4.2451171875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.929), 'mean_duration_us': np.float64(3.9645), 'median_duration_us': np.float64(3.9645), 'std_dev_duration_us': np.float64(0.28049999999999997), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(4.245)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.96)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0011128886604567095,99.97240393858313 -aten::where,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), (256, 256))","('bool', 'long int', 'long int')","((256, 1), (256, 1), (256, 1))","('', '', '')",5198,2,41.813,20.9065,4.92217030383956,,,,,,,,,3.864990234375,0.027966625623100757,7.72998046875,20.9065,17.426,24.387,,,,,,,3.864990234375,3.84521484375,3.884765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array >(int, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.73), 'mean_duration_us': np.float64(3.865), 'median_duration_us': np.float64(3.865), 'std_dev_duration_us': np.float64(0.019999999999999796), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.885)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.86)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::where', 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array >(int, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array)']",0.001084927666955488,99.97348886625008 -aten::add_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', '1')",5201,2,21.072000000000003,10.536000000000001,1.316632826569352,6.5536e-05,1.5,0.041666666666666664,,0.43636216893953483,8.359649111635002e-05,0.018181757039147282,3.4831871298454644e-06,3.6044921875,0.0006905339660024879,7.208984375,10.536000000000001,9.605,11.467,0.43636216893953483,0.43630305729378305,0.43642128058528656,0.018181757039147282,0.018179294053907627,0.018184220024386938,3.6044921875,3.60400390625,3.60498046875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.209), 'mean_duration_us': np.float64(3.6045), 'median_duration_us': np.float64(3.6045), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(3.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","{'shape_in1': (256, 256), 'shape_in2': (256, 256), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (256, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::add_', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0010118041864020481,99.97450067043648 -aten::gather,other,python3,CPU,thread 416 (python3),"((49408, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1482,2,40.46,20.23,0.056568542494922595,,,,,,,,,3.424560546875,0.48164744128673526,6.84912109375,20.23,20.19,20.27,,,,,,,3.424560546875,3.083984375,3.76513671875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.849), 'mean_duration_us': np.float64(3.4245), 'median_duration_us': np.float64(3.4245), 'std_dev_duration_us': np.float64(0.3405), 'min_duration_us': np.float64(3.084), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0009612962152981258,99.97546196665178 -aten::gt,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '0')",5167,2,33.248000000000005,16.624000000000002,1.742311108843656,,,,,,,,,3.424072265625,0.14121419604750876,6.84814453125,16.624000000000002,15.392,17.856,,,,,,,3.424072265625,3.32421875,3.52392578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::gt', 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)']",0.0009611591516044923,99.97642312580338 -aten::abs,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (0,))","('long int', 'long int')","((256, 1), (1,))","('', '')",5176,2,25.859,12.9295,0.05727564927611189,,,,,,,,,3.423828125,0.028311892606102,6.84765625,12.9295,12.889,12.97,,,,,,,3.423828125,3.40380859375,3.44384765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AbsFunctor, std::array >(int, at::native::AbsFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.404), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Ab...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::abs', 'aten::abs', 'void at::native::vectorized_elementwise_kernel<4, at::native::AbsFunctor, std::array >(int, at::native::AbsFunctor, std::array)']",0.0009610906197576757,99.97738421642313 -aten::gather,other,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",37,2,70.885,35.4425,17.68969034494386,,,,,,,,,3.343994140625,0.14121419604750876,6.68798828125,35.4425,22.934,47.951,,,,,,,3.343994140625,3.244140625,3.44384765625,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.688000000000001), 'mean_duration_us': np.float64(3.3440000000000003), 'median_duration_us': np.float64(3.3440000000000003), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.34)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0009386807058486084,99.97832289712898 -aten::min,reduce,python3,CPU,thread 416 (python3),"((256, 256), (256, 256))","('long int', 'long int')","((256, 1), (256, 1))","('', '')",5196,2,30.924999999999997,15.462499999999999,0.5946768029778854,6.5536e-05,0.5000076293945312,0.12499809268047057,,0.15782268954784814,0.005360614107885869,0.019727535175183056,0.0006700665390817568,3.323974609375,0.11290230344140675,6.64794921875,15.462499999999999,15.042,15.883,0.15782268954784814,0.15403216296083777,0.16161321613485852,0.019727535175183056,0.019253726581552146,0.020201343768813967,3.323974609375,3.244140625,3.40380859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BinaryFunctor, std::array >(int, at::native::BinaryFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.648), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.07999999999999985), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.404)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]","{'num_input_elems': 65536, 'num_output_elems': 1, 'dtype_in_out': ('long int', None), 'reduce_type': 'min'}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::min', 'aten::minimum', 'void at::native::vectorized_elementwise_kernel<4, at::native::BinaryFunctor, std::array >(int, at::native::BinaryFunctor, std::array)']",0.0009330610944096372,99.97925595822339 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'long int')","((256, 1), ())","('', '')",5172,2,22.112000000000002,11.056000000000001,0.1414213562373109,6.5536e-05,1.0000076293945312,0.06249952316647975,,0.3210768746606883,0.033256019157474094,0.0200671515660766,0.0020784853397574476,3.283447265625,0.3400879782562253,6.56689453125,11.056000000000001,10.956,11.156,0.3210768746606883,0.29756131799916863,0.34459243132220796,0.0200671515660766,0.018597440487737284,0.021536862644415917,3.283447265625,3.04296875,3.52392578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.567), 'mean_duration_us': np.float64(3.2835), 'median_duration_us': np.float64(3.2835), 'std_dev_duration_us': np.float64(0.24049999999999994), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.28)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0009216848078380618,99.98017764303123 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1048576, 1048576, 1048576, 1048576, 4096, 1), ())","('', '', 'False')",9170,2,32.879,16.4395,0.7148849557795997,0.001048576,4.0,0.25,vector_bf16,1.286461166118709,0.05593962523760452,0.32161529152967727,0.01398490630940113,3.263427734375,0.14190473001351125,6.52685546875,16.4395,15.934,16.945,1.286461166118709,1.2469058777761648,1.3260164544612534,0.32161529152967727,0.3117264694440412,0.33150411361531334,3.263427734375,3.1630859375,3.36376953125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.526999999999999), 'mean_duration_us': np.float64(3.2634999999999996), 'median_duration_us': np.float64(3.2634999999999996), 'std_dev_duration_us': np.float64(0.10050000000000003), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(3.364)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.26)}]","{'op_shape': (1, 1, 1, 1, 256, 4096), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1048576, 1048576, 4096, 1048576, 4096, 1), 'stride_output': (1048576, 1048576, 1048576, 1048576, 4096, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0009160651963990909,99.98109370822762 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), ())","('c10::BFloat16', 'double')","((3145728, 1048576, 1024, 1), ())","('', '')",27341,1,13.299,13.299,,0.003145728,12.000007629394531,0.24999984105438167,vector_bf16,1.951076632344034,,0.4877688479709268,,6.44921875,,6.44921875,13.299,13.299,13.299,1.951076632344034,1.951076632344034,1.951076632344034,0.4877688479709268,0.4877688479709268,0.4877688479709268,6.44921875,6.44921875,6.44921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.449), 'mean_duration_us': np.float64(6.449), 'median_duration_us': np.float64(6.449), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.449), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.45)}]","{'shape_in1': (1, 3, 1024, 1024), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (3145728, 1048576, 1024, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0009051686327552325,99.98199887686037 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '15')",5195,2,17.486,8.743,0.5246732316404189,,,,,,,,,3.0634765625,0.3121213526331245,6.126953125,8.743,8.372,9.114,,,,,,,3.0634765625,2.8427734375,3.2841796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.127), 'mean_duration_us': np.float64(3.0635), 'median_duration_us': np.float64(3.0635), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.06)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::full_like', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0008599376138561975,99.98285881447423 -aten::log,elementwise,python3,CPU,thread 416 (python3),"((256, 256),)","('float',)","((256, 1),)","('',)",5184,2,25.167,12.5835,0.021920310216784013,,,,,,,,,3.04345703125,0.0006905339660024879,6.0869140625,12.5835,12.568,12.599,,,,,,,3.04345703125,3.04296875,3.0439453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.087), 'mean_duration_us': np.float64(3.0435), 'median_duration_us': np.float64(3.0435), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::lo...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::log', 'void at::native::vectorized_elementwise_kernel<4, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.0008543180024172265,99.98371313247664 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 768), (1, 1, 1, 1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 59136, 768, 59136, 768, 1), (59136, 59136, 59136, 59136, 768, 1), ())","('', '', 'False')",1431,2,30.155,15.0775,3.4909861787179852,5.9136e-05,0.2255859375,0.25,vector_bf16,0.07881544776038232,0.009602730785797826,0.01970386194009558,0.002400682696449453,3.023681640625,0.36839987086232723,6.04736328125,15.0775,12.609,17.546,0.07881544776038232,0.07202529170383586,0.08560560381692879,0.01970386194009558,0.018006322925958964,0.021401400954232194,3.023681640625,2.76318359375,3.2841796875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.047), 'mean_duration_us': np.float64(3.0235), 'median_duration_us': np.float64(3.0235), 'std_dev_duration_us': np.float64(0.26049999999999995), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.284)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.02)}]","{'op_shape': (1, 1, 1, 1, 77, 768), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (59136, 59136, 768, 59136, 768, 1), 'stride_output': (59136, 59136, 59136, 59136, 768, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0008487669228250723,99.98456189939947 -aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '256', '1', '')",5155,4,40.260000000000005,10.065000000000001,5.556253593924596,,,,,,,,,1.5009765625,0.41580065693768986,6.00390625,8.252500000000001,5.849,17.906,,,,,,,1.32080078125,1.240234375,2.1220703125,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.004), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.321), 'std_dev_duration_us': np.float64(0.36005624560615523), 'min_duration_us': np.float64(1.24), 'max_duration_us': np.float64(2.122)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.0008426675884583842,99.98540456698792 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (), ())","('c10::BFloat16', 'double', 'Scalar')","((3145728, 1048576, 1024, 1), (), ())","('', '', '1')",27342,1,8.964,8.964,,0.003145728,12.000007629394531,0.24999984105438167,vector_bf16,2.1084781672394044,,0.527119206676485,,5.9677734375,,5.9677734375,8.964,8.964,8.964,2.1084781672394044,2.1084781672394044,2.1084781672394044,0.527119206676485,0.527119206676485,0.527119206676485,5.9677734375,5.9677734375,5.9677734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]","{'shape_in1': (1, 3, 1024, 1024), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (3145728, 1048576, 1024, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.000837596231793947,99.98624216321971 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 1280), (1, 1, 1, 1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 98560, 1280, 98560, 1280, 1), (98560, 98560, 98560, 98560, 1280, 1), ())","('', '', 'False')",5032,2,31.196,15.598,0.9277240969167512,9.856e-05,0.3759765625,0.25,vector_bf16,0.13245858379797232,0.008800490467240142,0.03311464594949308,0.0022001226168100354,2.98291015625,0.198183248242714,5.9658203125,15.598,14.942,16.254,0.13245858379797232,0.12623569731081927,0.1386814702851254,0.03311464594949308,0.03155892432770482,0.03467036757128135,2.98291015625,2.8427734375,3.123046875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.966), 'mean_duration_us': np.float64(2.983), 'median_duration_us': np.float64(2.983), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.123)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.98)}]","{'op_shape': (1, 1, 1, 1, 77, 1280), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (98560, 98560, 1280, 98560, 1280, 1), 'stride_output': (98560, 98560, 98560, 98560, 1280, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.00083732210440668,99.98707948532412 -aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1396,4,48.543,12.13575,1.4513578412415498,,,,,,,,,1.4608154296875,0.25613361444813626,5.84326171875,11.472000000000001,11.297,14.302,,,,,,,1.36083984375,1.28076171875,1.8408203125,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(5.843999999999999), 'mean_duration_us': np.float64(1.4609999999999999), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(0.22181073012818836), 'min_duration_us': np.float64(1.281), 'max_duration_us': np.float64(1.841)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.0008201206108556833,99.98789960593497 -aten::_local_scalar_dense,other,python3,CPU,thread 416 (python3),"((1,),)","('long int',)","((1,),)","('',)",20473,1,23.455,23.455,,,,,,,,,,5.80810546875,,5.80810546875,23.455,23.455,23.455,,,,,,,5.80810546875,5.80810546875,5.80810546875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.81)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::item', 'aten::_local_scalar_dense', 'Memcpy DtoD (Device -> Device)']",0.0008151863178848795,99.98871479225285 -aten::gather,other,python3,CPU,thread 416 (python3),"((77, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1495,2,21.802999999999997,10.901499999999999,0.14919953083036236,,,,,,,,,2.903564453125,0.14052366208150627,5.80712890625,10.901499999999999,10.796,11.007,,,,,,,2.903564453125,2.80419921875,3.0029296875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.807), 'mean_duration_us': np.float64(2.9035), 'median_duration_us': np.float64(2.9035), 'std_dev_duration_us': np.float64(0.09950000000000013), 'min_duration_us': np.float64(2.804), 'max_duration_us': np.float64(3.003)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.9)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0008150492541912462,99.98952984150704 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5072,2,69.344,34.672,1.5160369388639543,2.56e-07,0.00390625,0.0625,,0.001441005046664297,2.8525194290411314e-05,9.006281541651856e-05,1.782824643150707e-06,2.843017578125,0.05627851822920276,5.68603515625,34.672,33.6,35.744,0.001441005046664297,0.0014208346883468833,0.0014611754049817106,9.006281541651856e-05,8.880216802168021e-05,9.132346281135691e-05,2.843017578125,2.80322265625,2.8828125,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.686), 'mean_duration_us': np.float64(2.843), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(2.883)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","{'op_shape': (1, 256), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.0007980533561806997,99.99032789486321 -aten::gather,other,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",50,2,20.951,10.4755,1.0047987360660835,,,,,,,,,2.703125,0.028311892606102,5.40625,10.4755,9.765,11.186,,,,,,,2.703125,2.68310546875,2.72314453125,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.406), 'mean_duration_us': np.float64(2.703), 'median_duration_us': np.float64(2.703), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(2.683), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.7)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0007587846079547194,99.99108667947117 -aten::normal_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), (), ())","('c10::BFloat16', 'Scalar', 'Scalar', '')","((262144, 16384, 128, 1), (), (), ())","('', '0.', '1.', '')",18366,1,19.279,19.279,,,,,,,,,,5.2470703125,,5.2470703125,19.279,19.279,19.279,,,,,,,5.2470703125,5.2470703125,5.2470703125,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",,False,diffusers/utils/torch_utils.py(152): randn_tensor,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(633): prepare_latents', 'diffusers/utils/torch_utils.py(152): randn_tensor', 'aten::randn', 'aten::normal_', 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})']",0.0007364432258924688,99.99182312269706 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",20500,3,68.612,22.870666666666665,4.080723261057203,1e-09,7.62939453125e-06,0.125,vector_fp32,4.745146984886265e-06,6.621960788630501e-07,5.931433731107831e-07,8.277450985788126e-08,1.7083333333333333,0.24154693224356558,5.125,24.396,18.247,25.969,4.755878084179971e-06,4.077650572424091e-06,5.401912298054731e-06,5.944847605224964e-07,5.097063215530114e-07,6.752390372568414e-07,1.68212890625,1.48095703125,1.9619140625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.125), 'mean_duration_us': np.float64(1.7083333333333333), 'median_duration_us': np.float64(1.682), 'std_dev_duration_us': np.float64(0.19724829248662426), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.962)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.71)}]","{'op_shape': (1,), 'dtype_in_out': ('float', 'float'), 'stride_input': (1,), 'stride_output': (1,)}",True,torch/_dynamo/eval_frame.py(1039): _fn,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', 'torch/_inductor/utils.py(3041): copy_misaligned_inputs', 'torch/_inductor/utils.py(3029): clone_preserve_strides', 'aten::clone', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0007193102641882889,99.99254243296124 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'double')","((256, 1), ())","('', '')",5185,2,14.251,7.1255,0.10677312395916853,6.5536e-05,0.5000076293945312,0.12499809268047057,vector_fp32,0.20649471566880673,0.011494943093073473,0.02581144560719692,0.0014368459621047333,2.54296875,0.14155946303051,5.0859375,7.1255,7.05,7.201,0.20649471566880673,0.19836656345834103,0.21462286787927246,0.02581144560719692,0.024795442083872157,0.026827449130521687,2.54296875,2.44287109375,2.64306640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.086), 'mean_duration_us': np.float64(2.543), 'median_duration_us': np.float64(2.543), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.643)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.54)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::div', 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0007138277164429513,99.99325626067768 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",5186,2,18.448,9.224,0.7085209947489198,6.5536e-05,0.5000076293945312,0.12499809268047057,vector_fp32,0.20802032607994764,0.009337404158740426,0.026002143998763,0.0011671577104292474,2.52294921875,0.113247570424408,5.0458984375,9.224,8.723,9.725,0.20802032607994764,0.2014177842806228,0.21462286787927246,0.026002143998763,0.025176838867004316,0.026827449130521687,2.52294921875,2.44287109375,2.60302734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.046), 'mean_duration_us': np.float64(2.523), 'median_duration_us': np.float64(2.523), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.603)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.52)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0007082081050039803,99.99396446878269 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",5183,2,27.992,13.996,1.182282538143908,6.5536e-05,0.5000076293945312,0.12499809268047057,vector_fp32,0.21834858271893276,0.005147571704512462,0.02729315637935055,0.0006434366450000153,2.40185546875,0.056623785212204,4.8037109375,13.996,13.16,14.832,0.21834858271893276,0.214708699860028,0.2219884655778375,0.02729315637935055,0.026838177964407118,0.027748134794293982,2.40185546875,2.36181640625,2.44189453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.804), 'mean_duration_us': np.float64(2.402), 'median_duration_us': np.float64(2.402), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.442)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.4)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::div', 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0006742163089828874,99.99463868509167 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((256, 1), (), ())","('long int', 'long int', 'Scalar')","((1, 1), (), ())","('', '', '1')",5159,2,31.717,15.8585,0.5876057351660212,2.56e-07,0.00391387939453125,0.06237816764132553,,0.0018030654487239854,0.00013446468803464246,0.0001124719188287866,8.38766085206349e-06,2.282470703125,0.17021662261961323,4.56494140625,15.8585,15.443,16.274,0.0018030654487239854,0.001707984555984556,0.0018981463414634147,0.0001124719188287866,0.00010654094696199958,0.00011840289069557363,2.282470703125,2.162109375,2.40283203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.5649999999999995), 'mean_duration_us': np.float64(2.2824999999999998), 'median_duration_us': np.float64(2.2824999999999998), 'std_dev_duration_us': np.float64(0.12050000000000005), 'min_duration_us': np.float64(2.162), 'max_duration_us': np.float64(2.403)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.28)}]","{'shape_in1': (256, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (1, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(236): compute_bias,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0006407042358895116,99.99527938932756 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 4096), ())","('c10::BFloat16', 'Scalar')","((315392, 4096, 1), ())","('', '0.')",9175,2,24.856,12.428,0.8358002153625,,,,,,,,,2.221923828125,0.19783798125971275,4.44384765625,12.428,11.837,13.019,,,,,,,2.221923828125,2.08203125,2.36181640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.444), 'mean_duration_us': np.float64(2.222), 'median_duration_us': np.float64(2.222), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.22)}]",,False,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.000623708337878965,99.99590309766545 -aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 2048), (1, 2048)), ())","('TensorList', 'Scalar')","(((2048, 1), (2048, 1)), ())","('', '0')",18363,1,7.011,7.011,,,,,,,,,,4.125,,4.125,7.011,7.011,7.011,,,,,,,4.125,4.125,4.125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.125), 'mean_duration_us': np.float64(4.125), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.125)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.12)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0005789570419076472,99.99648205470736 -aten::eq,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",20462,1,16.735,16.735,,,,,,,,,,3.52392578125,,3.52392578125,16.735,16.735,16.735,,,,,,,3.52392578125,3.52392578125,3.52392578125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::eq', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.0004945943384762654,99.99697664904583 -aten::cat,other,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",18386,1,13.39,13.39,,,,,,,,,,3.04296875,,3.04296875,13.39,13.39,13.39,,,,,,,3.04296875,3.04296875,3.04296875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.043), 'mean_duration_us': np.float64(3.043), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.043)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0004270904693617966,99.99740373951519 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",1445,2,12.077,6.0385,0.8916616510762359,7.68e-07,0.0029296875,0.25,vector_bf16,0.00204703168771126,3.8611756340311866e-05,0.000511757921927815,9.652939085077967e-06,1.5009765625,0.028311892606102,3.001953125,6.0385,5.408,6.669,0.00204703168771126,0.0020197290529695025,0.0020743343224530167,0.000511757921927815,0.0005049322632423756,0.0005185835806132542,1.5009765625,1.48095703125,1.52099609375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.002), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.501), 'std_dev_duration_us': np.float64(0.019999999999999907), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.521)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.5)}]","{'op_shape': (1, 1, 1, 768), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (768, 768, 768, 1), 'stride_output': (768, 768, 768, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0004213337942291921,99.99782507330943 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1280), (1, 1, 1, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1280, 1280, 1280, 1), (1280, 1280, 1280, 1), ())","('', '', 'False')",5046,2,12.899000000000001,6.4495000000000005,0.26940768363207385,1.28e-06,0.0048828125,0.25,vector_bf16,0.0035632188356983976,0.00028165994123286267,0.0008908047089245995,7.041498530821571e-05,1.44140625,0.1139381043904105,2.8828125,6.4495000000000005,6.259,6.64,0.0035632188356983976,0.003364055181264036,0.003762382490132759,0.0008908047089245995,0.0008410137953160091,0.0009405956225331899,1.44140625,1.36083984375,1.52197265625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(2.883), 'mean_duration_us': np.float64(1.4415), 'median_duration_us': np.float64(1.4415), 'std_dev_duration_us': np.float64(0.08050000000000002), 'min_duration_us': np.float64(1.361), 'max_duration_us': np.float64(1.522)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.44)}]","{'op_shape': (1, 1, 1, 1280), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1280, 1280, 1280, 1), 'stride_output': (1280, 1280, 1280, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.00040461202360591247,99.99822968533303 -aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), ())","('c10::BFloat16', 'double', 'Scalar')","((262144, 16384, 128, 1), (), ())","('', '', '1')",26745,1,11.637,11.637,,0.000262144,1.0000076293945312,0.249998092665919,vector_bf16,0.3686695333905579,,0.09216668017167381,,2.84423828125,,2.84423828125,11.637,11.637,11.637,0.3686695333905579,0.3686695333905579,0.3686695333905579,0.09216668017167381,0.09216668017167381,0.09216668017167381,2.84423828125,2.84423828125,2.84423828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.844), 'mean_duration_us': np.float64(2.844), 'median_duration_us': np.float64(2.844), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.844), 'max_duration_us': np.float64(2.844)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0003991980077073917,99.99862888334074 -aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",26744,1,25.578,25.578,,0.000262144,1.0000076293945312,0.249998092665919,vector_bf16,0.3850636600322754,,0.09626518056302671,,2.72314453125,,2.72314453125,25.578,25.578,25.578,0.3850636600322754,0.3850636600322754,0.3850636600322754,0.09626518056302671,0.09626518056302671,0.09626518056302671,2.72314453125,2.72314453125,2.72314453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0003822021096968452,99.99901108545043 -aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'double', 'Scalar')","((1,), (1,), ())","('', '', 'False')",18372,1,53.59,53.59,,4e-09,4.57763671875e-05,0.08333333333333333,vector_fp32,1.8167436703012383e-05,,1.513953058584365e-06,,2.64208984375,,2.64208984375,53.59,53.59,53.59,1.8167436703012383e-05,1.8167436703012383e-05,1.8167436703012383e-05,1.513953058584365e-06,1.513953058584365e-06,1.513953058584365e-06,2.64208984375,2.64208984375,2.64208984375,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]","{'op_shape': (4,), 'dtype_in_out': ('float', 'double'), 'stride_input': (1,), 'stride_output': (1,)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.00037082582312526974,99.99938191127356 -aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",18385,1,9.013,9.013,,,,,,,,,,2.44287109375,,2.44287109375,9.013,9.013,9.013,,,,,,,2.44287109375,2.44287109375,2.44287109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.443), 'mean_duration_us': np.float64(2.443), 'median_duration_us': np.float64(2.443), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.00034286482962404813,99.99972477610318 -aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",18381,1,14.592,14.592,,4e-09,3.814697265625e-05,0.1,vector_fp32,2.039840637450199e-05,,2.0398406374501996e-06,,1.9609375,,1.9609375,14.592,14.592,14.592,2.039840637450199e-05,2.039840637450199e-05,2.039840637450199e-05,2.0398406374501996e-06,2.0398406374501996e-06,2.0398406374501996e-06,1.9609375,1.9609375,1.9609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.961), 'mean_duration_us': np.float64(1.961), 'median_duration_us': np.float64(1.961), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(1.961)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.96)}]","{'shape_in1': (4,), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0002752238968159459,100.0 +aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 38, 4429, 64), (2, 38, 4429, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((10771328, 283456, 64, 1), (10771328, 283456, 64, 1), (10771328, 283456, 64, 1), (), (), (), ())","('', '', '', '0.', 'False', 'False', '0.125')",18434,152,9721.546,63.957539473684214,11.041440813746393,381.649693696,164.357421875,2214.5,matrix_bf16,0.12832931058926547,0.00593861311360147,284.1852582999284,13.151058740070466,1345.823630885074,62.46694869506643,204565.19189453125,63.179,54.351,165.907,0.12675511756012922,0.10819976288163302,0.1448774257876203,280.6992078369061,239.60837490137632,320.8310594066852,1359.639404296875,1189.56591796875,1592.80615234375,"[{'name': 'attn_fwd', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(204565.196), 'mean_duration_us': np.float64(1345.823657894737), 'median_duration_us': np.float64(1359.6395), 'std_dev_duration_us': np.float64(62.26112668073086), 'min_duration_us': np.float64(1189.566), 'max_duration_us': np.float64(1592.806)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(1345.82)}]","{'B': 2, 'N_Q': 4429, 'H_Q': 38, 'N_KV': 4429, 'H_KV': 38, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': False, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_ops.py(840): __call__', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', 'attn_fwd']",28.711308016049646,28.711308016049646 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 9728), (8192, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",18467,152,3549.873,23.354427631578947,3.628111176626195,387.620798464,235.125,1572.20202020202,matrix_bf16,0.37573691256232084,0.009589873844826936,590.7343329949505,15.077219032319348,656.5875982987253,16.573010375012593,99801.31494140625,22.829,19.61,52.628,0.3741112423692925,0.3492120450154367,0.4026766253027489,588.1784510332892,549.0318826521484,633.0890037891137,659.01904296875,612.26904296875,706.0078125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99801.31399999998), 'mean_duration_us': np.float64(656.5875921052631), 'median_duration_us': np.float64(659.019), 'std_dev_duration_us': np.float64(16.518400036958493), 'min_duration_us': np.float64(612.269), 'max_duration_us': np.float64(706.008)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(656.59)}]","{'M': 8192, 'N': 9728, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT256x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",14.00739914328551,42.71870715933515 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 9728), (9728, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",18469,152,4341.809,28.564532894736843,6.448483371071854,387.620798464,235.125,1572.20202020202,matrix_bf16,0.37809134204199957,0.01519286001944795,594.4359717793246,23.88624521522257,653.1063232421875,25.6982753947453,99272.1611328125,27.726,24.257,100.439,0.37593960099575574,0.3535040054888546,0.41671825591515876,591.0530001594684,555.7797115790833,655.165283804875,655.81396484375,591.63818359375,697.43603515625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(99272.159), 'mean_duration_us': np.float64(653.1063092105263), 'median_duration_us': np.float64(655.814), 'std_dev_duration_us': np.float64(25.61359189916083), 'min_duration_us': np.float64(591.638), 'max_duration_us': np.float64(697.436)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(653.11)}]","{'M': 8192, 'N': 2432, 'K': 9728, 'bias': False, 'stride_A': (9728, 1), 'stride_B': (1, 9728), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",13.933130897325885,56.651838056661035 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 2432), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",18423,456,14436.133,31.658186403508772,9.781613829988565,96.905199616,87.28125,1058.8299319727892,matrix_bf16,0.5122289411392601,0.028356864043551637,542.3633349009765,30.025096426195386,179.2197265625,9.938501313517527,81724.1953125,28.4725,22.824,136.002,0.5053397387283673,0.4214410343655284,0.5778059722742,535.0688411809042,446.23438174779426,611.7982583165624,181.10791015625,158.39404296875,217.162109375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 456, 'total_duration_us': np.float64(81724.19200000001), 'mean_duration_us': np.float64(179.21971929824565), 'median_duration_us': np.float64(181.108), 'std_dev_duration_us': np.float64(9.927591429559296), 'min_duration_us': np.float64(158.394), 'max_duration_us': np.float64(217.162)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(179.22)}]","{'M': 8192, 'N': 2432, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",11.470223855047337,68.12206191170837 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((2432,), (8192, 2432), (2432, 2432), (), (), (8192, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",18431,152,4716.264,31.028052631578948,7.76335211171415,96.92512256,87.285888671875,1058.9913376202371,matrix_bf16,0.509699810811785,0.03225672185541874,539.7676844363539,34.15958902491378,180.276611328125,11.302861072544887,27402.044921875,29.764,25.898,95.823,0.49847493957332634,0.42617994075839083,0.5765232941408053,527.8806430289237,451.3208655306417,610.5331744313968,183.61181640625,158.7548828125,214.7587890625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(27402.047000000002), 'mean_duration_us': np.float64(180.27662500000002), 'median_duration_us': np.float64(183.61200000000002), 'std_dev_duration_us': np.float64(11.265613010286344), 'min_duration_us': np.float64(158.755), 'max_duration_us': np.float64(214.759)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(180.28)}]","{'M': 8192, 'N': 2432, 'K': 2432, 'bias': True, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT320x224x64_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA1_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB256_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT5_14_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA2_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG64_4_1']",3.8459551438604973,71.96801705556886 +triton_poi_fused_addmm_gelu_view_15,triton,python3,CPU,thread 416 (python3),"((2, 4096, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((39845888, 9728, 1), (1,), ())","('', '', '79691776')",18468,152,3065.261,20.166190789473685,1.9089934164424363,0.637534208,304.0185546875,1.9998779371376258,vector_bfloat16,2.3194788692892745,0.2120218580425448,4.638674616348549,0.4240178360902115,138.65906404194078,13.52017813104994,21076.177734375,19.884500000000003,17.596,31.967,2.3926313866320115,1.7959509770415318,2.864591925304503,4.784970721828365,3.591682735166123,5.728834190319071,133.23681640625,111.28515625,177.5029296875,"[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(21076.175), 'mean_duration_us': np.float64(138.65904605263157), 'median_duration_us': np.float64(133.237), 'std_dev_duration_us': np.float64(13.47563314660304), 'min_duration_us': np.float64(111.285), 'max_duration_us': np.float64(177.503)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_15', 'stream': 0, 'mean_duration_us': np.float64(138.66)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 79691776, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_15']",2.9581016453895796,74.92611870095844 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",18425,452,13391.991,29.628298672566373,7.565547330170742,7.878279168,17.4599609375,430.31668437832093,matrix_bf16,0.7134676613950346,0.03877063111647788,307.01703846266577,16.68364943329775,25.756830536158738,1.9186128143844703,11642.08740234375,28.4125,23.475,114.861,0.7108053195829385,0.3191578264400201,0.813216661418006,305.8713883614028,137.33893766706103,349.94069742260393,25.7568359375,22.51318359375,57.36376953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 452, 'total_duration_us': np.float64(11642.083999999999), 'mean_duration_us': np.float64(25.756823008849555), 'median_duration_us': np.float64(25.757), 'std_dev_duration_us': np.float64(1.9165006446350394), 'min_duration_us': np.float64(22.513), 'max_duration_us': np.float64(57.364)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.76)}]","{'M': 666, 'N': 2432, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",1.634000165242182,76.56011886620063 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 9728), (9728, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((9728, 1), (1, 9728), (2432, 1))","('', '', '')",18474,148,4140.771,27.97818243243243,7.661350314400288,31.513116672,60.57177734375,496.159289324552,matrix_bf16,0.8281003899847463,0.02968211018330037,410.8697009842161,14.727054694199342,76.79936919341216,2.8383699970808127,11366.306640625,27.0,23.635,113.528,0.828810922214293,0.7021770889618242,0.8932442085110182,411.22223815027013,348.3916854392814,443.1914116880987,76.6328125,71.10498046875,90.453125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(11366.307999999999), 'mean_duration_us': np.float64(76.79937837837838), 'median_duration_us': np.float64(76.633), 'std_dev_duration_us': np.float64(2.8287709713197278), 'min_duration_us': np.float64(71.105), 'max_duration_us': np.float64(90.453)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(76.8)}]","{'M': 666, 'N': 2432, 'K': 9728, 'bias': False, 'stride_A': (9728, 1), 'stride_B': (1, 9728), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_6_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_4_2']",1.5952935489245332,78.15541241512516 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 2432), (2432, 9728), (666, 9728))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (9728, 1))","('', '', '')",18472,148,3407.557,23.024033783783782,5.634611697823147,31.513116672,60.57177734375,496.159289324552,matrix_bf16,0.9255567601214649,0.07043225400423828,459.2235843314009,34.945617092269174,69.05995301942568,5.874709039595645,10220.873046875,22.083,19.188,84.736,0.9127883329174789,0.6339493694763262,1.0342607131861843,452.8884105640788,314.53986862712185,513.1580604307615,69.58251953125,61.41015625,100.18798828125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10220.875), 'mean_duration_us': np.float64(69.05996621621621), 'median_duration_us': np.float64(69.5825), 'std_dev_duration_us': np.float64(5.8548305020997935), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(100.188)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(69.06)}]","{'M': 666, 'N': 9728, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x192x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1']",1.4345286777481963,79.58994109287335 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '8192', '2432')",18515,148,3319.121,22.426493243243243,2.1597031778187863,0.039845888,114.088134765625,0.33307582842041067,vector_bfloat16,1.771300603735816,0.11124950471299291,0.5899774159708805,0.037054520943640486,67.80168852934966,4.233686810115376,10034.64990234375,21.9725,19.639,37.966,1.748992546601461,1.55458378071066,1.9869140999772925,0.5825471413604054,0.5177942806091371,0.6617930598501315,68.401123046875,60.208984375,76.953125,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(10034.648000000001), 'mean_duration_us': np.float64(67.80167567567568), 'median_duration_us': np.float64(68.40100000000001), 'std_dev_duration_us': np.float64(4.219346669062954), 'min_duration_us': np.float64(60.209), 'max_duration_us': np.float64(76.953)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(67.8)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_19']",1.4083917283833667,80.99833282125671 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",18470,148,3449.976,23.310648648648648,1.8970177126856393,0.039845888,114.171630859375,0.3328322431235526,vector_bfloat16,1.8399238265538633,0.0905979508886018,0.6123859743683927,0.030153919216650865,65.224853515625,3.2404804511629712,9653.2783203125,23.205,20.411,35.923,1.8228244178874216,1.6339891792523877,1.9963661336329734,0.6066947398258546,0.5438442837701849,0.6644550183529565,65.677001953125,59.9677734375,73.26708984375,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(9653.279999999999), 'mean_duration_us': np.float64(65.22486486486486), 'median_duration_us': np.float64(65.67699999999999), 'std_dev_duration_us': np.float64(3.2295163131456124), 'min_duration_us': np.float64(59.968), 'max_duration_us': np.float64(73.267)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(65.22)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_16']",1.3548651393343718,82.35319796059107 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (128, 128, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 1048576, 1024, 1), (1152, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27253,5,396.80899999999997,79.36179999999999,8.414502136193201,309.237645312,512.28125,575.6837674617215,matrix_bf16,0.3194370659361453,0.009239061430023855,183.89473358503847,5.318777691846403,1682.72666015625,48.64372494307394,8413.63330078125,75.392,73.97,94.1,0.3194500251328482,0.3077630405225379,0.33154247111574014,183.90219398421968,177.17418665348907,190.86361884547827,1681.533203125,1620.2021484375,1745.3876953125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(25.674), 'mean_duration_us': np.float64(5.1348), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.18339945474291905), 'min_duration_us': np.float64(4.886), 'max_duration_us': np.float64(5.447)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(334.733), 'mean_duration_us': np.float64(66.9466), 'median_duration_us': np.float64(66.017), 'std_dev_duration_us': np.float64(4.425827588146652), 'min_duration_us': np.float64(62.292), 'max_duration_us': np.float64(74.269)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1046.3899999999999), 'mean_duration_us': np.float64(209.27799999999996), 'median_duration_us': np.float64(207.267), 'std_dev_duration_us': np.float64(6.751884536927449), 'min_duration_us': np.float64(198.894), 'max_duration_us': np.float64(218.083)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1126.509), 'mean_duration_us': np.float64(225.30180000000001), 'median_duration_us': np.float64(225.974), 'std_dev_duration_us': np.float64(2.497012647144582), 'min_duration_us': np.float64(221.168), 'max_duration_us': np.float64(228.138)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(1583.9470000000001), 'mean_duration_us': np.float64(316.7894), 'median_duration_us': np.float64(316.67), 'std_dev_duration_us': np.float64(2.3336759500838977), 'min_duration_us': np.float64(313.985), 'max_duration_us': np.float64(320.755)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(4296.379999999999), 'mean_duration_us': np.float64(859.2759999999998), 'median_duration_us': np.float64(860.558), 'std_dev_duration_us': np.float64(38.63950000194101), 'min_duration_us': np.float64(799.788), 'max_duration_us': np.float64(914.678)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(66.95)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(209.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(225.3)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(316.79)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(859.28)}]","{'convNd': 'conv2d', 'input_shape': (1, 128, 1024, 1024), 'filter_shape': (128, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 1048576, 1024, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64']]",1.1808774258983836,83.53407538648946 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 14592), (2, 14592))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (14592, 1))","('', '', '')",18413,300,8768.494,29.228313333333336,6.617911988847339,0.141950976,67.75244140625,1.9980829795974258,matrix_bf16,2.5946450811213326,0.2646247974416752,5.184316174684716,0.5287423037476275,27.6878955078125,3.025975736385473,8306.36865234375,28.127000000000002,24.126,99.388,2.741197106748559,2.0864608373533713,3.0264640672282894,5.477139282716004,4.168921886712364,6.047126341092044,25.9169921875,23.47412109375,34.0498046875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 300, 'total_duration_us': np.float64(8306.373), 'mean_duration_us': np.float64(27.68791), 'median_duration_us': np.float64(25.917), 'std_dev_duration_us': np.float64(3.0209218607184574), 'min_duration_us': np.float64(23.474), 'max_duration_us': np.float64(34.05)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.69)}]","{'M': 2, 'N': 14592, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x16x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_4_2']",1.1658225266166418,84.6998979131061 +triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8,triton,python3,CPU,thread 416 (python3),"((8192, 2432), (2432,), (64,), (2, 38, 4096, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '311296', '64')",18424,304,6149.486,20.22857236842105,2.407726575438387,0.139460608,76.0047607421875,1.74989038451346,vector_bfloat16,3.5804589032745655,0.3626115685727799,6.26541060698577,0.6345304971588508,22.525390625,2.778457297323058,6847.71875,20.07,16.114,47.731,3.7083455831006753,1.5530908896310884,4.188431339372322,6.489198278320831,2.717738814040897,7.329295726962458,21.4912109375,19.02783203125,51.31494140625,"[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(6847.722), 'mean_duration_us': np.float64(22.525401315789473), 'median_duration_us': np.float64(21.491), 'std_dev_duration_us': np.float64(2.7738832289577378), 'min_duration_us': np.float64(19.028), 'max_duration_us': np.float64(51.315)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(22.53)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.transpose, aten.view', 'xnumel': 311296, 'rnumel': 64}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_8']",0.9610968533683588,85.66099476647446 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 4096))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",5111,192,6207.894,32.332781250000004,8.839132001998642,8.589934592,36.0,227.55555555555554,matrix_bf16,1.1719624301788094,0.02364293246762278,266.68656188957794,5.3800806326323425,32.22358194986979,0.6864988052764409,6186.927734375,29.839,22.683,72.348,1.1728122788188526,0.9909049248003691,1.2366933490314014,266.8799496690011,225.48592066568398,281.41644209070114,32.1865234375,30.52392578125,38.09521484375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 192, 'total_duration_us': np.float64(6186.93), 'mean_duration_us': np.float64(32.22359375), 'median_duration_us': np.float64(32.1865), 'std_dev_duration_us': np.float64(0.6847003158031528), 'min_duration_us': np.float64(30.524), 'max_duration_us': np.float64(38.095)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(32.22)}]","{'M': 256, 'N': 4096, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.8683529500281012,86.52934771650256 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 4096), (4096, 10240))","('c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096))","('', '')",5286,96,3498.243,36.44003125,9.181457586901209,21.47483648,87.0,235.4022988505747,matrix_bf16,1.4373282893677226,0.022610314012308376,338.350383520126,5.322519896230754,63.48492431640625,1.0088001313002912,6094.552734375,34.341,28.212,83.203,1.4413309061284947,1.3702315905830582,1.4855215744545514,339.2926087070296,322.5556663809315,349.6951936187266,63.29296875,61.41015625,66.5771484375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(6094.553999999999), 'mean_duration_us': np.float64(63.484937499999994), 'median_duration_us': np.float64(63.293), 'std_dev_duration_us': np.float64(1.0035055203769856), 'min_duration_us': np.float64(61.41), 'max_duration_us': np.float64(66.577)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(63.48)}]","{'M': 256, 'N': 10240, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT8_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW8_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA8_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.8553878553635602,87.38473557186612 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((33554432, 65536, 256, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27024,7,520.623,74.37471428571429,3.874985579082229,309.237645312,132.5,2225.7509433962264,matrix_bf16,0.17054299033315715,0.004793147775292346,379.586221623638,10.668353182694432,815.2283063616071,23.16508387604623,5706.59814453125,72.608,71.035,81.07,0.17053991420908315,0.1636285750695248,0.17623344351320352,379.57937493757834,364.19645532757505,392.2517531574783,814.68505859375,788.365234375,849.095703125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(62.446000000000005), 'mean_duration_us': np.float64(8.920857142857143), 'median_duration_us': np.float64(8.531), 'std_dev_duration_us': np.float64(0.6591703505319455), 'min_duration_us': np.float64(8.171), 'max_duration_us': np.float64(10.094)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(283.775), 'mean_duration_us': np.float64(40.53928571428571), 'median_duration_us': np.float64(40.379), 'std_dev_duration_us': np.float64(0.3694632068616445), 'min_duration_us': np.float64(40.099), 'max_duration_us': np.float64(41.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(370.262), 'mean_duration_us': np.float64(52.89457142857143), 'median_duration_us': np.float64(53.358), 'std_dev_duration_us': np.float64(1.4606747811633258), 'min_duration_us': np.float64(50.995), 'max_duration_us': np.float64(55.041)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(451.86600000000004), 'mean_duration_us': np.float64(64.55228571428572), 'median_duration_us': np.float64(63.173), 'std_dev_duration_us': np.float64(3.9155450893762884), 'min_duration_us': np.float64(59.408), 'max_duration_us': np.float64(70.624)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(488.43899999999996), 'mean_duration_us': np.float64(69.777), 'median_duration_us': np.float64(69.943), 'std_dev_duration_us': np.float64(0.7438663474422981), 'min_duration_us': np.float64(68.1), 'max_duration_us': np.float64(70.504)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 7, 'total_duration_us': np.float64(4049.81), 'mean_duration_us': np.float64(578.5442857142857), 'median_duration_us': np.float64(573.09), 'std_dev_duration_us': np.float64(19.20403529554798), 'min_duration_us': np.float64(556.546), 'max_duration_us': np.float64(608.904)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(8.92)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(40.54)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(52.89)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.55)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(69.78)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(578.54)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 256, 256), 'filter_shape': (512, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (33554432, 65536, 256, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_']]",0.800937322396119,88.18567289426224 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((67108864, 262144, 512, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27148,5,397.34,79.46799999999999,3.7312853683415876,309.237645312,257.125,1146.9596499756929,matrix_bf16,0.2380694526897961,0.0033349777892934247,273.05605612699327,3.8250849578846604,1132.68525390625,15.988691411278218,5663.42626953125,78.466,75.362,84.736,0.23843794552523803,0.23293412165672644,0.2417787864780853,273.47870254055033,267.16603864279443,277.31051231045245,1130.755859375,1115.13134765625,1157.4736328125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(26.154), 'mean_duration_us': np.float64(5.2308), 'median_duration_us': np.float64(5.207), 'std_dev_duration_us': np.float64(0.10632854743670675), 'min_duration_us': np.float64(5.126), 'max_duration_us': np.float64(5.407)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(176.538), 'mean_duration_us': np.float64(35.3076), 'median_duration_us': np.float64(35.011), 'std_dev_duration_us': np.float64(1.1099622696290183), 'min_duration_us': np.float64(34.33), 'max_duration_us': np.float64(37.335)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(531.463), 'mean_duration_us': np.float64(106.2926), 'median_duration_us': np.float64(107.198), 'std_dev_duration_us': np.float64(2.44941957206192), 'min_duration_us': np.float64(102.231), 'max_duration_us': np.float64(109.481)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(595.039), 'mean_duration_us': np.float64(119.0078), 'median_duration_us': np.float64(115.931), 'std_dev_duration_us': np.float64(6.309738834531901), 'min_duration_us': np.float64(112.887), 'max_duration_us': np.float64(127.749)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(710.931), 'mean_duration_us': np.float64(142.1862), 'median_duration_us': np.float64(136.041), 'std_dev_duration_us': np.float64(10.643601409297508), 'min_duration_us': np.float64(130.112), 'max_duration_us': np.float64(155.47)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(3623.301), 'mean_duration_us': np.float64(724.6602), 'median_duration_us': np.float64(719.949), 'std_dev_duration_us': np.float64(21.340082974534106), 'min_duration_us': np.float64(696.755), 'max_duration_us': np.float64(762.052)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.23)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(35.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.29)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(119.01)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(142.19)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(724.66)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 512, 512), 'filter_shape': (256, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (67108864, 262144, 512, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64']]",0.7948780266318891,88.98055092089413 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '666', '2432')",18518,144,2987.602,20.74723611111111,1.512158513660232,0.003239424,9.356201171875,0.330193356470005,vector_bfloat16,0.3287943986642104,0.043410560115431006,0.10856572608347254,0.014333878550757082,30.41143798828125,4.391962936042957,4379.2470703125,20.5205,17.967,27.631,0.34714615724253417,0.24272498760540237,0.3850941834978438,0.11462535484557647,0.08014617835656816,0.12715554100622903,28.260986328125,25.47607421875,40.4189453125,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(4379.2480000000005), 'mean_duration_us': np.float64(30.41144444444445), 'median_duration_us': np.float64(28.261), 'std_dev_duration_us': np.float64(4.3766938876054), 'min_duration_us': np.float64(25.476), 'max_duration_us': np.float64(40.419)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(30.41)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_20']",0.6146398140840623,89.59519073497819 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (256, 256, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27226,1,78.577,78.577,,1236.950581248,1025.125,1150.735763931228,matrix_bf16,0.2514515172495481,,289.3542537938251,,4274.86572265625,,4274.86572265625,78.577,78.577,78.577,0.2514515172495481,0.2514515172495481,0.2514515172495481,289.3542537938251,289.3542537938251,289.3542537938251,4274.86572265625,4274.86572265625,4274.86572265625,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(129.031), 'mean_duration_us': np.float64(129.031), 'median_duration_us': np.float64(129.031), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(129.031), 'max_duration_us': np.float64(129.031)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(392.862), 'mean_duration_us': np.float64(392.862), 'median_duration_us': np.float64(392.862), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(392.862), 'max_duration_us': np.float64(392.862)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(453.353), 'mean_duration_us': np.float64(453.353), 'median_duration_us': np.float64(453.353), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(453.353), 'max_duration_us': np.float64(453.353)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(664.706), 'mean_duration_us': np.float64(664.706), 'median_duration_us': np.float64(664.706), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(664.706), 'max_duration_us': np.float64(664.706)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2629.787), 'mean_duration_us': np.float64(2629.787), 'median_duration_us': np.float64(2629.787), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2629.787), 'max_duration_us': np.float64(2629.787)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(129.03)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(392.86)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(453.35)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(664.71)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(2629.79)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 1024, 1024), 'filter_shape': (256, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (268435456, 1048576, 1024, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64']]",0.5999895942889268,90.19518032926712 +triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10,triton,python3,CPU,thread 416 (python3),"((8192, 2432), (666, 2432), (2, 38, 4429, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (2432, 1), (10771328, 283456, 64, 1), ())","('', '', '', '21542656')",18433,152,3118.999,20.519730263157893,2.510095721164674,0.0,123.26806640625,0.0,vector_bfloat16,5.008577530463113,0.5273303511437225,0.0,0.0,26.167618600945723,3.622186564873429,3977.47802734375,20.175,17.546,37.035,5.307166481445097,2.3080612154989013,5.5539130337578415,0.0,0.0,0.0,24.35498046875,23.27294921875,56.001953125,"[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3977.477), 'mean_duration_us': np.float64(26.167611842105263), 'median_duration_us': np.float64(24.355), 'std_dev_duration_us': np.float64(3.610260218149725), 'min_duration_us': np.float64(23.273), 'max_duration_us': np.float64(56.002)}]","[{'name': 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpo...', 'stream': 0, 'mean_duration_us': np.float64(26.17)}]","{'fused_ops': 'aten._scaled_dot_product_flash_attention, aten.cat, aten.transpose, aten.view', 'xnumel': 21542656, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__scaled_dot_product_flash_attention_cat_transpose_view_10']",0.5582503832275333,90.75343071249465 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((2432,), (666, 2432), (2432, 2432), (), (), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'c10::BFloat16')","((1,), (2432, 1), (1, 2432), (), (), (2432, 1))","('', '', '', '1', '1', '')",18432,152,3476.724,22.87318421052632,6.942242827485621,7.87989888,17.464599609375,430.29083665338646,matrix_bf16,0.7219844426313035,0.05145801866718306,310.66328987055243,22.141913904827778,25.499563116776315,1.9140762579445143,3875.93359375,21.692,19.229,77.044,0.7165499719149424,0.5786817373593989,0.8091331998619261,308.3248869192411,249.001448924411,348.16260153261993,25.55712890625,22.6328125,31.64599609375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3875.933), 'mean_duration_us': np.float64(25.499559210526314), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(1.9077830366462447), 'min_duration_us': np.float64(22.633), 'max_duration_us': np.float64(31.646)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(25.5)}]","{'M': 666, 'N': 2432, 'K': 2432, 'bias': True, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.543998332410752,91.2974290449054 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27121,1,84.245,84.245,,1236.950581248,516.5,2283.9264278799615,matrix_bf16,0.15053602225789517,,343.8131995827328,,3597.740234375,,3597.740234375,84.245,84.245,84.245,0.15053602225789517,0.15053602225789517,0.15053602225789517,343.8131995827328,343.8131995827328,343.8131995827328,3597.740234375,3597.740234375,3597.740234375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.934), 'mean_duration_us': np.float64(9.934), 'median_duration_us': np.float64(9.934), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.934), 'max_duration_us': np.float64(9.934)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(204.142), 'mean_duration_us': np.float64(204.142), 'median_duration_us': np.float64(204.142), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(204.142), 'max_duration_us': np.float64(204.142)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(216.361), 'mean_duration_us': np.float64(216.361), 'median_duration_us': np.float64(216.361), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(216.361), 'max_duration_us': np.float64(216.361)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(292.594), 'mean_duration_us': np.float64(292.594), 'median_duration_us': np.float64(292.594), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(292.594), 'max_duration_us': np.float64(292.594)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(303.89), 'mean_duration_us': np.float64(303.89), 'median_duration_us': np.float64(303.89), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(303.89), 'max_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2570.819), 'mean_duration_us': np.float64(2570.819), 'median_duration_us': np.float64(2570.819), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2570.819), 'max_duration_us': np.float64(2570.819)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.93)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(204.14)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(216.36)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(292.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(303.89)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(2570.82)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 512, 512), 'filter_shape': (512, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 262144, 512, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi256ELi128ELi256ELi32ELi8ELi8ELi32ELi32ELi2ELi4ENS_8SequenceIJLi4ELi64ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi128EEEEEELb0EEENSX_INS5_IJiNSY_IiLi256EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi256ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.5049531011323376,91.80238214603774 +triton_poi_fused__unsafe_view_clone_slice_transpose_11,triton,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 4096, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((10771328, 283456, 64, 1), (9961472, 2432, 1), ())","('', '', '19922944')",18460,152,3078.333,20.252190789473683,1.593594623574472,0.0,117.08935546875,0.0,vector_bfloat16,5.283046754825653,0.49220577107192903,0.0,0.0,23.524985865542764,3.330519637347333,3575.7978515625,20.215,17.496,28.822,5.532519444300204,2.1860815863400043,5.99784071330773,0.0,0.0,0.0,22.19189453125,20.47021484375,56.1630859375,"[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'count': 152, 'total_duration_us': np.float64(3575.8), 'mean_duration_us': np.float64(23.525000000000002), 'median_duration_us': np.float64(22.192), 'std_dev_duration_us': np.float64(3.31954295760251), 'min_duration_us': np.float64(20.47), 'max_duration_us': np.float64(56.163)}]","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_11', 'stream': 0, 'mean_duration_us': np.float64(23.52)}]","{'fused_ops': 'aten._unsafe_view, aten.clone, aten.slice, aten.transpose', 'xnumel': 19922944, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__unsafe_view_clone_slice_transpose', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__unsafe_view_clone_slice_transpose_11']",0.5018734251341815,92.30425557117192 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((256, 10240), (10240, 4096))","('c10::BFloat16', 'c10::BFloat16')","((10240, 1), (1, 10240))","('', '')",5316,48,1486.231,30.963145833333332,8.2187466197442,21.47483648,87.0,235.4022988505747,matrix_bf16,1.35227774767847,0.015204273040601275,318.32929048798934,3.579120826109363,67.46939086914062,0.7553297493567382,3238.53076171875,28.783,25.318,63.665,1.3511071232954182,1.3255413550909207,1.3919971790370889,318.05372281712835,312.03548220990876,327.6793359388458,67.51953125,65.5361328125,68.82177734375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(3238.5289999999995), 'mean_duration_us': np.float64(67.46935416666666), 'median_duration_us': np.float64(67.5195), 'std_dev_duration_us': np.float64(0.7474217208060252), 'min_duration_us': np.float64(65.536), 'max_duration_us': np.float64(68.822)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(67.47)}]","{'M': 256, 'N': 4096, 'K': 10240, 'bias': False, 'stride_A': (10240, 1), 'stride_B': (1, 10240), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x64x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_4_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB4_WSGRA0_WSGRB0_WS64_WG32_4_2']",0.45453702733111295,92.75879259850304 +triton_poi_fused_addmm_gelu_view_17,triton,python3,CPU,thread 416 (python3),"((2, 333, 9728), (9728,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3239424, 9728, 1), (1,), ())","('', '', '6478848')",18473,148,2947.73,19.917094594594595,1.9654001352577701,0.051830784,24.7333984375,1.9984996249062266,vector_bfloat16,1.1982032825590174,0.08825420622537715,2.394608810755605,0.17637599803781281,21.75943900443412,1.5739936683940021,3220.39697265625,19.85,16.875,37.556,1.18578220681806,0.9794856566654987,1.4323931043930853,2.36978529554637,1.9575017174470282,2.862637081847846,21.87158203125,18.10595703125,26.47802734375,"[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(3220.398), 'mean_duration_us': np.float64(21.75944594594595), 'median_duration_us': np.float64(21.8715), 'std_dev_duration_us': np.float64(1.5686506565240377), 'min_duration_us': np.float64(18.106), 'max_duration_us': np.float64(26.478)}]","[{'name': 'triton_poi_fused_addmm_gelu_view_17', 'stream': 0, 'mean_duration_us': np.float64(21.76)}]","{'fused_ops': 'aten.addmm, aten.gelu, aten.view', 'xnumel': 6478848, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_gelu_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_gelu_view_17']",0.4519918983262726,93.2107844968293 +aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 1, 16384, 512), (1, 1, 16384, 512), (1, 1, 16384, 512), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((8388608, 512, 512, 1), (8388608, 512, 512, 1), (8388608, 512, 512, 1), (), (), (), ())","('', '', '', '0.', 'False', 'False', '0.044194173824159216')",26834,1,51.657,51.657,,549.755813888,64.0,8192.0,matrix_bf16,0.022661509991569472,,185.64308985093712,,2961.35888671875,,2961.35888671875,51.657,51.657,51.657,0.022661509991569472,0.022661509991569472,0.022661509991569472,185.64308985093712,185.64308985093712,185.64308985093712,2961.35888671875,2961.35888671875,2961.35888671875,"[{'name': 'attn_fwd', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2961.359), 'mean_duration_us': np.float64(2961.359), 'median_duration_us': np.float64(2961.359), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2961.359), 'max_duration_us': np.float64(2961.359)}]","[{'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(2961.36)}]","{'B': 1, 'N_Q': 16384, 'H_Q': 1, 'N_KV': 16384, 'H_KV': 1, 'd_h_qk': 512, 'd_h_v': 512, 'dropout': 0.0, 'causal': False, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', 'attn_fwd']",0.4156351642975723,93.62641966112687 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 3, 3), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((268435456, 1048576, 1024, 1), (2304, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27239,1,77.104,77.104,,618.475290624,768.5625,767.4379116857771,matrix_bf16,0.28336910216342354,,217.46819200057138,,2843.98046875,,2843.98046875,77.104,77.104,77.104,0.28336910216342354,0.28336910216342354,0.28336910216342354,217.46819200057138,217.46819200057138,217.46819200057138,2843.98046875,2843.98046875,2843.98046875,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.728), 'mean_duration_us': np.float64(5.728), 'median_duration_us': np.float64(5.728), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.728), 'max_duration_us': np.float64(5.728)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(75.511), 'mean_duration_us': np.float64(75.511), 'median_duration_us': np.float64(75.511), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(75.511), 'max_duration_us': np.float64(75.511)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.952), 'mean_duration_us': np.float64(210.952), 'median_duration_us': np.float64(210.952), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.952), 'max_duration_us': np.float64(210.952)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(231.063), 'mean_duration_us': np.float64(231.063), 'median_duration_us': np.float64(231.063), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(231.063), 'max_duration_us': np.float64(231.063)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(682.333), 'mean_duration_us': np.float64(682.333), 'median_duration_us': np.float64(682.333), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(682.333), 'max_duration_us': np.float64(682.333)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_wr2x2_ta1x8x4x1_1x4x1x64_tb1x8x2x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1638.393), 'mean_duration_us': np.float64(1638.393), 'median_duration_us': np.float64(1638.393), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1638.393), 'max_duration_us': np.float64(1638.393)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.73)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(75.51)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(210.95)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(231.06)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(682.33)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(1638.39)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 1024, 1024), 'filter_shape': (128, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (268435456, 1048576, 1024, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x32_wt32x32x8_ws2x1_wr2x2_ta1x8x4x1_1x4x1x64_tb1x8x2x1_1x4x1x64']]",0.3991607686219144,94.02558042974879 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (512, 512, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((8388608, 16384, 128, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",26760,10,796.183,79.6183,7.356471875536235,77.309411328,36.5,2019.945205479452,matrix_bf16,0.16116491665298904,0.006611202032220845,325.5443006847007,13.354265847440471,237.859375,10.34699437589636,2378.59375,77.8555,70.685,97.265,0.16382520681525575,0.14840403570035632,0.1652422418578569,330.91794104315545,299.76802038673617,333.7802741834541,233.62109375,231.61767578125,257.8974609375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(76.905), 'mean_duration_us': np.float64(7.6905), 'median_duration_us': np.float64(7.65), 'std_dev_duration_us': np.float64(0.4889914620931535), 'min_duration_us': np.float64(6.649), 'max_duration_us': np.float64(8.532)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(118.48700000000001), 'mean_duration_us': np.float64(11.848700000000001), 'median_duration_us': np.float64(11.837), 'std_dev_duration_us': np.float64(0.10417010127671), 'min_duration_us': np.float64(11.696), 'max_duration_us': np.float64(12.057)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(134.91000000000003), 'mean_duration_us': np.float64(13.491000000000003), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.54173148330146), 'min_duration_us': np.float64(12.898), 'max_duration_us': np.float64(14.621)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(165.03499999999997), 'mean_duration_us': np.float64(16.503499999999995), 'median_duration_us': np.float64(16.503), 'std_dev_duration_us': np.float64(0.3349988805951447), 'min_duration_us': np.float64(15.743), 'max_duration_us': np.float64(16.984)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(202.328), 'mean_duration_us': np.float64(20.2328), 'median_duration_us': np.float64(20.188499999999998), 'std_dev_duration_us': np.float64(1.0540910586851595), 'min_duration_us': np.float64(18.467), 'max_duration_us': np.float64(21.791)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(1680.929), 'mean_duration_us': np.float64(168.09290000000001), 'median_duration_us': np.float64(163.482), 'std_dev_duration_us': np.float64(10.59933224736351), 'min_duration_us': np.float64(161.199), 'max_duration_us': np.float64(190.161)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(11.85)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.49)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(16.5)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(20.23)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(168.09)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 128, 128), 'filter_shape': (512, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (8388608, 16384, 128, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_34GridwiseGemmMultiD_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorENS_5TupleIJEEES7_ttftSA_tNS0_12element_wise11PassThroughESC_SC_LNS1_18GemmSpecializationE7ELi256ELi128ELi128ELi64ELi8ELi8ELi32ELi32ELi2ELi2ENS_8SequenceIJLi8ELi32ELi1EEEENSE_IJLi1ELi0ELi2EEEESG_Li2ELi8ELi8ELb0ELi0ESF_SG_SG_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSE_IJLi1ELi32ELi1ELi8EEEENSE_IJLi8EEEELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttttLb0ELb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEENS_16TensorDescriptorINS9_IJNS_5EmbedINS9_IJiiiiEEESQ_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESV_ST_ST_NSP_INS9_IJiiEEESW_Lb0EEESX_ST_NS_23Merge_v2_magic_divisionINS9_IJiiiEEEEES10_NS_8RightPadIiiLb0EEES12_NS_7UnMergeISW_Lb0EEEST_EEENS9_IJNSE_IJLi0EEEENSE_IJLi1EEEENSE_IJLi2EEEENSE_IJLi3EEEENSE_IJLi4EEEENSE_IJLi5EEEENSE_IJLi6EEEENSE_IJLi7EEEESI_NSE_IJLi9ELi11ELi13EEEENSE_IJLi10ELi12ELi14EEEENSE_IJLi15EEEENSE_IJLi16EEEENSE_IJLi18EEEENSE_IJLi17EEEEEEENS9_IJNSE_IJLi1ELi2ELi3ELi4EEEES1B_S1C_S1D_SI_NSE_IJLi9EEEENSE_IJLi10ELi11EEEENSE_IJLi12ELi13EEEENSE_IJLi14EEEES1G_S1H_S1J_S1I_NSE_IJLi19ELi20EEEENSE_IJLi21EEEEEEENSE_IJLi19ELi21ELi20EEEElEENSO_INS9_IJS14_S12_S12_S14_ST_EEENS9_IJS16_S17_S18_S1A_S19_EEENS9_IJNSE_IJLi1ELi2EEEES19_S1A_NSE_IJLi5ELi6EEEES1D_EEENSE_IJLi5ELi7ELi6EEEElEESA_NSO_INS9_IJSX_S12_S12_EEENS9_IJS16_S17_S18_EEENS9_IJS1X_S19_S1A_EEENSE_IJLi3ELi4EEEElEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET1_T2_T3_T4_T0_S2F_']]",0.33384241555870625,94.35942284530749 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((1280,), (77, 1280), (1280, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (1280, 1), (1, 1280), (), ())","('', '', '', '1', '1')",1513,256,7815.374,30.5288046875,8.263595687543871,0.25241216,3.50341796875,68.70975609756097,matrix_bf16,0.431207267070061,0.012431324195834014,29.62814614787973,0.8541532534654629,8.526697158813477,0.2567364201120384,2182.83447265625,30.69,21.092,77.385,0.43463505488157134,0.36979763086753503,0.45180956041316356,29.863668612362797,25.40870502236422,31.04372469853471,8.4521484375,8.130859375,9.93408203125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 256, 'total_duration_us': np.float64(2182.826), 'mean_duration_us': np.float64(8.5266640625), 'median_duration_us': np.float64(8.452), 'std_dev_duration_us': np.float64(0.25624840784089964), 'min_duration_us': np.float64(8.131), 'max_duration_us': np.float64(9.934)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.53)}]","{'M': 77, 'N': 1280, 'K': 1280, 'bias': True, 'stride_A': (1280, 1), 'stride_B': (1, 1280), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.30636704276061316,94.6657898880681 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 3, 3), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 262144, 512, 1), (4608, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27134,1,95.602,95.602,,618.475290624,386.25,1527.052427184466,matrix_bf16,0.19221094144865633,,293.51618467058194,,2107.125,,2107.125,95.602,95.602,95.602,0.19221094144865633,0.19221094144865633,0.19221094144865633,293.51618467058194,293.51618467058194,293.51618467058194,2107.125,2107.125,2107.125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.048), 'mean_duration_us': np.float64(6.048), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.048)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(41.38), 'mean_duration_us': np.float64(41.38), 'median_duration_us': np.float64(41.38), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(41.38), 'max_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(106.478), 'mean_duration_us': np.float64(106.478), 'median_duration_us': np.float64(106.478), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(106.478), 'max_duration_us': np.float64(106.478)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(118.174), 'mean_duration_us': np.float64(118.174), 'median_duration_us': np.float64(118.174), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(118.174), 'max_duration_us': np.float64(118.174)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(329.409), 'mean_duration_us': np.float64(329.409), 'median_duration_us': np.float64(329.409), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(329.409), 'max_duration_us': np.float64(329.409)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1505.636), 'mean_duration_us': np.float64(1505.636), 'median_duration_us': np.float64(1505.636), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1505.636), 'max_duration_us': np.float64(1505.636)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(41.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(106.48)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(118.17)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(329.41)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_w...', 'stream': 0, 'mean_duration_us': np.float64(1505.64)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 512, 512), 'filter_shape': (256, 512, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 262144, 512, 1), 'weight_stride': (4608, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['SubTensorOpWithScalar1d'], ['batched_transpose_32x32_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x256x32_wt32x32x8_ws1x2_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x4x1_1x4x1x64']]",0.2957410023818228,94.96153089044992 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '666', '2432')",18475,144,3273.897,22.73539583333333,2.36958740682506,0.003239424,9.439697265625,0.32727272727272727,vector_bfloat16,0.7175581068318017,0.048741067275081526,0.23483719859949867,0.01595162201729941,13.859249538845486,0.9719595732811294,1995.73193359375,22.378,19.539,41.762,0.7183414438502853,0.5348423703234658,0.9051839928555481,0.23509356344191149,0.1750393211967706,0.2962420340254521,13.779296875,10.93505859375,18.5068359375,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(1995.7350000000001), 'mean_duration_us': np.float64(13.859270833333333), 'median_duration_us': np.float64(13.779499999999999), 'std_dev_duration_us': np.float64(0.9686016281987687), 'min_duration_us': np.float64(10.935), 'max_duration_us': np.float64(18.507)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(13.86)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_18']",0.28010666786566013,95.24163755831559 +triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9,triton,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (64,), (2, 38, 333, 64), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (1,), (10771328, 283456, 64, 1), (), ())","('', '', '', '', '25308', '64')",18426,304,5872.773,19.318332236842107,2.4236315995172375,0.011337984,6.1834716796875,1.7486526502813147,vector_bfloat16,1.253189766906519,0.12791340685967362,2.191393607206508,0.22367611791168043,5.234130859375,0.6274760849170535,1591.17578125,18.948,15.723,40.46,1.23570671133445,0.6062596137515409,1.7043902348864073,2.160821815745394,1.0601374803451582,2.980386501347709,5.2470703125,3.80419921875,10.69482421875,"[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9', 'stream': 0, 'count': 304, 'total_duration_us': np.float64(1591.176), 'mean_duration_us': np.float64(5.234131578947368), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.6264542941723528), 'min_duration_us': np.float64(3.804), 'max_duration_us': np.float64(10.695)}]","[{'name': 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose...', 'stream': 0, 'mean_duration_us': np.float64(5.23)}]","{'fused_ops': 'aten._to_copy, aten.add, aten.addmm, aten.mean, aten.mul, aten.pow, aten.rsqrt, aten.transpose, aten.view', 'xnumel': 25308, 'rnumel': 64}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__to_copy_add_addmm_mean_mul_pow_rsqrt_transpose_view_9']",0.22332605826068935,95.46496361657628 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (), (128,), (128,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27246,6,184.624,30.770666666666667,0.9884777522365727,0.671089408,512.00146484375,1.2499978542389272,vector_bf16,2.3220529179169467,0.09431026455339626,2.902561164825423,0.11788762832445064,231.535400390625,9.740609604863426,1389.21240234375,30.736,29.363,32.147,2.3282250635427584,2.1543145933092727,2.4112959275063877,2.910276333613738,2.692888618992198,3.014114735318048,230.600830078125,222.64892578125,249.2080078125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(361.81), 'mean_duration_us': np.float64(60.30166666666667), 'median_duration_us': np.float64(60.147999999999996), 'std_dev_duration_us': np.float64(1.7322068454880177), 'min_duration_us': np.float64(58.405), 'max_duration_us': np.float64(63.413)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1027.403), 'mean_duration_us': np.float64(171.23383333333334), 'median_duration_us': np.float64(170.95350000000002), 'std_dev_duration_us': np.float64(7.346735406892563), 'min_duration_us': np.float64(163.362), 'max_duration_us': np.float64(185.795)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(60.3)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(171.23)}]","{'op_shape': (1, 128, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 1048576, 1024, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.19497992211681833,95.6599435386931 +aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (64, 1, 16384, 64), ())","('', '', '1')",5219,48,536.131,11.169395833333333,1.2174860694660832,0.004194304,24.0,0.16666666666666666,vector_bf16,0.8932989719901001,0.01530507743233117,0.14888316199835,0.0025508462387218603,28.179982503255207,0.4890157762664813,1352.63916015625,11.016,8.362,16.034,0.8923680232703096,0.8443994225142127,0.9211561464853175,0.14872800387838492,0.14073323708570212,0.1535260244142196,28.201171875,27.31982421875,29.80322265625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(1352.64), 'mean_duration_us': np.float64(28.180000000000003), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4838763616186821), 'min_duration_us': np.float64(27.32), 'max_duration_us': np.float64(29.803)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(28.18)}]","{'shape_in1': (1, 64, 256, 256), 'shape_in2': (1, 64, 256, 256), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (4194304, 65536, 256, 1), 'stride_input2': (64, 1, 16384, 64), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.1898467632843407,95.84979030197744 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (128, 256, 1, 1), (128,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((268435456, 1048576, 1024, 1), (256, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",27261,1,66.639,66.639,,68.719476736,768.0625,85.32638945398324,matrix_bf16,0.7308579394169271,,62.36146917422441,,1101.9541015625,,1101.9541015625,66.639,66.639,66.639,0.7308579394169271,0.7308579394169271,0.7308579394169271,62.36146917422441,62.36146917422441,62.36146917422441,1101.9541015625,1101.9541015625,1101.9541015625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.231), 'mean_duration_us': np.float64(210.231), 'median_duration_us': np.float64(210.231), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.231), 'max_duration_us': np.float64(210.231)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(891.723), 'mean_duration_us': np.float64(891.723), 'median_duration_us': np.float64(891.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(891.723), 'max_duration_us': np.float64(891.723)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(210.23)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(891.72)}]","{'convNd': 'conv2d', 'input_shape': (1, 256, 1024, 1024), 'filter_shape': (128, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (268435456, 1048576, 1024, 1), 'weight_stride': (256, 1, 1, 1), 'bias': False, 'stride': (1, 1), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.15466240046264687,96.00445270244008 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024),)","('c10::BFloat16',)","((134217728, 1048576, 1024, 1),)","('',)",27250,6,53.229,8.8715,0.8245427217555191,0.134217728,512.0,0.25,vector_bf16,3.060151396175012,0.2008227131970654,0.765037849043753,0.05020567829926635,176.09407552083334,11.99649579488144,1056.564453125,8.488,8.242,10.305,3.05344141829577,2.728391166448712,3.2831729172481956,0.7633603545739425,0.682097791612178,0.8207932293120489,175.840576171875,163.52197265625,196.77197265625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(1056.564), 'mean_duration_us': np.float64(176.09400000000002), 'median_duration_us': np.float64(175.8405), 'std_dev_duration_us': np.float64(10.951276226997471), 'min_duration_us': np.float64(163.522), 'max_duration_us': np.float64(196.772)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(176.09)}]","{'op_shape': (1, 128, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 1048576, 1024, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.14829183387230943,96.15274453631238 +aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 20, 77, 64), (1, 20, 77, 64), (1, 20, 77, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((98560, 64, 1280, 1), (98560, 64, 1280, 1), (98560, 64, 1280, 1), (), (), (), ())","('', '', '', '0.', 'True', 'False', '0.125')",1541,64,4525.486,70.71071875,16.127880050878225,0.01517824,0.751953125,19.25,matrix_bf16,0.051794181616539106,0.0024706959580987346,0.9970379961183778,0.04756089719340058,15.265159606933594,0.9025663372159146,976.97021484375,66.4585,60.901,144.735,0.05221603672694067,0.03700036752743854,0.05841437708001737,1.0051587069936079,0.7122570749031918,1.1244767587903344,15.100341796875,13.498046875,21.31005859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(98.007), 'mean_duration_us': np.float64(1.531359375), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(0.8389537078853692), 'min_duration_us': np.float64(1.121), 'max_duration_us': np.float64(7.651)}, {'name': 'attn_fwd', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(878.968), 'mean_duration_us': np.float64(13.733875), 'median_duration_us': np.float64(13.74), 'std_dev_duration_us': np.float64(0.35501850744010516), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(14.381)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(1.53)}, {'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.73)}]","{'B': 1, 'N_Q': 77, 'H_Q': 20, 'N_KV': 77, 'H_KV': 20, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': True, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', ['aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)'], ['attn_fwd']]",0.13712055556033717,96.28986509187273 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((1280,), (77, 5120), (5120, 1280), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (5120, 1), (1, 5120), (), ())","('', '', '', '1', '1')",1606,64,1870.578,29.22778125,7.522269474475571,1.00935296,13.4423828125,71.60888122048674,matrix_bf16,1.114879926117181,0.020116756124396066,79.83530420443023,1.44053839985338,12.647163391113281,0.23802573761036794,809.41845703125,26.945,24.166,56.684,1.1171122372675293,1.0141330504127877,1.1499998916421001,79.9951575084427,72.62093314877919,82.35020564417177,12.61767578125,12.2568359375,13.89892578125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(809.4159999999999), 'mean_duration_us': np.float64(12.647124999999999), 'median_duration_us': np.float64(12.6175), 'std_dev_duration_us': np.float64(0.23618745865307908), 'min_duration_us': np.float64(12.257), 'max_duration_us': np.float64(13.899)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.65)}]","{'M': 77, 'N': 1280, 'K': 5120, 'bias': True, 'stride_A': (5120, 1), 'stride_B': (1, 5120), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA2048_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.11360418856440424,96.40346928043714 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'double')","((2621440, 10240, 1), ())","('', '')",5288,144,1256.962,8.728902777777778,3.0458010654574728,0.00262144,10.000007629394531,0.24999980926528223,vector_bf16,1.9659441249296883,0.36292666417321007,0.4914856562586243,0.09073159682058766,5.530008951822917,1.0932611565836916,796.3212890625,6.88,5.598,17.616,2.1285412900164973,1.3563350510958125,3.5390331021753463,0.5321349165174021,0.33908350407377,0.8847576005273567,4.92626953125,2.962890625,7.73095703125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 144, 'total_duration_us': np.float64(796.32), 'mean_duration_us': np.float64(5.53), 'median_duration_us': np.float64(4.9265), 'std_dev_duration_us': np.float64(1.0894735923065477), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(7.731)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.11176596369239084,96.51523524412953 +aten::mean,reduce,python3,CPU,thread 416 (python3),"((1, 256, 4096), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((1048576, 4096, 1), (), (), ())","('', '[-1]', 'True', '')",5095,98,1112.483,11.351867346938775,2.141622988170156,0.001048576,4.000003814697266,0.24999976158164827,vector_fp32,0.5172989462393036,0.008229361463212305,0.1293246132262638,0.0020573384037722835,8.11019212372449,0.13343169375155572,794.798828125,10.636,9.684,22.253,0.518403306216053,0.47168979100543623,0.5315887606906368,0.12960070295715145,0.11792233529185656,0.13289706343214308,8.0908203125,7.89013671875,8.89208984375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(794.8029999999999), 'mean_duration_us': np.float64(8.11023469387755), 'median_duration_us': np.float64(8.091), 'std_dev_duration_us': np.float64(0.13277860974004113), 'min_duration_us': np.float64(7.89), 'max_duration_us': np.float64(8.892)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::mean', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)']",0.11155228195839623,96.62678752608792 +triton_poi_fused__unsafe_view_clone_slice_transpose_13,triton,python3,CPU,thread 416 (python3),"((2, 38, 4429, 64), (2, 333, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((10771328, 283456, 64, 1), (809856, 2432, 1), ())","('', '', '1619712')",18463,148,2446.49,16.530337837837838,1.7095139960749801,0.0,47.26806640625,0.0,vector_bfloat16,9.524988997960184,0.9054188797215983,0.0,0.0,5.247835726351352,0.4718245491979532,776.6796875,16.284,14.311,30.355,9.59427218147448,8.30530188839797,12.37593266032675,0.0,0.0,0.0,5.166015625,4.0048828125,5.9677734375,"[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_13', 'stream': 0, 'count': 148, 'total_duration_us': np.float64(776.6790000000001), 'mean_duration_us': np.float64(5.247831081081082), 'median_duration_us': np.float64(5.166), 'std_dev_duration_us': np.float64(0.470211631314194), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.968)}]","[{'name': 'triton_poi_fused__unsafe_view_clone_slice_transpose_13', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]","{'fused_ops': 'aten._unsafe_view, aten.clone, aten.slice, aten.transpose', 'xnumel': 1619712, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__unsafe_view_clone_slice_transpose', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__unsafe_view_clone_slice_transpose_13']",0.10900920890353012,96.73579673499145 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((5120,), (77, 1280), (1280, 5120), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (1280, 1), (1, 1280), (), ())","('', '', '', '1', '1')",1597,64,2172.078,33.93871875,7.240565060534525,1.00964864,13.44970703125,71.59085133418043,matrix_bf16,1.2714808682337337,0.05973446799758913,91.02639781197588,4.276441417941762,11.121826171875,0.6552373406785019,711.796875,31.442,28.502,61.882,1.284889270875039,0.9097589114274915,1.3386645309603262,91.9863167720984,65.13041497795138,95.83613342232108,10.97607421875,10.53515625,15.501953125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x80x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(711.797), 'mean_duration_us': np.float64(11.121828125), 'median_duration_us': np.float64(10.976), 'std_dev_duration_us': np.float64(0.6501138014486267), 'min_duration_us': np.float64(10.535), 'max_duration_us': np.float64(15.502)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x80x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(11.12)}]","{'M': 77, 'N': 5120, 'K': 1280, 'bias': True, 'stride_A': (1280, 1), 'stride_B': (1, 1280), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x80x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_5_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.09990272115073813,96.8356994561422 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 768), (768, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",68,96,3109.546,32.391104166666665,11.741692560210758,0.090892032,1.35205078125,64.11105092091007,matrix_bf16,0.19472810359160286,0.005842449367897683,12.484223365093506,0.3745655689281276,7.2877248128255205,0.2425620764988777,699.62158203125,31.747,21.502,125.226,0.19502471138707173,0.16088585050146836,0.20821132621011113,12.503239202572349,10.314560953953565,13.348646936966654,7.26953125,6.80908203125,8.81201171875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(699.621), 'mean_duration_us': np.float64(7.28771875), 'median_duration_us': np.float64(7.2695), 'std_dev_duration_us': np.float64(0.24125560024264206), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(8.812)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","{'M': 77, 'N': 768, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.09819388406377343,96.93389334020597 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (3, 128, 3, 3), (3,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 1048576, 1024, 1), (1152, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",27334,1,84.546,84.546,,7.247757312,262.006591796875,26.381015655356656,matrix_bf16,0.39460322367107914,,10.410033821320944,,696.22802734375,,696.22802734375,84.546,84.546,84.546,0.39460322367107914,0.39460322367107914,0.39460322367107914,10.410033821320944,10.410033821320944,10.410033821320944,696.22802734375,696.22802734375,696.22802734375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.087), 'mean_duration_us': np.float64(5.087), 'median_duration_us': np.float64(5.087), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.087), 'max_duration_us': np.float64(5.087)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.251), 'mean_duration_us': np.float64(8.251), 'median_duration_us': np.float64(8.251), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.251), 'max_duration_us': np.float64(8.251)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.092), 'mean_duration_us': np.float64(9.092), 'median_duration_us': np.float64(9.092), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.092), 'max_duration_us': np.float64(9.092)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.975), 'mean_duration_us': np.float64(10.975), 'median_duration_us': np.float64(10.975), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.975), 'max_duration_us': np.float64(10.975)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(287.826), 'mean_duration_us': np.float64(287.826), 'median_duration_us': np.float64(287.826), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(287.826), 'max_duration_us': np.float64(287.826)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(374.997), 'mean_duration_us': np.float64(374.997), 'median_duration_us': np.float64(374.997), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(374.997), 'max_duration_us': np.float64(374.997)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.09)}, {'name': 'batched_transpose_4x256_half', 'stream': 0, 'mean_duration_us': np.float64(8.25)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(9.09)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(10.98)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(287.83)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(375.0)}]","{'convNd': 'conv2d', 'input_shape': (1, 128, 1024, 1024), 'filter_shape': (3, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 1048576, 1024, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['batched_transpose_16x32_half'], ['batched_transpose_4x256_half'], ['batched_transpose_256x4_half'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['batched_transpose_32x32_half'], ['_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_Li1ELi64ELi64ELi32ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi16ELi1EEEENS9_IJLi1ELi0ELi2EEEESB_Li2ELi8ELi8ELb0ELi1ESA_SB_SB_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENS9_IJLi1ELi16ELi1ELi4EEEELi1ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtLb0EEEPKtSH_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESK_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESP_SN_SN_NSJ_INS5_IJiiEEESQ_Lb0EEESR_SN_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESU_NS_8RightPadIiiLb0EEESW_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESN_EEENS5_IJNS9_IJLi0EEEENS9_IJLi1EEEENS9_IJLi2EEEENS9_IJLi3EEEENS9_IJLi4EEEENS9_IJLi5EEEENS9_IJLi6EEEENS9_IJLi7EEEENS9_IJLi8EEEENS9_IJLi9ELi11ELi13EEEENS9_IJLi10ELi12ELi14EEEENS9_IJLi15EEEENS9_IJLi16EEEENS9_IJLi18EEEENS9_IJLi17EEEEEEENS5_IJNS9_IJLi1ELi2ELi3ELi4EEEES18_S19_S1A_S1B_NS9_IJLi9EEEENS9_IJLi10ELi11EEEENS9_IJLi12ELi13EEEENS9_IJLi14EEEES1E_S1F_S1H_S1G_NS9_IJLi19ELi20EEEENS9_IJLi21EEEEEEENS9_IJLi19ELi21ELi20EEEElEENSI_INS5_IJNSX_ISQ_Lb0EEESW_SW_S11_SN_EEENS5_IJS13_S14_S15_S17_S16_EEENS5_IJNS9_IJLi1ELi2EEEES16_S17_NS9_IJLi5ELi6EEEES1A_EEENS9_IJLi5ELi7ELi6EEEElEES6_NSI_INS5_IJSR_SW_SW_NSX_INS5_IJiNSY_IiLi64EEEEEELb0EEENSX_INS5_IJiNSY_IiLi32EEEEEELb0EEEEEENS5_IJS13_S14_S15_S16_S17_EEENS5_IJS1W_S16_S17_S1X_NS9_IJLi7ELi8EEEEEEENS9_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi64ELi32ENSI_INS5_IJSR_SW_SW_EEENS5_IJS13_S14_S15_EEENS5_IJS1W_S16_S17_EEENS9_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2L_Lb1ELb0ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_']]",0.09771758898639606,97.03161092919237 +aten::layer_norm,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 77, 1280), (), (1280,), (1280,), (), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((98560, 1280, 1), (), (1,), (1,), (), ())","('', '[1280]', '', '', '1.0000000000000001e-05', 'True')",1500,130,2884.221,22.186315384615384,5.742365510784853,0.00050048,0.390625,1.221875,vector_bf16,0.08385900993368818,0.001796481186491025,0.10246522776272524,0.002195075449743723,4.886613581730769,0.10469760256131358,635.259765625,20.381,18.438,57.255,0.0838274008194264,0.07927242487242488,0.08816193378875462,0.10242660537623663,0.09686099414099414,0.10772286284813454,4.88623046875,4.64599609375,5.1669921875,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(635.259), 'mean_duration_us': np.float64(4.886607692307693), 'median_duration_us': np.float64(4.886), 'std_dev_duration_us': np.float64(0.10439831240559441), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(5.167)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","{'op_shape': (1, 77, 1280), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (98560, 1280, 1), 'stride_output': None, 'num_channels': 1280, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,torch/nn/functional.py(2880): layer_norm,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/normalization.py(228): forward', 'torch/nn/functional.py(2880): layer_norm', 'aten::layer_norm', 'aten::native_layer_norm', 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)']",0.08916051959840035,97.12077144879076 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', '1')",5262,96,1157.729,12.059677083333334,2.1962370282145955,0.001048576,6.0,0.16666666666666666,vector_bf16,1.3954191507413258,0.5661557267697908,0.23256985845688763,0.09435928779496518,6.4807078043619795,4.972852050214373,622.14794921875,11.536999999999999,9.784,21.582,1.6361780175238096,0.3916740702191689,1.9890246816918802,0.2726963362539682,0.06527901170319482,0.33150411361531334,3.84521484375,3.1630859375,16.06298828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(622.1469999999999), 'mean_duration_us': np.float64(6.480697916666666), 'median_duration_us': np.float64(3.845), 'std_dev_duration_us': np.float64(4.946894453256743), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(16.063)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.48)}]","{'shape_in1': (1, 256, 4096), 'shape_in2': (1, 256, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1048576, 4096, 1), 'stride_input2': (1048576, 4096, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(356): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.08732023877641266,97.20809168756718 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 1))","('c10::BFloat16', 'float')","((1048576, 4096, 1), (256, 1, 1))","('', '')",5098,98,858.087,8.755989795918367,2.526214434886481,0.001048576,6.0009765625,0.16663954434499592,vector_bf16,1.023365961807252,0.06258853332057247,0.17053323757373895,0.010429724673761803,6.172662228954081,0.395586423329981,604.9208984375,8.027000000000001,7.171,25.638,1.0268525131474102,0.8267786642715083,1.1385280537149924,0.1711142349003984,0.13777401988836852,0.1897237960950614,6.1279296875,5.52685546875,7.61083984375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(604.921), 'mean_duration_us': np.float64(6.172663265306123), 'median_duration_us': np.float64(6.128), 'std_dev_duration_us': np.float64(0.3935874755317555), 'min_duration_us': np.float64(5.527), 'max_duration_us': np.float64(7.611)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.17)}]","{'shape_in1': (1, 256, 4096), 'shape_in2': (1, 256, 1), 'dtype_in1_in2_out': ('c10::BFloat16', 'float', None), 'stride_input1': (1048576, 4096, 1), 'stride_input2': (256, 1, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1}>(int, at::native::(anonymous namespace)::type_specialized_broadcast_kernel_launcher<1>::apply >, std::array, std::array, OffsetCalculator<3, unsigned int, false> >(long, at::native::BinaryFunctor >, std::array, std::array, OffsetCalculator<3, unsigned int, false>)::{lambda(int, bool)#1})']",0.08490237307498089,97.29299406064216 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27141,5,157.063,31.412599999999998,1.2964433269526294,0.335545856,256.0029296875,1.2499914170293767,vector_bf16,2.269364568268366,0.04039953532870862,2.836686232446034,0.050499072412860564,118.3177734375,2.0926909657870496,591.5888671875,30.695,30.515,33.54,2.2426728945202075,2.2374338362710664,2.316319020758986,2.8033218693546873,2.796773091509944,2.8953788950506225,119.69580078125,115.89013671875,119.97607421875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(178.62), 'mean_duration_us': np.float64(35.724000000000004), 'median_duration_us': np.float64(35.612), 'std_dev_duration_us': np.float64(0.5430587445203343), 'min_duration_us': np.float64(34.931), 'max_duration_us': np.float64(36.493)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(412.969), 'mean_duration_us': np.float64(82.5938), 'median_duration_us': np.float64(83.483), 'std_dev_duration_us': np.float64(1.7604830473480866), 'min_duration_us': np.float64(80.038), 'max_duration_us': np.float64(84.405)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(35.72)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(82.59)}]","{'op_shape': (1, 256, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (67108864, 262144, 512, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.08303118447171302,97.37602524511387 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240))","('c10::BFloat16', 'c10::BFloat16')","((2621440, 10240, 1), (2621440, 10240, 1))","('', '')",5297,96,763.997,7.958302083333333,1.8334902415011174,0.00262144,15.0,0.16666666666666666,vector_bf16,2.7734013735868164,0.608155849747016,0.4622335622644694,0.10135930829116938,5.9616546630859375,1.3452461606471542,572.31884765625,8.317,5.488,14.822,2.8367131118865982,1.8012780137560813,3.4455294384426143,0.4727855186477665,0.3002130022926802,0.5742549064071024,5.647216796875,4.56494140625,8.73193359375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 96, 'total_duration_us': np.float64(572.318), 'mean_duration_us': np.float64(5.961645833333333), 'median_duration_us': np.float64(5.647), 'std_dev_duration_us': np.float64(1.33823683737196), 'min_duration_us': np.float64(4.565), 'max_duration_us': np.float64(8.732)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.96)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (1, 256, 10240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (2621440, 10240, 1), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.08032658228053349,97.4563518273944 +aten::_softmax,other,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (), ())","('float', 'Scalar', 'Scalar')","((4194304, 65536, 256, 1), (), ())","('', '-1', 'False')",5225,48,411.223,8.567145833333333,1.836050142892702,,,,,,,,,11.830708821614584,0.6630237228890721,567.8740234375,8.077,7.11,15.984,,,,,,,12.13720703125,10.4951171875,12.89794921875,"[{'name': 'void (anonymous namespace)::softmax_warp_forward(float*, float const*, int, int, int, bool const*, int, bool)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(567.874), 'mean_duration_us': np.float64(11.830708333333334), 'median_duration_us': np.float64(12.137), 'std_dev_duration_us': np.float64(0.6561059669981334), 'min_duration_us': np.float64(10.495), 'max_duration_us': np.float64(12.898)}]","[{'name': 'void (anonymous namespace)::softmax_warp_forward', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'torch/nn/functional.py(2096): softmax', 'aten::softmax', 'aten::_softmax', 'void (anonymous namespace)::softmax_warp_forward(float*, float const*, int, int, int, bool const*, int, bool)']",0.07970273852666786,97.53605456592106 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024), (), (256,), (256,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((268435456, 1048576, 1024, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27233,1,33.33,33.33,,1.342178816,1024.0029296875,1.2499978542389272,vector_bf16,2.144821332646688,,2.6810220635342357,,500.6220703125,,500.6220703125,33.33,33.33,33.33,2.144821332646688,2.144821332646688,2.144821332646688,2.6810220635342357,2.6810220635342357,2.6810220635342357,500.6220703125,500.6220703125,500.6220703125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(164.163), 'mean_duration_us': np.float64(164.163), 'median_duration_us': np.float64(164.163), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(164.163), 'max_duration_us': np.float64(164.163)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(336.459), 'mean_duration_us': np.float64(336.459), 'median_duration_us': np.float64(336.459), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(336.459), 'max_duration_us': np.float64(336.459)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(164.16)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(336.46)}]","{'op_shape': (1, 256, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (268435456, 1048576, 1024, 1), 'stride_output': None, 'num_channels': 256, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.07026373513136722,97.60631830105243 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('c10::BFloat16', 'float', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",5230,48,282.79200000000003,5.891500000000001,0.6596871276468704,0.004194304,24.0,0.16666666666666666,vector_bf16,2.4496158621719375,0.17195036303672756,0.4082693103619896,0.028658393839454614,10.319356282552084,0.6740310252108017,495.3291015625,5.769,5.188,8.282,2.4165232348087025,2.151697388719576,3.1258859505094616,0.402753872468117,0.35861623145326266,0.520980991751577,10.4140625,8.05078125,11.69580078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(495.32899999999995), 'mean_duration_us': np.float64(10.319354166666665), 'median_duration_us': np.float64(10.414), 'std_dev_duration_us': np.float64(0.6669758394419588), 'min_duration_us': np.float64(8.051), 'max_duration_us': np.float64(11.696)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(10.32)}]","{'op_shape': (1, 64, 256, 256), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (4194304, 65536, 256, 1), 'stride_output': (4194304, 65536, 256, 1)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::type_as', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.06952085187399014,97.67583915292641 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), (1, 128, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 1048576, 1024, 1), (134217728, 1048576, 1024, 1), ())","('', '', '1')",27268,3,25.848,8.616,0.9193193134053035,0.134217728,768.0,0.16666666666666666,vector_bf16,5.022471221335316,0.029738981350048137,0.8370785368892193,0.004956496891674644,160.34440104166666,0.9468266154769833,481.033203125,8.162,8.012,9.674,5.011919815187697,4.999446608457364,5.056047240360886,0.8353199691979494,0.8332411014095608,0.8426745400601476,160.67822265625,159.27587890625,161.0791015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(481.033), 'mean_duration_us': np.float64(160.34433333333334), 'median_duration_us': np.float64(160.678), 'std_dev_duration_us': np.float64(0.7729606860780295), 'min_duration_us': np.float64(159.276), 'max_duration_us': np.float64(161.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(160.34)}]","{'shape_in1': (1, 128, 1024, 1024), 'shape_in2': (1, 128, 1024, 1024), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (134217728, 1048576, 1024, 1), 'stride_input2': (134217728, 1048576, 1024, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.06751438176241395,97.74335353468882 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4096,), (1, 256, 4096))","('c10::BFloat16', 'c10::BFloat16')","((1,), (1048576, 4096, 1))","('', '')",5103,98,772.446,7.882102040816327,1.8123350290499731,0.001048576,4.0078125,0.24951267056530213,vector_bf16,0.8907988689554314,0.05272997979301834,0.2222656047296203,0.013156798077010416,4.73542629942602,0.30576023168563127,464.07177734375,7.286,6.429,14.372,0.8930138578461777,0.6640981333333333,1.0493430636430139,0.2228182725230229,0.1657008987654321,0.2618243901487442,4.7060546875,4.0048828125,6.328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(464.06999999999994), 'mean_duration_us': np.float64(4.735408163265306), 'median_duration_us': np.float64(4.7059999999999995), 'std_dev_duration_us': np.float64(0.3041668727260965), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.328)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","{'shape_in1': (4096,), 'shape_in2': (1, 256, 4096), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (1,), 'stride_input2': (1048576, 4096, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.06513379728718265,97.80848733197601 +aten::tanh,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240),)","('c10::BFloat16',)","((2621440, 10240, 1),)","('',)",5295,48,358.523,7.4692291666666675,1.3283991203553966,,,,,,,,,9.619974772135416,0.462344728681359,461.7587890625,7.035,6.32,12.539,,,,,,,9.61328125,8.3310546875,11.77587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(461.759), 'mean_duration_us': np.float64(9.619979166666667), 'median_duration_us': np.float64(9.6135), 'std_dev_duration_us': np.float64(0.45751723508443426), 'min_duration_us': np.float64(8.331), 'max_duration_us': np.float64(11.776)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ta...', 'stream': 0, 'mean_duration_us': np.float64(9.62)}]",,False,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::tanh', 'void at::native::vectorized_elementwise_kernel<8, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::tanh_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.06480916278624213,97.87329649476226 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512),)","('c10::BFloat16',)","((67108864, 262144, 512, 1),)","('',)",27145,5,43.426,8.6852,0.4451850177173528,0.067108864,256.0,0.25,vector_bf16,2.964445182785716,0.09138310205874534,0.741111295696429,0.022845775514686334,90.62138671875,2.827936505522151,453.10693359375,8.633,8.112,9.234,2.9637390637325196,2.831005627902426,3.0640208551189088,0.7409347659331299,0.7077514069756065,0.7660052137797272,90.5732421875,87.60888671875,94.81982421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(453.1069999999999), 'mean_duration_us': np.float64(90.62139999999998), 'median_duration_us': np.float64(90.573), 'std_dev_duration_us': np.float64(2.5293653433223118), 'min_duration_us': np.float64(87.609), 'max_duration_us': np.float64(94.82)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(90.62)}]","{'op_shape': (1, 256, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (67108864, 262144, 512, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.06359485019976018,97.93689134496202 +aten::pow,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), ())","('float', 'Scalar')","((1048576, 4096, 1), ())","('', '2')",5092,98,1055.055,10.765867346938776,2.785685718160984,0.001048576,8.0,0.125,vector_fp32,1.9879502095622998,0.496119610033179,0.24849377619528748,0.062014951254147375,4.5053411989795915,1.1635621576041233,441.5234375,10.04,9.193,30.185,2.063857867340539,1.2850526728999925,2.585772002408188,0.2579822334175674,0.16063158411249906,0.3232215003010235,4.0654296875,3.244140625,6.52783203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(441.52500000000003), 'mean_duration_us': np.float64(4.505357142857143), 'median_duration_us': np.float64(4.0655), 'std_dev_duration_us': np.float64(1.1575871567662643), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","{'op_shape': (1, 256, 4096), 'dtype_in_out': ('float', None), 'stride_input': (1048576, 4096, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::pow', 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, float)::{lambda(float)#1}, std::array)']",0.06196907349175683,97.99886041845377 +triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 14592), (14592,), (2432,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (14592, 1), (1,), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",18462,4,109.733,27.43325,2.211230181746502,0.039845888,285.0927734375,0.1332899446794663,vector_bfloat16,2.830974345109082,0.4917999574155184,0.37734041384857797,0.06555198911727832,108.5,22.329341551853997,434.0,26.384,26.219,30.746,3.0257543474499813,2.111632925951858,3.160755759584508,0.40330262958526275,0.2814594358834628,0.4212969603403236,98.926025390625,94.5791015625,141.56884765625,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(434.0), 'mean_duration_us': np.float64(108.5), 'median_duration_us': np.float64(98.926), 'std_dev_duration_us': np.float64(19.33785150941024), 'min_duration_us': np.float64(94.579), 'max_duration_us': np.float64(141.569)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(108.5)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.clone, aten.convolution, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_12']",0.060913137584961086,98.05977355603873 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (1, 3, 1024, 1024), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((3145728, 1048576, 1024, 1), (3145728, 1048576, 1024, 1), ())","('', '', 'False')",27348,1,42105.819,42105.819,,0.003145728,12.0,0.25,vector_bf16,0.030540216065674412,,0.007635054016418603,,412.01123046875,,412.01123046875,42105.819,42105.819,42105.819,0.030540216065674412,0.030540216065674412,0.030540216065674412,0.007635054016418603,0.007635054016418603,0.007635054016418603,412.01123046875,412.01123046875,412.01123046875,"[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(412.011), 'mean_duration_us': np.float64(412.011), 'median_duration_us': np.float64(412.011), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(412.011), 'max_duration_us': np.float64(412.011)}]","[{'name': 'Memcpy DtoH (Device -> Host)', 'stream': 0, 'mean_duration_us': np.float64(412.01)}]","{'op_shape': (1, 3, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (3145728, 1048576, 1024, 1), 'stride_output': (3145728, 1048576, 1024, 1)}",True,diffusers/image_processor.py(190): pt_to_numpy,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(190): pt_to_numpy', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy DtoH (Device -> Host)']",0.05782695107855318,98.11760050711729 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 1024, 1024),)","('c10::BFloat16',)","((268435456, 1048576, 1024, 1),)","('',)",27237,1,10.205,10.205,,0.268435456,1024.0,0.25,vector_bf16,2.78161956543441,,0.6954048913586025,,386.01318359375,,386.01318359375,10.205,10.205,10.205,2.78161956543441,2.78161956543441,2.78161956543441,0.6954048913586025,0.6954048913586025,0.6954048913586025,386.01318359375,386.01318359375,386.01318359375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(386.013), 'mean_duration_us': np.float64(386.013), 'median_duration_us': np.float64(386.013), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(386.013), 'max_duration_us': np.float64(386.013)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(386.01)}]","{'op_shape': (1, 256, 1024, 1024), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (268435456, 1048576, 1024, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.05417805106418188,98.17177855818147 +aten::_scaled_dot_product_flash_attention,SDPA_fwd,python3,CPU,thread 416 (python3),"((1, 12, 77, 64), (1, 12, 77, 64), (1, 12, 77, 64), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((59136, 64, 768, 1), (59136, 64, 768, 1), (59136, 64, 768, 1), (), (), (), ())","('', '', '', '0.', 'True', 'False', '0.125')",96,24,1704.529,71.02204166666667,11.41202741382269,0.009106944,0.451171875,19.25,matrix_bf16,0.030169183412463132,0.004406723040204032,0.5807567806899153,0.0848294185239276,16.071818033854168,2.800457197961641,385.7236328125,68.7475,63.254,119.918,0.03276362764384427,0.021790307304785896,0.03364999215087001,0.6306998321440023,0.4194634156171286,0.6477623489042477,14.439453125,14.05908203125,21.7109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(69.519), 'mean_duration_us': np.float64(2.8966250000000002), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(2.7337303392449543), 'min_duration_us': np.float64(1.201), 'max_duration_us': np.float64(8.492)}, {'name': 'attn_fwd', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(316.206), 'mean_duration_us': np.float64(13.17525), 'median_duration_us': np.float64(13.038499999999999), 'std_dev_duration_us': np.float64(0.5000066041230524), 'min_duration_us': np.float64(12.417), 'max_duration_us': np.float64(14.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.9)}, {'name': 'attn_fwd', 'stream': 0, 'mean_duration_us': np.float64(13.18)}]","{'B': 1, 'N_Q': 77, 'H_Q': 12, 'N_KV': 77, 'H_KV': 12, 'd_h_qk': 64, 'd_h_v': 64, 'dropout': 0.0, 'causal': True, 'flash_impl': True, 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16')}",True,transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(300): forward', 'transformers/integrations/sdpa_attention.py(40): sdpa_attention_forward', 'aten::scaled_dot_product_attention', 'aten::_scaled_dot_product_flash_attention', 'aten::_flash_attention_forward', ['aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)'], ['attn_fwd']]",0.054137411786356726,98.22591596996783 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (), ())","('c10::BFloat16', '', 'ScalarList')","((67108864, 262144, 512, 1), (), ())","('', '', '[2., 2.]')",27223,1,10.786,10.786,,,,,,,,,,382.287109375,,382.287109375,10.786,10.786,10.786,,,,,,,382.287109375,382.287109375,382.287109375,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(382.287), 'mean_duration_us': np.float64(382.287), 'median_duration_us': np.float64(382.287), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(382.287), 'max_duration_us': np.float64(382.287)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(382.29)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']",0.05365508592238811,98.27957105589022 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 64, 256, 256), (1, 64, 256, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((4194304, 65536, 256, 1), (4194304, 65536, 256, 1), ())","('', '', 'False')",5223,48,379.655,7.909479166666666,1.9989198358601163,0.004194304,24.0,0.16666666666666666,vector_fp32,3.1941074188111482,0.25569355103516106,0.5323512364685247,0.04261559183919351,7.928293863932292,0.6323219764114211,380.55810546875,7.371,6.85,19.368,3.141491445453812,2.7435115273075694,3.631339924751638,0.5235819075756354,0.45725192121792824,0.6052233207919396,8.010986328125,6.93017578125,9.1728515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(380.557), 'mean_duration_us': np.float64(7.928270833333333), 'median_duration_us': np.float64(8.011), 'std_dev_duration_us': np.float64(0.6257010647926363), 'min_duration_us': np.float64(6.93), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(7.93)}]","{'op_shape': (1, 64, 256, 256), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (4194304, 65536, 256, 1), 'stride_output': (4194304, 65536, 256, 1)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.05341241529375598,98.33298347118397 +aten::bmm,GEMM,python3,CPU,thread 416 (python3),"((64, 256, 256), (64, 256, 64))","('c10::BFloat16', 'c10::BFloat16')","((65536, 256, 1), (64, 4096, 1))","('', '')",5241,48,1673.868,34.87225,10.354268959267527,0.536870912,12.0,42.666666666666664,matrix_bf16,1.5903609938038132,0.031180263929752077,67.85540240229604,1.330357927669424,7.914967854817708,0.15546949489674314,379.91845703125,31.517000000000003,29.414,83.224,1.5906401374337105,1.5174775512896008,1.6710851291096556,67.86731253050498,64.74570885502297,71.29963217534531,7.91064453125,7.52978515625,8.2919921875,"[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB128_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(379.916), 'mean_duration_us': np.float64(7.914916666666667), 'median_duration_us': np.float64(7.9105), 'std_dev_duration_us': np.float64(0.15383430389726319), 'min_duration_us': np.float64(7.53), 'max_duration_us': np.float64(8.292)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(7.91)}]","{'B': 64, 'M': 256, 'N': 64, 'K': 256, 'bias': False, 'stride_A': (65536, 256, 1), 'stride_B': (64, 4096, 1), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'transpose': (False, False)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::matmul', 'aten::bmm', 'Cijk_Ailk_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x64x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA0_LBSPPB128_LBSPPM0_LPA0_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.05332263881154529,98.38630610999552 +aten::bmm,GEMM,python3,CPU,thread 416 (python3),"((64, 256, 64), (64, 64, 256))","('c10::BFloat16', 'c10::BFloat16')","((64, 4096, 1), (64, 1, 4096))","('', '')",5151,48,1340.282,27.922541666666664,4.7320771021143155,0.536870912,12.0,42.666666666666664,matrix_bf16,1.595970085635309,0.028005931689523502,68.09472365377317,1.1949197520863348,7.886566162109375,0.1390650795704857,378.55517578125,26.683999999999997,23.755,44.816,1.5945674015221833,1.5103624297268785,1.670868428710368,68.03487579827981,64.44213033501347,71.29038629164235,7.89111328125,7.53076171875,8.3310546875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AFC0_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD0_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(378.553), 'mean_duration_us': np.float64(7.886520833333333), 'median_duration_us': np.float64(7.891), 'std_dev_duration_us': np.float64(0.13759345151316446), 'min_duration_us': np.float64(7.531), 'max_duration_us': np.float64(8.331)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AF...', 'stream': 0, 'mean_duration_us': np.float64(7.89)}]","{'B': 64, 'M': 256, 'N': 256, 'K': 64, 'bias': False, 'stride_A': (64, 4096, 1), 'stride_B': (64, 1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'transpose': (True, False)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::matmul', 'aten::bmm', 'Cijk_Alik_Bljk_BBS_BH_UserArgs_MT128x64x64_MI16x16x1_SN_LDSB1_AFC0_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD0_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB2_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.053131298400604626,98.43943740839612 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (8388608, 16384, 128, 1), ())","('', '', '1')",26878,5,47.261,9.452200000000001,3.0552757976981386,0.008388608,48.0,0.16666666666666666,vector_bf16,0.6726143662492617,0.07519814684310595,0.11210239437487694,0.012533024473850997,75.70400390625,9.7861765523355,378.52001953125,8.173,7.852,14.912,0.6991881751917899,0.5415616254538004,0.7283669215452123,0.11653136253196497,0.09026027090896672,0.12139448692420206,71.98583984375,69.10205078125,92.93798828125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 5, 'total_duration_us': np.float64(378.52), 'mean_duration_us': np.float64(75.704), 'median_duration_us': np.float64(71.986), 'std_dev_duration_us': np.float64(8.753032731573668), 'min_duration_us': np.float64(69.102), 'max_duration_us': np.float64(92.938)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(75.7)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (1, 512, 128, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (512, 1, 65536, 512), 'stride_input2': (8388608, 16384, 128, 1), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::add', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.05312636412066633,98.49256377251679 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27031,6,190.485,31.747500000000002,1.7667491898965197,0.167775232,128.005859375,1.2499656692961443,vector_bf16,2.149101927696643,0.11003496193377399,2.6863036294389686,0.13753992483952507,62.590901692708336,3.1680777446719164,375.54541015625,31.451999999999998,30.005,34.231,2.125241709245668,2.0221457249963217,2.293429750175205,2.6564791755133426,2.5276127345593644,2.866708452661438,63.171630859375,58.525390625,66.376953125,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(111.75900000000001), 'mean_duration_us': np.float64(18.626500000000004), 'median_duration_us': np.float64(18.426000000000002), 'std_dev_duration_us': np.float64(0.5515921651606974), 'min_duration_us': np.float64(17.906), 'max_duration_us': np.float64(19.548)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(263.786), 'mean_duration_us': np.float64(43.964333333333336), 'median_duration_us': np.float64(44.7455), 'std_dev_duration_us': np.float64(2.4412839290468074), 'min_duration_us': np.float64(40.219), 'max_duration_us': np.float64(46.829)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(18.63)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(43.96)}]","{'op_shape': (1, 512, 256, 256), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33554432, 65536, 256, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.052708869212553675,98.54527264172934 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), (), ())","('c10::BFloat16', 'double', 'Scalar')","((2621440, 10240, 1), (), ())","('', '', '1')",5296,48,373.585,7.783020833333333,2.560760072418521,0.00262144,10.000007629394531,0.24999980926528223,vector_bf16,1.3699063380734053,0.09661753073931967,0.34247632322965266,0.024154364256512472,7.6912841796875,0.5368066733838069,369.181640625,7.0255,6.259,22.033,1.3563714325383884,1.1431306751836474,1.60631706664672,0.33909259942747483,0.2857824507612052,0.4015789602812477,7.73095703125,6.52783203125,9.1728515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(369.18199999999996), 'mean_duration_us': np.float64(7.6912916666666655), 'median_duration_us': np.float64(7.731), 'std_dev_duration_us': np.float64(0.5311947994197189), 'min_duration_us': np.float64(6.528), 'max_duration_us': np.float64(9.173)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.69)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.051815696012055955,98.5970883377414 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 1280), (1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 1280, 1), (98560, 1280, 1), ())","('', '', '1')",1499,130,1438.233,11.063330769230769,1.7957760620237115,9.856e-05,0.56396484375,0.16666666666666666,vector_bf16,0.21374836252903948,0.010641487638759984,0.03562472708817325,0.0017735812731266625,2.7733285757211537,0.1361878321358302,360.53271484375,11.422,8.633,17.606,0.21401400954232197,0.19175194426852438,0.25028007439553623,0.035669001590386995,0.031958657378087396,0.04171334573258938,2.76318359375,2.36279296875,3.083984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 130, 'total_duration_us': np.float64(360.52700000000004), 'mean_duration_us': np.float64(2.7732846153846156), 'median_duration_us': np.float64(2.763), 'std_dev_duration_us': np.float64(0.13570642718271758), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(3.084)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.77)}]","{'shape_in1': (1, 77, 1280), 'shape_in2': (1, 77, 1280), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (98560, 1280, 1), 'stride_input2': (98560, 1280, 1), 'stride_output': None}",True,transformers/models/clip/modeling_clip.py(234): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.05060179461556885,98.64769013235697 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('float', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",5091,98,851.584,8.689632653061224,1.5716419701133448,0.001048576,6.0,0.16666666666666666,vector_fp32,1.772961286208643,0.17509553373520487,0.2954935477014405,0.029182588955867478,3.653773716517857,1.208679528258489,358.06982421875,8.247,7.24,16.565,1.8058727243167485,0.41118527852948683,1.9635632258457787,0.3009787873861247,0.06853087975491447,0.32726053764096313,3.48388671875,3.2041015625,15.30078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(358.069), 'mean_duration_us': np.float64(3.653765306122449), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(1.202514761257105), 'min_duration_us': np.float64(3.204), 'max_duration_us': np.float64(15.301)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.65)}]","{'op_shape': (1, 256, 4096), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (1048576, 4096, 1), 'stride_output': (1048576, 4096, 1)}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.05025612089322476,98.6979462532502 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), (1, 256, 10240), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2621440, 10240, 1), (2621440, 10240, 1), ())","('', '', '1')",5293,48,362.679,7.555812499999999,1.2632263262494912,0.00262144,15.0,0.16666666666666666,vector_bf16,2.1403600581760758,0.12136864503662081,0.3567266763626793,0.020228107506103484,7.373291015625,0.4467926884954272,353.91796875,7.1555,6.409,12.199,2.1575522250502344,1.7376337641601036,2.35143110592014,0.35959203750837243,0.2896056273600173,0.3919051843200234,7.2900390625,6.68896484375,9.0517578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(353.918), 'mean_duration_us': np.float64(7.373291666666667), 'median_duration_us': np.float64(7.29), 'std_dev_duration_us': np.float64(0.4421139068127377), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(9.052)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.37)}]","{'shape_in1': (1, 256, 10240), 'shape_in2': (1, 256, 10240), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (2621440, 10240, 1), 'stride_input2': (2621440, 10240, 1), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.04967339613884494,98.74761964938904 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 128, 1024, 1024), ())","('c10::BFloat16', 'double')","((134217728, 1048576, 1024, 1), ())","('', '')",27269,3,25.979,8.659666666666666,0.5040171954738586,0.134217728,512.0000076293945,0.24999999627470976,vector_bf16,4.586877843701335,0.04590349744788913,1.1467194438378827,0.01147587419096851,117.052734375,1.1657288165048338,351.158203125,8.733,8.123,9.123,4.569380051033554,4.552296594446215,4.638956885624237,1.1423449957361216,1.138074131652928,1.1597392041245986,117.4931640625,115.73095703125,117.93408203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(351.158), 'mean_duration_us': np.float64(117.05266666666667), 'median_duration_us': np.float64(117.493), 'std_dev_duration_us': np.float64(0.951743079244021), 'min_duration_us': np.float64(115.731), 'max_duration_us': np.float64(117.934)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(117.05)}]","{'shape_in1': (1, 128, 1024, 1024), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (134217728, 1048576, 1024, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.04928605516368856,98.79690570455273 +aten::gelu,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 5120), ())","('c10::BFloat16', '')","((394240, 5120, 1), ())","('', '')",1599,64,746.145,11.658515625,2.0393301109284105,,,,,,,,,5.263710021972656,0.3725945490820721,336.87744140625,11.142,10.165,22.304,,,,,,,5.16650390625,4.80615234375,6.96923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 64, 'total_duration_us': np.float64(336.87699999999995), 'mean_duration_us': np.float64(5.263703124999999), 'median_duration_us': np.float64(5.1665), 'std_dev_duration_us': np.float64(0.369633588828497), 'min_duration_us': np.float64(4.806), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Ge...', 'stream': 0, 'mean_duration_us': np.float64(5.26)}]",,False,transformers/activations.py(88): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: GELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(88): forward', 'aten::gelu', 'void at::native::vectorized_elementwise_kernel<8, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::GeluCUDAKernelImpl(at::TensorIteratorBase&, at::native::GeluType)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.047281709533752464,98.84418741408648 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1, 65536, 512), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",26880,4,201.75900000000001,50.439750000000004,5.458195206903715,0.041946112,32.005859375,1.2498626960395436,vector_bf16,0.39912130302732496,0.017376149938031805,0.49884682784854806,0.021717801608335786,84.2020263671875,3.5496797689210453,336.80810546875,48.2565,46.82,58.426,0.39407333797801747,0.3841346451234302,0.4242038910298347,0.4925375646425072,0.4801155631961638,0.530196618913014,85.16357421875,79.1142578125,87.36669921875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(27.756999999999998), 'mean_duration_us': np.float64(6.9392499999999995), 'median_duration_us': np.float64(6.929), 'std_dev_duration_us': np.float64(0.39939477650565214), 'min_duration_us': np.float64(6.408), 'max_duration_us': np.float64(7.491)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(56.881), 'mean_duration_us': np.float64(14.22025), 'median_duration_us': np.float64(14.381), 'std_dev_duration_us': np.float64(0.4814152962879343), 'min_duration_us': np.float64(13.419), 'max_duration_us': np.float64(14.7)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(252.17000000000002), 'mean_duration_us': np.float64(63.042500000000004), 'median_duration_us': np.float64(63.313), 'std_dev_duration_us': np.float64(2.4823704900759695), 'min_duration_us': np.float64(59.287), 'max_duration_us': np.float64(66.257)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.94)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(14.22)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(63.04)}]","{'op_shape': (1, 512, 128, 128), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (512, 1, 65536, 512), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']]",0.04727197803720749,98.89145939212368 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 4096), (1, 256, 4096), ())","('c10::BFloat16', 'float', 'Scalar')","((1048576, 4096, 1), (1048576, 4096, 1), ())","('', '', 'False')",5102,98,631.281,6.441642857142857,1.4747967272129192,0.001048576,6.0,0.16666666666666666,vector_bf16,1.8500109098074213,0.12718544383168334,0.3083351516345702,0.021197573971947235,3.4167580117984695,0.23546391148849397,334.84228515625,6.089,5.418,19.218,1.83761300947469,1.6033974474863117,2.0951059980487807,0.3062688349124484,0.26723290791438525,0.34918433300813007,3.423828125,3.0029296875,3.923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(334.84000000000003), 'mean_duration_us': np.float64(3.4167346938775514), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.23425720867615366), 'min_duration_us': np.float64(3.003), 'max_duration_us': np.float64(3.924)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]","{'op_shape': (1, 256, 4096), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (1048576, 4096, 1), 'stride_output': (1048576, 4096, 1)}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.04699606955065767,98.93845546167434 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (256, 512, 1, 1), (256,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((134217728, 262144, 512, 1), (512, 1, 1, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",27156,1,77.585,77.585,,68.719476736,384.25,170.55562784645414,matrix_bf16,1.2371447381153708,,211.00199754620417,,325.681640625,,325.681640625,77.585,77.585,77.585,1.2371447381153708,1.2371447381153708,1.2371447381153708,211.00199754620417,211.00199754620417,211.00199754620417,325.681640625,325.681640625,325.681640625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(115.61), 'mean_duration_us': np.float64(115.61), 'median_duration_us': np.float64(115.61), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(115.61), 'max_duration_us': np.float64(115.61)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(210.072), 'mean_duration_us': np.float64(210.072), 'median_duration_us': np.float64(210.072), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(210.072), 'max_duration_us': np.float64(210.072)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(115.61)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF...', 'stream': 0, 'mean_duration_us': np.float64(210.07)}]","{'convNd': 'conv2d', 'input_shape': (1, 512, 512, 512), 'filter_shape': (256, 512, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (134217728, 262144, 512, 1), 'weight_stride': (512, 1, 1, 1), 'bias': False, 'stride': (1, 1), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x256x32_MI32x32x8x1_SN_1LDSB1_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA0_DTVB0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA8_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB256_LPA0_LPB8_LRVW8_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU4_SUM0_SUS256_SPO1_SRVW0_SSO16_SVW2_TSGRA0_TSGRB0_TT2_256_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA1_WSGRB0_WG128_2_1_WGM32']]",0.04571034696840201,98.98416580864274 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24,triton,python3,CPU,thread 416 (python3),"((2, 4096, 2432), (2, 14592), (14592,), (8192, 2432), (2432,), (2, 4864), (4864,), (2, 4096, 2432), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (9961472, 2432, 1), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '8192', '2432')",20447,4,110.533,27.63325,1.2336110610723305,0.039845888,114.115966796875,0.3329945937157026,vector_bfloat16,1.5304232034612713,0.2637053812120767,0.5096226528496702,0.08781246627735999,80.3485107421875,16.725685280144965,321.39404296875,27.4905,26.279,29.273,1.6599540938307058,1.1348991245988338,1.6668855015848398,0.5527557390618733,0.37791527290409527,0.555063860370839,72.0859375,71.7861328125,105.43603515625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(321.394), 'mean_duration_us': np.float64(80.3485), 'median_duration_us': np.float64(72.086), 'std_dev_duration_us': np.float64(14.484854805968892), 'min_duration_us': np.float64(71.786), 'max_duration_us': np.float64(105.436)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(80.35)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 8192, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_24']",0.0451085704109271,99.02927437905367 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 64, 64), (1, 256, 64, 64), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 4096, 64, 1), (1048576, 64, 16384, 1), ())","('', '', 'False')",5249,48,443.65,9.242708333333333,1.6096055147521606,0.001048576,4.0,0.25,vector_bf16,0.6409524591891147,0.030831353206344933,0.16023811479727867,0.007707838301586233,6.558736165364583,0.31613188099540285,314.8193359375,8.863,8.132,18.267,0.6405197978707994,0.5850656989510965,0.6935196667204909,0.16012994946769984,0.14626642473777413,0.17337991668012273,6.54833984375,6.0478515625,7.1689453125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(314.819), 'mean_duration_us': np.float64(6.558729166666667), 'median_duration_us': np.float64(6.5485), 'std_dev_duration_us': np.float64(0.31280177026775097), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.169)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.56)}]","{'op_shape': (1, 256, 64, 64), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1048576, 4096, 64, 1), 'stride_output': (1048576, 64, 16384, 1)}",True,transformers/models/t5/modeling_t5.py(253): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.04418579153079958,99.07346017058447 +triton_poi_fused_add_addmm_silu_3,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '', '4864')",18412,72,1541.699,21.41248611111111,4.5781927764562225,2.432e-05,0.07421875,0.3125,vector_bfloat16,0.020345975762088866,0.005449940679810506,0.006358117425652772,0.0017031064624407834,4.111178927951389,1.1141597813731445,296.0048828125,20.4805,17.466,54.261,0.018874042542095834,0.009666639495390587,0.02989749615456762,0.00589813829440495,0.003020824842309559,0.009342967548302383,4.14501953125,2.60302734375,8.05078125,"[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'count': 72, 'total_duration_us': np.float64(296.005), 'mean_duration_us': np.float64(4.111180555555555), 'median_duration_us': np.float64(4.1450000000000005), 'std_dev_duration_us': np.float64(1.1063898665679002), 'min_duration_us': np.float64(2.603), 'max_duration_us': np.float64(8.051)}]","[{'name': 'triton_poi_fused_add_addmm_silu_3', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_3']",0.04154512938382049,99.11500529996829 +aten::rsqrt,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 1),)","('float',)","((256, 1, 1),)","('',)",5097,98,768.239,7.839173469387755,2.5000466099799774,2.56e-07,0.001953125,0.125,vector_fp32,0.0007148460470941715,4.830387704882627e-05,8.935575588677144e-05,6.037984631103284e-06,2.89102857940051,0.4045436215443143,283.32080078125,7.161,6.28,25.899,0.0007204232222603916,0.0003043541107321675,0.0007748575651210049,9.005290278254895e-05,3.8044263841520934e-05,9.685719564012561e-05,2.8427734375,2.64306640625,6.72900390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(283.322), 'mean_duration_us': np.float64(2.8910408163265306), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.40249580853103045), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::rs...', 'stream': 0, 'mean_duration_us': np.float64(2.89)}]","{'op_shape': (1, 256, 1), 'dtype_in_out': ('float', None), 'stride_input': (256, 1, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::rsqrt', 'void at::native::vectorized_elementwise_kernel<4, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::rsqrt_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.0397648823010821,99.15477018226937 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256),)","('c10::BFloat16',)","((33554432, 65536, 256, 1),)","('',)",27035,6,51.627,8.6045,0.5049533641832682,0.033554432,128.0,0.25,vector_bf16,2.957530060564024,0.21523914482639145,0.739382515141006,0.05380978620659786,45.580403645833336,3.2794362265579236,273.482421875,8.3875,8.203,9.544,2.913184611115289,2.706396894078727,3.2216533478352596,0.7282961527788222,0.6765992235196817,0.8054133369588149,46.108154296875,41.6611328125,49.5927734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(273.482), 'mean_duration_us': np.float64(45.580333333333336), 'median_duration_us': np.float64(46.108000000000004), 'std_dev_duration_us': np.float64(2.993738168614989), 'min_duration_us': np.float64(41.661), 'max_duration_us': np.float64(49.593)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(45.58)}]","{'op_shape': (1, 512, 256, 256), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (33554432, 65536, 256, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.03838403776668259,99.19315422003605 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 512, 512), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((134217728, 262144, 512, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",27128,1,40.3,40.3,,0.671091712,512.005859375,1.2499914170293767,vector_bf16,2.1229327891536838,,2.6536477653723396,,252.89404296875,,252.89404296875,40.3,40.3,40.3,2.1229327891536838,2.1229327891536838,2.1229327891536838,2.6536477653723396,2.6536477653723396,2.6536477653723396,252.89404296875,252.89404296875,252.89404296875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.455), 'mean_duration_us': np.float64(64.455), 'median_duration_us': np.float64(64.455), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.455), 'max_duration_us': np.float64(64.455)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(188.439), 'mean_duration_us': np.float64(188.439), 'median_duration_us': np.float64(188.439), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(188.439), 'max_duration_us': np.float64(188.439)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(64.46)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(188.44)}]","{'op_shape': (1, 512, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 262144, 512, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.03549440007781689,99.22864862011387 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), (1, 256, 512, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((67108864, 262144, 512, 1), (67108864, 262144, 512, 1), ())","('', '', '1')",27163,3,24.807,8.269,0.9348844848429142,0.067108864,384.0,0.16666666666666666,vector_bf16,4.806911957597861,0.06987866686866041,0.8011519929329768,0.011646444478110094,83.77734375,1.2263848242878954,251.33203125,7.981,7.512,9.314,4.832423384269189,4.7278621765393885,4.860450311985005,0.8054038973781982,0.7879770294232313,0.8100750519975009,83.3232421875,82.8427734375,85.166015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(251.332), 'mean_duration_us': np.float64(83.77733333333333), 'median_duration_us': np.float64(83.323), 'std_dev_duration_us': np.float64(1.0012979354595477), 'min_duration_us': np.float64(82.843), 'max_duration_us': np.float64(85.166)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(83.78)}]","{'shape_in1': (1, 256, 512, 512), 'shape_in2': (1, 256, 512, 512), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (67108864, 262144, 512, 1), 'stride_input2': (67108864, 262144, 512, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.03527516727889168,99.26392378739277 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), (1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 768, 1), (59136, 768, 1), ())","('', '', '1')",54,50,553.635,11.0727,2.5819875452204384,5.9136e-05,0.33837890625,0.16666666666666666,vector_bf16,0.07100890361360628,0.005397594404611995,0.011834817268934377,0.000899599067435332,5.024775390625,0.37790636847342857,251.23876953125,11.0415,8.814,26.019,0.07030409907120744,0.059059100130039004,0.08518911699882767,0.011717349845201237,0.0098431833550065,0.014198186166471278,5.046875,4.1650390625,6.0078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(251.23900000000003), 'mean_duration_us': np.float64(5.024780000000001), 'median_duration_us': np.float64(5.047), 'std_dev_duration_us': np.float64(0.37414020313246205), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.02)}]","{'shape_in1': (1, 77, 768), 'shape_in2': (1, 77, 768), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (59136, 768, 1), 'stride_input2': (59136, 768, 1), 'stride_output': None}",True,transformers/models/clip/modeling_clip.py(234): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.03526207773072203,99.29918586512349 +aten::pow,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 10240), ())","('c10::BFloat16', 'Scalar')","((2621440, 10240, 1), ())","('', '3.')",5289,48,552.571,11.511895833333334,2.5602263134638084,0.00262144,10.0,0.25,vector_bf16,2.1873946560920685,0.12845204619245754,0.5468486640230172,0.03211301154811437,4.81292724609375,0.3375204223664483,231.0205078125,10.461,9.173,18.558,2.200065206433767,1.625896159903089,2.4695074149034038,0.5500163016084417,0.4064740399757723,0.6173768537258509,4.76611328125,4.24609375,6.44921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)', 'stream': 0, 'count': 48, 'total_duration_us': np.float64(231.017), 'mean_duration_us': np.float64(4.812854166666667), 'median_duration_us': np.float64(4.766), 'std_dev_duration_us': np.float64(0.334003617095143), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","{'op_shape': (1, 256, 10240), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (2621440, 10240, 1), 'stride_output': None}",True,transformers/activations.py(65): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerFF', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(146): forward', 'nn.Module: T5DenseGatedActDense', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(115): forward', 'nn.Module: NewGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(65): forward', 'aten::pow', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array >(int, at::native::(anonymous namespace)::pow_tensor_scalar_kernel_impl(at::TensorIteratorBase&, c10::BFloat16)::{lambda(c10::BFloat16)#2}, std::array)']",0.032424387044540065,99.33161025216803 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128),)","('c10::BFloat16',)","((8388608, 16384, 128, 1),)","('',)",26758,10,98.417,9.8417,2.7845479206187536,0.008388608,32.0,0.25,vector_bf16,1.5712199540858873,0.23950682265366277,0.39280498852147183,0.05987670566341569,21.7033203125,2.556412588605594,217.033203125,9.0485,8.052,17.546,1.528658727505411,1.3960563289452301,2.221846058262472,0.3821646818763528,0.34901408223630753,0.555461514565618,21.951416015625,15.10205078125,24.03515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 10, 'total_duration_us': np.float64(217.03300000000002), 'mean_duration_us': np.float64(21.703300000000002), 'median_duration_us': np.float64(21.9515), 'std_dev_duration_us': np.float64(2.425225888448332), 'min_duration_us': np.float64(15.102), 'max_duration_us': np.float64(24.035)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(21.7)}]","{'op_shape': (1, 512, 128, 128), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (8388608, 16384, 128, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.030461228945755595,99.36207148111379 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((768,), (77, 3072), (3072, 768), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (3072, 1), (1, 3072), (), ())","('', '', '', '1', '1')",163,24,748.493,31.187208333333334,3.7659750048717617,0.36339072,5.0654296875,68.41599190283401,matrix_bf16,0.5941187059367797,0.02303644922778071,40.647220574692945,1.5760615238378917,8.953898111979166,0.37142902420526336,214.8935546875,31.522,26.61,43.515,0.6041310576656731,0.5303977485006584,0.6167674448035381,41.33222554950524,36.28768806670242,42.19675650961048,8.7919921875,8.61181640625,10.01416015625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(214.894), 'mean_duration_us': np.float64(8.953916666666666), 'median_duration_us': np.float64(8.792), 'std_dev_duration_us': np.float64(0.36354767187017195), 'min_duration_us': np.float64(8.612), 'max_duration_us': np.float64(10.014)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.95)}]","{'M': 77, 'N': 768, 'K': 3072, 'bias': True, 'stride_A': (3072, 1), 'stride_B': (1, 3072), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x32x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB2048_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB2_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.03016092318617752,99.39223240429996 +aten::layer_norm,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 77, 768), (), (768,), (768,), (), ())","('c10::BFloat16', 'ScalarList', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((59136, 768, 1), (), (1,), (1,), (), ())","('', '[768]', '', '', '1.0000000000000001e-05', 'True')",55,50,1110.339,22.20678,4.586332434038138,0.000300288,0.234375,1.221875,vector_bf16,0.057607321869964326,0.0024247130139245644,0.07038894640986265,0.0029626962138890687,4.274140625,0.19483437471531076,213.70703125,21.1715,18.998,48.081,0.05789239475500345,0.04949031268436578,0.06075766296475133,0.07073726984126984,0.060470975811209436,0.07423826943505553,4.2451171875,4.044921875,4.9658203125,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)', 'stream': 0, 'count': 50, 'total_duration_us': np.float64(213.705), 'mean_duration_us': np.float64(4.274100000000001), 'median_duration_us': np.float64(4.245), 'std_dev_duration_us': np.float64(0.19289761532999833), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.966)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.27)}]","{'op_shape': (1, 77, 768), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (59136, 768, 1), 'stride_output': None, 'num_channels': 768, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,torch/nn/functional.py(2880): layer_norm,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/normalization.py(228): forward', 'torch/nn/functional.py(2880): layer_norm', 'aten::layer_norm', 'aten::native_layer_norm', 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, c10::BFloat16 const*, c10::BFloat16 const*, c10::BFloat16 const*, float*, float*, c10::BFloat16*)']",0.02999439123825997,99.42222679553822 +aten::silu,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 512, 512),)","('c10::BFloat16',)","((134217728, 262144, 512, 1),)","('',)",27132,1,9.824,9.824,,0.134217728,512.0,0.25,vector_bf16,2.650166378496158,,0.6625415946240395,,202.580078125,,202.580078125,9.824,9.824,9.824,2.650166378496158,2.650166378496158,2.650166378496158,0.6625415946240395,0.6625415946240395,0.6625415946240395,202.580078125,202.580078125,202.580078125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(202.58), 'mean_duration_us': np.float64(202.58), 'median_duration_us': np.float64(202.58), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(202.58), 'max_duration_us': np.float64(202.58)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(202.58)}]","{'op_shape': (1, 512, 512, 512), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (134217728, 262144, 512, 1), 'stride_output': None}",True,torch/nn/functional.py(2349): silu,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: SiLU', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/activation.py(469): forward', 'torch/nn/functional.py(2349): silu', 'aten::silu', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::silu_kernel(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#6}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.028432691637788682,99.45065948717601 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 1), (), ())","('float', 'double', 'Scalar')","((256, 1, 1), (), ())","('', '', '1')",5096,98,866.399,8.84080612244898,2.567299213314213,2.56e-07,0.00196075439453125,0.1245136186770428,vector_fp32,0.0010399005747285341,3.1825317628982755e-05,0.00012948178362378636,3.962685463530916e-06,1.97900390625,0.0625893259287263,193.9423828125,8.142,7.05,22.604,0.0010479561971129916,0.0009004893071000856,0.0010931173416407062,0.00013048481831757092,0.00011212318220701456,0.0001361079958463136,1.9619140625,1.880859375,2.283203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 98, 'total_duration_us': np.float64(193.94899999999998), 'mean_duration_us': np.float64(1.9790714285714284), 'median_duration_us': np.float64(1.962), 'std_dev_duration_us': np.float64(0.062211825439298846), 'min_duration_us': np.float64(1.881), 'max_duration_us': np.float64(2.283)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.98)}]","{'shape_in1': (1, 256, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (256, 1, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(55): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5LayerNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(55): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.027220366469615218,99.47787985364563 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((3072,), (77, 768), (768, 3072), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (768, 1), (1, 768), (), ())","('', '', '', '1', '1')",152,24,827.36,34.473333333333336,4.787860025438126,0.363568128,5.06982421875,68.39006067610516,matrix_bf16,0.7049808681361566,0.04202993484253143,48.21368434732506,2.8744297940934724,7.570332845052083,0.5188871878512363,181.68798828125,34.396,29.203,52.719,0.7174067348444912,0.5745311138786279,0.749921794186527,49.06349012546126,39.29221773846965,51.28719700675025,7.41015625,7.0888671875,9.2529296875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(181.688), 'mean_duration_us': np.float64(7.570333333333333), 'median_duration_us': np.float64(7.41), 'std_dev_duration_us': np.float64(0.5079509217324928), 'min_duration_us': np.float64(7.089), 'max_duration_us': np.float64(9.253)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]","{'M': 77, 'N': 3072, 'K': 768, 'bias': True, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x48x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.02550042725278935,99.50338028089843 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 256, 512, 512), ())","('c10::BFloat16', 'double')","((67108864, 262144, 512, 1), ())","('', '')",27164,3,25.487000000000002,8.495666666666667,0.16254332755709514,0.067108864,256.00000762939453,0.24999999254941963,vector_bf16,4.469912772646585,0.12985639942242433,1.1174781598582018,0.03246409888810058,60.088216145833336,1.7745229841248433,180.2646484375,8.412,8.392,8.683,4.533844348089992,4.320485290245513,4.555408679604249,1.133461053242726,1.0801212903712551,1.1388521359606238,59.20703125,58.9267578125,62.130859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(180.265), 'mean_duration_us': np.float64(60.08833333333333), 'median_duration_us': np.float64(59.207), 'std_dev_duration_us': np.float64(1.448899659128341), 'min_duration_us': np.float64(58.927), 'max_duration_us': np.float64(62.131)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(60.09)}]","{'shape_in1': (1, 256, 512, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (67108864, 262144, 512, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.025300657446954096,99.52868093834537 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((2, 16, 128, 128), (2432, 16, 2, 2), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((262144, 16384, 128, 1), (64, 4, 2, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",18414,4,949.711,237.42775,1.2800599920837124,2.550136832,39.296875,61.88787276341948,matrix_bf16,0.9567967968133243,0.010061874400333954,59.214118421630346,0.6227080026493774,43.0699462890625,0.45408290154729514,172.27978515625,237.82350000000002,235.58,238.484,0.9583142321704221,0.9446292253962569,0.9659294975161963,59.30802926793712,58.46109330993105,59.77932184071607,42.999755859375,42.6591796875,43.62109375,"[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(19.905), 'mean_duration_us': np.float64(4.97625), 'median_duration_us': np.float64(4.9864999999999995), 'std_dev_duration_us': np.float64(0.1425313561992589), 'min_duration_us': np.float64(4.766), 'max_duration_us': np.float64(5.166)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.806), 'mean_duration_us': np.float64(8.4515), 'median_duration_us': np.float64(8.4315), 'std_dev_duration_us': np.float64(0.5024542267709567), 'min_duration_us': np.float64(7.811), 'max_duration_us': np.float64(9.132)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(51.512), 'mean_duration_us': np.float64(12.878), 'median_duration_us': np.float64(12.838000000000001), 'std_dev_duration_us': np.float64(0.08246211251235361), 'min_duration_us': np.float64(12.818), 'max_duration_us': np.float64(13.018)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.05699999999999), 'mean_duration_us': np.float64(16.764249999999997), 'median_duration_us': np.float64(16.804000000000002), 'std_dev_duration_us': np.float64(0.3003168118837177), 'min_duration_us': np.float64(16.304), 'max_duration_us': np.float64(17.145)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(4.98)}, {'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(8.45)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(12.88)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(16.76)}]","{'convNd': 'conv2d', 'input_shape': (2, 16, 128, 128), 'filter_shape': (2432, 16, 2, 2), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (262144, 16384, 128, 1), 'weight_stride': (64, 4, 2, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['Im2d2Col_v2'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x112x32_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLRn20_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM0p30_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB128_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC3_NTD3_NEPBS0_NLCA2_NLCB1_ONLL1_PK0_PGR1_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_112_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM32']]",0.024179959115968184,99.55286089746134 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((666, 4096), (4096, 2432), (666, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((4096, 1), (1, 4096), (2432, 1))","('', '', '')",18420,4,110.85300000000001,27.713250000000002,1.621800927980989,13.268680704,27.29248046875,463.6441899991055,matrix_bf16,0.6774995134895065,0.012472136455825294,314.11871315663024,5.782633604619402,42.251708984375,0.7774666796021822,169.0068359375,28.016,25.568,29.253,0.6772508591693622,0.6645669783316136,0.690929357287688,314.0034260257771,308.1226183687141,320.3453822062526,42.261962890625,41.419921875,43.06298828125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(169.007), 'mean_duration_us': np.float64(42.25175), 'median_duration_us': np.float64(42.262), 'std_dev_duration_us': np.float64(0.6732137012123276), 'min_duration_us': np.float64(41.42), 'max_duration_us': np.float64(43.063)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(42.25)}]","{'M': 666, 'N': 2432, 'K': 4096, 'bias': False, 'stride_A': (4096, 1), 'stride_B': (1, 4096), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x96x128_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB256_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_3_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.023720591360045812,99.57658148882139 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (), ())","('c10::BFloat16', '', 'ScalarList')","((33554432, 65536, 256, 1), (), ())","('', '', '[2., 2.]')",27118,1,10.336,10.336,,,,,,,,,,159.51611328125,,159.51611328125,10.336,10.336,10.336,,,,,,,159.51611328125,159.51611328125,159.51611328125,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(159.516), 'mean_duration_us': np.float64(159.516), 'median_duration_us': np.float64(159.516), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(159.516), 'max_duration_us': np.float64(159.516)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(159.52)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)']",0.02238854137170281,99.59897003019309 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), ())","('c10::BFloat16', 'double')","((236544, 3072, 1), ())","('', '')",154,24,334.505,13.937708333333333,2.8549099046039617,0.000236544,0.9023513793945312,0.24999788624622696,vector_bf16,0.14903961514748587,0.017924786857637046,0.03725958875382261,0.00448115882582341,6.423543294270833,0.6604502574194904,154.1650390625,13.1995,12.348,27.011,0.14673507991585708,0.12175839346528433,0.20365578896479244,0.03668345981713545,0.030439340999057492,0.05091351676300578,6.448486328125,4.64599609375,7.77099609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(154.16500000000002), 'mean_duration_us': np.float64(6.423541666666668), 'median_duration_us': np.float64(6.4485), 'std_dev_duration_us': np.float64(0.6465522651705911), 'min_duration_us': np.float64(4.646), 'max_duration_us': np.float64(7.771)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.42)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.02163750284609438,99.62060753303918 +triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4,triton,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (), (), ())","('', '', '', '', '', '', '8192', '19', '128')",18417,4,156.513,39.12825,0.708237895531345,2.432e-06,209.004638671875,1.1097054841645027e-05,vector_bfloat16,5.740487575802279,0.09823798442072894,6.370250544645981e-05,1.090152300649496e-06,38.185791015625,0.6489508867729514,152.7431640625,39.3685,38.127,39.649,5.722922472324457,5.6459242978225594,5.87018106073764,6.350758452986724e-05,6.265313156471314e-05,6.514172116139158e-05,38.296142578125,37.333984375,38.81689453125,"[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(152.743), 'mean_duration_us': np.float64(38.18575), 'median_duration_us': np.float64(38.296), 'std_dev_duration_us': np.float64(0.5620197394220234), 'min_duration_us': np.float64(37.334), 'max_duration_us': np.float64(38.817)}]","[{'name': 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(38.19)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.clone, aten.convolution, aten.native_layer_norm, aten.slice, aten.transpose, aten.view', 'xnumel': 19, 'rnumel': 128}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_4']",0.021437938635256556,99.64204547167444 +aten::sigmoid,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072),)","('c10::BFloat16',)","((236544, 3072, 1),)","('',)",155,24,197.116,8.213166666666668,2.1981834529341766,0.000236544,0.90234375,0.25,vector_bf16,0.1554287062821396,0.009436700801585865,0.03885717657053489,0.002359175200396465,6.109761555989583,0.38336007029338576,146.63427734375,7.386,7.041,15.934,0.1564482841918295,0.13654911197237685,0.174983605562579,0.03911207104795737,0.03413727799309421,0.04374590139064475,6.0478515625,5.4072265625,6.92919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(146.634), 'mean_duration_us': np.float64(6.109749999999999), 'median_duration_us': np.float64(6.048), 'std_dev_duration_us': np.float64(0.37528314310664157), 'min_duration_us': np.float64(5.407), 'max_duration_us': np.float64(6.929)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::si...', 'stream': 0, 'mean_duration_us': np.float64(6.11)}]","{'op_shape': (1, 77, 3072), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::sigmoid', 'void at::native::vectorized_elementwise_kernel<8, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::sigmoid_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.020580538964311484,99.66262601063875 +triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7,triton,python3,CPU,thread 416 (python3),"((2, 2432, 64, 64), (2432,), (1, 36864, 2432), (2, 4096, 1), (2, 4096, 1), (2, 14592), (14592,), (2, 4096, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((9961472, 4096, 64, 1), (1,), (89653248, 2432, 1), (4096, 1, 8192), (4096, 1, 8192), (14592, 1), (1,), (9961472, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '8192', '2432')",18422,4,98.977,24.74425,0.7730917905828956,4.864e-06,247.0927734375,1.8772996921228504e-05,vector_bfloat16,7.670023327737122,0.4447054603016994,0.00014398932431735983,8.348454237097304e-06,33.8695068359375,2.052704965445482,135.47802734375,24.6915,23.866,25.728,7.818620491115268,7.037969235307381,8.004883093410573,0.00014677893840796103,0.00013212377478612642,0.0001502756456673908,33.1484375,32.3671875,36.81396484375,"[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(135.478), 'mean_duration_us': np.float64(33.8695), 'median_duration_us': np.float64(33.1485), 'std_dev_duration_us': np.float64(1.7777253021769148), 'min_duration_us': np.float64(32.367), 'max_duration_us': np.float64(36.814)}]","[{'name': 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_na...', 'stream': 0, 'mean_duration_us': np.float64(33.87)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.clone, aten.convolution, aten.mul, aten.native_layer_norm, aten.slice, aten.split, aten.transpose, aten.unsqueeze, aten.view', 'xnumel': 2432, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__unsafe_view_add_addmm_clone_convolution_mul_native_layer_norm_slice_split_transpose_unsqueeze_view_7']",0.01901472746389162,99.68164073810264 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), (1, 512, 256, 256), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((33554432, 65536, 256, 1), (33554432, 65536, 256, 1), ())","('', '', '1')",27058,3,23.405,7.801666666666667,0.41332956987533936,0.033554432,192.0,0.16666666666666666,vector_bf16,4.863714008193326,0.10654152556180534,0.8106190013655542,0.017756920926967516,41.40673828125,0.9002729161043719,124.22021484375,7.631,7.501,8.273,4.837242314648397,4.7729040297266945,4.980995680204885,0.8062070524413995,0.7954840049544492,0.8301659467008141,41.6201171875,40.4189453125,42.18115234375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(124.22), 'mean_duration_us': np.float64(41.406666666666666), 'median_duration_us': np.float64(41.62), 'std_dev_duration_us': np.float64(0.7349804230197037), 'min_duration_us': np.float64(40.419), 'max_duration_us': np.float64(42.181)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(41.41)}]","{'shape_in1': (1, 512, 256, 256), 'shape_in2': (1, 512, 256, 256), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (33554432, 65536, 256, 1), 'stride_input2': (33554432, 65536, 256, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.017434661376983338,99.69907539947963 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 3072), (1, 77, 3072))","('c10::BFloat16', 'c10::BFloat16')","((236544, 3072, 1), (236544, 3072, 1))","('', '')",156,24,167.869,6.994541666666667,0.9124549770508829,0.000236544,1.353515625,0.16666666666666666,vector_bf16,0.28015792972435755,0.029938919474100666,0.04669298828739291,0.004989819912350111,5.121663411458333,0.5496177307356938,122.919921875,6.69,6.279,10.546,0.27684094815905147,0.21741735896476921,0.344064,0.046140158026508574,0.0362362264941282,0.05734399999999999,5.126953125,4.125,6.52783203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)', 'stream': 0, 'count': 24, 'total_duration_us': np.float64(122.91999999999999), 'mean_duration_us': np.float64(5.121666666666666), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.5380385415769229), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(6.528)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.12)}]","{'shape_in1': (1, 77, 3072), 'shape_in2': (1, 77, 3072), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (236544, 3072, 1), 'stride_input2': (236544, 3072, 1), 'stride_output': None}",True,transformers/activations.py(122): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPEncoder', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(478): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: CLIPEncoderLayer', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/module.py(1791): inner', 'transformers/models/clip/modeling_clip.py(364): forward', 'nn.Module: CLIPMLP', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(348): forward', 'nn.Module: QuickGELUActivation', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/activations.py(122): forward', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor >, std::array >(int, at::native::BinaryFunctor >, std::array)']",0.017252161550932125,99.71632756103055 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",26754,6,236.452,39.40866666666667,18.4690841859218,0.041946112,32.005859375,1.2498626960395436,vector_bf16,1.6614942822631178,0.12358495556463041,2.0766397230836664,0.1544642257519363,20.2880859375,1.4392336798467016,121.728515625,32.0125,30.886,77.075,1.6444940762585691,1.54579119395466,1.8744936768211198,2.055391799773594,1.9320267491903564,2.342859720620722,20.427978515625,17.90380859375,21.7109375,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(40.815000000000005), 'mean_duration_us': np.float64(6.802500000000001), 'median_duration_us': np.float64(6.689), 'std_dev_duration_us': np.float64(0.5678253105782916), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.851)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(80.91400000000002), 'mean_duration_us': np.float64(13.485666666666669), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.8789754768415834), 'min_duration_us': np.float64(11.856), 'max_duration_us': np.float64(14.661)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.8)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(13.49)}]","{'op_shape': (1, 512, 128, 128), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (8388608, 16384, 128, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.017084944286356474,99.7334125053169 +triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2432,), (2, 14592), (14592,), (666, 2432), (2432,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (1,), (14592, 1), (1,), (2432, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '666', '2432')",18465,4,108.38,27.095,2.0221168775979974,0.003239424,9.36083984375,0.33002973240832506,vector_bfloat16,0.3412189619247622,0.011781128502206408,0.11261240269667572,0.0038881226870512717,28.791748046875,0.9892329482443104,115.1669921875,27.009500000000003,24.877,29.484,0.3403865093210463,0.32846814535947716,0.355634683697479,0.11233766858662875,0.10840425411764705,0.11737001949579831,28.842041015625,27.60009765625,29.8828125,"[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(115.167), 'mean_duration_us': np.float64(28.79175), 'median_duration_us': np.float64(28.842), 'std_dev_duration_us': np.float64(0.8567591187142386), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(29.883)}]","[{'name': 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_sp...', 'stream': 0, 'mean_duration_us': np.float64(28.79)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused__unsafe_view_add_addmm_mul_native_layer_norm_split_unsqueeze_view_14']",0.016164015761205817,99.74957652107811 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 4864), (2, 4864))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (4864, 1))","('', '', '')",20398,8,268.69100000000003,33.586375000000004,2.892712465958947,0.047316992,22.59033203125,1.997535934291581,matrix_bf16,1.9130246613125643,0.0419805222067827,3.8213355041578287,0.08385760164837419,12.38751220703125,0.27056156311034085,99.10009765625,34.4215,29.244,37.065,1.907682604797483,1.853810563644006,1.9777556622773045,3.8106645543059376,3.7030532162482324,3.95063800464756,12.4169921875,11.97705078125,12.77783203125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(99.1), 'mean_duration_us': np.float64(12.3875), 'median_duration_us': np.float64(12.417), 'std_dev_duration_us': np.float64(0.253121018487205), 'min_duration_us': np.float64(11.977), 'max_duration_us': np.float64(12.778)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(12.39)}]","{'M': 2, 'N': 4864, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.01390898129773787,99.76348550237584 +aten::upsample_nearest2d,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (), ())","('c10::BFloat16', '', 'ScalarList')","((512, 1, 65536, 512), (), ())","('', '', '[2., 2.]')",27016,1,45.798,45.798,,,,,,,,,,96.5009765625,,96.5009765625,45.798,45.798,45.798,,,,,,,96.5009765625,96.5009765625,96.5009765625,"[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(32.487), 'mean_duration_us': np.float64(32.487), 'median_duration_us': np.float64(32.487), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(32.487), 'max_duration_us': np.float64(32.487)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(64.014), 'mean_duration_us': np.float64(64.014), 'median_duration_us': np.float64(64.014), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(64.014), 'max_duration_us': np.float64(64.014)}]","[{'name': 'void at::native::(anonymous namespace)::upsample_nearest2d_out_f...', 'stream': 0, 'mean_duration_us': np.float64(32.49)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(64.01)}]",,True,torch/nn/functional.py(4530): interpolate,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: Upsample2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/upsampling.py(140): forward', 'torch/nn/functional.py(4530): interpolate', 'aten::upsample_nearest2d', 'aten::upsample_nearest2d', ['void at::native::(anonymous namespace)::upsample_nearest2d_out_frame(c10::BFloat16 const*, c10::BFloat16*, unsigned long, unsigned long, unsigned long, unsigned long, unsigned long, float, float)'], ['aten::contiguous', 'aten::clone', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']]",0.013544187240632874,99.77702968961647 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 256, 256), ())","('c10::BFloat16', 'double')","((33554432, 65536, 256, 1), ())","('', '')",27059,3,24.947,8.315666666666667,0.5741866711561093,0.033554432,128.00000762939453,0.2499999850988397,vector_bf16,4.2628518963360476,0.23752221117813557,1.0657129105625724,0.05938054925517739,31.552897135416668,1.8162073388792004,94.65869140625,8.062,7.912,8.973,4.391231581832995,3.9887673345812833,4.4085567725938635,1.097807830023803,0.9971917742080594,1.1021391274558547,30.56494140625,30.44482421875,33.64892578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(94.65899999999999), 'mean_duration_us': np.float64(31.552999999999997), 'median_duration_us': np.float64(30.565), 'std_dev_duration_us': np.float64(1.4829052565824967), 'min_duration_us': np.float64(30.445), 'max_duration_us': np.float64(33.649)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(31.55)}]","{'shape_in1': (1, 512, 256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (33554432, 65536, 256, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0132856172655329,99.79031530688201 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((16384, 512), (512, 512))","('c10::BFloat16', 'c10::BFloat16')","((1, 16384), (1, 512))","('', '')",26801,3,115.902,38.634,14.048248538518957,8.589934592,32.5,252.06153846153848,matrix_bf16,1.2694183170035318,0.15815236098516106,319.9715339351672,39.86412742124429,27.146158854166668,3.616534916430768,81.4384765625,31.797,29.313,54.792,1.333433036434153,1.089293584717193,1.3855283298592498,336.10718259903325,274.56901680009986,349.2384024063685,25.55712890625,24.59619140625,31.28515625,"[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA4_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB0_LBSPPM0_LPA4_LPB0_LPM0_LRVW4_LWPMn1_MIAV0_MIWT4_8_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB8_WSGRA0_WSGRB0_WS64_WG16_16_1', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(81.438), 'mean_duration_us': np.float64(27.146), 'median_duration_us': np.float64(25.557), 'std_dev_duration_us': np.float64(2.952893609100516), 'min_duration_us': np.float64(24.596), 'max_duration_us': np.float64(31.285)}]","[{'name': 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(27.15)}]","{'M': 16384, 'N': 512, 'K': 512, 'bias': False, 'stride_A': (1, 16384), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, True)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bjlk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT64x512x32_MI16x16x1_SN_LDSB0_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB1_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI1_GRPM1_GRVWA4_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA256_LBSPPB0_LBSPPM0_LPA4_LPB0_LPM0_LRVW4_LWPMn1_MIAV0_MIWT4_8_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS8_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB8_WSGRA0_WSGRB0_WS64_WG16_16_1']",0.011430122413735462,99.80174542929575 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((8192, 2432), (2432, 64), (8192, 64))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (64, 1))","('', '', '')",20448,4,143.603,35.90075,2.4016489300756136,2.550136832,39.296875,61.88787276341948,matrix_bf16,2.102580412527132,0.07858303974522783,130.12422904533722,4.863337165115389,19.6181640625,0.7299416556187925,78.47265625,35.206999999999994,33.921,39.268,2.097667245727664,2.0170031903248167,2.197983968328385,129.82016360358625,124.82803680623343,136.02855216794293,19.648193359375,18.7470703125,20.42919921875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(78.472), 'mean_duration_us': np.float64(19.618), 'median_duration_us': np.float64(19.648), 'std_dev_duration_us': np.float64(0.6320921610018587), 'min_duration_us': np.float64(18.747), 'max_duration_us': np.float64(20.429)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(19.62)}]","{'M': 8192, 'N': 64, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT32x64x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT2_2_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW2_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA2_VWB2_WSGRA0_WSGRB0_WS64_WG16_8_2']",0.011013861075607386,99.81275929037136 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2432), (2432, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2432, 1), (1, 2432), (2432, 1))","('', '', '')",18408,8,246.877,30.859625,4.84119129192392,0.023658496,11.2998046875,1.9967159277504105,matrix_bf16,1.2575011956583773,0.20337447445741427,2.5108726665362675,0.4060810524469881,9.7286376953125,2.1861249338708104,77.8291015625,31.006,25.928,36.184,1.3030390292017253,0.7908661405990288,1.4152657058205995,2.601798784087517,1.5791350196525764,2.825883576810918,9.112548828125,8.3720703125,14.98193359375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(77.829), 'mean_duration_us': np.float64(9.728625), 'median_duration_us': np.float64(9.1125), 'std_dev_duration_us': np.float64(2.0449552524138515), 'min_duration_us': np.float64(8.372), 'max_duration_us': np.float64(14.982)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(9.73)}]","{'M': 2, 'N': 2432, 'K': 2432, 'bias': False, 'stride_A': (2432, 1), 'stride_B': (1, 2432), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.010923536340070211,99.82368282671143 +aten::gather,other,python3,CPU,thread 416 (python3),"((32, 64), (), (65536, 64), (), (65536, 64))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((64, 1), (), (1, 0), (), (64, 1))","('', '0', '', 'False', '')",5211,2,26.83,13.415,0.1767766952966369,,,,,,,,,34.950439453125,0.8206996185939568,69.90087890625,13.415,13.29,13.54,,,,,,,34.950439453125,34.3701171875,35.53076171875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(69.901), 'mean_duration_us': np.float64(34.9505), 'median_duration_us': np.float64(34.9505), 'std_dev_duration_us': np.float64(0.5805000000000007), 'min_duration_us': np.float64(34.37), 'max_duration_us': np.float64(35.531)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(34.95)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.009810787682318226,99.83349361439375 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23,triton,python3,CPU,thread 416 (python3),"((2, 333, 2432), (2, 14592), (14592,), (666, 2432), (2432,), (2, 4864), (4864,), (2, 333, 2432), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'c10::BFloat16', 'Scalar', 'Scalar')","((809856, 2432, 1), (14592, 1), (1,), (2432, 1), (1,), (4864, 1), (1,), (809856, 2432, 1), (809856, 2432, 1), (), ())","('', '', '', '', '', '', '', '', '', '666', '2432')",20402,4,128.74200000000002,32.185500000000005,1.8335569257593287,0.003239424,9.384033203125,0.3292140385565991,vector_bfloat16,0.5797662294255786,0.007654402123810458,0.1908671818079265,0.0025199366359158408,16.974365234375,0.2250174974772836,67.8974609375,32.338,29.805,34.261,0.5807052653385005,0.5699594947535142,0.5876948922717994,0.19117632561316922,0.18763866708148313,0.1934774089238845,16.945068359375,16.7431640625,17.26416015625,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(67.89699999999999), 'mean_duration_us': np.float64(16.974249999999998), 'median_duration_us': np.float64(16.945), 'std_dev_duration_us': np.float64(0.19489917265088666), 'min_duration_us': np.float64(16.743), 'max_duration_us': np.float64(17.264)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(16.97)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_23']",0.009529602257501055,99.84302321665125 +aten::add_,elementwise,python3,CPU,thread 416 (python3),"((1, 16384, 512), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 512, 1), (1,), ())","('', '', '1')",26803,3,29.774,9.924666666666667,3.295674488376141,0.008388608,32.0009765625,0.2499923708382923,vector_bf16,1.6930266731505812,0.06847488706448931,0.4232437519133803,0.01711819936013603,19.841634114583332,0.8098247697242251,59.52490234375,8.362,7.701,13.711,1.7026305408057083,1.6202568465129439,1.7561926321330914,0.42564464555770276,0.40505185042674585,0.4390347597556924,19.7080078125,19.10693359375,20.7099609375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.525), 'mean_duration_us': np.float64(19.841666666666665), 'median_duration_us': np.float64(19.708), 'std_dev_duration_us': np.float64(0.6612121864844571), 'min_duration_us': np.float64(19.107), 'max_duration_us': np.float64(20.71)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(19.84)}]","{'shape_in1': (1, 16384, 512), 'shape_in2': (512,), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (8388608, 512, 1), 'stride_input2': (1,), 'stride_output': None}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.008354489783862249,99.85137770643512 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((), (1, 16, 128, 128))","('float', 'c10::BFloat16')","((), (262144, 16384, 128, 1))","('', '')",20483,4,54.0,13.5,5.319032242805077,0.000262144,1.5000038146972656,0.16666624281249284,vector_fp32,0.10583075101983144,0.0030098973109926094,0.017638413646499703,0.0005016482760745645,14.8712158203125,0.4270736026430738,59.48486328125,10.931000000000001,10.666,21.472,0.10627978761983532,0.10198941438703141,0.10877401445262375,0.017713252889507643,0.016998192502532927,0.018128956304450595,14.801513671875,14.4599609375,15.421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(59.485), 'mean_duration_us': np.float64(14.87125), 'median_duration_us': np.float64(14.8015), 'std_dev_duration_us': np.float64(0.3699130810068764), 'min_duration_us': np.float64(14.46), 'max_duration_us': np.float64(15.422)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(14.87)}]","{'shape_in1': (), 'shape_in2': (1, 16, 128, 128), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (), 'stride_input2': (262144, 16384, 128, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::mul', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2}>(int, at::native::gpu_kernel_impl > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#2})']",0.008348870187265853,99.85972657662238 +aten::convolution,CONV_fwd,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (512, 16, 3, 3), (512,), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((262144, 16384, 128, 1), (144, 9, 3, 1), (1,), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",26747,1,259.465,259.465,,2.415919104,16.640625,138.456338028169,matrix_bf16,0.31542244143555703,,43.67223617307182,,55.3193359375,,55.3193359375,259.465,259.465,259.465,0.31542244143555703,0.31542244143555703,0.31542244143555703,43.67223617307182,43.67223617307182,43.67223617307182,55.3193359375,55.3193359375,55.3193359375,"[{'name': 'Im2d2Col_v2', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.568), 'mean_duration_us': np.float64(6.568), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.568), 'max_duration_us': np.float64(6.568)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(22.553), 'mean_duration_us': np.float64(22.553), 'median_duration_us': np.float64(22.553), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(22.553), 'max_duration_us': np.float64(22.553)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA2_NLCB2_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU8_SUM0_SUS256_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(26.198), 'mean_duration_us': np.float64(26.198), 'median_duration_us': np.float64(26.198), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(26.198), 'max_duration_us': np.float64(26.198)}]","[{'name': 'Im2d2Col_v2', 'stream': 0, 'mean_duration_us': np.float64(6.57)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(22.55)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_A...', 'stream': 0, 'mean_duration_us': np.float64(26.2)}]","{'convNd': 'conv2d', 'input_shape': (1, 16, 128, 128), 'filter_shape': (512, 16, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (262144, 16384, 128, 1), 'weight_stride': (144, 9, 3, 1), 'bias': False, 'stride': (1, 1), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,torch/nn/modules/conv.py(530): _conv_forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/conv.py(547): forward', 'torch/nn/modules/conv.py(530): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution', ['Im2d2Col_v2'], ['aten::add_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})'], ['Cijk_Ailk_Bljk_BBS_BH_MT256x128x64_MI16x16x16x1_SN_1LDSB0_APM1_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_BL1_BS1_CLR1_DTVA1_DTVB0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB4_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA0_LBSPPB1024_LPA0_LPB4_LRVW4_LWPMn1_MIAV0_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA2_NLCB2_ONLL1_PK0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU8_SUM0_SUS256_SPO1_SRVW0_SSO0_SVW2_TSGRA0_TSGRB0_TT4_128_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB4_VFLRP1_WSGRA0_WSGRB0_WG64_4_1_WGM1']]",0.007764226546243362,99.86749080316862 +aten::sub,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",20458,4,208.71099999999998,52.177749999999996,0.7364606235230786,,,,,,,,,10.304443359375,12.785824794055774,41.2177734375,52.1075,51.407,53.089,,,,,,,3.94482421875,3.84521484375,29.48291015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(41.217999999999996), 'mean_duration_us': np.float64(10.304499999999999), 'median_duration_us': np.float64(3.945), 'std_dev_duration_us': np.float64(11.072868677537903), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(29.483)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(10.3)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::sub', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0057850320376594275,99.87327583520629 +triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6,triton,python3,CPU,thread 416 (python3),"((666, 2432), (2432,), (2, 14592), (14592,), (2, 333, 2432), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((2432, 1), (1,), (14592, 1), (1,), (809856, 2432, 1), (), ())","('', '', '', '', '', '666', '2432')",18421,4,106.88,26.72,1.0263017749830354,0.003239424,6.266845703125,0.4929681717246484,vector_bfloat16,0.7738455934964579,5.1380594757869256e-05,0.3814812474231243,2.5328997859885855e-05,8.49169921875,0.0005638186222554939,33.966796875,26.3795,25.939,28.182,0.7738455934964579,0.773801096596136,0.7738900903967798,0.3814812474231243,0.38145931186752524,0.3815031829787234,8.49169921875,8.4912109375,8.4921875,"[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(33.966), 'mean_duration_us': np.float64(8.4915), 'median_duration_us': np.float64(8.4915), 'std_dev_duration_us': np.float64(0.0005000000000006111), 'min_duration_us': np.float64(8.491), 'max_duration_us': np.float64(8.492)}]","[{'name': 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze...', 'stream': 0, 'mean_duration_us': np.float64(8.49)}]","{'fused_ops': 'aten.add, aten.addmm, aten.mul, aten.native_layer_norm, aten.split, aten.unsqueeze, aten.view', 'xnumel': 666, 'rnumel': 2432}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_red_fused_add_addmm_mul_native_layer_norm_split_unsqueeze_view_6']",0.004767336800385487,99.87804317200667 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 2048), (2048, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((2048, 1), (1, 2048), (2432, 1))","('', '', '')",18409,4,100.66,25.165,0.9785216740914153,0.019922944,9.51708984375,1.9964085988404905,matrix_bf16,1.4077244654612895,0.011089861041594647,2.8103932276450516,0.022139893943385655,7.08935546875,0.056164372579359176,28.357421875,24.947,24.236,26.53,1.4116556721646571,1.392030705353494,1.4155558121623493,2.8182415225114745,2.779062070017709,2.8260277955395487,7.0693359375,7.0498046875,7.1689453125,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(28.358), 'mean_duration_us': np.float64(7.0895), 'median_duration_us': np.float64(7.0695), 'std_dev_duration_us': np.float64(0.04858240422210485), 'min_duration_us': np.float64(7.05), 'max_duration_us': np.float64(7.169)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}]","{'M': 2, 'N': 2432, 'K': 2048, 'bias': False, 'stride_A': (2048, 1), 'stride_B': (1, 2048), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.003980045023563732,99.88202321703024 +aten::addmm,GEMM,python3,CPU,thread 416 (python3),"((512,), (16384, 512), (512, 512), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",26871,1,46.109,46.109,,8.5983232,32.5009765625,252.30011117454404,matrix_bf16,1.234768964387439,,311.5323469898275,,27.60009765625,,27.60009765625,46.109,46.109,46.109,1.234768964387439,1.234768964387439,1.234768964387439,311.5323469898275,311.5323469898275,311.5323469898275,27.60009765625,27.60009765625,27.60009765625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_7_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(27.6), 'mean_duration_us': np.float64(27.6), 'median_duration_us': np.float64(27.6), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(27.6), 'max_duration_us': np.float64(27.6)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x1...', 'stream': 0, 'mean_duration_us': np.float64(27.6)}]","{'M': 16384, 'N': 512, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::addmm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT128x224x64_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB128_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT4_7_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW4_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO1_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA4_VWB1_WSGRA0_WSGRB0_WS64_WG32_8_1']",0.003873752409892899,99.88589696944013 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'double')","((512, 1, 65536, 512), ())","('', '')",26947,3,25.569,8.523,0.12767145334803726,0.008388608,32.00000762939453,0.24999994039536944,vector_bf16,3.7863698265084067,0.09410203192276984,0.9465922309419269,0.023525502371775572,8.865559895833334,0.22076919151973087,26.5966796875,8.553,8.383,8.633,3.7905837674444265,3.69023161421974,3.8782940978610534,0.9476457159247614,0.922557683600043,0.9695732933009764,8.85205078125,8.65185546875,9.0927734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.596999999999998), 'mean_duration_us': np.float64(8.865666666666666), 'median_duration_us': np.float64(8.852), 'std_dev_duration_us': np.float64(0.18029666910092654), 'min_duration_us': np.float64(8.652), 'max_duration_us': np.float64(9.093)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (512, 1, 65536, 512), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UpDecoderBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(2637): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0037329198366539795,99.88962988927678 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 16, 128, 128), (1, 16, 128, 128)), ())","('TensorList', 'Scalar')","(((262144, 16384, 128, 1), (262144, 16384, 128, 1)), ())","('', '0')",18396,4,110.723,27.68075,5.0079809221548235,,,,,,,,,6.358642578125,0.7197509098981358,25.4345703125,29.5735,20.27,31.306,,,,,,,6.569091796875,5.3271484375,6.96923828125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 4, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(25.433999999999997), 'mean_duration_us': np.float64(6.358499999999999), 'median_duration_us': np.float64(6.569), 'std_dev_duration_us': np.float64(0.6233223483880552), 'min_duration_us': np.float64(5.327), 'max_duration_us': np.float64(6.969)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(6.36)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 4, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0035698144720269103,99.8931997037488 +triton_poi_fused_addmm_silu_2,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), ())","('', '', '4864')",18407,8,176.935,22.116875,4.010765457312536,1.9456e-05,0.023193359375,0.8,vector_bfloat16,0.007899680204024272,0.000830827446175292,0.0063197441632194176,0.0006646619569402334,3.1087646484375,0.3277799647686495,24.8701171875,21.612499999999997,17.786,29.273,0.00795134583830203,0.006980709180098107,0.008675728967078907,0.006361076670641624,0.005584567344078487,0.006940583173663127,3.083984375,2.80322265625,3.48388671875,"[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'count': 8, 'total_duration_us': np.float64(24.87), 'mean_duration_us': np.float64(3.10875), 'median_duration_us': np.float64(3.0839999999999996), 'std_dev_duration_us': np.float64(0.30680235901961384), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(3.484)}]","[{'name': 'triton_poi_fused_addmm_silu_2', 'stream': 0, 'mean_duration_us': np.float64(3.11)}]","{'fused_ops': 'aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_silu_2']",0.0034905918663509054,99.89669029561516 +aiter::_groupnorm_run,NORM_fwd,python3,CPU,thread 416 (python3),"((1, 512, 16384), (), (512,), (512,), ())","('c10::BFloat16', 'Scalar', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 1), (), (1,), (1,), ())","('', '32', '', '', '9.9999999999999995e-07')",26788,1,43.284,43.284,,0.041946112,32.005859375,1.2498626960395436,vector_bf16,1.3579653781167267,,1.6972702686213301,,24.7138671875,,24.7138671875,43.284,43.284,43.284,1.3579653781167267,1.3579653781167267,1.3579653781167267,1.6972702686213301,1.6972702686213301,1.6972702686213301,24.7138671875,24.7138671875,24.7138671875,"[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.809), 'mean_duration_us': np.float64(6.809), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.809), 'max_duration_us': np.float64(6.809)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(17.905), 'mean_duration_us': np.float64(17.905), 'median_duration_us': np.float64(17.905), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(17.905), 'max_duration_us': np.float64(17.905)}]","[{'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_b...', 'stream': 0, 'mean_duration_us': np.float64(6.81)}, {'name': 'void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip...', 'stream': 0, 'mean_duration_us': np.float64(17.9)}]","{'op_shape': (1, 512, 16384), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (8388608, 16384, 1), 'stride_output': None, 'num_channels': 512, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,aiter/ops/groupnorm.py(56): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'nn.Module: GroupNorm', 'torch/nn/modules/module.py(1779): _call_impl', 'aiter/ops/groupnorm.py(56): forward', 'torch/_ops.py(1244): __call__', 'aiter::_groupnorm_run', 'aiter/jit/core.py(1642): custom_wrapper', 'aiter/jit/core.py(1401): wrapper', ['void (anonymous namespace)::groupnorm_kernel_dispatch_up<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, bool, __hip_bfloat16 const*, float*, float*)'], ['void (anonymous namespace)::groupnorm_kernel_dispatch_down<__hip_bfloat16, 1024u>(unsigned int, unsigned int, long, float, bool, __hip_bfloat16 const*, __hip_bfloat16 const*, __hip_bfloat16 const*, float const*, float const*, __hip_bfloat16*)']]",0.003468661733291803,99.90015895734845 +triton_poi_fused__to_copy_cat_slice_1,triton,python3,CPU,thread 416 (python3),"((2, 256), (2, 256), ())","('float', 'c10::BFloat16', 'Scalar')","((256, 1), (256, 1), ())","('', '', '512')",18405,4,89.864,22.466,0.6811436461324936,0.0,0.0009765625,0.0,vector_bfloat16,0.0001681110557934964,6.683776053354772e-06,0.0,0.0,6.0982666015625,0.23668209081633035,24.39306640625,22.378500000000003,21.752,23.355,0.00016656137219330403,0.00016179231600061718,0.00017752916278676034,0.0,0.0,0.0,6.14794921875,5.76806640625,6.3291015625,"[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(24.393), 'mean_duration_us': np.float64(6.09825), 'median_duration_us': np.float64(6.148), 'std_dev_duration_us': np.float64(0.20497606567597107), 'min_duration_us': np.float64(5.768), 'max_duration_us': np.float64(6.329)}]","[{'name': 'triton_poi_fused__to_copy_cat_slice_1', 'stream': 0, 'mean_duration_us': np.float64(6.1)}]","{'fused_ops': 'aten._to_copy, aten.cat, aten.slice', 'xnumel': 512, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused__to_copy_cat_slice', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused__to_copy_cat_slice_1']",0.003423636428854835,99.9035825937773 +triton_poi_fused_addmm_clone_permute_view_25,triton,python3,CPU,thread 416 (python3),"((8192, 64), (64,), (2, 16, 64, 2, 64, 2), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((64, 1), (1,), (262144, 16384, 256, 128, 2, 1), (), ())","('', '', '', '32', '16384')",20449,4,123.213,30.80325,2.846714056006796,0.0,2.0313720703125,0.0,vector_bfloat16,0.3582185588680935,0.005826493818347321,0.0,0.0,5.9473876953125,0.09534735954134627,23.78955078125,29.609,28.953,35.042,0.3557645348010273,0.35454635110533156,0.36679881476498777,0.0,0.0,0.0,5.9873046875,5.80712890625,6.0078125,"[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(23.79), 'mean_duration_us': np.float64(5.9475), 'median_duration_us': np.float64(5.9875), 'std_dev_duration_us': np.float64(0.08270580390758536), 'min_duration_us': np.float64(5.807), 'max_duration_us': np.float64(6.008)}]","[{'name': 'triton_poi_fused_addmm_clone_permute_view_25', 'stream': 0, 'mean_duration_us': np.float64(5.95)}]","{'fused_ops': 'aten.addmm, aten.clone, aten.permute, aten.view', 'xnumel': 16384, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_addmm_clone_permute_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_addmm_clone_permute_view_25']",0.0033389312899140544,99.90692152506722 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((2, 256), (256, 2432), (2, 2432))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16')","((256, 1), (1, 256), (2432, 1))","('', '', '')",18406,4,303.76,75.94,2.2629047704223013,0.002490368,1.19775390625,1.9828781084386466,matrix_bf16,0.21933771753860043,0.003744450834736281,0.4349199584621902,0.00742478958832337,5.727294921875,0.09820929015034323,22.9091796875,75.2415,74.05,79.227,0.2200741225895731,0.214793897954071,0.2224087270211846,0.43638015991670753,0.425910118079332,0.44100939593601385,5.70751953125,5.64697265625,5.84716796875,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.909), 'mean_duration_us': np.float64(5.72725), 'median_duration_us': np.float64(5.7075), 'std_dev_duration_us': np.float64(0.08497168646084413), 'min_duration_us': np.float64(5.647), 'max_duration_us': np.float64(5.847)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(5.73)}]","{'M': 2, 'N': 2432, 'K': 256, 'bias': False, 'stride_A': (256, 1), 'stride_B': (1, 256), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0032153686964591782,99.91013689376368 +aten::argmax,reduce,python3,CPU,thread 416 (python3),"((1, 77), (), ())","('int', 'Scalar', 'Scalar')","((77, 1), (), ())","('', '-1', 'False')",1402,4,81.482,20.3705,3.974949098206583,,,,,,,,,5.59765625,0.26256004736612226,22.390625,19.4295,16.915,25.708,,,,,,,5.547607421875,5.3671875,5.92822265625,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(22.39), 'mean_duration_us': np.float64(5.5975), 'median_duration_us': np.float64(5.547499999999999), 'std_dev_duration_us': np.float64(0.22739887862520336), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.928)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::argmax', 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, long, 4, 4> >(at::native::ReduceOp, unsigned int, long, 4, 4>)']",0.0031425880673692837,99.91327948183104 +aten::nonzero,other,python3,CPU,thread 416 (python3),"((4,),)","('bool',)","((1,),)","('',)",20463,1,144.725,144.725,,,,,,,,,,19.3427734375,,19.3427734375,144.725,144.725,144.725,,,,,,,19.3427734375,19.3427734375,19.3427734375,"[{'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.882), 'mean_duration_us': np.float64(1.882), 'median_duration_us': np.float64(1.882), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(1.882)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.922), 'mean_duration_us': np.float64(1.922), 'median_duration_us': np.float64(1.922), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.922), 'max_duration_us': np.float64(1.922)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.202), 'mean_duration_us': np.float64(2.202), 'median_duration_us': np.float64(2.202), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.202), 'max_duration_us': np.float64(2.202)}, {'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.805), 'mean_duration_us': np.float64(3.805), 'median_duration_us': np.float64(3.805), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(3.805)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.965), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(3.965)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.567), 'mean_duration_us': np.float64(5.567), 'median_duration_us': np.float64(5.567), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.567), 'max_duration_us': np.float64(5.567)}]","[{'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_stat...', 'stream': 0, 'mean_duration_us': np.float64(1.92)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel Device)', 'stream': 0, 'mean_duration_us': np.float64(3.8)}, {'name': 'void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::nonzero', ['Memset (Device)'], ['void rocprim::ROCPRIM_400400_NS::detail::init_lookback_scan_state_kernel, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper >(rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state, unsigned int, rocprim::ROCPRIM_400400_NS::detail::block_id_wrapper, unsigned int, rocprim::ROCPRIM_400400_NS::detail::lookback_scan_state::value_type*)'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::transform_impl, unsigned long*, int*, rocprim::ROCPRIM_400400_NS::identity >(unsigned long*, int*, unsigned long, rocprim::ROCPRIM_400400_NS::identity, ihipStream_t*, bool)::{lambda(auto:1)#1})'], ['Memcpy DtoD (Device -> Device)'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::reduce_impl, bool const*, long>, int*, int, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int> >(void*, unsigned long&, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, int*, int, unsigned long, hipcub::HIPCUB_400400_NS::detail::convert_binary_result_type_wrapper, bool const*, long>, int>, ihipStream_t*, bool)::{lambda(auto:1)#3})'], ['void rocprim::ROCPRIM_400400_NS::detail::trampoline_kernel, rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1}, rocprim::ROCPRIM_400400_NS::detail::comp_target<(rocprim::ROCPRIM_400400_NS::detail::gen)5, (rocprim::ROCPRIM_400400_NS::detail::target_arch)942, (rocprim::ROCPRIM_400400_NS::detail::gpu)9, (rocprim::ROCPRIM_400400_NS::detail::rep)0>, rocprim::ROCPRIM_400400_NS::detail::default_config_static_selector, (rocprim::ROCPRIM_400400_NS::arch::wavefront::target)1>(rocprim::ROCPRIM_400400_NS::detail::partition_impl<(rocprim::ROCPRIM_400400_NS::detail::partition_subalgo)5, false, rocprim::ROCPRIM_400400_NS::default_config, unsigned long, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::empty_type, int*, rocprim::ROCPRIM_400400_NS::empty_type>(void*, unsigned long&, hipcub::HIPCUB_400400_NS::CountingInputIterator, rocprim::ROCPRIM_400400_NS::empty_type*, hipcub::HIPCUB_400400_NS::TransformInputIterator, bool const*, long>, rocprim::ROCPRIM_400400_NS::tuple, rocprim::ROCPRIM_400400_NS::tuple, int*, unsigned long, rocprim::ROCPRIM_400400_NS::empty_type, ihipStream_t*, bool, rocprim::ROCPRIM_400400_NS::empty_type)::{lambda(auto:1, auto:2)#1}::operator(), std::integral_constant >(std::integral_constant, std::integral_constant) const::{lambda(auto:1)#1})']]",0.00271481340938518,99.91599429524042 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('float', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",20484,4,44.095,11.02375,0.30319451951951,0.000262144,2.5,0.1,vector_fp32,0.5696638661689855,0.01925345978273532,0.05696638661689855,0.0019253459782735385,4.605712890625,0.15711709075500374,18.4228515625,10.886,10.846,11.477,0.5717238154840321,0.5454342294016052,0.5897736043062726,0.0571723815484032,0.05454342294016052,0.05897736043062726,4.5859375,4.44482421875,4.80615234375,"[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.423000000000002), 'mean_duration_us': np.float64(4.6057500000000005), 'median_duration_us': np.float64(4.586), 'std_dev_duration_us': np.float64(0.13594185337856768), 'min_duration_us': np.float64(4.445), 'max_duration_us': np.float64(4.806)}]","[{'name': 'void at::native::vectorized_templated_elementwise_kernel<4, at::...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (1, 16, 128, 128), 'dtype_in1_in2_out': ('float', 'c10::BFloat16', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (262144, 16384, 128, 1), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::add', 'void at::native::vectorized_templated_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>, float, float, c10::BFloat16>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithCast<2>, at::native::memory::StoreWithCast<1>)']",0.002585699750999718,99.91857999499142 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((512, 1, 65536, 512), ())","('', '')",26879,2,19.069,9.5345,0.9623723291948917,0.008388608,32.00000762939453,0.24999994039536944,vector_bf16,3.6540526689465587,0.16894613833063338,0.9135129494381802,0.04223652451268619,9.192626953125,0.42502365607453124,18.38525390625,9.5345,8.854,10.215,3.6540526689465587,3.5345897088776876,3.77351562901543,0.9135129494381802,0.883647216541508,0.9433786823348524,9.192626953125,8.89208984375,9.4931640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(18.384999999999998), 'mean_duration_us': np.float64(9.192499999999999), 'median_duration_us': np.float64(9.192499999999999), 'std_dev_duration_us': np.float64(0.30050000000000043), 'min_duration_us': np.float64(8.892), 'max_duration_us': np.float64(9.493)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.19)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'long int', None), 'stride_input1': (512, 1, 65536, 512), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/attention_processor.py(2705): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/attention_processor.py(569): forward', 'diffusers/models/attention_processor.py(2705): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.002580422812732372,99.92116041780415 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",1401,4,47.852000000000004,11.963000000000001,0.9144663288862344,7.7e-08,0.000881195068359375,0.08333333333333333,,0.000204408392642626,1.991845552618759e-05,1.7034032720218834e-05,1.659871293848969e-06,4.55615234375,0.48984807208769054,18.224609375,11.7925,11.047,13.22,0.0002126285554446636,0.000174764684152198,0.00021761177552897883,1.7719046287055302e-05,1.4563723679349833e-05,1.8134314627414904e-05,4.345703125,4.24609375,5.287109375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(18.224), 'mean_duration_us': np.float64(4.556), 'median_duration_us': np.float64(4.3454999999999995), 'std_dev_duration_us': np.float64(0.42424108711910485), 'min_duration_us': np.float64(4.246), 'max_duration_us': np.float64(5.287)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.56)}]","{'op_shape': (1, 77), 'dtype_in_out': ('int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#3}::operator()() const::{lambda(int)#1} const&)::{lambda(int, bool)#1})']",0.0025578758946809828,99.92371829369883 +triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0,triton,python3,CPU,thread 416 (python3),"((2,), (2, 256), ())","('float', 'float', 'Scalar')","((0,), (256, 1), ())","('', '', '512')",18404,4,213.96800000000002,53.492000000000004,13.28275034270639,3.072e-06,0.0,,,0.0,0.0,0.0007414546695004077,1.7788188898982248e-05,4.14501953125,0.10076276427281922,16.580078125,47.435500000000005,45.718,73.379,0.0,0.0,0.0,0.0007447272727272727,0.0007168933454876937,0.0007594707870593917,4.125,4.044921875,4.28515625,"[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.58), 'mean_duration_us': np.float64(4.145), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(4.045), 'max_duration_us': np.float64(4.285)}]","[{'name': 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0', 'stream': 0, 'mean_duration_us': np.float64(4.14)}]","{'fused_ops': 'aten.arange, aten.cat, aten.cos, aten.div, aten.exp, aten.mul, aten.sin, aten.unsqueeze', 'xnumel': 512, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_arange_cat_cos_div_exp_mul_sin_unsqueeze_0']",0.0023270612442339365,99.92604535494306 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 1280), (1280, 1280))","('c10::BFloat16', 'c10::BFloat16')","((1280, 1), (1, 1280))","('', '')",5016,2,88.441,44.2205,3.4627019074705245,0.0032768,3.1298828125,0.9984399375975039,matrix_bf16,0.3997147924815793,0.005479037827151149,0.3990912124621072,0.00547049018623518,8.21142578125,0.11255703645840552,16.4228515625,44.2205,41.772,46.669,0.3997147924815793,0.39584052767962313,0.4035890572835355,0.3990912124621072,0.39522299175500586,0.40295943316920857,8.21142578125,8.1318359375,8.291015625,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(16.423000000000002), 'mean_duration_us': np.float64(8.211500000000001), 'median_duration_us': np.float64(8.211500000000001), 'std_dev_duration_us': np.float64(0.07950000000000035), 'min_duration_us': np.float64(8.132), 'max_duration_us': np.float64(8.291)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]","{'M': 1, 'N': 1280, 'K': 1280, 'bias': False, 'stride_A': (1280, 1), 'stride_B': (1, 1280), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.0023049940478432154,99.9283503489909 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'bool', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5171,2,17.887,8.9435,0.013435028842543864,6.5536e-05,,,,,,0.008676379506827888,0.0005844485318503793,7.570556640625,0.5099593338928372,15.14111328125,8.9435,8.934,8.953,,,,0.008676379506827888,0.008263111986701963,0.009089647026953813,7.570556640625,7.2099609375,7.93115234375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(15.141), 'mean_duration_us': np.float64(7.5705), 'median_duration_us': np.float64(7.5705), 'std_dev_duration_us': np.float64(0.36050000000000004), 'min_duration_us': np.float64(7.21), 'max_duration_us': np.float64(7.931)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.57)}]","{'op_shape': (256, 256), 'dtype_in_out': ('long int', 'bool'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})']",0.0021250984250927715,99.930475447416 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",20459,4,95.543,23.88575,0.3737649662555347,0.000262144,1.0000076293945312,0.249998092665919,vector_bf16,0.27803774295407285,0.01866830191289951,0.06950890542765527,0.004667039871536402,3.7847900390625,0.26663028995436494,15.13916015625,23.911,23.435,24.286,0.2830870390932726,0.25175850316529896,0.2942183904644472,0.0707712198317606,0.06293914560375147,0.0735540364433484,3.705078125,3.56396484375,4.1650390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(15.139), 'mean_duration_us': np.float64(3.78475), 'median_duration_us': np.float64(3.705), 'std_dev_duration_us': np.float64(0.23088999003854627), 'min_duration_us': np.float64(3.564), 'max_duration_us': np.float64(4.165)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.002124824298429533,99.93260027171443 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77), (1, 77), ())","('long int', 'long int', 'Scalar')","((77, 1), (77, 1), ())","('', '', 'False')",25,4,189.452,47.363,22.981442498967144,7.7e-08,0.0011749267578125,0.0625,,0.00034795994099494283,4.661040970475972e-05,2.1747496312183927e-05,2.9131506065474824e-06,3.584228515625,0.4348311081041389,14.3369140625,37.8365,32.548,81.231,0.00033264928894099143,0.0003107310344827586,0.00041581015161502974,2.0790580558811965e-05,1.9420689655172414e-05,2.598813447593936e-05,3.70458984375,2.962890625,3.96484375,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.337000000000002), 'mean_duration_us': np.float64(3.5842500000000004), 'median_duration_us': np.float64(3.7045000000000003), 'std_dev_duration_us': np.float64(0.3765510423568098), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.965)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.58)}]","{'op_shape': (1, 77), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (77, 1), 'stride_output': (77, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.0020122267715042066,99.93461249848593 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('float', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",20477,4,79.65,19.9125,0.27813366091383684,0.000262144,1.5,0.16666666666666666,vector_fp32,0.442202039589035,0.02304089823211664,0.07370033993150582,0.003840149705352772,3.564453125,0.19360992946960456,14.2578125,19.86,19.64,20.29,0.44890337639244104,0.4090445043809524,0.46195690119030547,0.07481722939874016,0.06817408406349205,0.07699281686505091,3.50390625,3.40478515625,3.84521484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(14.258000000000001), 'mean_duration_us': np.float64(3.5645000000000002), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.16751193987295365), 'min_duration_us': np.float64(3.405), 'max_duration_us': np.float64(3.845)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.56)}]","{'op_shape': (1, 16, 128, 128), 'dtype_in_out': ('float', 'c10::BFloat16'), 'stride_input': (262144, 16384, 128, 1), 'stride_output': (262144, 16384, 128, 1)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::bfloat16tofloat32_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(c10::BFloat16)#1}, std::array)']",0.002001124641643037,99.93661362312757 +triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5,triton,python3,CPU,thread 416 (python3),"((2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1, 19), (2, 4096, 1), (2, 4096, 1), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar')","((77824, 19, 155648, 1), (77824, 19, 155648, 1), (77824, 19, 155648, 1), (4096, 1, 8192), (4096, 1, 8192), (), ())","('', '', '', '', '', '8192', '19')",18418,4,100.35900000000001,25.089750000000002,1.2790182107121606,0.000155648,0.0,,,0.0,0.0,0.044581133166009465,0.001511515479090946,3.4942626953125,0.11484846594160597,13.97705078125,25.192500000000003,23.755,26.219,0.0,0.0,0.0,0.043914696721771784,0.04367270913823812,0.04682243008225618,3.54443359375,3.32421875,3.56396484375,"[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.977), 'mean_duration_us': np.float64(3.49425), 'median_duration_us': np.float64(3.5445), 'std_dev_duration_us': np.float64(0.09957503452171139), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}]","{'fused_ops': 'aten._unsafe_view, aten.add, aten.clone, aten.convolution, aten.native_layer_norm, aten.slice, aten.transpose, aten.view', 'xnumel': 8192, 'rnumel': 19}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view', 'triton/backends/amd/driver.py(662): __call__', 'triton_per_fused__unsafe_view_add_clone_convolution_native_layer_norm_slice_transpose_view_5']",0.001961718933802463,99.93857534206137 +aten::mm,GEMM,python3,CPU,thread 416 (python3),"((1, 768), (768, 768))","('c10::BFloat16', 'c10::BFloat16')","((768, 1), (1, 768))","('', '')",1415,2,94.88,47.44,8.42729861818127,0.001179648,1.1279296875,0.9974025974025974,matrix_bf16,0.17181775296139734,0.007069432797830054,0.1713714730835755,0.007051070634718818,6.889404296875,0.28346419304402126,13.77880859375,47.44,41.481,53.399,0.17181775296139734,0.1668189090909091,0.17681659683188555,0.1713714730835755,0.1663856132231405,0.17635733294401051,6.889404296875,6.68896484375,7.08984375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.779), 'mean_duration_us': np.float64(6.8895), 'median_duration_us': np.float64(6.8895), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.09)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16...', 'stream': 0, 'mean_duration_us': np.float64(6.89)}]","{'M': 1, 'N': 768, 'K': 768, 'bias': False, 'stride_A': (768, 1), 'stride_B': (1, 768), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,torch/nn/modules/linear.py(130): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: Linear', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/linear.py(130): forward', 'aten::linear', 'aten::matmul', 'aten::mm', 'Cijk_Alik_Bljk_BBS_BH_Bias_HA_S_SAV_UserArgs_MT16x16x512_MI16x16x1_SN_LDSB1_AFC1_AG0_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTLA0_DTLB0_DTVA0_DTVB0_DTVMXSA0_DTVMXSB0_DTVSM0_DPLB0_EPS0_ELFLR0_EMLLn1_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LDSTI0_LBSPPA1024_LBSPPB1024_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_MGRIPM1_NTn1_NTA0_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SGROB0_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKFTR0_SKXCCM0_SGRO0_TDMI0_TIN0_TLDS1_TLDSM1_ULSGRO0_USL1_USLMX0_UIOFGRO0_UPLRP0_USFGROn1_USI0_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4']",0.001933895077483728,99.94050923713885 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', '1')",20460,4,40.211,10.05275,0.29292817663493387,0.000262144,1.5,0.16666666666666666,vector_bf16,0.4587556569474247,0.03613384601984402,0.07645927615790411,0.006022307669974005,3.4444580078125,0.2698734709293077,13.77783203125,10.025500000000001,9.785,10.375,0.45690230962562683,0.4177441929710803,0.5034738155673648,0.07615038493760448,0.0696240321618467,0.0839123025945608,3.4443359375,3.1240234375,3.76513671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.778), 'mean_duration_us': np.float64(3.4445), 'median_duration_us': np.float64(3.4444999999999997), 'std_dev_duration_us': np.float64(0.23366696386096175), 'min_duration_us': np.float64(3.124), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (1, 16, 128, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (262144, 16384, 128, 1), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.0019337580141521084,99.942442995153 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (1, 16, 128, 128), ())","('c10::BFloat16', 'float', 'Scalar')","((262144, 16384, 128, 1), (262144, 16384, 128, 1), ())","('', '', 'False')",20488,4,32.077,8.01925,0.19403672332834324,0.000262144,1.5,0.16666666666666666,vector_bf16,0.4649342648875561,0.010455401439686662,0.07748904414792601,0.0017425669066144418,3.38427734375,0.07683981154707822,13.537109375,8.036999999999999,7.781,8.222,0.4676212078152885,0.451341666246322,0.47315297767332554,0.07793686796921476,0.07522361104105366,0.07885882961222092,3.364013671875,3.32421875,3.48486328125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.536999999999999), 'mean_duration_us': np.float64(3.3842499999999998), 'median_duration_us': np.float64(3.364), 'std_dev_duration_us': np.float64(0.0667097256777451), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.485)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::bf...', 'stream': 0, 'mean_duration_us': np.float64(3.38)}]","{'op_shape': (1, 16, 128, 128), 'dtype_in_out': ('c10::BFloat16', 'float'), 'stride_input': (262144, 16384, 128, 1), 'stride_output': (262144, 16384, 128, 1)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::vectorized_elementwise_kernel<4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array >(int, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda(float)#1}, std::array)']",0.0018999719029079297,99.9443429670559 +triton_poi_fused_add_addmm_silu_22,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '', '4864')",20392,4,102.68299999999999,25.670749999999998,2.1531769357548547,2.432e-05,0.06494140625,0.35714285714285715,vector_bfloat16,0.020584887980653954,0.0016720264371797874,0.0073517457073764125,0.0005971522989927814,3.3236083984375,0.2555605086823307,13.29443359375,25.512999999999998,23.735,27.922,0.02012489028359386,0.019106810247979177,0.022982961107448914,0.007187460815569236,0.006823860802849706,0.00820820039551747,3.3837890625,2.962890625,3.56396484375,"[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(13.295000000000002), 'mean_duration_us': np.float64(3.3237500000000004), 'median_duration_us': np.float64(3.384), 'std_dev_duration_us': np.float64(0.22131467981134914), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.564)}]","[{'name': 'triton_poi_fused_add_addmm_silu_22', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_22']",0.0018659116650005122,99.94620887872091 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('float', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5182,2,14.350999999999999,7.1754999999999995,0.6583164132846755,6.5536e-05,0.75,0.08333333333333333,vector_fp32,0.11866382322961364,0.0025340510883724607,0.009888651935801136,0.00021117092403103737,6.62890625,0.14155946303051,13.2578125,7.1754999999999995,6.71,7.641,0.11866382322961364,0.11687197852115232,0.12045566793807495,0.009888651935801136,0.00973933154342936,0.010037972328172912,6.62890625,6.52880859375,6.72900390625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(13.258), 'mean_duration_us': np.float64(6.629), 'median_duration_us': np.float64(6.629), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(6.529), 'max_duration_us': np.float64(6.729)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(6.63)}]","{'op_shape': (256, 256), 'dtype_in_out': ('float', 'long int'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})']",0.0018607717900647853,99.94806965051097 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), (1, 512, 128, 128), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((8388608, 16384, 128, 1), (8388608, 16384, 128, 1), ())","('', '', '1')",26781,1,8.593,8.593,,0.008388608,48.0,0.16666666666666666,vector_bf16,3.9513633267144557,,0.6585605544524092,,12.73779296875,,12.73779296875,8.593,8.593,8.593,3.9513633267144557,3.9513633267144557,3.9513633267144557,0.6585605544524092,0.6585605544524092,0.6585605544524092,12.73779296875,12.73779296875,12.73779296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(12.738), 'mean_duration_us': np.float64(12.738), 'median_duration_us': np.float64(12.738), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(12.738), 'max_duration_us': np.float64(12.738)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(12.74)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (1, 512, 128, 128), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (8388608, 16384, 128, 1), 'stride_input2': (8388608, 16384, 128, 1), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.001787785565977462,99.94985743607695 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (), ())","('long int', 'long int', 'Scalar')","((256, 1), (), ())","('', '', '1')",5173,4,28.461,7.11525,0.49590077972648244,6.5536e-05,1.0000076293945312,0.06249952316647975,,0.3354102272086957,0.018940029952049627,0.02096297926570411,0.0011837428407619468,3.1337890625,0.177498125952915,12.53515625,7.0455000000000005,6.599,7.771,0.3361487217642716,0.3154377250293772,0.3539057402768622,0.021009134823288648,0.01971470740305523,0.022118940013183916,3.1240234375,2.962890625,3.32421875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(3.13375), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.1535746968090772), 'min_duration_us': np.float64(2.963), 'max_duration_us': np.float64(3.324)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.13)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0017593449246664395,99.95161678100162 +triton_poi_fused_add_addmm_silu_21,triton,python3,CPU,thread 416 (python3),"((2, 2432), (2432,), (2, 2432), (2432,), (2, 2432), (2, 2432), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2432, 1), (1,), (2432, 1), (1,), (2432, 1), (2432, 1), ())","('', '', '', '', '', '', '4864')",20338,4,104.155,26.03875,3.840230754785444,2.432e-05,0.0556640625,0.4166666666666667,vector_bfloat16,0.01885723387272625,0.0010973936284998697,0.007857180780302606,0.0004572473452082783,3.1033935546875,0.18656449590027488,12.41357421875,24.5565,23.415,31.627,0.019053717110242667,0.017351961678037448,0.019969539592382225,0.007939048795934444,0.007229984032515605,0.008320641496825928,3.0634765625,2.9228515625,3.36376953125,"[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(12.414000000000001), 'mean_duration_us': np.float64(3.1035000000000004), 'median_duration_us': np.float64(3.0635000000000003), 'std_dev_duration_us': np.float64(0.16161760423914215), 'min_duration_us': np.float64(2.923), 'max_duration_us': np.float64(3.364)}]","[{'name': 'triton_poi_fused_add_addmm_silu_21', 'stream': 0, 'mean_duration_us': np.float64(3.1)}]","{'fused_ops': 'aten.add, aten.addmm, aten.silu', 'xnumel': 4864, 'rnumel': 1}",True,/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', '/tmp/torchinductor_root/ov/cov463qhi2m2kw6ldmzzijfv5t3cjjklfci3qly3nsw6upcskct3.py(2533): call', 'torch/_inductor/runtime/triton_heuristics.py(1283): run', 'triton_poi_fused_add_addmm_silu', 'triton/backends/amd/driver.py(662): __call__', 'triton_poi_fused_add_addmm_silu_21']",0.0017422805398798259,99.9533590615415 +aten::gather,other,python3,CPU,thread 416 (python3),"((32128, 4096), (), (256, 4096), (), (256, 4096))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((4096, 1), (), (1, 0), (), (4096, 1))","('', '0', '', 'False', '')",5083,2,40.138999999999996,20.069499999999998,1.2042028483606888,,,,,,,,,5.908203125,2.974129791572715,11.81640625,20.069499999999998,19.218,20.921,,,,,,,5.908203125,3.80517578125,8.01123046875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.815999999999999), 'mean_duration_us': np.float64(5.9079999999999995), 'median_duration_us': np.float64(5.9079999999999995), 'std_dev_duration_us': np.float64(2.1029999999999993), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0016584663125945715,99.9550175278541 +aten::index,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 1280), ())","('c10::BFloat16', '')","((98560, 1280, 1), ())","('', '')",5005,2,47.150999999999996,23.575499999999998,2.153140148713037,,,,,,,,,5.867431640625,0.19852851522571524,11.73486328125,23.575499999999998,22.053,25.098,,,,,,,5.867431640625,5.72705078125,6.0078125,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.735), 'mean_duration_us': np.float64(5.8675), 'median_duration_us': np.float64(5.8675), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.727), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.87)}]",,False,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::index', 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.0016470215244043527,99.9566645493785 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 77, 4096), (1, 256, 4096)), ())","('TensorList', 'Scalar')","(((315392, 4096, 1), (1048576, 4096, 1)), ())","('', '-2')",9180,2,42.772999999999996,21.386499999999998,1.0839946955589745,,,,,,,,,5.62744140625,0.1988737822087165,11.2548828125,21.386499999999998,20.62,22.153,,,,,,,5.62744140625,5.48681640625,5.76806640625,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.254999999999999), 'mean_duration_us': np.float64(5.6274999999999995), 'median_duration_us': np.float64(5.6274999999999995), 'std_dev_duration_us': np.float64(0.14049999999999985), 'min_duration_us': np.float64(5.487), 'max_duration_us': np.float64(5.768)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(5.63)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0015796548969134246,99.95824420427542 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'float', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5190,2,10.846,5.423,0.049497474683058526,6.5536e-05,0.75,0.08333333333333333,,0.14182547560451392,0.0036194682899149014,0.011818789633709493,0.00030162235749290847,5.546875,0.14155946303051,11.09375,5.423,5.388,5.458,0.14182547560451392,0.13926612503242541,0.14438482617660242,0.011818789633709493,0.011605510419368784,0.012032068848050201,5.546875,5.44677734375,5.64697265625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(11.094000000000001), 'mean_duration_us': np.float64(5.547000000000001), 'median_duration_us': np.float64(5.547000000000001), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(5.447), 'max_duration_us': np.float64(5.647)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.55)}]","{'op_shape': (256, 256), 'dtype_in_out': ('long int', 'float'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1} const&)::{lambda(int, bool)#1})']",0.0015570394471962259,99.95980124372261 +aten::clamp,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (), ())","('c10::BFloat16', 'Scalar', 'Scalar')","((3145728, 1048576, 1024, 1), (), ())","('', '0', '1')",27343,1,23.875,23.875,,,,,,,,,,10.89501953125,,10.89501953125,23.875,23.875,23.875,,,,,,,10.89501953125,10.89501953125,10.89501953125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.895), 'mean_duration_us': np.float64(10.895), 'median_duration_us': np.float64(10.895), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.895), 'max_duration_us': np.float64(10.895)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(10.9)}]",,False,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::clamp', 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)']",0.0015291470592116805,99.96133039078182 +aten::index,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 768), ())","('c10::BFloat16', '')","((59136, 768, 1), ())","('', '')",1404,2,58.266000000000005,29.133000000000003,6.8264088655749315,,,,,,,,,5.287109375,0.16987135563661201,10.57421875,29.133000000000003,24.306,33.96,,,,,,,5.287109375,5.1669921875,5.4072265625,"[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(10.574), 'mean_duration_us': np.float64(5.287), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(0.1200000000000001), 'min_duration_us': np.float64(5.167), 'max_duration_us': np.float64(5.407)}]","[{'name': 'void at::native::index_elementwise_kernel<128, 4, at::native::gp...', 'stream': 0, 'mean_duration_us': np.float64(5.29)}]",,False,transformers/models/clip/modeling_clip.py(529): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::index', 'void at::native::index_elementwise_kernel<128, 4, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1}>(long, at::native::gpu_index_kernel >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1}>(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef, at::native::index_kernel_impl >(at::TensorIteratorBase&, c10::ArrayRef, c10::ArrayRef)::{lambda(char*, char const*, long)#1} const&, bool)::{lambda(int)#1})']",0.0014841217547747125,99.9628145125366 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 2048), (1, 77, 2048), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((315392, 4096, 1), (157696, 2048, 1), ())","('', '', 'False')",9179,2,14.832,7.416,0.261629509039023,0.000157696,0.6015625,0.25,vector_bf16,0.13146708067116858,0.007753461466496543,0.032866770167792145,0.0019383653666241358,4.806396484375,0.28346419304402126,9.61279296875,7.416,7.231,7.601,0.13146708067116858,0.1259845554905403,0.13694960585179689,0.032866770167792145,0.031496138872635075,0.03423740146294922,4.806396484375,4.60595703125,5.0068359375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.613), 'mean_duration_us': np.float64(4.8065), 'median_duration_us': np.float64(4.8065), 'std_dev_duration_us': np.float64(0.2004999999999999), 'min_duration_us': np.float64(4.606), 'max_duration_us': np.float64(5.007)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.81)}]","{'op_shape': (1, 77, 2048), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (315392, 4096, 1), 'stride_output': (157696, 2048, 1)}",True,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::constant_pad_nd', 'aten::copy_', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#12}::operator()() const::{lambda(c10::BFloat16)#1} const&)::{lambda(int, bool)#1})']",0.001349182904795427,99.96416369544139 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 512, 128, 128), ())","('c10::BFloat16', 'long int')","((8388608, 16384, 128, 1), ())","('', '')",26782,1,8.703,8.703,,0.008388608,32.00000762939453,0.24999994039536944,vector_bf16,3.6584057240204433,,0.9146012129471891,,9.171875,,9.171875,8.703,8.703,8.703,3.6584057240204433,3.6584057240204433,3.6584057240204433,0.9146012129471891,0.9146012129471891,0.9146012129471891,9.171875,9.171875,9.171875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.172), 'mean_duration_us': np.float64(9.172), 'median_duration_us': np.float64(9.172), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.172), 'max_duration_us': np.float64(9.172)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(9.17)}]","{'shape_in1': (1, 512, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'long int', None), 'stride_input1': (8388608, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/models/resnet.py(319): forward,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/utils/accelerate_utils.py(43): wrapper', 'diffusers/models/autoencoders/autoencoder_kl.py(213): decode', 'diffusers/models/autoencoders/autoencoder_kl.py(199): _decode', 'nn.Module: Decoder', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/autoencoders/vae.py(279): forward', 'nn.Module: UNetMidBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/unets/unetd_blocks.py(736): forward', 'nn.Module: ResnetBlock2D', 'torch/nn/modules/module.py(1779): _call_impl', 'diffusers/models/resnet.py(319): forward', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.001287298810569274,99.96545099425195 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 77, 768), (1, 77, 1280)), ())","('TensorList', 'Scalar')","(((59136, 768, 1), (98560, 1280, 1)), ())","('', '-1')",5048,2,46.71,23.355,0.2687005768508899,,,,,,,,,4.505859375,0.08493567781830601,9.01171875,23.355,23.165,23.545,,,,,,,4.505859375,4.44580078125,4.56591796875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(9.012), 'mean_duration_us': np.float64(4.506), 'median_duration_us': np.float64(4.506), 'std_dev_duration_us': np.float64(0.06000000000000005), 'min_duration_us': np.float64(4.446), 'max_duration_us': np.float64(4.566)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0012648204241836947,99.96671581467614 +aten::sub,elementwise,python3,CPU,thread 416 (python3),"((), (), ())","('float', 'float', 'Scalar')","((), (), ())","('', '', '1')",20482,4,53.568,13.392,0.5482420390058885,,,,,,,,,2.10205078125,0.1007627642728192,8.408203125,13.179,13.009,14.201,,,,,,,2.08203125,2.001953125,2.2421875,"[{'name': 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(8.408), 'mean_duration_us': np.float64(2.102), 'median_duration_us': np.float64(2.082), 'std_dev_duration_us': np.float64(0.08717797887081355), 'min_duration_us': np.float64(2.002), 'max_duration_us': np.float64(2.242)}]","[{'name': 'void at::native::unrolled_elementwise_kernel', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'aten::sub', 'void at::native::unrolled_elementwise_kernel, std::array, 4, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, at::native::CUDAFunctor_add, std::array, TrivialOffsetCalculator<2, unsigned int>, TrivialOffsetCalculator<1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast)']",0.001180115285242914,99.96789592996137 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 333, 4096), (1, 333, 4096)), ())","('TensorList', 'Scalar')","(((1363968, 4096, 1), (1363968, 4096, 1)), ())","('', '0')",18362,1,9.123,9.123,,,,,,,,,,8.2109375,,8.2109375,9.123,9.123,9.123,,,,,,,8.2109375,8.2109375,8.2109375,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(8.211), 'mean_duration_us': np.float64(8.211), 'median_duration_us': np.float64(8.211), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(8.211), 'max_duration_us': np.float64(8.211)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(8.21)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 3, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0011524284922557982,99.96904835845363 +aten::sub,elementwise,python3,CPU,thread 416 (python3),"((1, 256), (256, 1), ())","('long int', 'long int', 'Scalar')","((256, 1), (1, 1), ())","('', '', '1')",5166,2,26.78,13.39,0.38325187540310923,,,,,,,,,4.0048828125,0.113247570424408,8.009765625,13.39,13.119,13.661,,,,,,,4.0048828125,3.9248046875,4.0849609375,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(8.01), 'mean_duration_us': np.float64(4.005), 'median_duration_us': np.float64(4.005), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.085)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]",,False,transformers/models/t5/modeling_t5.py(236): compute_bias,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'aten::sub', 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast >(at::TensorIteratorBase&, at::native::CUDAFunctor_add const&)::{lambda(int, bool)#1})']",0.0011241934459422045,99.97017255189958 +aten::lt,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '8')",5178,2,22.474,11.237,0.0848528137423864,,,,,,,,,3.98486328125,0.028311892606102,7.9697265625,11.237,11.177,11.297,,,,,,,3.98486328125,3.96484375,4.0048828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.97), 'mean_duration_us': np.float64(3.985), 'median_duration_us': np.float64(3.985), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.965), 'max_duration_us': np.float64(4.005)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.98)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::lt', 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)']",0.0011185738493458097,99.97129112574892 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 768), (1, 1280)), ())","('TensorList', 'Scalar')","(((768, 1), (1280, 1)), ())","('', '-1')",9181,2,18.978,9.489,0.28991378028648457,,,,,,,,,3.964599609375,0.39671176346842923,7.92919921875,9.489,9.284,9.694,,,,,,,3.964599609375,3.68408203125,4.2451171875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.929), 'mean_duration_us': np.float64(3.9645), 'median_duration_us': np.float64(3.9645), 'std_dev_duration_us': np.float64(0.28049999999999997), 'min_duration_us': np.float64(3.684), 'max_duration_us': np.float64(4.245)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.96)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0011128857210836052,99.97240401147 +aten::where,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), (256, 256))","('bool', 'long int', 'long int')","((256, 1), (256, 1), (256, 1))","('', '', '')",5198,2,41.813,20.9065,4.92217030383956,,,,,,,,,3.864990234375,0.027966625623100757,7.72998046875,20.9065,17.426,24.387,,,,,,,3.864990234375,3.84521484375,3.884765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array >(int, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.73), 'mean_duration_us': np.float64(3.865), 'median_duration_us': np.float64(3.865), 'std_dev_duration_us': np.float64(0.019999999999999796), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.885)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.86)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::where', 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array >(int, at::native::(anonymous namespace)::where_kernel_impl(at::TensorIterator&)::{lambda()#1}::operator()() const::{lambda()#8}::operator()() const::{lambda(bool, long, long)#1}, std::array)']",0.0010849248014332504,99.97348893627144 +aten::add_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (256, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', '1')",5201,2,21.072000000000003,10.536000000000001,1.316632826569352,6.5536e-05,1.5,0.041666666666666664,,0.43636216893953483,8.359649111635002e-05,0.018181757039147282,3.4831871298454644e-06,3.6044921875,0.0006905339660024879,7.208984375,10.536000000000001,9.605,11.467,0.43636216893953483,0.43630305729378305,0.43642128058528656,0.018181757039147282,0.018179294053907627,0.018184220024386938,3.6044921875,3.60400390625,3.60498046875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(7.209), 'mean_duration_us': np.float64(3.6045), 'median_duration_us': np.float64(3.6045), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(3.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","{'shape_in1': (256, 256), 'shape_in2': (256, 256), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (256, 1), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::add_', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)']",0.001011801514014308,99.97450073778545 +aten::gather,other,python3,CPU,thread 416 (python3),"((49408, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1482,2,40.46,20.23,0.056568542494922595,,,,,,,,,3.424560546875,0.48164744128673526,6.84912109375,20.23,20.19,20.27,,,,,,,3.424560546875,3.083984375,3.76513671875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.849), 'mean_duration_us': np.float64(3.4245), 'median_duration_us': np.float64(3.4245), 'std_dev_duration_us': np.float64(0.3405), 'min_duration_us': np.float64(3.084), 'max_duration_us': np.float64(3.765)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0009612936763125642,99.97546203146176 +aten::gt,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '0')",5167,2,33.248000000000005,16.624000000000002,1.742311108843656,,,,,,,,,3.424072265625,0.14121419604750876,6.84814453125,16.624000000000002,15.392,17.856,,,,,,,3.424072265625,3.32421875,3.52392578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.10000000000000009), 'min_duration_us': np.float64(3.324), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::co...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::gt', 'void at::native::vectorized_elementwise_kernel<4, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array >(int, at::native::compare_scalar_kernel(at::TensorIteratorBase&, at::native::(anonymous namespace)::OpType, long)::{lambda(long)#1}, std::array)']",0.0009611566129809448,99.97642318807475 +aten::abs,elementwise,python3,CPU,thread 416 (python3),"((256, 256), (0,))","('long int', 'long int')","((256, 1), (1,))","('', '')",5176,2,25.859,12.9295,0.05727564927611189,,,,,,,,,3.423828125,0.028311892606102,6.84765625,12.9295,12.889,12.97,,,,,,,3.423828125,3.40380859375,3.44384765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AbsFunctor, std::array >(int, at::native::AbsFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.848), 'mean_duration_us': np.float64(3.424), 'median_duration_us': np.float64(3.424), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(3.404), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Ab...', 'stream': 0, 'mean_duration_us': np.float64(3.42)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::abs', 'aten::abs', 'void at::native::vectorized_elementwise_kernel<4, at::native::AbsFunctor, std::array >(int, at::native::AbsFunctor, std::array)']",0.0009610880813151352,99.97738427615606 +aten::gather,other,python3,CPU,thread 416 (python3),"((49408, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",37,2,70.885,35.4425,17.68969034494386,,,,,,,,,3.343994140625,0.14121419604750876,6.68798828125,35.4425,22.934,47.951,,,,,,,3.343994140625,3.244140625,3.44384765625,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.688000000000001), 'mean_duration_us': np.float64(3.3440000000000003), 'median_duration_us': np.float64(3.3440000000000003), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.444)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(3.34)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0009386782265953655,99.97832295438265 +aten::min,reduce,python3,CPU,thread 416 (python3),"((256, 256), (256, 256))","('long int', 'long int')","((256, 1), (256, 1))","('', '')",5196,2,30.924999999999997,15.462499999999999,0.5946768029778854,6.5536e-05,0.5000076293945312,0.12499809268047057,,0.15782268954784814,0.005360614107885869,0.019727535175183056,0.0006700665390817568,3.323974609375,0.11290230344140675,6.64794921875,15.462499999999999,15.042,15.883,0.15782268954784814,0.15403216296083777,0.16161321613485852,0.019727535175183056,0.019253726581552146,0.020201343768813967,3.323974609375,3.244140625,3.40380859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BinaryFunctor, std::array >(int, at::native::BinaryFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.648), 'mean_duration_us': np.float64(3.324), 'median_duration_us': np.float64(3.324), 'std_dev_duration_us': np.float64(0.07999999999999985), 'min_duration_us': np.float64(3.244), 'max_duration_us': np.float64(3.404)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.32)}]","{'num_input_elems': 65536, 'num_output_elems': 1, 'dtype_in_out': ('long int', None), 'reduce_type': 'min'}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::min', 'aten::minimum', 'void at::native::vectorized_elementwise_kernel<4, at::native::BinaryFunctor, std::array >(int, at::native::BinaryFunctor, std::array)']",0.0009330586299989707,99.97925601301264 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'long int')","((256, 1), ())","('', '')",5172,2,22.112000000000002,11.056000000000001,0.1414213562373109,6.5536e-05,1.0000076293945312,0.06249952316647975,,0.3210768746606883,0.033256019157474094,0.0200671515660766,0.0020784853397574476,3.283447265625,0.3400879782562253,6.56689453125,11.056000000000001,10.956,11.156,0.3210768746606883,0.29756131799916863,0.34459243132220796,0.0200671515660766,0.018597440487737284,0.021536862644415917,3.283447265625,3.04296875,3.52392578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.567), 'mean_duration_us': np.float64(3.2835), 'median_duration_us': np.float64(3.2835), 'std_dev_duration_us': np.float64(0.24049999999999994), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.28)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0009216823734745616,99.98017769538612 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 256, 4096), (1, 1, 1, 1, 256, 4096), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1048576, 1048576, 4096, 1048576, 4096, 1), (1048576, 1048576, 1048576, 1048576, 4096, 1), ())","('', '', 'False')",9170,2,32.879,16.4395,0.7148849557795997,0.001048576,4.0,0.25,vector_bf16,1.286461166118709,0.05593962523760452,0.32161529152967727,0.01398490630940113,3.263427734375,0.14190473001351125,6.52685546875,16.4395,15.934,16.945,1.286461166118709,1.2469058777761648,1.3260164544612534,0.32161529152967727,0.3117264694440412,0.33150411361531334,3.263427734375,3.1630859375,3.36376953125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.526999999999999), 'mean_duration_us': np.float64(3.2634999999999996), 'median_duration_us': np.float64(3.2634999999999996), 'std_dev_duration_us': np.float64(0.10050000000000003), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(3.364)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.26)}]","{'op_shape': (1, 1, 1, 1, 256, 4096), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1048576, 1048576, 4096, 1048576, 4096, 1), 'stride_output': (1048576, 1048576, 1048576, 1048576, 4096, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0009160627768781668,99.981093758163 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), ())","('c10::BFloat16', 'double')","((3145728, 1048576, 1024, 1), ())","('', '')",27341,1,13.299,13.299,,0.003145728,12.000007629394531,0.24999984105438167,vector_bf16,1.951076632344034,,0.4877688479709268,,6.44921875,,6.44921875,13.299,13.299,13.299,1.951076632344034,1.951076632344034,1.951076632344034,0.4877688479709268,0.4877688479709268,0.4877688479709268,6.44921875,6.44921875,6.44921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(6.449), 'mean_duration_us': np.float64(6.449), 'median_duration_us': np.float64(6.449), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(6.449), 'max_duration_us': np.float64(6.449)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(6.45)}]","{'shape_in1': (1, 3, 1024, 1024), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (3145728, 1048576, 1024, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0009051662420144255,99.98199892440502 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('long int', 'Scalar')","((256, 1), ())","('', '15')",5195,2,17.486,8.743,0.5246732316404189,,,,,,,,,3.0634765625,0.3121213526331245,6.126953125,8.743,8.372,9.114,,,,,,,3.0634765625,2.8427734375,3.2841796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.127), 'mean_duration_us': np.float64(3.0635), 'median_duration_us': np.float64(3.0635), 'std_dev_duration_us': np.float64(0.22049999999999992), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.06)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::full_like', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0008599353425800282,99.9828588597476 +aten::log,elementwise,python3,CPU,thread 416 (python3),"((256, 256),)","('float',)","((256, 1),)","('',)",5184,2,25.167,12.5835,0.021920310216784013,,,,,,,,,3.04345703125,0.0006905339660024879,6.0869140625,12.5835,12.568,12.599,,,,,,,3.04345703125,3.04296875,3.0439453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.087), 'mean_duration_us': np.float64(3.0435), 'median_duration_us': np.float64(3.0435), 'std_dev_duration_us': np.float64(0.0004999999999999449), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.044)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::lo...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",,False,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::log', 'void at::native::vectorized_elementwise_kernel<4, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::log_kernel_cuda(at::TensorIteratorBase&)::{lambda()#2}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)']",0.0008543157459836334,99.98371317549358 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 768), (1, 1, 1, 1, 77, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((59136, 59136, 768, 59136, 768, 1), (59136, 59136, 59136, 59136, 768, 1), ())","('', '', 'False')",1431,2,30.155,15.0775,3.4909861787179852,5.9136e-05,0.2255859375,0.25,vector_bf16,0.07881544776038232,0.009602730785797826,0.01970386194009558,0.002400682696449453,3.023681640625,0.36839987086232723,6.04736328125,15.0775,12.609,17.546,0.07881544776038232,0.07202529170383586,0.08560560381692879,0.01970386194009558,0.018006322925958964,0.021401400954232194,3.023681640625,2.76318359375,3.2841796875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(6.047), 'mean_duration_us': np.float64(3.0235), 'median_duration_us': np.float64(3.0235), 'std_dev_duration_us': np.float64(0.26049999999999995), 'min_duration_us': np.float64(2.763), 'max_duration_us': np.float64(3.284)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.02)}]","{'op_shape': (1, 1, 1, 1, 77, 768), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (59136, 59136, 768, 59136, 768, 1), 'stride_output': (59136, 59136, 59136, 59136, 768, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0008487646810530482,99.98456194017463 +aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '256', '1', '')",5155,4,40.260000000000005,10.065000000000001,5.556253593924596,,,,,,,,,1.5009765625,0.41580065693768986,6.00390625,8.252500000000001,5.849,17.906,,,,,,,1.32080078125,1.240234375,2.1220703125,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(6.004), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.321), 'std_dev_duration_us': np.float64(0.36005624560615523), 'min_duration_us': np.float64(1.24), 'max_duration_us': np.float64(2.122)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.0008426653627959856,99.98540460553743 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 3, 1024, 1024), (), ())","('c10::BFloat16', 'double', 'Scalar')","((3145728, 1048576, 1024, 1), (), ())","('', '', '1')",27342,1,8.964,8.964,,0.003145728,12.000007629394531,0.24999984105438167,vector_bf16,2.1084781672394044,,0.527119206676485,,5.9677734375,,5.9677734375,8.964,8.964,8.964,2.1084781672394044,2.1084781672394044,2.1084781672394044,0.527119206676485,0.527119206676485,0.527119206676485,5.9677734375,5.9677734375,5.9677734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.968), 'mean_duration_us': np.float64(5.968), 'median_duration_us': np.float64(5.968), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.968), 'max_duration_us': np.float64(5.968)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.97)}]","{'shape_in1': (1, 3, 1024, 1024), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (3145728, 1048576, 1024, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/image_processor.py(221): denormalize,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/image_processor.py(738): postprocess', 'diffusers/image_processor.py(540): _denormalize_conditionally', 'diffusers/image_processor.py(221): denormalize', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0008375940195260683,99.98624219955695 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1, 77, 1280), (1, 1, 1, 1, 77, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((98560, 98560, 1280, 98560, 1280, 1), (98560, 98560, 98560, 98560, 1280, 1), ())","('', '', 'False')",5032,2,31.196,15.598,0.9277240969167512,9.856e-05,0.3759765625,0.25,vector_bf16,0.13245858379797232,0.008800490467240142,0.03311464594949308,0.0022001226168100354,2.98291015625,0.198183248242714,5.9658203125,15.598,14.942,16.254,0.13245858379797232,0.12623569731081927,0.1386814702851254,0.03311464594949308,0.03155892432770482,0.03467036757128135,2.98291015625,2.8427734375,3.123046875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.966), 'mean_duration_us': np.float64(2.983), 'median_duration_us': np.float64(2.983), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.843), 'max_duration_us': np.float64(3.123)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.98)}]","{'op_shape': (1, 1, 1, 1, 77, 1280), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (98560, 98560, 1280, 98560, 1280, 1), 'stride_output': (98560, 98560, 98560, 98560, 1280, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0008373198928628295,99.98707951944982 +aten::arange,other,python3,CPU,thread 416 (python3),"((), (), (), (0,))","('Scalar', 'Scalar', 'Scalar', 'long int')","((), (), (), (1,))","('0', '1', '1', '')",1396,4,48.543,12.13575,1.4513578412415498,,,,,,,,,1.4608154296875,0.25613361444813626,5.84326171875,11.472000000000001,11.297,14.302,,,,,,,1.36083984375,1.28076171875,1.8408203125,"[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(5.843999999999999), 'mean_duration_us': np.float64(1.4609999999999999), 'median_duration_us': np.float64(1.361), 'std_dev_duration_us': np.float64(0.22181073012818836), 'min_duration_us': np.float64(1.281), 'max_duration_us': np.float64(1.841)}]","[{'name': 'void (anonymous namespace)::elementwise_kernel_with_index', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'aten::arange', 'aten::arange', 'void (anonymous namespace)::elementwise_kernel_with_index(int, at::native::arange_cuda_out(c10::Scalar const&, c10::Scalar const&, c10::Scalar const&, at::Tensor&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(long)#1}, function_traits::result_type*)']",0.0008201184447445966,99.98789963789457 +aten::_local_scalar_dense,other,python3,CPU,thread 416 (python3),"((1,),)","('long int',)","((1,),)","('',)",20473,1,23.455,23.455,,,,,,,,,,5.80810546875,,5.80810546875,23.455,23.455,23.455,,,,,,,5.80810546875,5.80810546875,5.80810546875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.808), 'mean_duration_us': np.float64(5.808), 'median_duration_us': np.float64(5.808), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.808), 'max_duration_us': np.float64(5.808)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.81)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::item', 'aten::_local_scalar_dense', 'Memcpy DtoD (Device -> Device)']",0.0008151841648062986,99.98871482205938 +aten::gather,other,python3,CPU,thread 416 (python3),"((77, 1280), (), (77, 1280), (), (77, 1280))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((1280, 1), (), (1, 0), (), (1280, 1))","('', '0', '', 'False', '')",1495,2,21.802999999999997,10.901499999999999,0.14919953083036236,,,,,,,,,2.903564453125,0.14052366208150627,5.80712890625,10.901499999999999,10.796,11.007,,,,,,,2.903564453125,2.80419921875,3.0029296875,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.807), 'mean_duration_us': np.float64(2.9035), 'median_duration_us': np.float64(2.9035), 'std_dev_duration_us': np.float64(0.09950000000000013), 'min_duration_us': np.float64(2.804), 'max_duration_us': np.float64(3.003)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.9)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0008150471014746793,99.98952986916085 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 256), (1, 256), ())","('long int', 'long int', 'Scalar')","((256, 1), (256, 1), ())","('', '', 'False')",5072,2,69.344,34.672,1.5160369388639543,2.56e-07,0.00390625,0.0625,,0.001441005046664297,2.8525194290411314e-05,9.006281541651856e-05,1.782824643150707e-06,2.843017578125,0.05627851822920276,5.68603515625,34.672,33.6,35.744,0.001441005046664297,0.0014208346883468833,0.0014611754049817106,9.006281541651856e-05,8.880216802168021e-05,9.132346281135691e-05,2.843017578125,2.80322265625,2.8828125,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.686), 'mean_duration_us': np.float64(2.843), 'median_duration_us': np.float64(2.843), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.803), 'max_duration_us': np.float64(2.883)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","{'op_shape': (1, 256), 'dtype_in_out': ('long int', 'long int'), 'stride_input': (256, 1), 'stride_output': (256, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.0007980512483538754,99.9903279204092 +aten::gather,other,python3,CPU,thread 416 (python3),"((77, 768), (), (77, 768), (), (77, 768))","('c10::BFloat16', 'Scalar', 'long int', 'Scalar', 'c10::BFloat16')","((768, 1), (), (1, 0), (), (768, 1))","('', '0', '', 'False', '')",50,2,20.951,10.4755,1.0047987360660835,,,,,,,,,2.703125,0.028311892606102,5.40625,10.4755,9.765,11.186,,,,,,,2.703125,2.68310546875,2.72314453125,"[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.406), 'mean_duration_us': np.float64(2.703), 'median_duration_us': np.float64(2.703), 'std_dev_duration_us': np.float64(0.020000000000000018), 'min_duration_us': np.float64(2.683), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_gather_kernel<16, long>(char*, char*...', 'stream': 0, 'mean_duration_us': np.float64(2.7)}]",,False,torch/nn/functional.py(2428): embedding,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'nn.Module: CLIPTextModelWithProjection', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(870): wrapper', 'transformers/models/clip/modeling_clip.py(972): forward', 'nn.Module: CLIPTextTransformer', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/utils/generic.py(890): wrapper', 'transformers/utils/output_capturing.py(217): wrapper', 'transformers/models/clip/modeling_clip.py(529): forward', 'nn.Module: CLIPTextEmbeddings', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/clip/modeling_clip.py(234): forward', 'nn.Module: Embedding', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/nn/modules/sparse.py(191): forward', 'torch/nn/functional.py(2428): embedding', 'aten::embedding', 'aten::index_select', 'aten::gather', 'void at::native::vectorized_gather_kernel<16, long>(char*, char*, long*, int, long, long, long, long, bool)']",0.0007587826038449213,99.99108670301304 +aten::normal_,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), (), ())","('c10::BFloat16', 'Scalar', 'Scalar', '')","((262144, 16384, 128, 1), (), (), ())","('', '0.', '1.', '')",18366,1,19.279,19.279,,,,,,,,,,5.2470703125,,5.2470703125,19.279,19.279,19.279,,,,,,,5.2470703125,5.2470703125,5.2470703125,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.247), 'mean_duration_us': np.float64(5.247), 'median_duration_us': np.float64(5.247), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(5.247)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(5.25)}]",,False,diffusers/utils/torch_utils.py(152): randn_tensor,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(633): prepare_latents', 'diffusers/utils/torch_utils.py(152): randn_tensor', 'aten::randn', 'aten::normal_', 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})']",0.0007364412807909613,99.99182314429383 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1,), (1,), ())","('float', 'float', 'Scalar')","((1,), (1,), ())","('', '', 'False')",20500,3,68.612,22.870666666666665,4.080723261057203,1e-09,7.62939453125e-06,0.125,vector_fp32,4.745146984886265e-06,6.621960788630501e-07,5.931433731107831e-07,8.277450985788126e-08,1.7083333333333333,0.24154693224356558,5.125,24.396,18.247,25.969,4.755878084179971e-06,4.077650572424091e-06,5.401912298054731e-06,5.944847605224964e-07,5.097063215530114e-07,6.752390372568414e-07,1.68212890625,1.48095703125,1.9619140625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.125), 'mean_duration_us': np.float64(1.7083333333333333), 'median_duration_us': np.float64(1.682), 'std_dev_duration_us': np.float64(0.19724829248662426), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.962)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.71)}]","{'op_shape': (1,), 'dtype_in_out': ('float', 'float'), 'stride_input': (1,), 'stride_output': (1,)}",True,torch/_dynamo/eval_frame.py(1039): _fn,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'nn.Module: SD3Transformer2DModel', 'torch/nn/modules/module.py(1779): _call_impl', 'torch/_dynamo/eval_frame.py(791): compile_wrapper', 'Torch-Compiled Region: 0/0', 'diffusers/utils/peft_utils.py(292): wrapper', 'torch/_dynamo/eval_frame.py(1039): _fn', 'torch/_functorch/aot_autograd.py(1126): forward', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(310): runtime_wrapper', 'torch/_functorch/_aot_autograd/utils.py(119): call_func_at_runtime_with_args', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(716): inner_fn', 'torch/_functorch/_aot_autograd/runtime_wrappers.py(512): wrapper', 'torch/_inductor/output_code.py(590): __call__', 'torch/_inductor/utils.py(3013): run', 'torch/_inductor/utils.py(3041): copy_misaligned_inputs', 'torch/_inductor/utils.py(3029): clone_preserve_strides', 'aten::clone', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0007193083643385382,99.99254245265817 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'double')","((256, 1), ())","('', '')",5185,2,14.251,7.1255,0.10677312395916853,6.5536e-05,0.5000076293945312,0.12499809268047057,vector_fp32,0.20649471566880673,0.011494943093073473,0.02581144560719692,0.0014368459621047333,2.54296875,0.14155946303051,5.0859375,7.1255,7.05,7.201,0.20649471566880673,0.19836656345834103,0.21462286787927246,0.02581144560719692,0.024795442083872157,0.026827449130521687,2.54296875,2.44287109375,2.64306640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.086), 'mean_duration_us': np.float64(2.543), 'median_duration_us': np.float64(2.543), 'std_dev_duration_us': np.float64(0.09999999999999987), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.643)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.54)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'double', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::div', 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0007138258310737626,99.99325627848924 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",5186,2,18.448,9.224,0.7085209947489198,6.5536e-05,0.5000076293945312,0.12499809268047057,vector_fp32,0.20802032607994764,0.009337404158740426,0.026002143998763,0.0011671577104292474,2.52294921875,0.113247570424408,5.0458984375,9.224,8.723,9.725,0.20802032607994764,0.2014177842806228,0.21462286787927246,0.026002143998763,0.025176838867004316,0.026827449130521687,2.52294921875,2.44287109375,2.60302734375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(5.046), 'mean_duration_us': np.float64(2.523), 'median_duration_us': np.float64(2.523), 'std_dev_duration_us': np.float64(0.08000000000000007), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.603)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.52)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.0007082062344773678,99.99396448472372 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((256, 256), ())","('float', 'long int')","((256, 1), ())","('', '')",5183,2,27.992,13.996,1.182282538143908,6.5536e-05,0.5000076293945312,0.12499809268047057,vector_fp32,0.21834858271893276,0.005147571704512462,0.02729315637935055,0.0006434366450000153,2.40185546875,0.056623785212204,4.8037109375,13.996,13.16,14.832,0.21834858271893276,0.214708699860028,0.2219884655778375,0.02729315637935055,0.026838177964407118,0.027748134794293982,2.40185546875,2.36181640625,2.44189453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.804), 'mean_duration_us': np.float64(2.402), 'median_duration_us': np.float64(2.402), 'std_dev_duration_us': np.float64(0.040000000000000036), 'min_duration_us': np.float64(2.362), 'max_duration_us': np.float64(2.442)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.4)}]","{'shape_in1': (256, 256), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (256, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(188): _relative_position_bucket,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'transformers/models/t5/modeling_t5.py(188): _relative_position_bucket', 'aten::div', 'void at::native::vectorized_elementwise_kernel<4, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.0006742145282357601,99.99463869925195 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((256, 1), (), ())","('long int', 'long int', 'Scalar')","((1, 1), (), ())","('', '', '1')",5159,2,31.717,15.8585,0.5876057351660212,2.56e-07,0.00391387939453125,0.06237816764132553,,0.0018030654487239854,0.00013446468803464246,0.0001124719188287866,8.38766085206349e-06,2.282470703125,0.17021662261961323,4.56494140625,15.8585,15.443,16.274,0.0018030654487239854,0.001707984555984556,0.0018981463414634147,0.0001124719188287866,0.00010654094696199958,0.00011840289069557363,2.282470703125,2.162109375,2.40283203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.5649999999999995), 'mean_duration_us': np.float64(2.2824999999999998), 'median_duration_us': np.float64(2.2824999999999998), 'std_dev_duration_us': np.float64(0.12050000000000005), 'min_duration_us': np.float64(2.162), 'max_duration_us': np.float64(2.403)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.28)}]","{'shape_in1': (256, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (1, 1), 'stride_input2': (), 'stride_output': None}",True,transformers/models/t5/modeling_t5.py(236): compute_bias,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(233): _get_t5_prompt_embeds', 'nn.Module: T5EncoderModel', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(1163): forward', 'nn.Module: T5Stack', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(637): forward', 'transformers/modeling_layers.py(59): __call__', 'nn.Module: T5Block', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(424): forward', 'nn.Module: T5LayerSelfAttention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(356): forward', 'nn.Module: T5Attention', 'torch/nn/modules/module.py(1779): _call_impl', 'transformers/models/t5/modeling_t5.py(253): forward', 'transformers/models/t5/modeling_t5.py(236): compute_bias', 'aten::add', 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.0006407025436548202,99.9952794017956 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1, 77, 4096), ())","('c10::BFloat16', 'Scalar')","((315392, 4096, 1), ())","('', '0.')",9175,2,24.856,12.428,0.8358002153625,,,,,,,,,2.221923828125,0.19783798125971275,4.44384765625,12.428,11.837,13.019,,,,,,,2.221923828125,2.08203125,2.36181640625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.444), 'mean_duration_us': np.float64(2.222), 'median_duration_us': np.float64(2.222), 'std_dev_duration_us': np.float64(0.14000000000000012), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.362)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.22)}]",,False,torch/nn/functional.py(5213): pad,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'torch/nn/functional.py(5213): pad', 'aten::pad', 'aten::constant_pad_nd', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.0006237066905340163,99.99590310848613 +aten::cat,other,python3,CPU,thread 416 (python3),"(((1, 2048), (1, 2048)), ())","('TensorList', 'Scalar')","(((2048, 1), (2048, 1)), ())","('', '0')",18363,1,7.011,7.011,,,,,,,,,,4.125,,4.125,7.011,7.011,7.011,,,,,,,4.125,4.125,4.125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.125), 'mean_duration_us': np.float64(4.125), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.125)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.12)}]",,False,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 2, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.0005789555127602867,99.9964820639989 +aten::eq,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'float')","((1,), ())","('', '')",20462,1,16.735,16.735,,,,,,,,,,3.52392578125,,3.52392578125,16.735,16.735,16.735,,,,,,,3.52392578125,3.52392578125,3.52392578125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.524), 'mean_duration_us': np.float64(3.524), 'median_duration_us': np.float64(3.524), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.524), 'max_duration_us': np.float64(3.524)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', '/app/xDiT/xfuser/model_executor/schedulers/base_scheduler.py(40): check_naive_step_fn', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(425): step', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(417): _init_step_index', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(386): index_for_timestep', 'aten::eq', 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BinaryFunctor > const&)::{lambda(int, bool)#1})']",0.0004945930321485546,99.99697665703104 +aten::cat,other,python3,CPU,thread 416 (python3),"(((4,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,)), ())","('', '0')",18386,1,13.39,13.39,,,,,,,,,,3.04296875,,3.04296875,13.39,13.39,13.39,,,,,,,3.04296875,3.04296875,3.04296875,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(3.043), 'mean_duration_us': np.float64(3.043), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(3.043), 'max_duration_us': np.float64(3.043)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(3.04)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::cat', 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<4u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)']",0.000427089341326007,99.99740374637237 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 768), (1, 1, 1, 768), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((768, 768, 768, 1), (768, 768, 768, 1), ())","('', '', 'False')",1445,2,12.077,6.0385,0.8916616510762359,7.68e-07,0.0029296875,0.25,vector_bf16,0.00204703168771126,3.8611756340311866e-05,0.000511757921927815,9.652939085077967e-06,1.5009765625,0.028311892606102,3.001953125,6.0385,5.408,6.669,0.00204703168771126,0.0020197290529695025,0.0020743343224530167,0.000511757921927815,0.0005049322632423756,0.0005185835806132542,1.5009765625,1.48095703125,1.52099609375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(3.002), 'mean_duration_us': np.float64(1.501), 'median_duration_us': np.float64(1.501), 'std_dev_duration_us': np.float64(0.019999999999999907), 'min_duration_us': np.float64(1.481), 'max_duration_us': np.float64(1.521)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.5)}]","{'op_shape': (1, 1, 1, 768), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (768, 768, 768, 1), 'stride_output': (768, 768, 768, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0004213326813979928,99.99782507905377 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((1, 1, 1, 1280), (1, 1, 1, 1280), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1280, 1280, 1280, 1), (1280, 1280, 1280, 1), ())","('', '', 'False')",5046,2,12.899000000000001,6.4495000000000005,0.26940768363207385,1.28e-06,0.0048828125,0.25,vector_bf16,0.0035632188356983976,0.00028165994123286267,0.0008908047089245995,7.041498530821571e-05,1.44140625,0.1139381043904105,2.8828125,6.4495000000000005,6.259,6.64,0.0035632188356983976,0.003364055181264036,0.003762382490132759,0.0008908047089245995,0.0008410137953160091,0.0009405956225331899,1.44140625,1.36083984375,1.52197265625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(2.883), 'mean_duration_us': np.float64(1.4415), 'median_duration_us': np.float64(1.4415), 'std_dev_duration_us': np.float64(0.08050000000000002), 'min_duration_us': np.float64(1.361), 'max_duration_us': np.float64(1.522)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(1.44)}]","{'op_shape': (1, 1, 1, 1280), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1280, 1280, 1280, 1), 'stride_output': (1280, 1280, 1280, 1)}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(344): encode_prompt', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(289): _get_clip_prompt_embeds', 'aten::repeat', 'aten::copy_', 'Memcpy DtoD (Device -> Device)']",0.0004046109549404277,99.99822969000871 +aten::add,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), (), ())","('c10::BFloat16', 'double', 'Scalar')","((262144, 16384, 128, 1), (), ())","('', '', '1')",26745,1,11.637,11.637,,0.000262144,1.0000076293945312,0.249998092665919,vector_bf16,0.3686695333905579,,0.09216668017167381,,2.84423828125,,2.84423828125,11.637,11.637,11.637,0.3686695333905579,0.3686695333905579,0.3686695333905579,0.09216668017167381,0.09216668017167381,0.09216668017167381,2.84423828125,2.84423828125,2.84423828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.844), 'mean_duration_us': np.float64(2.844), 'median_duration_us': np.float64(2.844), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.844), 'max_duration_us': np.float64(2.844)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::add', 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)']",0.00039919695334146197,99.99862888696205 +aten::div,elementwise,python3,CPU,thread 416 (python3),"((1, 16, 128, 128), ())","('c10::BFloat16', 'double')","((262144, 16384, 128, 1), ())","('', '')",26744,1,25.578,25.578,,0.000262144,1.0000076293945312,0.249998092665919,vector_bf16,0.3850636600322754,,0.09626518056302671,,2.72314453125,,2.72314453125,25.578,25.578,25.578,0.3850636600322754,0.3850636600322754,0.3850636600322754,0.09626518056302671,0.09626518056302671,0.09626518056302671,2.72314453125,2.72314453125,2.72314453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.723), 'mean_duration_us': np.float64(2.723), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(2.723)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BU...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]","{'shape_in1': (1, 16, 128, 128), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', None), 'stride_input1': (262144, 16384, 128, 1), 'stride_input2': (), 'stride_output': None}",True,diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'aten::div', 'void at::native::vectorized_elementwise_kernel<8, at::native::BUnaryFunctor >, std::array >(int, at::native::BUnaryFunctor >, std::array)']",0.00038220110022065803,99.99901108806228 +aten::copy_,elementwise,python3,CPU,thread 416 (python3),"((4,), (4,), ())","('float', 'double', 'Scalar')","((1,), (1,), ())","('', '', 'False')",18372,1,53.59,53.59,,4e-09,4.57763671875e-05,0.08333333333333333,vector_fp32,1.8167436703012383e-05,,1.513953058584365e-06,,2.64208984375,,2.64208984375,53.59,53.59,53.59,1.8167436703012383e-05,1.8167436703012383e-05,1.8167436703012383e-05,1.513953058584365e-06,1.513953058584365e-06,1.513953058584365e-06,2.64208984375,2.64208984375,2.64208984375,"[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.642), 'mean_duration_us': np.float64(2.642), 'median_duration_us': np.float64(2.642), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.642), 'max_duration_us': np.float64(2.642)}]","[{'name': 'Memcpy HtoD (Host -> Device)', 'stream': 0, 'mean_duration_us': np.float64(2.64)}]","{'op_shape': (4,), 'dtype_in_out': ('float', 'double'), 'stride_input': (1,), 'stride_output': (1,)}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::to', 'aten::_to_copy', 'aten::copy_', 'aten::copy_', 'Memcpy HtoD (Host -> Device)']",0.000370824843696249,99.99938191290597 +aten::fill_,elementwise,python3,CPU,thread 416 (python3),"((1,), ())","('float', 'Scalar')","((1,), ())","('', '0')",18385,1,9.013,9.013,,,,,,,,,,2.44287109375,,2.44287109375,9.013,9.013,9.013,,,,,,,2.44287109375,2.44287109375,2.44287109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(2.443), 'mean_duration_us': np.float64(2.443), 'median_duration_us': np.float64(2.443), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.443), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]",,False,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::zeros', 'aten::zero_', 'aten::fill_', 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)']",0.00034286392404589427,99.99972477683002 +aten::mul,elementwise,python3,CPU,thread 416 (python3),"((4,), ())","('float', 'long int')","((1,), ())","('', '')",18381,1,14.592,14.592,,4e-09,3.814697265625e-05,0.1,vector_fp32,2.039840637450199e-05,,2.0398406374501996e-06,,1.9609375,,1.9609375,14.592,14.592,14.592,2.039840637450199e-05,2.039840637450199e-05,2.039840637450199e-05,2.0398406374501996e-06,2.0398406374501996e-06,2.0398406374501996e-06,1.9609375,1.9609375,1.9609375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(1.961), 'mean_duration_us': np.float64(1.961), 'median_duration_us': np.float64(1.961), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(1.961)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.96)}]","{'shape_in1': (4,), 'shape_in2': (), 'dtype_in1_in2_out': ('float', 'long int', None), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': None}",True,diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps,"['/app/xDiT/xfuser/runner.py(126): ', '/app/xDiT/xfuser/runner.py(81): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(611): profile', '/app/xDiT/xfuser/model_executor/models/runner_models/base_model.py(677): _run_timed_pipe', '/app/xDiT/xfuser/model_executor/models/runner_models/stable_diffusion.py(61): _run_pipe', 'torch/utils/_contextlib.py(117): decorate_context', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(234): data_parallel_fn', '/app/xDiT/xfuser/model_executor/pipelines/base_pipeline.py(272): check_naive_forward_fn', 'torch/utils/_contextlib.py(117): decorate_context', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(772): __call__', 'diffusers/pipelines/stable_diffusion/pipeline_stable_diffusion.py(89): retrieve_timesteps', 'diffusers/schedulers/scheduling_flow_match_euler_discrete.py(282): set_timesteps', 'aten::mul', 'void at::native::vectorized_elementwise_kernel<4, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)']",0.00027522316989172726,99.99999999999991 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/BinaryElementwise.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/BinaryElementwise.csv index 319eb6b21..a0c470809 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/BinaryElementwise.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/BinaryElementwise.csv @@ -1,29 +1,29 @@ name,param: shape_in1,param: shape_in2,param: dtype_in1_in2_out,param: stride_input1,param: stride_input2,param: stride_output,is_recompute,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::add_,(),(),"('long int', 'long int', None)",(),(),,False,1e-09,2.288818359375e-05,0.041666666666666664,5.30261213627774e-06,5.382500087568622e-06,5.334941097009482e-07,3.798160884012055e-06,6.124096685771244e-06,2.2094217234490584e-07,2.242708369820259e-07,2.2228921237539506e-08,1.5825670350050229e-07,2.551706952404685e-07,python3,CPU,thread 542 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(274.618), 'mean_duration_us': np.float64(4.576966666666666), 'median_duration_us': np.float64(4.459), 'std_dev_duration_us': np.float64(0.515218949142552), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(6.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', '1']",4.5769775390625,4.458984375,0.5195361566293653,3.9189453125,6.31884765625,274.61865234375,60,5874 -aten::add_,(),(),"('long int', 'long int', None)",(),(),,True,1e-09,2.288818359375e-05,0.041666666666666664,1.4599697739254407e-05,6.898526315789474e-06,1.3534759942728616e-05,4.51225557697604e-06,3.7549274255156605e-05,6.083207391356003e-07,2.8743859649122805e-07,5.639483309470256e-07,1.8801064904066833e-07,1.5645530939648586e-06,python3,CPU,thread 639 (pt_autograd_0),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 57, 'total_duration_us': np.float64(171.62300000000002), 'mean_duration_us': np.float64(3.010929824561404), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.5473071555679883), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.01)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', '1']",3.0109906112938596,3.47900390625,1.5609787077950346,0.63916015625,5.31884765625,171.62646484375,57,75 -aten::add_,"(10, 64, 56, 56)","(10, 64, 56, 56)","('c10::BFloat16', 'c10::BFloat16', None)","(200704, 3136, 56, 1)","(200704, 3136, 56, 1)",,False,0.00200704,11.484375,0.16666666666666666,1.8542856273685298,1.8702136589064988,0.193405193236508,1.3939132719154468,2.150737552978111,0.3090476045614216,0.31170227648441645,0.032234198872751335,0.23231887865257445,0.3584562588296852,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(98.50499999999997), 'mean_duration_us': np.float64(6.5669999999999975), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.730325954625741), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(8.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.57)}]","[[10, 64, 56, 56], [10, 64, 56, 56], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], []]","['', '', '1']",6.567024739583333,6.43896484375,0.756000593569641,5.59912109375,8.63916015625,98.50537109375,15,1254 +aten::add_,(),(),"('long int', 'long int', None)",(),(),None,False,1e-09,2.288818359375e-05,0.041666666666666664,5.30261213627774e-06,5.382500087568622e-06,5.334941097009482e-07,3.798160884012055e-06,6.124096685771244e-06,2.2094217234490584e-07,2.242708369820259e-07,2.2228921237539506e-08,1.5825670350050229e-07,2.551706952404685e-07,python3,CPU,thread 542 (python3),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(274.618), 'mean_duration_us': np.float64(4.576966666666666), 'median_duration_us': np.float64(4.459), 'std_dev_duration_us': np.float64(0.515218949142552), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(6.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', '1']",4.5769775390625,4.458984375,0.5195361566293653,3.9189453125,6.31884765625,274.61865234375,60,5874 +aten::add_,(),(),"('long int', 'long int', None)",(),(),None,True,1e-09,2.288818359375e-05,0.041666666666666664,1.4599697739254407e-05,6.898526315789474e-06,1.3534759942728616e-05,4.51225557697604e-06,3.7549274255156605e-05,6.083207391356003e-07,2.8743859649122805e-07,5.639483309470256e-07,1.8801064904066833e-07,1.5645530939648586e-06,python3,CPU,thread 639 (pt_autograd_0),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 57, 'total_duration_us': np.float64(171.62300000000002), 'mean_duration_us': np.float64(3.010929824561404), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.5473071555679883), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.01)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', '1']",3.0109906112938596,3.47900390625,1.5609787077950346,0.63916015625,5.31884765625,171.62646484375,57,75 +aten::add_,"(10, 64, 56, 56)","(10, 64, 56, 56)","('c10::BFloat16', 'c10::BFloat16', None)","(200704, 3136, 56, 1)","(200704, 3136, 56, 1)",None,False,0.00200704,11.484375,0.16666666666666666,1.8542856273685298,1.8702136589064988,0.193405193236508,1.3939132719154468,2.150737552978111,0.3090476045614216,0.31170227648441645,0.032234198872751335,0.23231887865257445,0.3584562588296852,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(98.50499999999997), 'mean_duration_us': np.float64(6.5669999999999975), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.730325954625741), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(8.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.57)}]","[[10, 64, 56, 56], [10, 64, 56, 56], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], []]","['', '', '1']",6.567024739583333,6.43896484375,0.756000593569641,5.59912109375,8.63916015625,98.50537109375,15,1254 aten::mul,"(512,)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(1,)",(),"(1,)",False,5.12e-07,0.00196075439453125,0.2490272373540856,0.001403201957640396,0.0005978543234417151,0.0011944753466311248,0.00034272244831515546,0.0032167211611917493,0.0003494355069610325,0.00014888201050688627,0.0002974568956591127,8.534722448315156e-05,0.0008010511841100076,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(82.649), 'mean_duration_us': np.float64(2.754966666666667), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(1.6267029329973628), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.999)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.75)}]","[[512], [], [512]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[1], [], [1]]","['', '', '']",2.7550455729166665,3.43896484375,1.6544370356456592,0.63916015625,5.9990234375,82.6513671875,30,251 aten::mul,"(256,)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(1,)",(),"(1,)",False,2.56e-07,0.00098419189453125,0.24806201550387597,0.0009225621914914683,0.0009133405171805666,0.0006401909615510164,0.00028049581950895816,0.001614618792971734,0.0002288526366490464,0.0002265650895331638,0.00015880706022970952,6.958035832780358e-05,0.0004005255920550038,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.68900000000001), 'mean_duration_us': np.float64(2.0896333333333335), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.425860780565745), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","[[256], [], [256]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[1], [], [1]]","['', '', '']",2.08974609375,2.01904296875,1.4501653361546871,0.63916015625,3.67919921875,62.6923828125,30,654 aten::mul,"(128,)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(1,)",(),"(1,)",False,1.28e-07,0.00049591064453125,0.24615384615384617,0.0004665090466028926,0.00045929849481825974,0.0003241785608034115,0.00014133510285335103,0.0008135676088617264,0.00011483299608686586,0.00011305809103218701,7.979779958237824e-05,3.479017916390179e-05,0.0002002627960275019,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.039), 'std_dev_duration_us': np.float64(1.425871429454049), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","[[128], [], [128]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[1], [], [1]]","['', '', '']",2.087109375,2.0390625,1.4501753944792757,0.63916015625,3.67919921875,62.61328125,30,1054 aten::mul,"(64,)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(1,)",(),"(1,)",False,6.4e-08,0.00025177001953125,0.24242424242424243,0.0002376293523446567,0.0002336452485810752,0.00016544210163953982,7.175474452554745e-05,0.0004130420168067227,5.7607115719916775e-05,5.664127238329095e-05,4.010717615503995e-05,1.7395089581950895e-05,0.00010013139801375095,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.4287113074375803), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","[[64], [], [64]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[1], [], [1]]","['', '', '']",2.087109375,2.01904296875,1.4530668185492028,0.63916015625,3.67919921875,62.61328125,30,1426 -aten::threshold_backward,"(10, 64, 56, 56)","(10, 64, 56, 56)","('c10::BFloat16', 'c10::BFloat16', None)","(200704, 3136, 56, 1)","(200704, 3136, 56, 1)",,False,0.00200704,11.484375,0.16666666666666666,3.165084549111451,3.6130421691504555,1.3915160070258372,1.0988463518089469,4.428534300592566,0.5275140915185751,0.6021736948584092,0.23191933450430616,0.18314105863482444,0.7380890500987609,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.348), 'mean_duration_us': np.float64(5.112333333333333), 'median_duration_us': np.float64(3.4589999999999996), 'std_dev_duration_us': np.float64(3.254036809188789), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(10.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.11)}]","[[10, 64, 56, 56], [10, 64, 56, 56], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], []]","['', '', '0']",5.1123046875,3.458984375,3.398747629905021,2.71923828125,10.958984375,61.34765625,12,1402 -aten::threshold_backward,"(10, 128, 28, 28)","(10, 128, 28, 28)","('c10::BFloat16', 'c10::BFloat16', None)","(100352, 784, 28, 1)","(100352, 784, 28, 1)",,False,0.00100352,5.7421875,0.16666666666666666,1.6190023371009568,1.5603676650007188,0.727229851991352,0.7067836166676219,2.7378449733570163,0.26983372285015944,0.26006127750011976,0.12120497533189199,0.11779726944460364,0.4563074955595026,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(55.308), 'mean_duration_us': np.float64(4.609), 'median_duration_us': np.float64(3.859), 'std_dev_duration_us': np.float64(2.273213584333861), 'min_duration_us': np.float64(2.199), 'max_duration_us': np.float64(8.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","[[10, 128, 28, 28], [10, 128, 28, 28], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], [100352, 784, 28, 1], []]","['', '', '0']",4.608968098958333,3.85888671875,2.3743423923450107,2.19921875,8.51904296875,55.3076171875,12,1030 -aten::add_,"(10, 128, 28, 28)","(10, 128, 28, 28)","('c10::BFloat16', 'c10::BFloat16', None)","(100352, 784, 28, 1)","(100352, 784, 28, 1)",,False,0.00100352,5.7421875,0.16666666666666666,1.5900526398718595,1.572501052758445,0.5150038701567308,0.9904621493975905,2.316598489573549,0.26500877331197653,0.2620835087930741,0.08583397835945514,0.16507702489959838,0.3860997482622581,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(50.348), 'mean_duration_us': np.float64(4.195666666666667), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(1.3371071593389794), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(6.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.2)}]","[[10, 128, 28, 28], [10, 128, 28, 28], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], [100352, 784, 28, 1], []]","['', '', '1']",4.195638020833333,3.87890625,1.3965733264774087,2.59912109375,6.0791015625,50.34765625,12,854 -aten::add_,"(10, 256, 14, 14)","(10, 256, 14, 14)","('c10::BFloat16', 'c10::BFloat16', None)","(50176, 196, 14, 1)","(50176, 196, 14, 1)",,False,0.00050176,2.87109375,0.16666666666666666,0.8179343239459235,0.7043839215158687,0.3200299152211666,0.5156068640240843,1.4206513548387096,0.13632238732432056,0.11739732025264477,0.05333831920352776,0.08593447733734738,0.23677522580645158,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(50.028000000000006), 'mean_duration_us': np.float64(4.1690000000000005), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(1.3368744643134347), 'min_duration_us': np.float64(2.119), 'max_duration_us': np.float64(5.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.17)}]","[[10, 256, 14, 14], [10, 256, 14, 14], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], [50176, 196, 14, 1], []]","['', '', '1']",4.168986002604167,4.31884765625,1.3962392111228676,2.119140625,5.8388671875,50.02783203125,12,454 -aten::threshold_backward,"(10, 256, 14, 14)","(10, 256, 14, 14)","('c10::BFloat16', 'c10::BFloat16', None)","(50176, 196, 14, 1)","(50176, 196, 14, 1)",,False,0.00050176,2.87109375,0.16666666666666666,0.959759619857854,0.8318693393547332,0.5073463271319937,0.4181787086272382,1.7928545740040709,0.15995993664297567,0.13864488989245552,0.0845577211886656,0.06969645143787302,0.2988090956673451,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(47.94800000000001), 'mean_duration_us': np.float64(3.995666666666667), 'median_duration_us': np.float64(3.6189999999999998), 'std_dev_duration_us': np.float64(1.8999268991785507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]","[[10, 256, 14, 14], [10, 256, 14, 14], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], [50176, 196, 14, 1], []]","['', '', '0']",3.9957682291666665,3.619140625,1.984446512224859,1.67919921875,7.19921875,47.94921875,12,630 -aten::add_,"(10, 512, 7, 7)","(10, 512, 7, 7)","('c10::BFloat16', 'c10::BFloat16', None)","(25088, 49, 7, 1)","(25088, 49, 7, 1)",,False,0.00025088,1.435546875,0.16666666666666666,0.3279100381954734,0.3360747236454813,0.07400773863785495,0.20680307506540552,0.41363389775929155,0.054651673032578896,0.056012453940913545,0.012334623106309154,0.034467179177567586,0.06893898295988192,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.510999999999996), 'mean_duration_us': np.float64(4.834555555555555), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(1.1699108333649584), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(7.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.83)}]","[[10, 512, 7, 7], [10, 512, 7, 7], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], [25088, 49, 7, 1], []]","['', '', '1']",4.834581163194445,4.47900390625,1.2408330665478784,3.63916015625,7.27880859375,43.51123046875,9,316 -aten::threshold_backward,"(10, 512, 7, 7)","(10, 512, 7, 7)","('c10::BFloat16', 'c10::BFloat16', None)","(25088, 49, 7, 1)","(25088, 49, 7, 1)",,False,0.00025088,1.435546875,0.16666666666666666,0.5506234561117808,0.5445946389992844,0.20692332879085323,0.23973974959172564,0.7844309007633588,0.0917705760186301,0.09076577316654738,0.0344872214651422,0.03995662493195427,0.13073848346055977,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(38.228), 'mean_duration_us': np.float64(3.1856666666666666), 'median_duration_us': np.float64(2.9589999999999996), 'std_dev_duration_us': np.float64(1.3174048563579668), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.19)}]","[[10, 512, 7, 7], [10, 512, 7, 7], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], [25088, 49, 7, 1], []]","['', '', '0']",3.1856282552083335,2.959228515625,1.3758855731737367,1.9189453125,6.27880859375,38.2275390625,12,227 -aten::add_,"(10, 64, 56, 56)","(10, 64, 56, 56)","('c10::BFloat16', 'c10::BFloat16', None)","(200704, 3136, 56, 1)","(200704, 3136, 56, 1)",,True,0.00200704,11.484375,0.16666666666666666,1.9331527244233129,1.9119961156014238,0.14419505308634836,1.7107732741398447,2.105567106633655,0.32219212073721876,0.31866601926690397,0.02403250884772472,0.2851288790233074,0.35092785110560915,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(37.554), 'mean_duration_us': np.float64(6.259), 'median_duration_us': np.float64(6.2989999999999995), 'std_dev_duration_us': np.float64(0.4361956747454822), 'min_duration_us': np.float64(5.719), 'max_duration_us': np.float64(7.039)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.26)}]","[[10, 64, 56, 56], [10, 64, 56, 56], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], []]","['', '', '1']",6.258951822916667,6.298828125,0.47782093094713657,5.71923828125,7.0390625,37.5537109375,6,1328 -aten::threshold_backward,"(10, 64, 112, 112)","(10, 64, 112, 112)","('c10::BFloat16', 'c10::BFloat16', None)","(802816, 12544, 112, 1)","(802816, 12544, 112, 1)",,False,0.00802816,45.9375,0.16666666666666666,3.961416641468842,4.014406693253032,0.22266977934034973,3.71703203014318,4.152811201010314,0.6602361069114736,0.6690677822088386,0.037111629890058284,0.6195053383571966,0.6921352001683856,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.557), 'mean_duration_us': np.float64(12.185666666666668), 'median_duration_us': np.float64(11.999), 'std_dev_duration_us': np.float64(0.5706915882408716), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(12.19)}]","[[10, 64, 112, 112], [10, 64, 112, 112], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[802816, 12544, 112, 1], [802816, 12544, 112, 1], []]","['', '', '0']",12.185709635416666,11.9990234375,0.698889002841252,11.59912109375,12.958984375,36.55712890625,3,1600 +aten::threshold_backward,"(10, 64, 56, 56)","(10, 64, 56, 56)","('c10::BFloat16', 'c10::BFloat16', None)","(200704, 3136, 56, 1)","(200704, 3136, 56, 1)",None,False,0.00200704,11.484375,0.16666666666666666,3.165084549111451,3.6130421691504555,1.3915160070258372,1.0988463518089469,4.428534300592566,0.5275140915185751,0.6021736948584092,0.23191933450430616,0.18314105863482444,0.7380890500987609,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.348), 'mean_duration_us': np.float64(5.112333333333333), 'median_duration_us': np.float64(3.4589999999999996), 'std_dev_duration_us': np.float64(3.254036809188789), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(10.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.11)}]","[[10, 64, 56, 56], [10, 64, 56, 56], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], []]","['', '', '0']",5.1123046875,3.458984375,3.398747629905021,2.71923828125,10.958984375,61.34765625,12,1402 +aten::threshold_backward,"(10, 128, 28, 28)","(10, 128, 28, 28)","('c10::BFloat16', 'c10::BFloat16', None)","(100352, 784, 28, 1)","(100352, 784, 28, 1)",None,False,0.00100352,5.7421875,0.16666666666666666,1.6190023371009568,1.5603676650007188,0.727229851991352,0.7067836166676219,2.7378449733570163,0.26983372285015944,0.26006127750011976,0.12120497533189199,0.11779726944460364,0.4563074955595026,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(55.308), 'mean_duration_us': np.float64(4.609), 'median_duration_us': np.float64(3.859), 'std_dev_duration_us': np.float64(2.273213584333861), 'min_duration_us': np.float64(2.199), 'max_duration_us': np.float64(8.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","[[10, 128, 28, 28], [10, 128, 28, 28], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], [100352, 784, 28, 1], []]","['', '', '0']",4.608968098958333,3.85888671875,2.3743423923450107,2.19921875,8.51904296875,55.3076171875,12,1030 +aten::add_,"(10, 128, 28, 28)","(10, 128, 28, 28)","('c10::BFloat16', 'c10::BFloat16', None)","(100352, 784, 28, 1)","(100352, 784, 28, 1)",None,False,0.00100352,5.7421875,0.16666666666666666,1.5900526398718595,1.572501052758445,0.5150038701567308,0.9904621493975905,2.316598489573549,0.26500877331197653,0.2620835087930741,0.08583397835945514,0.16507702489959838,0.3860997482622581,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(50.348), 'mean_duration_us': np.float64(4.195666666666667), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(1.3371071593389794), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(6.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.2)}]","[[10, 128, 28, 28], [10, 128, 28, 28], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], [100352, 784, 28, 1], []]","['', '', '1']",4.195638020833333,3.87890625,1.3965733264774087,2.59912109375,6.0791015625,50.34765625,12,854 +aten::add_,"(10, 256, 14, 14)","(10, 256, 14, 14)","('c10::BFloat16', 'c10::BFloat16', None)","(50176, 196, 14, 1)","(50176, 196, 14, 1)",None,False,0.00050176,2.87109375,0.16666666666666666,0.8179343239459235,0.7043839215158687,0.3200299152211666,0.5156068640240843,1.4206513548387096,0.13632238732432056,0.11739732025264477,0.05333831920352776,0.08593447733734738,0.23677522580645158,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(50.028000000000006), 'mean_duration_us': np.float64(4.1690000000000005), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(1.3368744643134347), 'min_duration_us': np.float64(2.119), 'max_duration_us': np.float64(5.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.17)}]","[[10, 256, 14, 14], [10, 256, 14, 14], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], [50176, 196, 14, 1], []]","['', '', '1']",4.168986002604167,4.31884765625,1.3962392111228676,2.119140625,5.8388671875,50.02783203125,12,454 +aten::threshold_backward,"(10, 256, 14, 14)","(10, 256, 14, 14)","('c10::BFloat16', 'c10::BFloat16', None)","(50176, 196, 14, 1)","(50176, 196, 14, 1)",None,False,0.00050176,2.87109375,0.16666666666666666,0.959759619857854,0.8318693393547332,0.5073463271319937,0.4181787086272382,1.7928545740040709,0.15995993664297567,0.13864488989245552,0.0845577211886656,0.06969645143787302,0.2988090956673451,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(47.94800000000001), 'mean_duration_us': np.float64(3.995666666666667), 'median_duration_us': np.float64(3.6189999999999998), 'std_dev_duration_us': np.float64(1.8999268991785507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]","[[10, 256, 14, 14], [10, 256, 14, 14], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], [50176, 196, 14, 1], []]","['', '', '0']",3.9957682291666665,3.619140625,1.984446512224859,1.67919921875,7.19921875,47.94921875,12,630 +aten::add_,"(10, 512, 7, 7)","(10, 512, 7, 7)","('c10::BFloat16', 'c10::BFloat16', None)","(25088, 49, 7, 1)","(25088, 49, 7, 1)",None,False,0.00025088,1.435546875,0.16666666666666666,0.3279100381954734,0.3360747236454813,0.07400773863785495,0.20680307506540552,0.41363389775929155,0.054651673032578896,0.056012453940913545,0.012334623106309154,0.034467179177567586,0.06893898295988192,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.510999999999996), 'mean_duration_us': np.float64(4.834555555555555), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(1.1699108333649584), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(7.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.83)}]","[[10, 512, 7, 7], [10, 512, 7, 7], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], [25088, 49, 7, 1], []]","['', '', '1']",4.834581163194445,4.47900390625,1.2408330665478784,3.63916015625,7.27880859375,43.51123046875,9,316 +aten::threshold_backward,"(10, 512, 7, 7)","(10, 512, 7, 7)","('c10::BFloat16', 'c10::BFloat16', None)","(25088, 49, 7, 1)","(25088, 49, 7, 1)",None,False,0.00025088,1.435546875,0.16666666666666666,0.5506234561117808,0.5445946389992844,0.20692332879085323,0.23973974959172564,0.7844309007633588,0.0917705760186301,0.09076577316654738,0.0344872214651422,0.03995662493195427,0.13073848346055977,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(38.228), 'mean_duration_us': np.float64(3.1856666666666666), 'median_duration_us': np.float64(2.9589999999999996), 'std_dev_duration_us': np.float64(1.3174048563579668), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.19)}]","[[10, 512, 7, 7], [10, 512, 7, 7], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], [25088, 49, 7, 1], []]","['', '', '0']",3.1856282552083335,2.959228515625,1.3758855731737367,1.9189453125,6.27880859375,38.2275390625,12,227 +aten::add_,"(10, 64, 56, 56)","(10, 64, 56, 56)","('c10::BFloat16', 'c10::BFloat16', None)","(200704, 3136, 56, 1)","(200704, 3136, 56, 1)",None,True,0.00200704,11.484375,0.16666666666666666,1.9331527244233129,1.9119961156014238,0.14419505308634836,1.7107732741398447,2.105567106633655,0.32219212073721876,0.31866601926690397,0.02403250884772472,0.2851288790233074,0.35092785110560915,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(37.554), 'mean_duration_us': np.float64(6.259), 'median_duration_us': np.float64(6.2989999999999995), 'std_dev_duration_us': np.float64(0.4361956747454822), 'min_duration_us': np.float64(5.719), 'max_duration_us': np.float64(7.039)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.26)}]","[[10, 64, 56, 56], [10, 64, 56, 56], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], []]","['', '', '1']",6.258951822916667,6.298828125,0.47782093094713657,5.71923828125,7.0390625,37.5537109375,6,1328 +aten::threshold_backward,"(10, 64, 112, 112)","(10, 64, 112, 112)","('c10::BFloat16', 'c10::BFloat16', None)","(802816, 12544, 112, 1)","(802816, 12544, 112, 1)",None,False,0.00802816,45.9375,0.16666666666666666,3.961416641468842,4.014406693253032,0.22266977934034973,3.71703203014318,4.152811201010314,0.6602361069114736,0.6690677822088386,0.037111629890058284,0.6195053383571966,0.6921352001683856,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.557), 'mean_duration_us': np.float64(12.185666666666668), 'median_duration_us': np.float64(11.999), 'std_dev_duration_us': np.float64(0.5706915882408716), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(12.19)}]","[[10, 64, 112, 112], [10, 64, 112, 112], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[802816, 12544, 112, 1], [802816, 12544, 112, 1], []]","['', '', '0']",12.185709635416666,11.9990234375,0.698889002841252,11.59912109375,12.958984375,36.55712890625,3,1600 aten::mul,"(512, 512, 3, 3)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(4608, 9, 3, 1)",(),"(4608, 9, 3, 1)",False,0.002359296,9.000007629394531,0.2499997880725538,2.6787217353571995,2.359874141147741,0.6836274955838052,2.03424578633828,3.630916628968627,0.6696798661446434,0.5899680351648352,0.17090672901652196,0.5085610154720555,0.9077283877512681,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.391), 'mean_duration_us': np.float64(3.710111111111111), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.7815148316562939), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(4.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]","[[512, 512, 3, 3], [], [512, 512, 3, 3]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[4608, 9, 3, 1], [], [4608, 9, 3, 1]]","['', '', '']",3.710177951388889,3.9990234375,0.8288603382936338,2.59912109375,4.63916015625,33.3916015625,9,272 -aten::add_,"(10, 512, 7, 7)","(10, 512, 7, 7)","('c10::BFloat16', 'c10::BFloat16', None)","(25088, 49, 7, 1)","(25088, 49, 7, 1)",,True,0.00025088,1.435546875,0.16666666666666666,0.29522556932188054,0.29888887434996225,0.047309360287814316,0.2294955289213132,0.36191752054472887,0.049204261553646746,0.049814812391660364,0.007884893381302379,0.03824925482021886,0.0603195867574548,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(31.274), 'mean_duration_us': np.float64(5.2123333333333335), 'median_duration_us': np.float64(5.059), 'std_dev_duration_us': np.float64(0.7854227453345676), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(6.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]","[[10, 512, 7, 7], [10, 512, 7, 7], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], [25088, 49, 7, 1], []]","['', '', '1']",5.212483723958333,5.05908203125,0.8603393923316893,4.1591796875,6.55908203125,31.27490234375,6,153 +aten::add_,"(10, 512, 7, 7)","(10, 512, 7, 7)","('c10::BFloat16', 'c10::BFloat16', None)","(25088, 49, 7, 1)","(25088, 49, 7, 1)",None,True,0.00025088,1.435546875,0.16666666666666666,0.29522556932188054,0.29888887434996225,0.047309360287814316,0.2294955289213132,0.36191752054472887,0.049204261553646746,0.049814812391660364,0.007884893381302379,0.03824925482021886,0.0603195867574548,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(31.274), 'mean_duration_us': np.float64(5.2123333333333335), 'median_duration_us': np.float64(5.059), 'std_dev_duration_us': np.float64(0.7854227453345676), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(6.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]","[[10, 512, 7, 7], [10, 512, 7, 7], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], [25088, 49, 7, 1], []]","['', '', '1']",5.212483723958333,5.05908203125,0.8603393923316893,4.1591796875,6.55908203125,31.27490234375,6,153 aten::mul,"(64, 64, 3, 3)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(576, 9, 3, 1)",(),"(576, 9, 3, 1)",False,3.6864e-05,0.14063262939453125,0.24998643736776432,0.06668872402117339,0.06586034554800356,0.026107861124065823,0.03923178383995843,0.09458386219855935,0.016671276530655182,0.016464193147355307,0.006526611189697569,0.009807413873733437,0.023644682743501406,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(30.868), 'mean_duration_us': np.float64(2.5723333333333334), 'median_duration_us': np.float64(2.519), 'std_dev_duration_us': np.float64(0.9664137600197731), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.57)}]","[[64, 64, 3, 3], [], [64, 64, 3, 3]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[576, 9, 3, 1], [], [576, 9, 3, 1]]","['', '', '']",2.5723876953125,2.51904296875,1.0093065844733184,1.55908203125,3.7587890625,30.86865234375,12,1447 -aten::add_,"(10, 128, 28, 28)","(10, 128, 28, 28)","('c10::BFloat16', 'c10::BFloat16', None)","(100352, 784, 28, 1)","(100352, 784, 28, 1)",,True,0.00100352,5.7421875,0.16666666666666666,1.22715017000074,1.229089972137329,0.09870807605136768,1.1152440770552592,1.3941496619559073,0.20452502833345665,0.20484832868955477,0.016451346008561282,0.18587401284254315,0.23235827699265119,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(29.593999999999998), 'mean_duration_us': np.float64(4.932333333333333), 'median_duration_us': np.float64(4.898999999999999), 'std_dev_duration_us': np.float64(0.3499841266241783), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.93)}]","[[10, 128, 28, 28], [10, 128, 28, 28], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], [100352, 784, 28, 1], []]","['', '', '1']",4.932210286458333,4.89892578125,0.38339940966681924,4.31884765625,5.39892578125,29.59326171875,6,956 -aten::add_,"(10, 256, 14, 14)","(10, 256, 14, 14)","('c10::BFloat16', 'c10::BFloat16', None)","(50176, 196, 14, 1)","(50176, 196, 14, 1)",,True,0.00050176,2.87109375,0.16666666666666666,0.6952010846285724,0.7004151067592712,0.01428130609525998,0.6721494472909626,0.710243852090773,0.11586684743809539,0.11673585112654519,0.0023802176825433335,0.11202490788182709,0.11837397534846215,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.993), 'mean_duration_us': np.float64(4.332166666666667), 'median_duration_us': np.float64(4.2985), 'std_dev_duration_us': np.float64(0.08222006378548305), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.479)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]","[[10, 256, 14, 14], [10, 256, 14, 14], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], [50176, 196, 14, 1], []]","['', '', '1']",4.33203125,4.29833984375,0.09015475637167203,4.23876953125,4.47900390625,25.9921875,6,556 +aten::add_,"(10, 128, 28, 28)","(10, 128, 28, 28)","('c10::BFloat16', 'c10::BFloat16', None)","(100352, 784, 28, 1)","(100352, 784, 28, 1)",None,True,0.00100352,5.7421875,0.16666666666666666,1.22715017000074,1.229089972137329,0.09870807605136768,1.1152440770552592,1.3941496619559073,0.20452502833345665,0.20484832868955477,0.016451346008561282,0.18587401284254315,0.23235827699265119,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(29.593999999999998), 'mean_duration_us': np.float64(4.932333333333333), 'median_duration_us': np.float64(4.898999999999999), 'std_dev_duration_us': np.float64(0.3499841266241783), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.93)}]","[[10, 128, 28, 28], [10, 128, 28, 28], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], [100352, 784, 28, 1], []]","['', '', '1']",4.932210286458333,4.89892578125,0.38339940966681924,4.31884765625,5.39892578125,29.59326171875,6,956 +aten::add_,"(10, 256, 14, 14)","(10, 256, 14, 14)","('c10::BFloat16', 'c10::BFloat16', None)","(50176, 196, 14, 1)","(50176, 196, 14, 1)",None,True,0.00050176,2.87109375,0.16666666666666666,0.6952010846285724,0.7004151067592712,0.01428130609525998,0.6721494472909626,0.710243852090773,0.11586684743809539,0.11673585112654519,0.0023802176825433335,0.11202490788182709,0.11837397534846215,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.993), 'mean_duration_us': np.float64(4.332166666666667), 'median_duration_us': np.float64(4.2985), 'std_dev_duration_us': np.float64(0.08222006378548305), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.479)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]","[[10, 256, 14, 14], [10, 256, 14, 14], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], [50176, 196, 14, 1], []]","['', '', '1']",4.33203125,4.29833984375,0.09015475637167203,4.23876953125,4.47900390625,25.9921875,6,556 aten::mul,"(256, 256, 3, 3)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(2304, 9, 3, 1)",(),"(2304, 9, 3, 1)",False,0.000589824,2.2500076293945312,0.24999915229237096,1.0809307060186755,1.2830203377588956,0.3345349679931722,0.6145833874332232,1.3722961067878445,0.27023176019146283,0.32075399681359534,0.0836334584104485,0.15364532587127958,0.34307286339108206,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.991), 'mean_duration_us': np.float64(2.4434444444444443), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.895111552465962), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]","[[256, 256, 3, 3], [], [256, 256, 3, 3]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[2304, 9, 3, 1], [], [2304, 9, 3, 1]]","['', '', '']",2.4434136284722223,1.8388671875,0.9494697472681765,1.71923828125,3.8388671875,21.99072265625,9,675 aten::mul,"(128, 128, 3, 3)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(1152, 9, 3, 1)",(),"(1152, 9, 3, 1)",False,0.000147456,0.5625076293945312,0.24999660920397673,0.2733472121251077,0.3139230602910603,0.0840759242798106,0.15692075032475966,0.35125790520500144,0.06833587616663707,0.07847970062370062,0.02101869598564295,0.03922965549493375,0.08781328525734224,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.670999999999996), 'mean_duration_us': np.float64(2.4078888888888885), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.8656974637628507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.41)}]","[[128, 128, 3, 3], [], [128, 128, 3, 3]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[1152, 9, 3, 1], [], [1152, 9, 3, 1]]","['', '', '']",2.4078776041666665,1.87890625,0.9181949417968699,1.67919921875,3.7587890625,21.6708984375,9,1075 -aten::div,"(10, 512, 7, 7)",(),"('c10::BFloat16', 'Scalar', None)","(512, 1, 0, 0)",(),,False,0.00025088,0.9570350646972656,0.24999900351162502,0.17027858830971124,0.1684052074729597,0.009476088609910798,0.1618791077504726,0.18055144970570147,0.04256947739679404,0.042101134054408386,0.0023690127096655618,0.040469615626969116,0.04513768250900465,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'Scalar']","[[512, 1, 0, 0], []]","['', '49']",5.905436197916667,5.958984375,0.32389367900670174,5.55810546875,6.19921875,17.71630859375,3,56 -aten::div,"(10, 512, 7, 7)",(),"('c10::BFloat16', 'long int', None)","(512, 1, 0, 0)",(),,False,0.00025088,0.9570388793945312,0.24999800703119393,0.17027926703224627,0.1684058787282858,0.009476126381159359,0.16187975299306867,0.18055216937538432,0.04256947739679404,0.042101134054408386,0.0023690127096655618,0.040469615626969116,0.04513768250900465,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'long int']","[[512, 1, 0, 0], []]","['', '']",5.905436197916667,5.958984375,0.32389367900670174,5.55810546875,6.19921875,17.71630859375,3,57 +aten::div,"(10, 512, 7, 7)",(),"('c10::BFloat16', 'Scalar', None)","(512, 1, 0, 0)",(),None,False,0.00025088,0.9570350646972656,0.24999900351162502,0.17027858830971124,0.1684052074729597,0.009476088609910798,0.1618791077504726,0.18055144970570147,0.04256947739679404,0.042101134054408386,0.0023690127096655618,0.040469615626969116,0.04513768250900465,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'Scalar']","[[512, 1, 0, 0], []]","['', '49']",5.905436197916667,5.958984375,0.32389367900670174,5.55810546875,6.19921875,17.71630859375,3,56 +aten::div,"(10, 512, 7, 7)",(),"('c10::BFloat16', 'long int', None)","(512, 1, 0, 0)",(),None,False,0.00025088,0.9570388793945312,0.24999800703119393,0.17027926703224627,0.1684058787282858,0.009476126381159359,0.16187975299306867,0.18055216937538432,0.04256947739679404,0.042101134054408386,0.0023690127096655618,0.040469615626969116,0.04513768250900465,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'long int']","[[512, 1, 0, 0], []]","['', '']",5.905436197916667,5.958984375,0.32389367900670174,5.55810546875,6.19921875,17.71630859375,3,57 aten::mul,"(1000, 512)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(512, 1)",(),"(512, 1)",False,0.000512,1.9531326293945312,0.2499990234413147,0.4226052056017336,0.4032224941357431,0.03357184104754338,0.4032224941357431,0.46137062853371463,0.1056508887016494,0.100805229763507,0.008392927477012892,0.100805229763507,0.1153422065779342,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.597), 'mean_duration_us': np.float64(4.865666666666667), 'median_duration_us': np.float64(5.079), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.87)}]","[[1000, 512], [], [1000, 512]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[512, 1], [], [512, 1]]","['', '', '']",4.86572265625,5.0791015625,0.36958310688847623,4.43896484375,5.0791015625,14.59716796875,3,45 aten::mul,"(1000,)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(1,)",(),"(1,)",False,1e-06,0.00382232666015625,0.249500998003992,0.0009143118490488159,0.000945557424259878,8.813688365013132e-05,0.000814808814770697,0.0009825693081158726,0.00022812171882455478,0.0002359175210229236,2.1990240431669502e-05,0.0002032956124677387,0.0002451520229830021,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.236999999999998), 'mean_duration_us': np.float64(4.412333333333333), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(0.3641733408999376), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}]","[[1000], [], [1000]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[1], [], [1]]","['', '', '']",4.412272135416667,4.23876953125,0.44599523130071334,4.0791015625,4.9189453125,13.23681640625,3,33 aten::mul,"(64, 3, 7, 7)",(),"('c10::BFloat16', 'double', 'c10::BFloat16')","(147, 49, 7, 1)",(),"(147, 49, 7, 1)",False,9.408e-06,0.03589630126953125,0.2499468650371945,0.010469517217205479,0.010343045753387896,0.00042669772018276105,0.010120351844558225,0.010945154053670312,0.0026168230068934414,0.002585211860995572,0.00010665175747819901,0.0025295502166207172,0.0027357069430640354,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.796999999999999), 'mean_duration_us': np.float64(3.5989999999999998), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.11775681155103787), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","[[64, 3, 7, 7], [], [64, 3, 7, 7]]","['c10::BFloat16', 'double', 'c10::BFloat16']","[[147, 49, 7, 1], [], [147, 49, 7, 1]]","['', '', '']",3.59912109375,3.63916015625,0.1443628928652574,3.43896484375,3.71923828125,10.79736328125,3,1640 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_bwd.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_bwd.csv index 7157fcb3a..e3a1b1547 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_bwd.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_bwd.csv @@ -1,11 +1,11 @@ name,param: convNd,param: input_shape,param: filter_shape,param: dtype_input_weight,param: input_stride,param: weight_stride,param: bias,param: stride,param: padding,param: dilation,param: transposed_conv,param: output_padding,param: groups,is_recompute,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first aten::convolution_backward,conv2d,"(10, 64, 56, 56)","(64, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,15.453125,285.37917087967645,0.16771902416997722,0.1668129363611862,0.011060510520327083,0.15168149832482414,0.18357664253669007,47.86351605837652,47.60493747075955,3.1564393217968814,43.286740229725346,52.38895003999536,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(20.628), 'mean_duration_us': np.float64(1.719), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.04320493798938569), 'min_duration_us': np.float64(1.639), 'max_duration_us': np.float64(1.799)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(32.788), 'mean_duration_us': np.float64(2.732333333333333), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(1.0898725715523914), 'min_duration_us': np.float64(1.359), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(34.668), 'mean_duration_us': np.float64(2.889), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.9813086500518919), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(3.959)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(42.828), 'mean_duration_us': np.float64(3.5690000000000004), 'median_duration_us': np.float64(3.539), 'std_dev_duration_us': np.float64(0.12124355652982134), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(48.388000000000005), 'mean_duration_us': np.float64(4.032333333333334), 'median_duration_us': np.float64(3.059), 'std_dev_duration_us': np.float64(1.8432459292117143), 'min_duration_us': np.float64(2.999), 'max_duration_us': np.float64(8.079)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(58.068000000000005), 'mean_duration_us': np.float64(4.839), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.31790984046843623), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(5.279)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(88.548), 'mean_duration_us': np.float64(7.3790000000000004), 'median_duration_us': np.float64(8.419), 'std_dev_duration_us': np.float64(2.289250241163396), 'min_duration_us': np.float64(3.239), 'max_duration_us': np.float64(9.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(90.787), 'mean_duration_us': np.float64(7.5655833333333335), 'median_duration_us': np.float64(8.599), 'std_dev_duration_us': np.float64(2.267036996402034), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(9.999)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(98.066), 'mean_duration_us': np.float64(8.172166666666667), 'median_duration_us': np.float64(9.079), 'std_dev_duration_us': np.float64(2.5927668886517528), 'min_duration_us': np.float64(3.159), 'max_duration_us': np.float64(10.599)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(136.468), 'mean_duration_us': np.float64(11.372333333333332), 'median_duration_us': np.float64(11.339), 'std_dev_duration_us': np.float64(0.12995725793078597), 'min_duration_us': np.float64(11.199), 'max_duration_us': np.float64(11.599)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x8x2x1_1x4x1x64_tb1x4x1x2_1x8x1x32_mh_gkgs', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(246.66499999999996), 'mean_duration_us': np.float64(20.555416666666662), 'median_duration_us': np.float64(19.8985), 'std_dev_duration_us': np.float64(1.1820240027408733), 'min_duration_us': np.float64(19.318), 'max_duration_us': np.float64(22.159)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt64x64x64_wt32x32x8_ws1x1_wr1x1_ta1x4x1x4_1x16x1x16_tb1x4x1x4_1x16x1x16_gkgs', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(266.105), 'mean_duration_us': np.float64(22.175416666666667), 'median_duration_us': np.float64(22.399), 'std_dev_duration_us': np.float64(0.9716467515111766), 'min_duration_us': np.float64(20.119), 'max_duration_us': np.float64(23.959)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(1.72)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.73)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.57)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.03)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.84)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.38)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.57)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(8.17)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(11.37)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(20.56)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt64x64x64_wt32x32x8_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(22.18)}]","[[10, 64, 56, 56], [10, 64, 56, 56], [64, 64, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[200704, 3136, 56, 1], [200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",97.00081380208333,97.147705078125,6.431868499251053,88.26708984375,106.82763671875,1164.009765625,12,1436 -aten::convolution_backward,conv2d,"(10, 512, 7, 7)","(512, 512, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(25088, 49, 7, 1)","(4608, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,10.9140625,404.0658554044381,0.11327044989240877,0.11952192167101829,0.010886726470365848,0.09904190137970378,0.12296707669384373,45.76872122782169,48.29472751958225,4.398954443802515,40.01945060187201,49.68679703088111,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.671), 'mean_duration_us': np.float64(2.852333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(1.0731469817524737), 'min_duration_us': np.float64(2.039), 'max_duration_us': np.float64(4.639)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.751), 'mean_duration_us': np.float64(2.8612222222222226), 'median_duration_us': np.float64(1.959), 'std_dev_duration_us': np.float64(1.3294759015640358), 'min_duration_us': np.float64(1.879), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(29.750999999999998), 'mean_duration_us': np.float64(3.3056666666666663), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(2.0624042065296293), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(7.039)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.07), 'mean_duration_us': np.float64(4.007777777777778), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.5201994869017457), 'min_duration_us': np.float64(3.518), 'max_duration_us': np.float64(5.079)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.951), 'mean_duration_us': np.float64(4.105666666666667), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.5205125678918169), 'min_duration_us': np.float64(3.679), 'max_duration_us': np.float64(5.119)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.95100000000001), 'mean_duration_us': np.float64(4.105666666666668), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.5872724145478732), 'min_duration_us': np.float64(3.599), 'max_duration_us': np.float64(5.359)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(65.991), 'mean_duration_us': np.float64(7.332333333333334), 'median_duration_us': np.float64(6.399), 'std_dev_duration_us': np.float64(1.357645019878171), 'min_duration_us': np.float64(6.359), 'max_duration_us': np.float64(9.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(86.95100000000001), 'mean_duration_us': np.float64(9.661222222222223), 'median_duration_us': np.float64(9.959), 'std_dev_duration_us': np.float64(1.7759991102211097), 'min_duration_us': np.float64(6.959), 'max_duration_us': np.float64(12.239)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(95.149), 'mean_duration_us': np.float64(10.572111111111111), 'median_duration_us': np.float64(10.599), 'std_dev_duration_us': np.float64(0.46438189371451216), 'min_duration_us': np.float64(9.718), 'max_duration_us': np.float64(11.359)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(189.671), 'mean_duration_us': np.float64(21.074555555555555), 'median_duration_us': np.float64(21.079), 'std_dev_duration_us': np.float64(0.5667668756711394), 'min_duration_us': np.float64(20.159), 'max_duration_us': np.float64(21.959)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi64ELi4ELi32ELi32ELi8ELi2ELi2ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ES27_S28_S29_Li2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEES2F_EEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi64ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(288.30899999999997), 'mean_duration_us': np.float64(32.03433333333333), 'median_duration_us': np.float64(31.159), 'std_dev_duration_us': np.float64(1.7587434276904754), 'min_duration_us': np.float64(30.319), 'max_duration_us': np.float64(35.559)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.85)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.86)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.01)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.11)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.11)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.66)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.57)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(21.07)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(32.03)}]","[[10, 512, 7, 7], [10, 512, 7, 7], [512, 512, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[25088, 49, 7, 1], [25088, 49, 7, 1], [4608, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",101.9130859375,95.75,10.291085880638466,93.0673828125,115.54931640625,917.2177734375,9,261 -aten::convolution_backward,conv2d,"(10, 128, 28, 28)","(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,8.21875,536.5779467680609,0.08567876601906471,0.08463224355414899,0.002563205655590205,0.08309853965742912,0.089594310677936,45.97333635213085,45.41179547665971,1.3753596278208733,44.588843788807594,48.07433126566664,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(16.590999999999998), 'mean_duration_us': np.float64(1.8434444444444442), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.11066577420434434), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(2.039)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(19.031), 'mean_duration_us': np.float64(2.1145555555555555), 'median_duration_us': np.float64(2.119), 'std_dev_duration_us': np.float64(0.060939152003564714), 'min_duration_us': np.float64(1.999), 'max_duration_us': np.float64(2.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(23.191000000000003), 'mean_duration_us': np.float64(2.576777777777778), 'median_duration_us': np.float64(1.999), 'std_dev_duration_us': np.float64(0.8458234354465577), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(3.799)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(31.948999999999998), 'mean_duration_us': np.float64(3.549888888888889), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.5093323395375218), 'min_duration_us': np.float64(2.839), 'max_duration_us': np.float64(4.119)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.631), 'mean_duration_us': np.float64(3.7367777777777778), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.10517475169954882), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.751), 'mean_duration_us': np.float64(4.083444444444444), 'median_duration_us': np.float64(4.079), 'std_dev_duration_us': np.float64(0.08314794192830977), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(4.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(53.711), 'mean_duration_us': np.float64(5.967888888888889), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(3.051252727958886), 'min_duration_us': np.float64(3.679), 'max_duration_us': np.float64(10.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(70.908), 'mean_duration_us': np.float64(7.878666666666667), 'median_duration_us': np.float64(9.518), 'std_dev_duration_us': np.float64(2.7867448553624152), 'min_duration_us': np.float64(3.799), 'max_duration_us': np.float64(10.239)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(73.55100000000002), 'mean_duration_us': np.float64(8.172333333333334), 'median_duration_us': np.float64(6.519), 'std_dev_duration_us': np.float64(2.3897559150116843), 'min_duration_us': np.float64(6.399), 'max_duration_us': np.float64(11.959)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr1x1_ta1x4x1x1_1x8x1x32_tb1x4x1x4_1x8x1x32_mh_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(221.029), 'mean_duration_us': np.float64(24.558777777777777), 'median_duration_us': np.float64(24.599), 'std_dev_duration_us': np.float64(0.14214294665564847), 'min_duration_us': np.float64(24.319), 'max_duration_us': np.float64(24.758)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi32ELi4ELi32ELi32ELi8ELi2ELi1ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ENSL_IJLi1ELi4ELi4ELi4EEEES28_S29_Li2ELi8ELi2ELb0ELb1ELi8ELi4ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEENSH_INS6_IJiNS9_IiLi32EEEEEELb0EEEEEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi32ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(325.629), 'mean_duration_us': np.float64(36.181000000000004), 'median_duration_us': np.float64(35.919), 'std_dev_duration_us': np.float64(1.0892671338514213), 'min_duration_us': np.float64(34.479), 'max_duration_us': np.float64(37.838)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.84)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.58)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.55)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.74)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.08)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.88)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(8.17)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(24.56)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(36.18)}]","[[10, 128, 28, 28], [10, 128, 28, 28], [128, 128, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[100352, 784, 28, 1], [100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",100.66362847222223,101.82861328125,2.963567541464249,96.18896484375,103.7080078125,905.97265625,9,1064 -aten::convolution_backward,conv2d,"(10, 256, 14, 14)","(256, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,6.078125,725.5526992287918,0.07313026487148827,0.07538057397621811,0.005395406883636787,0.06573932293807164,0.0786955140567818,53.0598610728248,54.69257891786067,3.9146520278602766,47.6973432031911,57.09774264109536,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(18.790999999999997), 'mean_duration_us': np.float64(2.0878888888888887), 'median_duration_us': np.float64(2.119), 'std_dev_duration_us': np.float64(0.13169362124470263), 'min_duration_us': np.float64(1.879), 'max_duration_us': np.float64(2.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.751), 'mean_duration_us': np.float64(2.8612222222222226), 'median_duration_us': np.float64(2.439), 'std_dev_duration_us': np.float64(0.7138281426813814), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(29.511), 'mean_duration_us': np.float64(3.279), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.7867796529030363), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(29.511), 'mean_duration_us': np.float64(3.279), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.72), 'min_duration_us': np.float64(2.239), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.351), 'mean_duration_us': np.float64(3.7056666666666667), 'median_duration_us': np.float64(3.119), 'std_dev_duration_us': np.float64(0.9668275728151092), 'min_duration_us': np.float64(2.919), 'max_duration_us': np.float64(5.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(35.311), 'mean_duration_us': np.float64(3.9234444444444443), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.09696632990787296), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(4.079)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.351000000000006), 'mean_duration_us': np.float64(4.039000000000001), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(4.159)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(41.71), 'mean_duration_us': np.float64(4.634444444444444), 'median_duration_us': np.float64(2.879), 'std_dev_duration_us': np.float64(2.533569599119047), 'min_duration_us': np.float64(2.799), 'max_duration_us': np.float64(8.519)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(66.47), 'mean_duration_us': np.float64(7.385555555555555), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(3.9766123804931452), 'min_duration_us': np.float64(3.678), 'max_duration_us': np.float64(13.159)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(181.99099999999999), 'mean_duration_us': np.float64(20.22122222222222), 'median_duration_us': np.float64(20.119), 'std_dev_duration_us': np.float64(0.3813944524964438), 'min_duration_us': np.float64(19.919), 'max_duration_us': np.float64(21.199)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi64ELi4ELi32ELi32ELi8ELi2ELi2ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ES27_S28_S29_Li2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEES2F_EEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi64ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(289.58799999999997), 'mean_duration_us': np.float64(32.17644444444444), 'median_duration_us': np.float64(32.238), 'std_dev_duration_us': np.float64(0.48993244684255766), 'min_duration_us': np.float64(31.399), 'max_duration_us': np.float64(32.919)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.09)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.86)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.92)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.04)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.63)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(7.39)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(20.22)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(32.18)}]","[[10, 256, 14, 14], [10, 256, 14, 14], [256, 256, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[50176, 196, 14, 1], [50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",87.59282769097223,84.54931640625,6.739914204505456,80.98779296875,96.94921875,788.33544921875,9,664 -aten::convolution_backward,conv2d,"(10, 256, 14, 14)","(512, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",[],"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,7.37109375,299.14149443561206,0.08060856069668952,0.08206090968755346,0.0032083050587841627,0.07693090637636081,0.08283386602615427,24.113365311111448,24.54782315868054,0.9597371698900271,23.013226301710734,24.77904647294306,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.757), 'mean_duration_us': np.float64(1.9189999999999998), 'median_duration_us': np.float64(1.919), 'std_dev_duration_us': np.float64(2.220446049250313e-16), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(1.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(7.677), 'mean_duration_us': np.float64(2.5589999999999997), 'median_duration_us': np.float64(2.359), 'std_dev_duration_us': np.float64(0.28284271247461906), 'min_duration_us': np.float64(2.359), 'max_duration_us': np.float64(2.959)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.077), 'mean_duration_us': np.float64(3.6923333333333335), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.157), 'mean_duration_us': np.float64(3.719), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.757), 'mean_duration_us': np.float64(3.919), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.20396078054371136), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(4.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.835999999999999), 'mean_duration_us': np.float64(4.611999999999999), 'median_duration_us': np.float64(4.598), 'std_dev_duration_us': np.float64(0.14730241002780656), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(4.799)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.037), 'mean_duration_us': np.float64(5.678999999999999), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.4393935214209088), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.957), 'mean_duration_us': np.float64(6.985666666666667), 'median_duration_us': np.float64(7.079), 'std_dev_duration_us': np.float64(0.4781445620544296), 'min_duration_us': np.float64(6.359), 'max_duration_us': np.float64(7.519)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(33.597), 'mean_duration_us': np.float64(11.199), 'median_duration_us': np.float64(10.799), 'std_dev_duration_us': np.float64(1.786169084941288), 'min_duration_us': np.float64(9.239), 'max_duration_us': np.float64(13.559)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi64ELi4ELi32ELi32ELi8ELi2ELi2ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ES27_S28_S29_Li2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEES2F_EEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi64ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(66.637), 'mean_duration_us': np.float64(22.212333333333333), 'median_duration_us': np.float64(22.439), 'std_dev_duration_us': np.float64(0.3492213560989005), 'min_duration_us': np.float64(21.719), 'max_duration_us': np.float64(22.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(88.477), 'mean_duration_us': np.float64(29.492333333333335), 'median_duration_us': np.float64(29.439), 'std_dev_duration_us': np.float64(0.5239168721170258), 'min_duration_us': np.float64(28.879), 'max_duration_us': np.float64(30.159)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.92)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.56)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.72)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.92)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.61)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(5.68)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.99)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(11.2)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(22.21)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(29.49)}]","[[10, 512, 7, 7], [10, 256, 14, 14], [512, 256, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[25088, 49, 7, 1], [50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",95.98860677083333,94.18798828125,3.9047255427825176,93.30908203125,100.46875,287.9658203125,3,448 +aten::convolution_backward,conv2d,"(10, 512, 7, 7)","(512, 512, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(25088, 49, 7, 1)","(4608, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,10.9140625,404.0658554044381,0.10838932619059242,0.11477625684119802,0.01069720206975669,0.0944020797499557,0.11785058479361615,43.79642580391239,46.37716640065817,4.322374104750362,38.14465710612383,47.619397354545775,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.671), 'mean_duration_us': np.float64(2.852333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(1.0731469817524737), 'min_duration_us': np.float64(2.039), 'max_duration_us': np.float64(4.639)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.751), 'mean_duration_us': np.float64(2.8612222222222226), 'median_duration_us': np.float64(1.959), 'std_dev_duration_us': np.float64(1.3294759015640358), 'min_duration_us': np.float64(1.879), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(29.750999999999998), 'mean_duration_us': np.float64(3.3056666666666663), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(2.0624042065296293), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(7.039)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.07), 'mean_duration_us': np.float64(4.007777777777778), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.5201994869017457), 'min_duration_us': np.float64(3.518), 'max_duration_us': np.float64(5.079)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.951), 'mean_duration_us': np.float64(4.105666666666667), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.5205125678918169), 'min_duration_us': np.float64(3.679), 'max_duration_us': np.float64(5.119)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.95100000000001), 'mean_duration_us': np.float64(4.105666666666668), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.5872724145478732), 'min_duration_us': np.float64(3.599), 'max_duration_us': np.float64(5.359)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(41.791000000000004), 'mean_duration_us': np.float64(4.6434444444444445), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.7958658612704798), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.999)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(65.991), 'mean_duration_us': np.float64(7.332333333333334), 'median_duration_us': np.float64(6.399), 'std_dev_duration_us': np.float64(1.357645019878171), 'min_duration_us': np.float64(6.359), 'max_duration_us': np.float64(9.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(86.95100000000001), 'mean_duration_us': np.float64(9.661222222222223), 'median_duration_us': np.float64(9.959), 'std_dev_duration_us': np.float64(1.7759991102211097), 'min_duration_us': np.float64(6.959), 'max_duration_us': np.float64(12.239)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(95.149), 'mean_duration_us': np.float64(10.572111111111111), 'median_duration_us': np.float64(10.599), 'std_dev_duration_us': np.float64(0.46438189371451216), 'min_duration_us': np.float64(9.718), 'max_duration_us': np.float64(11.359)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(189.671), 'mean_duration_us': np.float64(21.074555555555555), 'median_duration_us': np.float64(21.079), 'std_dev_duration_us': np.float64(0.5667668756711394), 'min_duration_us': np.float64(20.159), 'max_duration_us': np.float64(21.959)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi64ELi4ELi32ELi32ELi8ELi2ELi2ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ES27_S28_S29_Li2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEES2F_EEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi64ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(288.30899999999997), 'mean_duration_us': np.float64(32.03433333333333), 'median_duration_us': np.float64(31.159), 'std_dev_duration_us': np.float64(1.7587434276904754), 'min_duration_us': np.float64(30.319), 'max_duration_us': np.float64(35.559)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.85)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.86)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.01)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.11)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.11)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.66)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.57)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(21.07)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(32.03)}]","[[10, 512, 7, 7], [10, 512, 7, 7], [512, 512, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[25088, 49, 7, 1], [25088, 49, 7, 1], [4608, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",106.55653211805556,99.708984375,11.08876281118792,97.10791015625,121.228515625,959.0087890625,9,261 +aten::convolution_backward,conv2d,"(10, 128, 28, 28)","(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,8.21875,536.5779467680609,0.08331325203953538,0.08338828680500435,0.0022366016214666017,0.08031174911268453,0.08646693725259652,44.70405371794385,44.744315718335415,1.2001111057846643,43.093513440235895,46.39625165432099,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(16.590999999999998), 'mean_duration_us': np.float64(1.8434444444444442), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.11066577420434434), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(2.039)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(19.031), 'mean_duration_us': np.float64(2.1145555555555555), 'median_duration_us': np.float64(2.119), 'std_dev_duration_us': np.float64(0.060939152003564714), 'min_duration_us': np.float64(1.999), 'max_duration_us': np.float64(2.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(23.191000000000003), 'mean_duration_us': np.float64(2.576777777777778), 'median_duration_us': np.float64(1.999), 'std_dev_duration_us': np.float64(0.8458234354465577), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(3.799)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.591), 'mean_duration_us': np.float64(2.8434444444444447), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.9610077015659843), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(31.948999999999998), 'mean_duration_us': np.float64(3.549888888888889), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.5093323395375218), 'min_duration_us': np.float64(2.839), 'max_duration_us': np.float64(4.119)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.631), 'mean_duration_us': np.float64(3.7367777777777778), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.10517475169954882), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.751), 'mean_duration_us': np.float64(4.083444444444444), 'median_duration_us': np.float64(4.079), 'std_dev_duration_us': np.float64(0.08314794192830977), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(4.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(53.711), 'mean_duration_us': np.float64(5.967888888888889), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(3.051252727958886), 'min_duration_us': np.float64(3.679), 'max_duration_us': np.float64(10.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(70.908), 'mean_duration_us': np.float64(7.878666666666667), 'median_duration_us': np.float64(9.518), 'std_dev_duration_us': np.float64(2.7867448553624152), 'min_duration_us': np.float64(3.799), 'max_duration_us': np.float64(10.239)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(73.55100000000002), 'mean_duration_us': np.float64(8.172333333333334), 'median_duration_us': np.float64(6.519), 'std_dev_duration_us': np.float64(2.3897559150116843), 'min_duration_us': np.float64(6.399), 'max_duration_us': np.float64(11.959)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr1x1_ta1x4x1x1_1x8x1x32_tb1x4x1x4_1x8x1x32_mh_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(221.029), 'mean_duration_us': np.float64(24.558777777777777), 'median_duration_us': np.float64(24.599), 'std_dev_duration_us': np.float64(0.14214294665564847), 'min_duration_us': np.float64(24.319), 'max_duration_us': np.float64(24.758)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi32ELi4ELi32ELi32ELi8ELi2ELi1ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ENSL_IJLi1ELi4ELi4ELi4EEEES28_S29_Li2ELi8ELi2ELb0ELb1ELi8ELi4ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEENSH_INS6_IJiNS9_IiLi32EEEEEELb0EEEEEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi32ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(325.629), 'mean_duration_us': np.float64(36.181000000000004), 'median_duration_us': np.float64(35.919), 'std_dev_duration_us': np.float64(1.0892671338514213), 'min_duration_us': np.float64(34.479), 'max_duration_us': np.float64(37.838)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.84)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.58)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(2.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.55)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.74)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.08)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.88)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(8.17)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(24.56)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(36.18)}]","[[10, 128, 28, 28], [10, 128, 28, 28], [128, 128, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[100352, 784, 28, 1], [100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",103.50705295138889,103.34765625,2.779794999382955,99.66796875,107.306640625,931.5634765625,9,1064 +aten::convolution_backward,conv2d,"(10, 256, 14, 14)","(256, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",[],"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,4.62422016,6.078125,725.5526992287918,0.07017330937374262,0.07207400316950209,0.004987008948320308,0.06338618827425785,0.0753470684045857,50.91443402993604,52.29348754385674,3.618337803531935,45.99001999621218,54.66826885992358,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(18.790999999999997), 'mean_duration_us': np.float64(2.0878888888888887), 'median_duration_us': np.float64(2.119), 'std_dev_duration_us': np.float64(0.13169362124470263), 'min_duration_us': np.float64(1.879), 'max_duration_us': np.float64(2.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.751), 'mean_duration_us': np.float64(2.8612222222222226), 'median_duration_us': np.float64(2.439), 'std_dev_duration_us': np.float64(0.7138281426813814), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(29.511), 'mean_duration_us': np.float64(3.279), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.7867796529030363), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(29.511), 'mean_duration_us': np.float64(3.279), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.72), 'min_duration_us': np.float64(2.239), 'max_duration_us': np.float64(3.959)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(32.911), 'mean_duration_us': np.float64(3.656777777777778), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.10850271658429948), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.351), 'mean_duration_us': np.float64(3.7056666666666667), 'median_duration_us': np.float64(3.119), 'std_dev_duration_us': np.float64(0.9668275728151092), 'min_duration_us': np.float64(2.919), 'max_duration_us': np.float64(5.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(35.311), 'mean_duration_us': np.float64(3.9234444444444443), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.09696632990787296), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(4.079)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(36.351000000000006), 'mean_duration_us': np.float64(4.039000000000001), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(4.159)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(41.71), 'mean_duration_us': np.float64(4.634444444444444), 'median_duration_us': np.float64(2.879), 'std_dev_duration_us': np.float64(2.533569599119047), 'min_duration_us': np.float64(2.799), 'max_duration_us': np.float64(8.519)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(66.47), 'mean_duration_us': np.float64(7.385555555555555), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(3.9766123804931452), 'min_duration_us': np.float64(3.678), 'max_duration_us': np.float64(13.159)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(181.99099999999999), 'mean_duration_us': np.float64(20.22122222222222), 'median_duration_us': np.float64(20.119), 'std_dev_duration_us': np.float64(0.3813944524964438), 'min_duration_us': np.float64(19.919), 'max_duration_us': np.float64(21.199)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi64ELi4ELi32ELi32ELi8ELi2ELi2ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ES27_S28_S29_Li2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEES2F_EEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi64ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(289.58799999999997), 'mean_duration_us': np.float64(32.17644444444444), 'median_duration_us': np.float64(32.238), 'std_dev_duration_us': np.float64(0.48993244684255766), 'min_duration_us': np.float64(31.399), 'max_duration_us': np.float64(32.919)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.09)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.86)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.28)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.66)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.92)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.04)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.63)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(7.39)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(20.22)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(32.18)}]","[[10, 256, 14, 14], [10, 256, 14, 14], [256, 256, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[50176, 196, 14, 1], [50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",91.24962022569444,88.42822265625,6.750349780917789,84.5869140625,100.54833984375,821.24658203125,9,664 +aten::convolution_backward,conv2d,"(10, 256, 14, 14)","(512, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",[],"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,7.37109375,299.14149443561206,0.07718494850755674,0.07878293324308318,0.0035234593992817323,0.07314564755461907,0.07962626472496794,23.089220844486288,23.567244386356965,1.0540129102843425,21.88089832094932,23.819519826152572,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.757), 'mean_duration_us': np.float64(1.9189999999999998), 'median_duration_us': np.float64(1.919), 'std_dev_duration_us': np.float64(2.220446049250313e-16), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(1.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(7.677), 'mean_duration_us': np.float64(2.5589999999999997), 'median_duration_us': np.float64(2.359), 'std_dev_duration_us': np.float64(0.28284271247461906), 'min_duration_us': np.float64(2.359), 'max_duration_us': np.float64(2.959)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.077), 'mean_duration_us': np.float64(3.6923333333333335), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.157), 'mean_duration_us': np.float64(3.719), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.757), 'mean_duration_us': np.float64(3.919), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.20396078054371136), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(4.199)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.876999999999999), 'mean_duration_us': np.float64(4.292333333333333), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.6444291185917105), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.835999999999999), 'mean_duration_us': np.float64(4.611999999999999), 'median_duration_us': np.float64(4.598), 'std_dev_duration_us': np.float64(0.14730241002780656), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(4.799)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.037), 'mean_duration_us': np.float64(5.678999999999999), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.4393935214209088), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.957), 'mean_duration_us': np.float64(6.985666666666667), 'median_duration_us': np.float64(7.079), 'std_dev_duration_us': np.float64(0.4781445620544296), 'min_duration_us': np.float64(6.359), 'max_duration_us': np.float64(7.519)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(33.597), 'mean_duration_us': np.float64(11.199), 'median_duration_us': np.float64(10.799), 'std_dev_duration_us': np.float64(1.786169084941288), 'min_duration_us': np.float64(9.239), 'max_duration_us': np.float64(13.559)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi64ELi4ELi32ELi32ELi8ELi2ELi2ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ES27_S28_S29_Li2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEES2F_EEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi64ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(66.637), 'mean_duration_us': np.float64(22.212333333333333), 'median_duration_us': np.float64(22.439), 'std_dev_duration_us': np.float64(0.3492213560989005), 'min_duration_us': np.float64(21.719), 'max_duration_us': np.float64(22.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(88.477), 'mean_duration_us': np.float64(29.492333333333335), 'median_duration_us': np.float64(29.439), 'std_dev_duration_us': np.float64(0.5239168721170258), 'min_duration_us': np.float64(28.879), 'max_duration_us': np.float64(30.159)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.92)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.56)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.69)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.72)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.92)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(4.29)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.61)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(5.68)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.99)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(11.2)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(22.21)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(29.49)}]","[[10, 512, 7, 7], [10, 256, 14, 14], [512, 256, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[25088, 49, 7, 1], [50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",100.28092447916667,98.10693359375,4.69415564310188,97.06787109375,105.66796875,300.8427734375,3,448 aten::convolution_backward,conv2d,"(10, 64, 56, 56)","(128, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",[],"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,11.765625,187.41035856573706,0.1349630457335169,0.1357099972929423,0.0022382409041266167,0.13244684508326912,0.13673229482433924,25.293472794042373,25.433459253625525,0.4194695303988689,24.821910727956094,25.62504840054549,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.117), 'mean_duration_us': np.float64(1.7056666666666667), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(1.719)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.6370000000000005), 'mean_duration_us': np.float64(1.8790000000000002), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.919)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.597000000000001), 'mean_duration_us': np.float64(2.8656666666666673), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.0714890988194368), 'min_duration_us': np.float64(1.359), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757), 'mean_duration_us': np.float64(3.5856666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.08219218670625292), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3409789827345178), 'min_duration_us': np.float64(4.639), 'max_duration_us': np.float64(5.399)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.037), 'mean_duration_us': np.float64(7.678999999999999), 'median_duration_us': np.float64(8.079), 'std_dev_duration_us': np.float64(0.7118052168020874), 'min_duration_us': np.float64(6.679), 'max_duration_us': np.float64(8.279)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.156), 'mean_duration_us': np.float64(9.718666666666666), 'median_duration_us': np.float64(9.359), 'std_dev_duration_us': np.float64(0.5378973466708636), 'min_duration_us': np.float64(9.318), 'max_duration_us': np.float64(10.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1x1_ta1x8x1x1_1x4x1x32_tb1x8x1x2_1x4x1x32_mh', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.277), 'mean_duration_us': np.float64(13.425666666666666), 'median_duration_us': np.float64(13.439), 'std_dev_duration_us': np.float64(0.018856180831641704), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(13.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.997), 'mean_duration_us': np.float64(13.665666666666667), 'median_duration_us': np.float64(13.639), 'std_dev_duration_us': np.float64(0.06798692684790397), 'min_duration_us': np.float64(13.599), 'max_duration_us': np.float64(13.759)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x4x1x4_1x8x1x32_tb1x4x1x2_1x8x1x32_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.235), 'mean_duration_us': np.float64(28.078333333333333), 'median_duration_us': np.float64(28.078), 'std_dev_duration_us': np.float64(0.5229661132000395), 'min_duration_us': np.float64(27.438), 'max_duration_us': np.float64(28.719)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.87)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(7.68)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.72)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(13.43)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.67)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(28.08)}]","[[10, 128, 28, 28], [10, 64, 56, 56], [128, 64, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[100352, 784, 28, 1], [200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",91.42822265625,90.908203125,1.5276087070124051,90.228515625,93.14794921875,274.28466796875,3,1248 -aten::convolution_backward,conv2d,"(10, 128, 28, 28)","(256, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",[],"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,6.8671875,321.09215017064844,0.08582313519691137,0.08685178692203042,0.002079293581891174,0.08343001490147713,0.08718760376722655,27.557135014762537,27.887427008957758,0.667644847045464,26.788722873484538,27.995255161845307,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.476999999999999), 'mean_duration_us': np.float64(2.159), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.159)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5569999999999995), 'mean_duration_us': np.float64(2.1856666666666666), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.997), 'mean_duration_us': np.float64(2.332333333333333), 'median_duration_us': np.float64(2.359), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.477), 'mean_duration_us': np.float64(3.8256666666666668), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.12364824660660949), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.637), 'mean_duration_us': np.float64(3.879), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.799), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.997), 'mean_duration_us': np.float64(4.999), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(1.4580352076224588), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(7.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.997), 'mean_duration_us': np.float64(7.332333333333334), 'median_duration_us': np.float64(7.279), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.239), 'max_duration_us': np.float64(7.479)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.357), 'mean_duration_us': np.float64(12.119), 'median_duration_us': np.float64(12.079), 'std_dev_duration_us': np.float64(0.44181444068749043), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.679)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr1x1_ta1x4x1x1_1x8x1x32_tb1x4x1x4_1x8x1x32_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.357), 'mean_duration_us': np.float64(19.785666666666668), 'median_duration_us': np.float64(19.679), 'std_dev_duration_us': np.float64(0.24073960113690362), 'min_duration_us': np.float64(19.559), 'max_duration_us': np.float64(20.119)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi32ELi4ELi32ELi32ELi8ELi2ELi1ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ENSL_IJLi1ELi4ELi4ELi4EEEES28_S29_Li2ELi8ELi2ELb0ELb1ELi8ELi4ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEENSH_INS6_IJiNS9_IiLi32EEEEEELb0EEEEEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi32ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(64.437), 'mean_duration_us': np.float64(21.479), 'median_duration_us': np.float64(21.439), 'std_dev_duration_us': np.float64(0.18184242262647862), 'min_duration_us': np.float64(21.279), 'max_duration_us': np.float64(21.719)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.16)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.19)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.33)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.83)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.88)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.0)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(12.12)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(19.79)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(21.48)}]","[[10, 256, 14, 14], [10, 128, 28, 28], [256, 128, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[50176, 196, 14, 1], [100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",83.93570963541667,82.90869140625,2.061593135713855,82.58935546875,86.30908203125,251.80712890625,3,848 +aten::convolution_backward,conv2d,"(10, 128, 28, 28)","(256, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",[],"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,6.8671875,321.09215017064844,0.08223832731986833,0.08323835491736657,0.0017988898280057205,0.08016161975995825,0.08331500728228015,26.40608134557411,26.727182357084803,0.5776094027944655,25.73926684988694,26.751794829750576,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.476999999999999), 'mean_duration_us': np.float64(2.159), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.159)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5569999999999995), 'mean_duration_us': np.float64(2.1856666666666666), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.997), 'mean_duration_us': np.float64(2.332333333333333), 'median_duration_us': np.float64(2.359), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.957), 'mean_duration_us': np.float64(3.6523333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1359738536958075), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.477), 'mean_duration_us': np.float64(3.8256666666666668), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.12364824660660949), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.637), 'mean_duration_us': np.float64(3.879), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.799), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.997), 'mean_duration_us': np.float64(4.999), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(1.4580352076224588), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(7.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.997), 'mean_duration_us': np.float64(7.332333333333334), 'median_duration_us': np.float64(7.279), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.239), 'max_duration_us': np.float64(7.479)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.357), 'mean_duration_us': np.float64(12.119), 'median_duration_us': np.float64(12.079), 'std_dev_duration_us': np.float64(0.44181444068749043), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.679)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr1x1_ta1x4x1x1_1x8x1x32_tb1x4x1x4_1x8x1x32_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.357), 'mean_duration_us': np.float64(19.785666666666668), 'median_duration_us': np.float64(19.679), 'std_dev_duration_us': np.float64(0.24073960113690362), 'min_duration_us': np.float64(19.559), 'max_duration_us': np.float64(20.119)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi32ELi4ELi32ELi32ELi8ELi2ELi1ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ENSL_IJLi1ELi4ELi4ELi4EEEES28_S29_Li2ELi8ELi2ELb0ELb1ELi8ELi4ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEENSH_INS6_IJiNS9_IiLi32EEEEEELb0EEEEEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi32ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(64.437), 'mean_duration_us': np.float64(21.479), 'median_duration_us': np.float64(21.439), 'std_dev_duration_us': np.float64(0.18184242262647862), 'min_duration_us': np.float64(21.279), 'max_duration_us': np.float64(21.719)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.16)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.19)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.33)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.83)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.88)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.0)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(12.12)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(19.79)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(21.48)}]","[[10, 256, 14, 14], [10, 128, 28, 28], [256, 128, 3, 3], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[50176, 196, 14, 1], [100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",87.58805338541667,86.5078125,1.9403670437970018,86.42822265625,89.828125,262.76416015625,3,848 aten::convolution_backward,conv2d,"(10, 128, 28, 28)","(256, 128, 1, 1)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(128, 1, 1, 1)",[],"(2, 2)","(0, 0)","(1, 1)",False,"(0, 0)",1,False,0.25690112,5.8671875,41.75765645805592,0.08194129870898983,0.08195399545989684,0.0005017494598043458,0.08143332137224994,0.08243657929482272,3.4216766012169386,3.422206787779447,0.020951881570525563,3.400464658100876,3.4423583577704933,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5169999999999995), 'mean_duration_us': np.float64(2.172333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.199)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1319932658214888), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.799)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.717), 'mean_duration_us': np.float64(3.905666666666667), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(4.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.997), 'mean_duration_us': np.float64(3.999), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.1423610433604174), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.597), 'mean_duration_us': np.float64(7.199000000000001), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(7.079), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.636), 'mean_duration_us': np.float64(7.212), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.06844462481938694), 'min_duration_us': np.float64(7.118), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.677), 'mean_duration_us': np.float64(19.892333333333333), 'median_duration_us': np.float64(19.799), 'std_dev_duration_us': np.float64(0.9005677221743096), 'min_duration_us': np.float64(18.839), 'max_duration_us': np.float64(21.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(65.196), 'mean_duration_us': np.float64(21.732), 'median_duration_us': np.float64(21.799), 'std_dev_duration_us': np.float64(0.2171128738697909), 'min_duration_us': np.float64(21.439), 'max_duration_us': np.float64(21.958)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.51)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.17)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.2)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(7.21)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(19.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(21.73)}]","[[10, 256, 14, 14], [10, 128, 28, 28], [256, 128, 1, 1], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[50176, 196, 14, 1], [100352, 784, 28, 1], [128, 1, 1, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",75.08235677083333,75.06884765625,0.45986563848762135,74.62939453125,75.548828125,225.2470703125,3,760 aten::convolution_backward,conv2d,"(10, 64, 56, 56)","(128, 64, 1, 1)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(64, 1, 1, 1)",[],"(2, 2)","(0, 0)","(1, 1)",False,"(0, 0)",1,False,0.25690112,11.515625,21.275440976933513,0.19650931176811723,0.19592625820201398,0.005852997801854299,0.19096966202556084,0.20263201507677686,4.180822263940404,4.168417542208384,0.12452510927147278,4.062963772809761,4.3110854768030675,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.637), 'mean_duration_us': np.float64(3.545666666666667), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09977753031397167), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.679)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.837), 'mean_duration_us': np.float64(3.6123333333333334), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.07542472332656493), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.719)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.397), 'mean_duration_us': np.float64(3.799), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.1423610433604176), 'min_duration_us': np.float64(3.679), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.956), 'mean_duration_us': np.float64(3.985333333333333), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.1151240876426629), 'min_duration_us': np.float64(3.838), 'max_duration_us': np.float64(4.119)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1x1_ta1x8x1x1_1x4x1x32_tb1x8x1x2_1x4x1x32_mh', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.357), 'mean_duration_us': np.float64(4.119), 'median_duration_us': np.float64(4.119), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(4.159)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.397), 'mean_duration_us': np.float64(7.1323333333333325), 'median_duration_us': np.float64(7.079), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(7.079), 'max_duration_us': np.float64(7.239)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(27.595999999999997), 'mean_duration_us': np.float64(9.198666666666666), 'median_duration_us': np.float64(9.199), 'std_dev_duration_us': np.float64(0.26168726033611617), 'min_duration_us': np.float64(8.878), 'max_duration_us': np.float64(9.519)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.996), 'mean_duration_us': np.float64(10.998666666666667), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.9337666851104847), 'min_duration_us': np.float64(10.318), 'max_duration_us': np.float64(12.319)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x4x1x4_1x8x1x32_tb1x4x1x2_1x8x1x32_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(45.277), 'mean_duration_us': np.float64(15.092333333333334), 'median_duration_us': np.float64(15.479), 'std_dev_duration_us': np.float64(0.8147528595974503), 'min_duration_us': np.float64(13.959), 'max_duration_us': np.float64(15.839)}]","[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.55)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.61)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.8)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.99)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(4.12)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.13)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.2)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(11.0)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(15.09)}]","[[10, 128, 28, 28], [10, 64, 56, 56], [128, 64, 1, 1], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[100352, 784, 28, 1], [200704, 3136, 56, 1], [64, 1, 1, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]']",61.483723958333336,61.63037109375,1.824006770122803,59.5908203125,63.22998046875,184.451171875,3,1160 aten::convolution_backward,conv2d,"(10, 3, 224, 224)","(64, 3, 7, 7)","('c10::BFloat16', 'c10::BFloat16')","(150528, 50176, 224, 1)","(147, 49, 7, 1)",[],"(2, 2)","(3, 3)","(1, 1)",False,"(0, 0)",1,False,4.72055808,36.403076171875,123.66743345382847,0.641309736655398,0.6405267666491873,0.008015534094070525,0.6337144197146564,0.6496880236023503,79.30912918112368,79.21230128998427,0.9912605291753606,78.36983582879378,80.34525042459299,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.5969999999999995), 'mean_duration_us': np.float64(1.532333333333333), 'median_duration_us': np.float64(1.519), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(1.559)}, {'name': 'batched_transpose_4x64_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.356999999999999), 'mean_duration_us': np.float64(1.7856666666666665), 'median_duration_us': np.float64(1.799), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.759), 'max_duration_us': np.float64(1.799)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.797), 'mean_duration_us': np.float64(3.599), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.1131370849898475), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.957), 'mean_duration_us': np.float64(3.985666666666667), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.1236482466066093), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.159)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.357), 'mean_duration_us': np.float64(10.452333333333334), 'median_duration_us': np.float64(10.479), 'std_dev_duration_us': np.float64(0.09977753031397107), 'min_duration_us': np.float64(10.319), 'max_duration_us': np.float64(10.559)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt64x32x32_wt16x16x16_ws1x1_wr2x1_ta1x4x1x2_1x8x1x32_tb1x4x1x1_1x8x1x32_vs1_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(114.517), 'mean_duration_us': np.float64(38.172333333333334), 'median_duration_us': np.float64(38.399), 'std_dev_duration_us': np.float64(0.5309948733797308), 'min_duration_us': np.float64(37.439), 'max_duration_us': np.float64(38.679)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.53)}, {'name': 'batched_transpose_4x64_half', 'stream': 0, 'mean_duration_us': np.float64(1.79)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.6)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(3.99)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.45)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt64x32x32_wt16x16x16_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(38.17)}]","[[10, 64, 112, 112], [10, 3, 224, 224], [64, 3, 7, 7], [], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList']","[[802816, 12544, 112, 1], [150528, 50176, 224, 1], [147, 49, 7, 1], [], [], [], [], [], [], [], []]","['', '', '', '[0]', '[2, 2]', '[3, 3]', '[1, 1]', 'False', '[0, 0]', '1', '[False, True, False]']",59.527180989583336,59.59375,0.7427193325631799,58.75341796875,60.234375,178.58154296875,3,1631 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_fwd.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_fwd.csv index 37e622061..584a050df 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_fwd.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/CONV_fwd.csv @@ -1,16 +1,16 @@ name,param: convNd,param: input_shape,param: filter_shape,param: dtype_input_weight,param: input_stride,param: weight_stride,param: bias,param: stride,param: padding,param: dilation,param: transposed_conv,param: output_padding,param: groups,is_recompute,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::convolution,conv2d,"(10, 64, 56, 56)","(64, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,7.7265625,285.37917087967645,0.1834168415574402,0.1839134068021956,0.013919581008416088,0.15950039531284546,0.20136486964964018,52.34334616903127,52.48505554686723,3.9723584871742736,45.518090569360474,57.46533954490844,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(56.06799999999999), 'mean_duration_us': np.float64(4.672333333333333), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.456021441991005), 'min_duration_us': np.float64(4.199), 'max_duration_us': np.float64(5.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(79.987), 'mean_duration_us': np.float64(6.665583333333333), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(1.2505812287581408), 'min_duration_us': np.float64(5.279), 'max_duration_us': np.float64(9.119)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.868), 'mean_duration_us': np.float64(7.489), 'median_duration_us': np.float64(7.199), 'std_dev_duration_us': np.float64(1.7640956134329377), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(10.519)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(128.226), 'mean_duration_us': np.float64(10.6855), 'median_duration_us': np.float64(10.839), 'std_dev_duration_us': np.float64(0.7668145690669508), 'min_duration_us': np.float64(8.999), 'max_duration_us': np.float64(11.559)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_LNS_25InMemoryDataOperationEnumE0ELi1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENSA_IJLi1ELi0ELi2EEEESC_Li2ELi8ELi8ELb0ELi1ESB_SC_SC_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENSA_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtEEPKtSI_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESL_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESQ_SO_SO_NSK_INS5_IJiiEEESR_Lb0EEESS_SO_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESV_NS_8RightPadIiiLb0EEESX_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESO_EEENS5_IJNSA_IJLi0EEEENSA_IJLi1EEEENSA_IJLi2EEEENSA_IJLi3EEEENSA_IJLi4EEEENSA_IJLi5EEEENSA_IJLi6EEEENSA_IJLi7EEEENSA_IJLi8EEEENSA_IJLi9ELi11ELi13EEEENSA_IJLi10ELi12ELi14EEEENSA_IJLi15EEEENSA_IJLi16EEEENSA_IJLi18EEEENSA_IJLi17EEEEEEENS5_IJNSA_IJLi1ELi2ELi3ELi4EEEES19_S1A_S1B_S1C_NSA_IJLi9EEEENSA_IJLi10ELi11EEEENSA_IJLi12ELi13EEEENSA_IJLi14EEEES1F_S1G_S1I_S1H_NSA_IJLi19ELi20EEEENSA_IJLi21EEEEEEENSA_IJLi19ELi21ELi20EEEElEENSJ_INS5_IJNSY_ISR_Lb0EEESX_SX_S12_SO_EEENS5_IJS14_S15_S16_S18_S17_EEENS5_IJNSA_IJLi1ELi2EEEES17_S18_NSA_IJLi5ELi6EEEES1B_EEENSA_IJLi5ELi7ELi6EEEElEES6_NSJ_INS5_IJSS_SX_SX_NSY_INS5_IJiNSZ_IiLi128EEEEEELb0EEENSY_INS5_IJiNSZ_IiLi64EEEEEELb0EEEEEENS5_IJS14_S15_S16_S17_S18_EEENS5_IJS1X_S17_S18_S1Y_NSA_IJLi7ELi8EEEEEEENSA_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSJ_INS5_IJSS_SX_SX_EEENS5_IJS14_S15_S16_EEENS5_IJS1X_S17_S18_EEENSA_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2M_Lb1ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(178.82799999999997), 'mean_duration_us': np.float64(14.902333333333331), 'median_duration_us': np.float64(14.719000000000001), 'std_dev_duration_us': np.float64(0.8173874370347406), 'min_duration_us': np.float64(13.839), 'max_duration_us': np.float64(16.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.67)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.67)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.69)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(14.9)}]","[[10, 64, 56, 56], [64, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",44.414794921875,44.053466796875,3.499152344076261,40.23486328125,50.79541015625,532.9775390625,12,5899 -aten::convolution,conv2d,"(10, 64, 56, 56)","(64, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,2.31211008,7.7265625,285.37917087967645,0.20919834786878924,0.21681222791232177,0.030347122735902687,0.1638895195124601,0.23832504989802072,59.70085106419321,61.87369383819383,8.660436724955689,46.770655194334424,68.01300513975468,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(39.748), 'mean_duration_us': np.float64(3.312333333333333), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.7179291206116535), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(69.426), 'mean_duration_us': np.float64(5.7855), 'median_duration_us': np.float64(3.239), 'std_dev_duration_us': np.float64(4.219149746493164), 'min_duration_us': np.float64(3.158), 'max_duration_us': np.float64(13.359)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(80.34800000000001), 'mean_duration_us': np.float64(6.695666666666668), 'median_duration_us': np.float64(5.459), 'std_dev_duration_us': np.float64(3.7655794891210155), 'min_duration_us': np.float64(3.119), 'max_duration_us': np.float64(14.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(128.028), 'mean_duration_us': np.float64(10.668999999999999), 'median_duration_us': np.float64(10.559), 'std_dev_duration_us': np.float64(0.7290404652692469), 'min_duration_us': np.float64(9.519), 'max_duration_us': np.float64(11.719)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_LNS_25InMemoryDataOperationEnumE0ELi1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENSA_IJLi1ELi0ELi2EEEESC_Li2ELi8ELi8ELb0ELi1ESB_SC_SC_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENSA_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtEEPKtSI_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESL_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESQ_SO_SO_NSK_INS5_IJiiEEESR_Lb0EEESS_SO_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESV_NS_8RightPadIiiLb0EEESX_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESO_EEENS5_IJNSA_IJLi0EEEENSA_IJLi1EEEENSA_IJLi2EEEENSA_IJLi3EEEENSA_IJLi4EEEENSA_IJLi5EEEENSA_IJLi6EEEENSA_IJLi7EEEENSA_IJLi8EEEENSA_IJLi9ELi11ELi13EEEENSA_IJLi10ELi12ELi14EEEENSA_IJLi15EEEENSA_IJLi16EEEENSA_IJLi18EEEENSA_IJLi17EEEEEEENS5_IJNSA_IJLi1ELi2ELi3ELi4EEEES19_S1A_S1B_S1C_NSA_IJLi9EEEENSA_IJLi10ELi11EEEENSA_IJLi12ELi13EEEENSA_IJLi14EEEES1F_S1G_S1I_S1H_NSA_IJLi19ELi20EEEENSA_IJLi21EEEEEEENSA_IJLi19ELi21ELi20EEEElEENSJ_INS5_IJNSY_ISR_Lb0EEESX_SX_S12_SO_EEENS5_IJS14_S15_S16_S18_S17_EEENS5_IJNSA_IJLi1ELi2EEEES17_S18_NSA_IJLi5ELi6EEEES1B_EEENSA_IJLi5ELi7ELi6EEEElEES6_NSJ_INS5_IJSS_SX_SX_NSY_INS5_IJiNSZ_IiLi128EEEEEELb0EEENSY_INS5_IJiNSZ_IiLi64EEEEEELb0EEEEEENS5_IJS14_S15_S16_S17_S18_EEENS5_IJS1X_S17_S18_S1Y_NSA_IJLi7ELi8EEEEEEENSA_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSJ_INS5_IJSS_SX_SX_EEENS5_IJS14_S15_S16_EEENS5_IJS1X_S17_S18_EEENSA_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2M_Lb1ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(156.748), 'mean_duration_us': np.float64(13.062333333333333), 'median_duration_us': np.float64(13.039000000000001), 'std_dev_duration_us': np.float64(0.511066423167174), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(13.959)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.31)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.79)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.7)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.67)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.06)}]","[[10, 64, 56, 56], [64, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",39.525146484375,37.594970703125,6.011626623307329,33.9951171875,49.43505859375,474.3017578125,12,1269 +aten::convolution,conv2d,"(10, 64, 56, 56)","(64, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,7.7265625,285.37917087967645,0.16484630826658622,0.16626262435778655,0.012357526749693239,0.14397232621541184,0.1807086323676759,47.04370277569393,47.44788988750423,3.5265807379508773,41.08670308497254,51.57047967588761,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(56.06799999999999), 'mean_duration_us': np.float64(4.672333333333333), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.456021441991005), 'min_duration_us': np.float64(4.199), 'max_duration_us': np.float64(5.679)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(59.988), 'mean_duration_us': np.float64(4.999), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5046450898073482), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(6.159)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(79.987), 'mean_duration_us': np.float64(6.665583333333333), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(1.2505812287581408), 'min_duration_us': np.float64(5.279), 'max_duration_us': np.float64(9.119)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.868), 'mean_duration_us': np.float64(7.489), 'median_duration_us': np.float64(7.199), 'std_dev_duration_us': np.float64(1.7640956134329377), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(10.519)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(128.226), 'mean_duration_us': np.float64(10.6855), 'median_duration_us': np.float64(10.839), 'std_dev_duration_us': np.float64(0.7668145690669508), 'min_duration_us': np.float64(8.999), 'max_duration_us': np.float64(11.559)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_LNS_25InMemoryDataOperationEnumE0ELi1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENSA_IJLi1ELi0ELi2EEEESC_Li2ELi8ELi8ELb0ELi1ESB_SC_SC_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENSA_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtEEPKtSI_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESL_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESQ_SO_SO_NSK_INS5_IJiiEEESR_Lb0EEESS_SO_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESV_NS_8RightPadIiiLb0EEESX_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESO_EEENS5_IJNSA_IJLi0EEEENSA_IJLi1EEEENSA_IJLi2EEEENSA_IJLi3EEEENSA_IJLi4EEEENSA_IJLi5EEEENSA_IJLi6EEEENSA_IJLi7EEEENSA_IJLi8EEEENSA_IJLi9ELi11ELi13EEEENSA_IJLi10ELi12ELi14EEEENSA_IJLi15EEEENSA_IJLi16EEEENSA_IJLi18EEEENSA_IJLi17EEEEEEENS5_IJNSA_IJLi1ELi2ELi3ELi4EEEES19_S1A_S1B_S1C_NSA_IJLi9EEEENSA_IJLi10ELi11EEEENSA_IJLi12ELi13EEEENSA_IJLi14EEEES1F_S1G_S1I_S1H_NSA_IJLi19ELi20EEEENSA_IJLi21EEEEEEENSA_IJLi19ELi21ELi20EEEElEENSJ_INS5_IJNSY_ISR_Lb0EEESX_SX_S12_SO_EEENS5_IJS14_S15_S16_S18_S17_EEENS5_IJNSA_IJLi1ELi2EEEES17_S18_NSA_IJLi5ELi6EEEES1B_EEENSA_IJLi5ELi7ELi6EEEElEES6_NSJ_INS5_IJSS_SX_SX_NSY_INS5_IJiNSZ_IiLi128EEEEEELb0EEENSY_INS5_IJiNSZ_IiLi64EEEEEELb0EEEEEENS5_IJS14_S15_S16_S17_S18_EEENS5_IJS1X_S17_S18_S1Y_NSA_IJLi7ELi8EEEEEEENSA_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSJ_INS5_IJSS_SX_SX_EEENS5_IJS14_S15_S16_EEENS5_IJS1X_S17_S18_EEENSA_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2M_Lb1ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(178.82799999999997), 'mean_duration_us': np.float64(14.902333333333331), 'median_duration_us': np.float64(14.719000000000001), 'std_dev_duration_us': np.float64(0.8173874370347406), 'min_duration_us': np.float64(13.839), 'max_duration_us': np.float64(16.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.67)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(5.0)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.67)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.69)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(14.9)}]","[[10, 64, 56, 56], [64, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",49.413818359375,48.732421875,3.875672063970556,44.833984375,56.27392578125,592.9658203125,12,5899 +aten::convolution,conv2d,"(10, 64, 56, 56)","(64, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,2.31211008,7.7265625,285.37917087967645,0.19115626396997346,0.195507173884155,0.02700023290998393,0.15207980041244673,0.22359673652436396,54.552016120207604,55.79367518408889,7.705304081409365,43.40040734925073,63.80985128072446,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(39.748), 'mean_duration_us': np.float64(3.312333333333333), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.7179291206116535), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.759)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(44.068), 'mean_duration_us': np.float64(3.672333333333333), 'median_duration_us': np.float64(3.939), 'std_dev_duration_us': np.float64(0.6742567924924614), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(4.119)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(69.426), 'mean_duration_us': np.float64(5.7855), 'median_duration_us': np.float64(3.239), 'std_dev_duration_us': np.float64(4.219149746493164), 'min_duration_us': np.float64(3.158), 'max_duration_us': np.float64(13.359)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(80.34800000000001), 'mean_duration_us': np.float64(6.695666666666668), 'median_duration_us': np.float64(5.459), 'std_dev_duration_us': np.float64(3.7655794891210155), 'min_duration_us': np.float64(3.119), 'max_duration_us': np.float64(14.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(128.028), 'mean_duration_us': np.float64(10.668999999999999), 'median_duration_us': np.float64(10.559), 'std_dev_duration_us': np.float64(0.7290404652692469), 'min_duration_us': np.float64(9.519), 'max_duration_us': np.float64(11.719)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_conv_fwd_multiple_abd_xdl_cshuffleINS_34GridwiseGemmMultipleD_xdl_cshuffleItttftNS_5TupleIJEEEtNS0_12element_wise11PassThroughES8_S8_LNS_25InMemoryDataOperationEnumE0ELi1ELi256ELi128ELi64ELi32ELi8ELi8ELi32ELi32ELi2ELi1ENS_8SequenceIJLi4ELi64ELi1EEEENSA_IJLi1ELi0ELi2EEEESC_Li2ELi8ELi8ELb0ELi1ESB_SC_SC_Li2ELi8ELi8ELb0ELi1ELi1ELi1ENSA_IJLi1ELi32ELi1ELi8EEEELi8ELNS_13LoopSchedulerE0ELNS_15PipelineVersionE0EtEEPKtSI_S6_tS8_S8_S8_NS_16TensorDescriptorINS5_IJNS_5EmbedINS5_IJiiiiEEESL_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESQ_SO_SO_NSK_INS5_IJiiEEESR_Lb0EEESS_SO_NS_23Merge_v2_magic_divisionINS5_IJiiiEEEEESV_NS_8RightPadIiiLb0EEESX_NS_7UnMergeINS5_IJiNS_17integral_constantIiLi8EEEEEELb0EEESO_EEENS5_IJNSA_IJLi0EEEENSA_IJLi1EEEENSA_IJLi2EEEENSA_IJLi3EEEENSA_IJLi4EEEENSA_IJLi5EEEENSA_IJLi6EEEENSA_IJLi7EEEENSA_IJLi8EEEENSA_IJLi9ELi11ELi13EEEENSA_IJLi10ELi12ELi14EEEENSA_IJLi15EEEENSA_IJLi16EEEENSA_IJLi18EEEENSA_IJLi17EEEEEEENS5_IJNSA_IJLi1ELi2ELi3ELi4EEEES19_S1A_S1B_S1C_NSA_IJLi9EEEENSA_IJLi10ELi11EEEENSA_IJLi12ELi13EEEENSA_IJLi14EEEES1F_S1G_S1I_S1H_NSA_IJLi19ELi20EEEENSA_IJLi21EEEEEEENSA_IJLi19ELi21ELi20EEEElEENSJ_INS5_IJNSY_ISR_Lb0EEESX_SX_S12_SO_EEENS5_IJS14_S15_S16_S18_S17_EEENS5_IJNSA_IJLi1ELi2EEEES17_S18_NSA_IJLi5ELi6EEEES1B_EEENSA_IJLi5ELi7ELi6EEEElEES6_NSJ_INS5_IJSS_SX_SX_NSY_INS5_IJiNSZ_IiLi128EEEEEELb0EEENSY_INS5_IJiNSZ_IiLi64EEEEEELb0EEEEEENS5_IJS14_S15_S16_S17_S18_EEENS5_IJS1X_S17_S18_S1Y_NSA_IJLi7ELi8EEEEEEENSA_IJLi5ELi6ELi7ELi8EEEElEENS_31BlockToCTileMap_M00_N0_M01AdaptILi128ELi64ENSJ_INS5_IJSS_SX_SX_EEENS5_IJS14_S15_S16_EEENS5_IJS1X_S17_S18_EEENSA_IJLi3ELi4EEEElEEEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEES2M_Lb1ELb0ELb0EEEvT0_T1_T2_PT3_T4_T5_T6_T7_T8_T9_T10_T11_T12_T13_', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(156.748), 'mean_duration_us': np.float64(13.062333333333333), 'median_duration_us': np.float64(13.039000000000001), 'std_dev_duration_us': np.float64(0.511066423167174), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(13.959)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.31)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.67)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.79)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.7)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.67)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_149kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.06)}]","[[10, 64, 56, 56], [64, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",43.197509765625,41.634033203125,6.308534592174761,36.234375,53.27392578125,518.3701171875,12,1269 aten::convolution,conv2d,"(10, 512, 7, 7)","(512, 512, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(25088, 49, 7, 1)","(4608, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,5.45703125,404.0658554044381,0.10883948756524439,0.10963192515880367,0.005616061677121839,0.10161088845150046,0.11932841219057705,43.97832064483118,44.29851761892734,2.2692587655703194,41.057490560560474,48.2165369458389,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.751), 'mean_duration_us': np.float64(4.861222222222222), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.46307613431577266), 'min_duration_us': np.float64(4.199), 'max_duration_us': np.float64(5.719)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(45.10999999999999), 'mean_duration_us': np.float64(5.0122222222222215), 'median_duration_us': np.float64(4.919), 'std_dev_duration_us': np.float64(0.40185508105888074), 'min_duration_us': np.float64(4.199), 'max_duration_us': np.float64(5.679)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(46.431000000000004), 'mean_duration_us': np.float64(5.159000000000001), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.5094659513211413), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.959)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(47.59), 'mean_duration_us': np.float64(5.287777777777778), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.4567162449432488), 'min_duration_us': np.float64(4.599), 'max_duration_us': np.float64(6.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(93.07), 'mean_duration_us': np.float64(10.341111111111111), 'median_duration_us': np.float64(11.439), 'std_dev_duration_us': np.float64(2.0787966842192596), 'min_duration_us': np.float64(7.119), 'max_duration_us': np.float64(12.479)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(198.31), 'mean_duration_us': np.float64(22.034444444444446), 'median_duration_us': np.float64(22.359), 'std_dev_duration_us': np.float64(0.6597284140060317), 'min_duration_us': np.float64(20.958), 'max_duration_us': np.float64(22.839)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.86)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.01)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.16)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.29)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.34)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(22.03)}]","[[10, 512, 7, 7], [512, 512, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[25088, 49, 7, 1], [4608, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",52.69580078125,52.19384765625,2.6621130469584453,47.95263671875,56.31396484375,474.26220703125,9,6289 aten::convolution,conv2d,"(10, 512, 7, 7)","(512, 512, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(25088, 49, 7, 1)","(4608, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,2.31211008,5.45703125,404.0658554044381,0.11000503597171911,0.10765097718170127,0.005771283636129945,0.10352189339410965,0.12012593281738507,44.44927895870866,43.49808418004777,2.3319786592144798,41.82966240737797,48.53878780011276,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(41.31100000000001), 'mean_duration_us': np.float64(4.590111111111112), 'median_duration_us': np.float64(4.639), 'std_dev_duration_us': np.float64(0.23230461058439075), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(5.079)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.95099999999999), 'mean_duration_us': np.float64(4.883444444444444), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.3624334762288909), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(5.359)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(44.150999999999996), 'mean_duration_us': np.float64(4.905666666666666), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.5771962885843562), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(5.959)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(45.671), 'mean_duration_us': np.float64(5.0745555555555555), 'median_duration_us': np.float64(4.999), 'std_dev_duration_us': np.float64(0.36778952649915037), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.679)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(96.231), 'mean_duration_us': np.float64(10.692333333333332), 'median_duration_us': np.float64(11.639), 'std_dev_duration_us': np.float64(2.301535719181144), 'min_duration_us': np.float64(7.199), 'max_duration_us': np.float64(13.799)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(197.95), 'mean_duration_us': np.float64(21.994444444444444), 'median_duration_us': np.float64(22.039), 'std_dev_duration_us': np.float64(0.6985106554680959), 'min_duration_us': np.float64(20.879), 'max_duration_us': np.float64(23.079)}]","[{'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.59)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.88)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.91)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.07)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(10.69)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(21.99)}]","[[10, 512, 7, 7], [512, 512, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[25088, 49, 7, 1], [4608, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",52.140842013888886,53.154296875,2.6612590919264862,47.63427734375,55.2744140625,469.267578125,9,98 aten::convolution,conv2d,"(10, 256, 14, 14)","(256, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,3.0390625,725.5526992287918,0.06593452926300568,0.06601261340211399,0.001782836538846183,0.06298519571112848,0.068925375436966,47.838975679153535,47.89562983705053,1.293541863043565,45.699078759662996,50.00899219364855,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(40.791), 'mean_duration_us': np.float64(4.532333333333333), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.24513035081133647), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.119)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.830999999999996), 'mean_duration_us': np.float64(4.870111111111111), 'median_duration_us': np.float64(4.919), 'std_dev_duration_us': np.float64(0.3611230767248333), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(5.319)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(48.711), 'mean_duration_us': np.float64(5.412333333333333), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.30579586509812584), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(5.959)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(48.83), 'mean_duration_us': np.float64(5.4255555555555555), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.3366987150129296), 'min_duration_us': np.float64(4.639), 'max_duration_us': np.float64(5.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(56.190000000000005), 'mean_duration_us': np.float64(6.243333333333334), 'median_duration_us': np.float64(5.999), 'std_dev_duration_us': np.float64(1.2056345493832974), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(8.519)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(196.91000000000003), 'mean_duration_us': np.float64(21.87888888888889), 'median_duration_us': np.float64(21.599), 'std_dev_duration_us': np.float64(1.0406707713398065), 'min_duration_us': np.float64(20.039), 'max_duration_us': np.float64(23.879)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.87)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.41)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.43)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.24)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(21.88)}]","[[10, 256, 14, 14], [256, 256, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",48.362521701388886,48.27392578125,1.3081636800736347,46.23388671875,50.59423828125,435.2626953125,9,6160 +aten::convolution,conv2d,"(10, 128, 28, 28)","(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,4.109375,536.5779467680609,0.09493792102599727,0.09417757636813798,0.0034548538536194598,0.09247907378569559,0.10320094041702238,50.941594734557924,50.53361055920772,1.8537983871588535,49.62223153094053,55.37534871349885,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'Memset (Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(40.431), 'mean_duration_us': np.float64(4.492333333333333), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.6231104770958892), 'min_duration_us': np.float64(2.879), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(41.55100000000001), 'mean_duration_us': np.float64(4.616777777777779), 'median_duration_us': np.float64(4.639), 'std_dev_duration_us': np.float64(0.32282701861928675), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.359)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(45.47), 'mean_duration_us': np.float64(5.052222222222222), 'median_duration_us': np.float64(5.239), 'std_dev_duration_us': np.float64(0.28209288374882535), 'min_duration_us': np.float64(4.599), 'max_duration_us': np.float64(5.358)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(49.431000000000004), 'mean_duration_us': np.float64(5.492333333333334), 'median_duration_us': np.float64(5.759), 'std_dev_duration_us': np.float64(0.5762715409326481), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(6.239)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(99.67), 'mean_duration_us': np.float64(11.074444444444445), 'median_duration_us': np.float64(11.039), 'std_dev_duration_us': np.float64(0.7863597015659654), 'min_duration_us': np.float64(9.519), 'max_duration_us': np.float64(11.999)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi256ELi64ELi64ELi64ELi8ELi8ELi32ELi32ELi1ELi1ENS_8SequenceIJLi8ELi32ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi32ELi1ELi8EEEELi8ELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi64EEEEEELb0EEES22_EEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2I_i', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(132.391), 'mean_duration_us': np.float64(14.710111111111111), 'median_duration_us': np.float64(14.359), 'std_dev_duration_us': np.float64(0.587205140085822), 'min_duration_us': np.float64(13.879), 'max_duration_us': np.float64(15.359)}]","[{'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.62)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.05)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(11.07)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(14.71)}]","[[10, 128, 28, 28], [128, 128, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",45.438151041666664,45.75390625,1.5677191732883085,41.75341796875,46.59423828125,408.943359375,9,6031 aten::convolution,conv2d,"(10, 256, 14, 14)","(256, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,2.31211008,3.0390625,725.5526992287918,0.07714432106735924,0.07873396416981336,0.004119289645192149,0.07013871211942095,0.08206029125749707,55.97227038059505,57.12564022439107,2.9887617209743773,50.88933189867704,59.539065821377825,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(27.871), 'mean_duration_us': np.float64(3.0967777777777776), 'median_duration_us': np.float64(2.239), 'std_dev_duration_us': np.float64(1.0861734849949949), 'min_duration_us': np.float64(2.039), 'max_duration_us': np.float64(4.599)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.39), 'mean_duration_us': np.float64(3.71), 'median_duration_us': np.float64(3.718), 'std_dev_duration_us': np.float64(0.12617095985650228), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(34.471000000000004), 'mean_duration_us': np.float64(3.8301111111111115), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(1.5669676621809998), 'min_duration_us': np.float64(2.359), 'max_duration_us': np.float64(6.639)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(44.031000000000006), 'mean_duration_us': np.float64(4.892333333333334), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(1.7610098113172328), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(8.079)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(44.31099999999999), 'mean_duration_us': np.float64(4.923444444444444), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.33276989417484243), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.719)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(188.67), 'mean_duration_us': np.float64(20.96333333333333), 'median_duration_us': np.float64(20.959), 'std_dev_duration_us': np.float64(0.5914419291490544), 'min_duration_us': np.float64(20.239), 'max_duration_us': np.float64(21.958)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.1)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.83)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.92)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(20.96)}]","[[10, 256, 14, 14], [256, 256, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",41.416015625,40.47412109375,2.274696041069656,38.83349609375,45.43408203125,372.744140625,9,501 -aten::convolution,conv2d,"(10, 128, 28, 28)","(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,2.31211008,4.109375,536.5779467680609,0.10530708177370153,0.10449875801963317,0.002917265420849667,0.10222070421980517,0.11084363017019407,56.50545771826905,56.071729017987195,1.565340289696978,54.84937558744831,59.47624748904101,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(41.55100000000001), 'mean_duration_us': np.float64(4.616777777777779), 'median_duration_us': np.float64(4.639), 'std_dev_duration_us': np.float64(0.32282701861928675), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.359)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(45.47), 'mean_duration_us': np.float64(5.052222222222222), 'median_duration_us': np.float64(5.239), 'std_dev_duration_us': np.float64(0.28209288374882535), 'min_duration_us': np.float64(4.599), 'max_duration_us': np.float64(5.358)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(49.431000000000004), 'mean_duration_us': np.float64(5.492333333333334), 'median_duration_us': np.float64(5.759), 'std_dev_duration_us': np.float64(0.5762715409326481), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(6.239)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(99.67), 'mean_duration_us': np.float64(11.074444444444445), 'median_duration_us': np.float64(11.039), 'std_dev_duration_us': np.float64(0.7863597015659654), 'min_duration_us': np.float64(9.519), 'max_duration_us': np.float64(11.999)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi256ELi64ELi64ELi64ELi8ELi8ELi32ELi32ELi1ELi1ENS_8SequenceIJLi8ELi32ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi32ELi1ELi8EEEELi8ELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi64EEEEEELb0EEES22_EEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2I_i', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(132.391), 'mean_duration_us': np.float64(14.710111111111111), 'median_duration_us': np.float64(14.359), 'std_dev_duration_us': np.float64(0.587205140085822), 'min_duration_us': np.float64(13.879), 'max_duration_us': np.float64(15.359)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.62)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.05)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(11.07)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(14.71)}]","[[10, 128, 28, 28], [128, 128, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",40.94580078125,41.23486328125,1.1151018481502926,38.87451171875,42.15380859375,368.51220703125,9,6031 -aten::convolution,conv2d,"(10, 128, 28, 28)","(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,2.31211008,4.109375,536.5779467680609,0.11861370197170173,0.12201949056316802,0.005981379145113769,0.10926805116204204,0.1248435443009323,63.64549666253439,65.47296771206948,3.209476140526444,58.63082653987593,66.98829266824168,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.671), 'mean_duration_us': np.float64(2.852333333333333), 'median_duration_us': np.float64(2.759), 'std_dev_duration_us': np.float64(0.2796823595120404), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(3.639)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(31.151), 'mean_duration_us': np.float64(3.461222222222222), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.5688541656069638), 'min_duration_us': np.float64(1.879), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(48.230999999999995), 'mean_duration_us': np.float64(5.358999999999999), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(2.011875852145068), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(8.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(104.271), 'mean_duration_us': np.float64(11.585666666666667), 'median_duration_us': np.float64(11.479), 'std_dev_duration_us': np.float64(0.7421290693373732), 'min_duration_us': np.float64(10.559), 'max_duration_us': np.float64(12.679)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi256ELi64ELi64ELi64ELi8ELi8ELi32ELi32ELi1ELi1ENS_8SequenceIJLi8ELi32ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi32ELi1ELi8EEEELi8ELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi64EEEEEELb0EEES22_EEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2I_i', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(118.389), 'mean_duration_us': np.float64(13.154333333333334), 'median_duration_us': np.float64(13.199), 'std_dev_duration_us': np.float64(0.30681988925824927), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(13.559)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.85)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.46)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.36)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(11.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.15)}]","[[10, 128, 28, 28], [128, 128, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",36.41259765625,35.31396484375,1.8892307500006171,34.51513671875,39.43505859375,327.71337890625,9,901 +aten::convolution,conv2d,"(10, 128, 28, 28)","(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",False,"(1, 1)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,2.31211008,4.109375,536.5779467680609,0.10795603521667614,0.11039298994245686,0.005606072543406586,0.09975939245543235,0.11610530103806228,57.926827717784555,59.23444388091069,3.0080948947739063,53.52868997456507,62.29954403989106,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(25.671), 'mean_duration_us': np.float64(2.852333333333333), 'median_duration_us': np.float64(2.759), 'std_dev_duration_us': np.float64(0.2796823595120404), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(3.639)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(31.151), 'mean_duration_us': np.float64(3.461222222222222), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.5688541656069638), 'min_duration_us': np.float64(1.879), 'max_duration_us': np.float64(3.839)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(32.39), 'mean_duration_us': np.float64(3.598888888888889), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.6034125996630323), 'min_duration_us': np.float64(1.918), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(48.230999999999995), 'mean_duration_us': np.float64(5.358999999999999), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(2.011875852145068), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(8.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(104.271), 'mean_duration_us': np.float64(11.585666666666667), 'median_duration_us': np.float64(11.479), 'std_dev_duration_us': np.float64(0.7421290693373732), 'min_duration_us': np.float64(10.559), 'max_duration_us': np.float64(12.679)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi256ELi64ELi64ELi64ELi8ELi8ELi32ELi32ELi1ELi1ENS_8SequenceIJLi8ELi32ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi32ELi1ELi8EEEELi8ELNS_26BlockGemmPipelineSchedulerE0ELNS_24BlockGemmPipelineVersionE2EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi64EEEEEELb0EEES22_EEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi1ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2I_i', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(118.389), 'mean_duration_us': np.float64(13.154333333333334), 'median_duration_us': np.float64(13.199), 'std_dev_duration_us': np.float64(0.30681988925824927), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(13.559)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.85)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.46)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.6)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.36)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(11.59)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.15)}]","[[10, 128, 28, 28], [128, 128, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[1, 1]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",40.011501736111114,39.033203125,2.1069782785230307,37.11279296875,43.19384765625,360.103515625,9,901 aten::convolution,conv2d,"(10, 3, 224, 224)","(64, 3, 7, 7)","('c10::BFloat16', 'c10::BFloat16')","(150528, 50176, 224, 1)","(147, 49, 7, 1)",False,"(2, 2)","(3, 3)","(1, 1)",False,"(0, 0)",1,False,2.36027904,18.2015380859375,123.66743345382847,0.32267209714534706,0.3237328591022031,0.0070184064922076475,0.3151836907470871,0.329099741586751,39.90403010112948,40.035211809839325,0.8679483178270077,38.97795810119744,40.69892039235167,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_64x4_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.477), 'mean_duration_us': np.float64(4.825666666666667), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.5487764167268449), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.559)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.917), 'mean_duration_us': np.float64(5.639), 'median_duration_us': np.float64(5.479), 'std_dev_duration_us': np.float64(0.4079215610874227), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(6.199)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.837), 'mean_duration_us': np.float64(7.279), 'median_duration_us': np.float64(7.279), 'std_dev_duration_us': np.float64(0.1306394529484363), 'min_duration_us': np.float64(7.119), 'max_duration_us': np.float64(7.439)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(43.277), 'mean_duration_us': np.float64(14.425666666666666), 'median_duration_us': np.float64(14.439), 'std_dev_duration_us': np.float64(0.7022503510540639), 'min_duration_us': np.float64(13.559), 'max_duration_us': np.float64(15.279)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x64x8_wt64x16x4_ws1x1_wr2x2_ta1x1x8x1_1x8x1x32_tb1x1x2x1_1x8x1x32_me', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(80.995), 'mean_duration_us': np.float64(26.998333333333335), 'median_duration_us': np.float64(26.958), 'std_dev_duration_us': np.float64(0.6697264781651949), 'min_duration_us': np.float64(26.199), 'max_duration_us': np.float64(27.838)}]","[{'name': 'batched_transpose_64x4_half', 'stream': 0, 'mean_duration_us': np.float64(4.83)}, {'name': 'batched_transpose_256x4_half', 'stream': 0, 'mean_duration_us': np.float64(5.64)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(7.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(14.43)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt256x64x8_wt64x16x4_ws1x1_wr2...', 'stream': 0, 'mean_duration_us': np.float64(27.0)}]","[[10, 3, 224, 224], [64, 3, 7, 7], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[150528, 50176, 224, 1], [147, 49, 7, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[3, 3]', '[1, 1]', 'False', '[0, 0]', '1']",59.167643229166664,58.955078125,1.2934403803036723,57.99365234375,60.55419921875,177.5029296875,3,5868 +aten::convolution,conv2d,"(10, 64, 56, 56)","(128, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,1.15605504,5.8828125,187.41035856573706,0.11636516154285974,0.1168414088399323,0.0037364627143583943,0.11241340826822802,0.11984066752041891,21.808036649307258,21.897290326017593,0.7002518170654148,21.067437151145203,22.45938247075899,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.15434449203720302), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.919)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.277), 'mean_duration_us': np.float64(3.759), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.09797958971132721), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.477), 'mean_duration_us': np.float64(7.492333333333334), 'median_duration_us': np.float64(7.439), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.399), 'max_duration_us': np.float64(7.639)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.357), 'mean_duration_us': np.float64(9.785666666666666), 'median_duration_us': np.float64(9.679), 'std_dev_duration_us': np.float64(0.20997354330698184), 'min_duration_us': np.float64(9.599), 'max_duration_us': np.float64(10.079)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(39.837), 'mean_duration_us': np.float64(13.279000000000002), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.2993325909419156), 'min_duration_us': np.float64(12.879), 'max_duration_us': np.float64(13.599)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(45.076), 'mean_duration_us': np.float64(15.025333333333334), 'median_duration_us': np.float64(15.719), 'std_dev_duration_us': np.float64(1.7995185158505285), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(16.799)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.76)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.03)}]","[[10, 64, 56, 56], [128, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",53.047200520833336,52.79443359375,1.7144715434542532,51.47314453125,54.8740234375,159.1416015625,3,869 aten::convolution,conv2d,"(10, 128, 28, 28)","(256, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,1.15605504,3.43359375,321.09215017064844,0.0745927716124512,0.0810293127616787,0.015942201878728298,0.056438571061172005,0.08631043101450292,23.95115342423007,26.01787626149738,5.118915879695417,18.12198213459066,27.71360187660217,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.997), 'mean_duration_us': np.float64(2.999), 'median_duration_us': np.float64(3.039), 'std_dev_duration_us': np.float64(0.768027777275449), 'min_duration_us': np.float64(2.039), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.879)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.917), 'mean_duration_us': np.float64(4.972333333333333), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.21746008573733433), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.917), 'mean_duration_us': np.float64(7.305666666666667), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(5.044054806293136), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(14.439)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.917), 'mean_duration_us': np.float64(14.972333333333333), 'median_duration_us': np.float64(12.399), 'std_dev_duration_us': np.float64(3.724417926185096), 'min_duration_us': np.float64(12.279), 'max_duration_us': np.float64(20.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(47.955), 'mean_duration_us': np.float64(15.985), 'median_duration_us': np.float64(17.158), 'std_dev_duration_us': np.float64(2.1576386784322046), 'min_duration_us': np.float64(12.959), 'max_duration_us': np.float64(17.838)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.0)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.31)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.98)}]","[[10, 128, 28, 28], [256, 128, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",49.980143229166664,44.43310546875,12.039248815535107,41.71435546875,63.79296875,149.9404296875,3,469 -aten::convolution,conv2d,"(10, 64, 56, 56)","(128, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,1.15605504,5.8828125,187.41035856573706,0.12525968614239344,0.12549164247541472,0.0044684306939032645,0.12067979488747087,0.12960762106429471,23.47496269377764,23.518433713320753,0.837430198570557,22.616643631500516,24.28981073651165,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.15434449203720302), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.477), 'mean_duration_us': np.float64(7.492333333333334), 'median_duration_us': np.float64(7.439), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.399), 'max_duration_us': np.float64(7.639)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.357), 'mean_duration_us': np.float64(9.785666666666666), 'median_duration_us': np.float64(9.679), 'std_dev_duration_us': np.float64(0.20997354330698184), 'min_duration_us': np.float64(9.599), 'max_duration_us': np.float64(10.079)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(39.837), 'mean_duration_us': np.float64(13.279000000000002), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.2993325909419156), 'min_duration_us': np.float64(12.879), 'max_duration_us': np.float64(13.599)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(45.076), 'mean_duration_us': np.float64(15.025333333333334), 'median_duration_us': np.float64(15.719), 'std_dev_duration_us': np.float64(1.7995185158505285), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(16.799)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.03)}]","[[10, 64, 56, 56], [128, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",49.288248697916664,49.1552734375,1.7642605215678475,47.59423828125,51.115234375,147.86474609375,3,869 -aten::convolution,conv2d,"(10, 64, 56, 56)","(128, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,1.15605504,5.8828125,187.41035856573706,0.14827363711599853,0.1473109953241059,0.0038905511072880117,0.14495477663419504,0.15255513938969462,27.788015497755264,27.607606454366305,0.7291295780351684,27.166026664830817,28.590413374068664,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.396999999999998), 'mean_duration_us': np.float64(4.4656666666666665), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.16759740119968727), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.639)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.997), 'mean_duration_us': np.float64(5.999), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.738286303995047), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(6.599)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.717), 'mean_duration_us': np.float64(6.905666666666666), 'median_duration_us': np.float64(7.359), 'std_dev_duration_us': np.float64(0.6411101482758033), 'min_duration_us': np.float64(5.999), 'max_duration_us': np.float64(7.359)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.476999999999997), 'mean_duration_us': np.float64(10.492333333333333), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.5309948733797298), 'min_duration_us': np.float64(9.919), 'max_duration_us': np.float64(11.199)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(41.277), 'mean_duration_us': np.float64(13.759), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.4537253207246281), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(14.399)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.47)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.49)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.76)}]","[[10, 64, 56, 56], [128, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",41.62158203125,41.87451171875,1.082452905348479,40.43505859375,42.55517578125,124.86474609375,3,6006 +aten::convolution,conv2d,"(10, 64, 56, 56)","(128, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(200704, 3136, 56, 1)","(576, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,1.15605504,5.8828125,187.41035856573706,0.13182544425605489,0.13070855903654346,0.0027346069259115715,0.12982605563719696,0.13494171809442426,24.705453776114833,24.496137916649424,0.5124936645214361,24.330747638142412,25.289475773552663,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.396999999999998), 'mean_duration_us': np.float64(4.4656666666666665), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.16759740119968727), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.639)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.556), 'mean_duration_us': np.float64(5.185333333333333), 'median_duration_us': np.float64(5.278), 'std_dev_duration_us': np.float64(0.16091474623400923), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(5.319)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.997), 'mean_duration_us': np.float64(5.999), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.738286303995047), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(6.599)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.717), 'mean_duration_us': np.float64(6.905666666666666), 'median_duration_us': np.float64(7.359), 'std_dev_duration_us': np.float64(0.6411101482758033), 'min_duration_us': np.float64(5.999), 'max_duration_us': np.float64(7.359)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.476999999999997), 'mean_duration_us': np.float64(10.492333333333333), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.5309948733797298), 'min_duration_us': np.float64(9.919), 'max_duration_us': np.float64(11.199)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(41.277), 'mean_duration_us': np.float64(13.759), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.4537253207246281), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(14.399)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.47)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(5.19)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.49)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.76)}]","[[10, 64, 56, 56], [128, 64, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[200704, 3136, 56, 1], [576, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",46.806803385416664,47.193359375,0.9608392846176006,45.712890625,47.51416015625,140.42041015625,3,6006 aten::convolution,conv2d,"(10, 256, 14, 14)","(512, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,1.15605504,3.685546875,299.14149443561206,0.09291021412141652,0.09185246843919367,0.001986041389297363,0.0916769175740166,0.09520125635103927,27.793300300613243,27.476884676500287,0.594107389205396,27.42437012834175,28.478646096997693,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.277), 'mean_duration_us': np.float64(4.425666666666666), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.18571184369578841), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.437000000000001), 'mean_duration_us': np.float64(4.479), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.639)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.517), 'mean_duration_us': np.float64(4.8389999999999995), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.2902872140943631), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(5.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.757), 'mean_duration_us': np.float64(5.5856666666666674), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.1643843734125062), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(5.799)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.477), 'mean_duration_us': np.float64(17.159), 'median_duration_us': np.float64(17.159), 'std_dev_duration_us': np.float64(0.4898979485566353), 'min_duration_us': np.float64(16.559), 'max_duration_us': np.float64(17.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.43)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.48)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.84)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.59)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(17.16)}]","[[10, 256, 14, 14], [512, 256, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",41.607259114583336,42.07373046875,0.8786485534396721,40.59375,42.154296875,124.82177734375,3,6264 aten::convolution,conv2d,"(10, 256, 14, 14)","(512, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(50176, 196, 14, 1)","(2304, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,True,1.15605504,3.685546875,299.14149443561206,0.09326654481051204,0.09418167985149223,0.003432223314842696,0.08946950835386946,0.09614844622617444,27.899893595462554,28.17364845923176,1.0267204116387927,26.764042435395993,28.761989891759907,python3,CPU,thread 639 (pt_autograd_0),matrix_bf16,"[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.357), 'mean_duration_us': np.float64(4.452333333333333), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.22939534045447024), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.916999999999998), 'mean_duration_us': np.float64(4.638999999999999), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.4079215610874227), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.557), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.27904599381941786), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.836), 'mean_duration_us': np.float64(5.611999999999999), 'median_duration_us': np.float64(5.478), 'std_dev_duration_us': np.float64(0.27792924759130083), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(5.999)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.397), 'mean_duration_us': np.float64(16.799), 'median_duration_us': np.float64(16.719), 'std_dev_duration_us': np.float64(0.851038581185758), 'min_duration_us': np.float64(15.799), 'max_duration_us': np.float64(17.879)}]","[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.61)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(16.8)}]","[[10, 256, 14, 14], [512, 256, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[50176, 196, 14, 1], [2304, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",41.473795572916664,41.033203125,1.5480063825290074,40.19384765625,43.1943359375,124.42138671875,3,66 aten::convolution,conv2d,"(10, 128, 28, 28)","(256, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(100352, 784, 28, 1)","(1152, 9, 3, 1)",False,"(2, 2)","(1, 1)","(1, 1)",False,"(0, 0)",1,False,1.15605504,3.43359375,321.09215017064844,0.08848329434037287,0.08834451298763539,0.0017454310118086836,0.08681139692481575,0.09029397310866744,28.41129123393269,28.36672963097863,0.560444196556177,27.87445809790671,28.99268597291274,python3,CPU,thread 542 (python3),matrix_bf16,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.917), 'mean_duration_us': np.float64(4.639), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4418144406874905), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(5.159)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.957), 'mean_duration_us': np.float64(4.652333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.30346151137976096), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.079)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.3785351884420904), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.997), 'mean_duration_us': np.float64(5.665666666666667), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.46341725858620714), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.877000000000002), 'mean_duration_us': np.float64(5.9590000000000005), 'median_duration_us': np.float64(5.839), 'std_dev_duration_us': np.float64(0.19866219234335095), 'min_duration_us': np.float64(5.799), 'max_duration_us': np.float64(6.239)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(14.759), 'std_dev_duration_us': np.float64(0.4607240678178929), 'min_duration_us': np.float64(14.319), 'max_duration_us': np.float64(15.439)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.95)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.67)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.96)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]","[[10, 128, 28, 28], [256, 128, 3, 3], [], [], [], [], [], [], []]","['c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar']","[[100352, 784, 28, 1], [1152, 9, 3, 1], [], [], [], [], [], [], []]","['', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1']",40.700520833333336,40.75390625,0.8011398380941223,39.8740234375,41.4736328125,122.1015625,3,6135 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/Normalization.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/Normalization.csv index 1beee7258..88e71125e 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/Normalization.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/Normalization.csv @@ -1,24 +1,24 @@ name,param: op_shape,param: dtype_in_out,param: stride_input,param: stride_output,param: num_channels,param: has_bias,param: is_affine,param: is_training,param: output_mask,is_recompute,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::native_batch_norm_backward,"(10, 64, 112, 112)","('c10::BFloat16', None)","(802816, 12544, 112, 1)",,64,True,True,True,[True],False,0.07225344,45.93798828125,1.4999840562919187,0.12067939344638634,0.12169049708883495,0.0017619546798114713,0.11864487584337362,0.12170280740695048,0.18101716609255902,0.18253380543549058,0.0026429039276261376,0.17796542212579466,0.18255227071639177,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(1197.6290000000001), 'mean_duration_us': np.float64(399.2096666666667), 'median_duration_us': np.float64(395.836), 'std_dev_duration_us': np.float64(4.799397207520504), 'min_duration_us': np.float64(395.796), 'max_duration_us': np.float64(405.997)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(1023.8620000000001), 'mean_duration_us': np.float64(85.32183333333334), 'median_duration_us': np.float64(85.6585), 'std_dev_duration_us': np.float64(1.298095709962182), 'min_duration_us': np.float64(82.959), 'max_duration_us': np.float64(87.318)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(441.06500000000005), 'mean_duration_us': np.float64(29.404333333333337), 'median_duration_us': np.float64(28.199), 'std_dev_duration_us': np.float64(3.0918341194543766), 'min_duration_us': np.float64(25.879), 'max_duration_us': np.float64(35.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(174.86399999999998), 'mean_duration_us': np.float64(11.657599999999999), 'median_duration_us': np.float64(11.159), 'std_dev_duration_us': np.float64(1.1193715975194891), 'min_duration_us': np.float64(10.679), 'max_duration_us': np.float64(14.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(113.78399999999999), 'mean_duration_us': np.float64(7.5855999999999995), 'median_duration_us': np.float64(7.319), 'std_dev_duration_us': np.float64(1.1215021949748174), 'min_duration_us': np.float64(6.479), 'max_duration_us': np.float64(10.679)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(1197.6290000000001), 'mean_duration_us': np.float64(399.2096666666667), 'median_duration_us': np.float64(395.836), 'std_dev_duration_us': np.float64(4.799397207520504), 'min_duration_us': np.float64(395.796), 'max_duration_us': np.float64(405.997)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(1023.8620000000001), 'mean_duration_us': np.float64(85.32183333333334), 'median_duration_us': np.float64(85.6585), 'std_dev_duration_us': np.float64(1.298095709962182), 'min_duration_us': np.float64(82.959), 'max_duration_us': np.float64(87.318)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(441.06500000000005), 'mean_duration_us': np.float64(29.404333333333337), 'median_duration_us': np.float64(28.199), 'std_dev_duration_us': np.float64(3.0918341194543766), 'min_duration_us': np.float64(25.879), 'max_duration_us': np.float64(35.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(174.86399999999998), 'mean_duration_us': np.float64(11.657599999999999), 'median_duration_us': np.float64(11.159), 'std_dev_duration_us': np.float64(1.1193715975194891), 'min_duration_us': np.float64(10.679), 'max_duration_us': np.float64(14.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(113.78399999999999), 'mean_duration_us': np.float64(7.5855999999999995), 'median_duration_us': np.float64(7.319), 'std_dev_duration_us': np.float64(1.1215021949748174), 'min_duration_us': np.float64(6.479), 'max_duration_us': np.float64(10.679)}]","[{'name': 'void at::native::batch_norm_backward_kernel Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(274.09899999999993), 'mean_duration_us': np.float64(4.568316666666665), 'median_duration_us': np.float64(4.4190000000000005), 'std_dev_duration_us': np.float64(0.43588976020956904), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.57)}]","[[256], [256], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1], [1], []]","['', '', 'False']",4.5683349609375,4.4189453125,0.4395425185034987,4.0390625,5.47900390625,274.10009765625,60,1741 aten::copy_,"(64,)","('c10::BFloat16', 'c10::BFloat16')","(1,)","(1,)",False,6.4e-08,0.000244140625,0.25,5.932401329837431e-05,5.873059258429484e-05,1.9516611026549833e-05,4.0513716096128585e-05,0.00016419918571875978,1.4831003324593577e-05,1.468264814607371e-05,4.879152756637458e-06,1.0128429024032146e-05,4.1049796429689945e-05,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(272.898), 'mean_duration_us': np.float64(4.5483), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.8070267715509815), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(6.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.55)}]","[[64], [64], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1], [1], []]","['', '', 'False']",4.5482666015625,4.35888671875,0.8138025619177839,1.55908203125,6.31884765625,272.89599609375,60,1801 aten::copy_,"(512,)","('c10::BFloat16', 'c10::BFloat16')","(1,)","(1,)",False,5.12e-07,0.001953125,0.25,0.0005745607509502952,0.0004786379093917608,0.00040864354519158137,0.00033912548512289776,0.0025637555012224937,0.0001436401877375738,0.0001196594773479402,0.00010216088629789534,8.478137128072444e-05,0.0006409388753056234,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(253.97700000000003), 'mean_duration_us': np.float64(4.232950000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(1.0400542201411103), 'min_duration_us': np.float64(0.799), 'max_duration_us': np.float64(6.039)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.23)}]","[[512], [512], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1], [1], []]","['', '', 'False']",4.232999674479166,4.27880859375,1.048844740315332,0.798828125,6.0390625,253.97998046875,60,1654 -aten::copy_,(),"('long int', None)",(),,False,1e-09,1.52587890625e-05,0.0625,4.9558273088948645e-06,3.5255742019139313e-06,2.8003635564774575e-06,2.8781730346947737e-06,1.1119104173736003e-05,3.0973920680592903e-07,2.203483876196207e-07,1.750227222798411e-07,1.7988581466842336e-07,6.949440108585002e-07,python3,CPU,thread 542 (python3),,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(238.17999999999998), 'mean_duration_us': np.float64(3.9696666666666665), 'median_duration_us': np.float64(4.539), 'std_dev_duration_us': np.float64(1.3463009404372495), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.97)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', 'True']",3.9697509765625,4.5390625,1.3576512794071245,1.43896484375,5.55908203125,238.18505859375,60,5847 -aten::clamp_min_,"(10, 64, 56, 56)","('c10::BFloat16', None)","(200704, 3136, 56, 1)",,False,0.00200704,7.65625,0.24999999999999997,1.1135704722370185,1.1231365867000933,0.12752058629825047,0.8541571863473427,1.3119750781998085,0.27839261805925464,0.2807841466750233,0.03188014657456262,0.21353929658683568,0.32799376954995213,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(87.62700000000002), 'mean_duration_us': np.float64(7.302250000000002), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.8555424327096035), 'min_duration_us': np.float64(6.119), 'max_duration_us': np.float64(9.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.3)}]","[[10, 64, 56, 56], []]","['c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], []]","['', '0']",7.302205403645833,7.158935546875,0.893610122762632,6.119140625,9.39892578125,87.62646484375,12,5922 -aten::clamp_min_,"(10, 64, 56, 56)","('c10::BFloat16', None)","(200704, 3136, 56, 1)",,True,0.00200704,7.65625,0.24999999999999997,1.4416669297588818,1.384649376629823,0.15519152239405698,1.2625103033095293,1.8085657991420083,0.36041673243972044,0.3461623441574557,0.038797880598514245,0.3156275758273823,0.4521414497855021,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.46600000000001), 'mean_duration_us': np.float64(5.622166666666668), 'median_duration_us': np.float64(5.7989999999999995), 'std_dev_duration_us': np.float64(0.5222931541662104), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.62)}]","[[10, 64, 56, 56], []]","['c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], []]","['', '0']",5.6221923828125,5.799072265625,0.5455056274040518,4.43896484375,6.35888671875,67.46630859375,12,1297 -aten::clamp_min_,"(10, 128, 28, 28)","('c10::BFloat16', None)","(100352, 784, 28, 1)",,False,0.00100352,3.828125,0.24999999999999997,0.7276497399843521,0.7018557022112183,0.06460940177098536,0.6312551516547646,0.8295495297679111,0.18191243499608803,0.17546392555280457,0.01615235044274634,0.15781378791369116,0.20738738244197777,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(66.66699999999999), 'mean_duration_us': np.float64(5.555583333333332), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.46067531196663397), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.56)}]","[[10, 128, 28, 28], []]","['c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], []]","['', '0']",5.5555419921875,5.71923828125,0.48117926954934276,4.8388671875,6.35888671875,66.66650390625,12,6029 -aten::clamp_min_,"(10, 256, 14, 14)","('c10::BFloat16', None)","(50176, 196, 14, 1)",,False,0.00050176,1.9140625,0.24999999999999997,0.3690627712191356,0.3731781436255698,0.023393149398912485,0.3237569250157529,0.4080224260472503,0.0922656928047839,0.09329453590639245,0.005848287349728121,0.08093923125393823,0.10200560651181258,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(65.508), 'mean_duration_us': np.float64(5.459), 'median_duration_us': np.float64(5.379), 'std_dev_duration_us': np.float64(0.3438992100407715), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.46)}]","[[10, 256, 14, 14], []]","['c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], []]","['', '0']",5.459025065104167,5.37890625,0.3592526349408488,4.9189453125,6.19921875,65.50830078125,12,6158 -aten::clamp_min_,"(10, 512, 7, 7)","('c10::BFloat16', None)","(25088, 49, 7, 1)",,True,0.00025088,0.95703125,0.24999999999999997,0.1903412584785916,0.1901381946114128,0.018326339750038282,0.15982649972781707,0.22016164542046063,0.0475853146196479,0.0475345486528532,0.0045815849375095705,0.03995662493195427,0.05504041135511516,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(63.826), 'mean_duration_us': np.float64(5.318833333333333), 'median_duration_us': np.float64(5.279), 'std_dev_duration_us': np.float64(0.5084422014567852), 'min_duration_us': np.float64(4.558), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], []]","['', '0']",5.318806966145833,5.279052734375,0.5309911273970868,4.55810546875,6.27880859375,63.82568359375,12,94 -aten::clamp_min_,"(10, 512, 7, 7)","('c10::BFloat16', None)","(25088, 49, 7, 1)",,False,0.00025088,0.95703125,0.24999999999999997,0.1988810296057187,0.19994568134825264,0.012983218725457043,0.1767009681024847,0.22011448645175108,0.04972025740142968,0.04998642033706316,0.0032458046813642607,0.044175242025621175,0.05502862161293777,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(60.788000000000004), 'mean_duration_us': np.float64(5.065666666666667), 'median_duration_us': np.float64(5.019), 'std_dev_duration_us': np.float64(0.3188869531493706), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.07)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], []]","['', '0']",5.065714518229167,5.01904296875,0.33309153344527864,4.55908203125,5.67919921875,60.78857421875,12,6287 +aten::copy_,(),"('long int', None)",(),None,False,1e-09,1.52587890625e-05,0.0625,4.9558273088948645e-06,3.5255742019139313e-06,2.8003635564774575e-06,2.8781730346947737e-06,1.1119104173736003e-05,3.0973920680592903e-07,2.203483876196207e-07,1.750227222798411e-07,1.7988581466842336e-07,6.949440108585002e-07,python3,CPU,thread 542 (python3),,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(238.17999999999998), 'mean_duration_us': np.float64(3.9696666666666665), 'median_duration_us': np.float64(4.539), 'std_dev_duration_us': np.float64(1.3463009404372495), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.97)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', 'True']",3.9697509765625,4.5390625,1.3576512794071245,1.43896484375,5.55908203125,238.18505859375,60,5847 +aten::clamp_min_,"(10, 64, 56, 56)","('c10::BFloat16', None)","(200704, 3136, 56, 1)",None,False,0.00200704,7.65625,0.24999999999999997,1.1135704722370185,1.1231365867000933,0.12752058629825047,0.8541571863473427,1.3119750781998085,0.27839261805925464,0.2807841466750233,0.03188014657456262,0.21353929658683568,0.32799376954995213,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(87.62700000000002), 'mean_duration_us': np.float64(7.302250000000002), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.8555424327096035), 'min_duration_us': np.float64(6.119), 'max_duration_us': np.float64(9.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.3)}]","[[10, 64, 56, 56], []]","['c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], []]","['', '0']",7.302205403645833,7.158935546875,0.893610122762632,6.119140625,9.39892578125,87.62646484375,12,5922 +aten::clamp_min_,"(10, 64, 56, 56)","('c10::BFloat16', None)","(200704, 3136, 56, 1)",None,True,0.00200704,7.65625,0.24999999999999997,1.4416669297588818,1.384649376629823,0.15519152239405698,1.2625103033095293,1.8085657991420083,0.36041673243972044,0.3461623441574557,0.038797880598514245,0.3156275758273823,0.4521414497855021,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.46600000000001), 'mean_duration_us': np.float64(5.622166666666668), 'median_duration_us': np.float64(5.7989999999999995), 'std_dev_duration_us': np.float64(0.5222931541662104), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.62)}]","[[10, 64, 56, 56], []]","['c10::BFloat16', 'Scalar']","[[200704, 3136, 56, 1], []]","['', '0']",5.6221923828125,5.799072265625,0.5455056274040518,4.43896484375,6.35888671875,67.46630859375,12,1297 +aten::clamp_min_,"(10, 128, 28, 28)","('c10::BFloat16', None)","(100352, 784, 28, 1)",None,False,0.00100352,3.828125,0.24999999999999997,0.7276497399843521,0.7018557022112183,0.06460940177098536,0.6312551516547646,0.8295495297679111,0.18191243499608803,0.17546392555280457,0.01615235044274634,0.15781378791369116,0.20738738244197777,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(66.66699999999999), 'mean_duration_us': np.float64(5.555583333333332), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.46067531196663397), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.56)}]","[[10, 128, 28, 28], []]","['c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], []]","['', '0']",5.5555419921875,5.71923828125,0.48117926954934276,4.8388671875,6.35888671875,66.66650390625,12,6029 +aten::clamp_min_,"(10, 256, 14, 14)","('c10::BFloat16', None)","(50176, 196, 14, 1)",None,False,0.00050176,1.9140625,0.24999999999999997,0.3690627712191356,0.3731781436255698,0.023393149398912485,0.3237569250157529,0.4080224260472503,0.0922656928047839,0.09329453590639245,0.005848287349728121,0.08093923125393823,0.10200560651181258,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(65.508), 'mean_duration_us': np.float64(5.459), 'median_duration_us': np.float64(5.379), 'std_dev_duration_us': np.float64(0.3438992100407715), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.46)}]","[[10, 256, 14, 14], []]","['c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], []]","['', '0']",5.459025065104167,5.37890625,0.3592526349408488,4.9189453125,6.19921875,65.50830078125,12,6158 +aten::clamp_min_,"(10, 512, 7, 7)","('c10::BFloat16', None)","(25088, 49, 7, 1)",None,True,0.00025088,0.95703125,0.24999999999999997,0.1903412584785916,0.1901381946114128,0.018326339750038282,0.15982649972781707,0.22016164542046063,0.0475853146196479,0.0475345486528532,0.0045815849375095705,0.03995662493195427,0.05504041135511516,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(63.826), 'mean_duration_us': np.float64(5.318833333333333), 'median_duration_us': np.float64(5.279), 'std_dev_duration_us': np.float64(0.5084422014567852), 'min_duration_us': np.float64(4.558), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], []]","['', '0']",5.318806966145833,5.279052734375,0.5309911273970868,4.55810546875,6.27880859375,63.82568359375,12,94 +aten::clamp_min_,"(10, 512, 7, 7)","('c10::BFloat16', None)","(25088, 49, 7, 1)",None,False,0.00025088,0.95703125,0.24999999999999997,0.1988810296057187,0.19994568134825264,0.012983218725457043,0.1767009681024847,0.22011448645175108,0.04972025740142968,0.04998642033706316,0.0032458046813642607,0.044175242025621175,0.05502862161293777,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(60.788000000000004), 'mean_duration_us': np.float64(5.065666666666667), 'median_duration_us': np.float64(5.019), 'std_dev_duration_us': np.float64(0.3188869531493706), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.07)}]","[[10, 512, 7, 7], []]","['c10::BFloat16', 'Scalar']","[[25088, 49, 7, 1], []]","['', '0']",5.065714518229167,5.01904296875,0.33309153344527864,4.55908203125,5.67919921875,60.78857421875,12,6287 aten::copy_,"(64, 64, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(576, 9, 3, 1)","(576, 9, 3, 1)",False,3.6864e-05,0.140625,0.25,0.03143695960242978,0.031953819823427855,0.0032985443652827815,0.02671767566132885,0.03579775817923186,0.007859239900607445,0.007988454955856964,0.0008246360913206954,0.006679418915332212,0.008949439544807964,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(56.868), 'mean_duration_us': np.float64(4.739), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.4831838849409888), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.519)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","[[64, 64, 3, 3], [64, 64, 3, 3], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[576, 9, 3, 1], [576, 9, 3, 1], []]","['', '', 'False']",4.738972981770833,4.618896484375,0.5046606226144523,4.119140625,5.51904296875,56.86767578125,12,1805 -aten::clamp_min_,"(10, 128, 28, 28)","('c10::BFloat16', None)","(100352, 784, 28, 1)",,True,0.00100352,3.828125,0.24999999999999997,0.9298180230887522,0.8805258591489127,0.1745056838628018,0.7490511015945329,1.3036530034887408,0.23245450577218804,0.22013146478722817,0.04362642096570045,0.18726277539863323,0.3259132508721852,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(53.348), 'mean_duration_us': np.float64(4.445666666666667), 'median_duration_us': np.float64(4.559), 'std_dev_duration_us': np.float64(0.725687413575723), 'min_duration_us': np.float64(3.079), 'max_duration_us': np.float64(5.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]","[[10, 128, 28, 28], []]","['c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], []]","['', '0']",4.4456787109375,4.55908203125,0.7578874066557242,3.0791015625,5.35888671875,53.34814453125,12,897 -aten::clamp_min_,"(10, 64, 112, 112)","('c10::BFloat16', None)","(802816, 12544, 112, 1)",,False,0.00802816,30.625,0.24999999999999997,1.8607984413183,1.884648289775332,0.04921750919684054,1.804199679578624,1.8935473546009443,0.465199610329575,0.471162072443833,0.012304377299210136,0.451049919894656,0.47338683865023606,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.797), 'mean_duration_us': np.float64(17.265666666666664), 'median_duration_us': np.float64(17.039), 'std_dev_duration_us': np.float64(0.37853518844208994), 'min_duration_us': np.float64(16.959), 'max_duration_us': np.float64(17.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(17.27)}]","[[10, 64, 112, 112], []]","['c10::BFloat16', 'Scalar']","[[802816, 12544, 112, 1], []]","['', '0']",17.265625,17.0390625,0.4635000603108948,16.958984375,17.798828125,51.796875,3,5891 +aten::clamp_min_,"(10, 128, 28, 28)","('c10::BFloat16', None)","(100352, 784, 28, 1)",None,True,0.00100352,3.828125,0.24999999999999997,0.9298180230887522,0.8805258591489127,0.1745056838628018,0.7490511015945329,1.3036530034887408,0.23245450577218804,0.22013146478722817,0.04362642096570045,0.18726277539863323,0.3259132508721852,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(53.348), 'mean_duration_us': np.float64(4.445666666666667), 'median_duration_us': np.float64(4.559), 'std_dev_duration_us': np.float64(0.725687413575723), 'min_duration_us': np.float64(3.079), 'max_duration_us': np.float64(5.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]","[[10, 128, 28, 28], []]","['c10::BFloat16', 'Scalar']","[[100352, 784, 28, 1], []]","['', '0']",4.4456787109375,4.55908203125,0.7578874066557242,3.0791015625,5.35888671875,53.34814453125,12,897 +aten::clamp_min_,"(10, 64, 112, 112)","('c10::BFloat16', None)","(802816, 12544, 112, 1)",None,False,0.00802816,30.625,0.24999999999999997,1.8607984413183,1.884648289775332,0.04921750919684054,1.804199679578624,1.8935473546009443,0.465199610329575,0.471162072443833,0.012304377299210136,0.451049919894656,0.47338683865023606,python3,CPU,thread 542 (python3),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.797), 'mean_duration_us': np.float64(17.265666666666664), 'median_duration_us': np.float64(17.039), 'std_dev_duration_us': np.float64(0.37853518844208994), 'min_duration_us': np.float64(16.959), 'max_duration_us': np.float64(17.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(17.27)}]","[[10, 64, 112, 112], []]","['c10::BFloat16', 'Scalar']","[[802816, 12544, 112, 1], []]","['', '0']",17.265625,17.0390625,0.4635000603108948,16.958984375,17.798828125,51.796875,3,5891 aten::copy_,"(512, 512, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(4608, 9, 3, 1)","(4608, 9, 3, 1)",False,0.002359296,9.0,0.25,1.8616538552030524,1.9502878740665992,0.2435625724804497,1.503021450501594,2.165044565027445,0.4654134638007631,0.4875719685166498,0.06089064312011243,0.3757553626253985,0.5412611412568612,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(46.35100000000001), 'mean_duration_us': np.float64(5.150111111111112), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.6577477470622245), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(6.279)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.15)}]","[[512, 512, 3, 3], [512, 512, 3, 3], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[4608, 9, 3, 1], [4608, 9, 3, 1], []]","['', '', 'False']",5.150119357638889,4.8388671875,0.6976119225404901,4.35888671875,6.27880859375,46.35107421875,9,1658 -aten::clamp_min_,"(10, 256, 14, 14)","('c10::BFloat16', None)","(50176, 196, 14, 1)",,True,0.00050176,1.9140625,0.24999999999999997,0.5587514956047688,0.5570036566177266,0.10057935081336584,0.43639642424885866,0.6782867854785478,0.1396878739011922,0.13925091415443164,0.02514483770334146,0.10909910606221467,0.16957169636963695,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(44.428000000000004), 'mean_duration_us': np.float64(3.7023333333333337), 'median_duration_us': np.float64(3.6390000000000002), 'std_dev_duration_us': np.float64(0.6417597335105681), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(4.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.7)}]","[[10, 256, 14, 14], []]","['c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], []]","['', '0']",3.7023111979166665,3.638916015625,0.6702554335583752,2.958984375,4.59912109375,44.427734375,12,497 +aten::clamp_min_,"(10, 256, 14, 14)","('c10::BFloat16', None)","(50176, 196, 14, 1)",None,True,0.00050176,1.9140625,0.24999999999999997,0.5587514956047688,0.5570036566177266,0.10057935081336584,0.43639642424885866,0.6782867854785478,0.1396878739011922,0.13925091415443164,0.02514483770334146,0.10909910606221467,0.16957169636963695,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(44.428000000000004), 'mean_duration_us': np.float64(3.7023333333333337), 'median_duration_us': np.float64(3.6390000000000002), 'std_dev_duration_us': np.float64(0.6417597335105681), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(4.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.7)}]","[[10, 256, 14, 14], []]","['c10::BFloat16', 'Scalar']","[[50176, 196, 14, 1], []]","['', '0']",3.7023111979166665,3.638916015625,0.6702554335583752,2.958984375,4.59912109375,44.427734375,12,497 aten::copy_,"(128, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(1152, 9, 3, 1)","(1152, 9, 3, 1)",False,0.000147456,0.5625,0.25,0.12328301444114621,0.12394413626103017,0.011430523082899711,0.10765168452009624,0.13914981591982492,0.030820753610286553,0.03098603406525754,0.0028576307707249278,0.02691292113002406,0.03478745397995623,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.391), 'mean_duration_us': np.float64(4.821222222222222), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.4225262063608935), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.82)}]","[[128, 128, 3, 3], [128, 128, 3, 3], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1152, 9, 3, 1], [1152, 9, 3, 1], []]","['', '', 'False']",4.821180555555555,4.7587890625,0.44821790427644176,4.23876953125,5.47900390625,43.390625,9,1775 aten::copy_,"(256, 256, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(2304, 9, 3, 1)","(2304, 9, 3, 1)",False,0.000589824,2.25,0.25,0.5064330496442352,0.5267456893055706,0.04900106631659805,0.41837719352324876,0.5462790512153759,0.1266082624110588,0.13168642232639266,0.012250266579149512,0.10459429838081219,0.13656976280384397,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(42.311), 'mean_duration_us': np.float64(4.701222222222222), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.46689941285933856), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.639)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.7)}]","[[256, 256, 3, 3], [256, 256, 3, 3], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[2304, 9, 3, 1], [2304, 9, 3, 1], []]","['', '', 'False']",4.701171875,4.47900390625,0.4952850959970768,4.31884765625,5.63916015625,42.310546875,9,1745 aten::copy_,"(256, 128, 3, 3)","('c10::BFloat16', 'c10::BFloat16')","(1152, 9, 3, 1)","(1152, 9, 3, 1)",False,0.000294912,1.125,0.25,0.23812062089248345,0.23410068837209302,0.023501540945279162,0.21688832965257204,0.2633728446527853,0.05953015522312086,0.058525172093023256,0.0058753852363197905,0.05422208241314301,0.06584321116319633,python3,CPU,thread 639 (pt_autograd_0),vector_bf16,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.957), 'mean_duration_us': np.float64(4.985666666666667), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.3937286149395573), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(5.439)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.99)}]","[[256, 128, 3, 3], [256, 128, 3, 3], []]","['c10::BFloat16', 'c10::BFloat16', 'Scalar']","[[1152, 9, 3, 1], [1152, 9, 3, 1], []]","['', '', 'False']",4.985677083333333,5.0390625,0.4822019830070951,4.47900390625,5.43896484375,14.95703125,3,1769 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/gpu_timeline.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/gpu_timeline.csv index 977e3c16c..888d5ccc0 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/gpu_timeline.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/gpu_timeline.csv @@ -1,17 +1,17 @@ type,time ms,percent,is_recompute -computation_time,15.11189404296875,26.738384562518462,False -exposed_comm_time,38.3431845703125,67.84290648660685,False +computation_time,15.35199609375,27.16321158617176,False +exposed_comm_time,38.236294921875,67.65378019194466,False exposed_memcpy_time,1.5836318359375,2.802015214925736,False -busy_time,55.03871044921875,97.38330626405104,False -idle_time,1.478892578125,2.6166937359489535,False +busy_time,55.1719228515625,97.61900699304216,False +idle_time,1.34568017578125,2.380993006957845,False total_time,56.51760302734375,100.0,False total_comm_time,47.20031005859375,83.5143522200646,False total_memcpy_time,1.63343310546875,2.8901316014383687,False -computation_time,4.12223779296875,9.867892037163763,True +computation_time,4.20997314453125,10.077914607559405,True exposed_comm_time,0.0,0.0,True exposed_memcpy_time,0.0,0.0,True -busy_time,4.12223779296875,9.867892037163763,True -idle_time,37.65201123046875,90.13210796283624,True +busy_time,4.20997314453125,10.077914607559405,True +idle_time,37.56427587890625,89.9220853924406,True total_time,41.7742490234375,100.0,True total_comm_time,0.0,0.0,True total_memcpy_time,0.0,0.0,True diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary.csv index 810a0a47b..0ecf1a3ee 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary.csv @@ -1,26 +1,26 @@ name,is_recompute,total_direct_kernel_time_sum,total_subtree_kernel_time_sum,total_direct_kernel_time_ms,total_subtree_kernel_time_ms,Count,Categories,Percentage (%),Cumulative Percentage (%) -aten::convolution_backward,False,5312.84423828125,5312.84423828125,5.31284423828125,5.31284423828125,60,['CONV_bwd'],25.459818877761315,25.459818877761315 -aten::native_batch_norm_backward,False,2951.205078125,2951.205078125,2.951205078125,2.951205078125,60,['NORM_bwd'],14.142546513748243,39.60236539150956 -aten::miopen_convolution,False,2515.88037109375,2515.88037109375,2.51588037109375,2.51588037109375,60,['CONV_fwd'],12.05641567743077,51.65878106894033 -aten::miopen_convolution,True,2228.34521484375,2228.34521484375,2.22834521484375,2.22834521484375,57,['CONV_fwd'],10.678510986311485,62.337292055251815 -aten::native_batch_norm,False,2145.6875,2145.6875,2.1456875,2.1456875,60,['NORM_fwd'],10.282404803937819,72.61969685918963 -aten::copy_,False,1633.43310546875,1633.43310546875,1.63343310546875,1.63343310546875,366,['elementwise'],7.827617213868724,80.44731407305835 -aten::native_batch_norm,True,1368.7841796875,1368.7841796875,1.3687841796875,1.3687841796875,57,['NORM_fwd'],6.559386222258756,87.0067002953171 -aten::add_,False,517.0107421875,517.0107421875,0.5170107421875,0.5170107421875,108,['elementwise'],2.477580607220859,89.48428090253796 -aten::mul,False,460.46533203125,460.46533203125,0.46046533203125,0.46046533203125,186,['elementwise'],2.206607878418897,91.69088878095685 -aten::clamp_min_,False,332.38671875,332.38671875,0.33238671875,0.33238671875,51,['elementwise'],1.5928390288148335,93.28372780977169 -aten::add_,True,296.04052734375,296.04052734375,0.29604052734375,0.29604052734375,81,['elementwise'],1.4186635008684445,94.70239131064014 -aten::threshold_backward,False,239.38916015625,239.38916015625,0.23938916015625,0.23938916015625,51,['elementwise'],1.1471830126247484,95.84957432326489 -aten::clamp_min_,True,229.06787109375,229.06787109375,0.22906787109375,0.22906787109375,48,['elementwise'],1.097722095208265,96.94729641847316 -aten::max_pool2d_with_indices_backward,False,156.23583984375,246.15283203125,0.15623583984375,0.24615283203125,3,['other'],0.748701826410712,97.69599824488387 -aten::fill_,False,118.10986328125,118.10986328125,0.11810986328125,0.11810986328125,9,['elementwise'],0.5659973437863455,98.26199558867022 -aten::_foreach_add_,False,90.75634765625,90.75634765625,0.09075634765625,0.09075634765625,3,['multi_tensor_apply'],0.43491585104003994,98.69691143971026 -aten::max_pool2d_with_indices,False,70.755859375,70.755859375,0.070755859375,0.070755859375,3,['other'],0.33907099162587684,99.03598243133614 -aten::mm,False,44.474609375,44.474609375,0.044474609375,0.044474609375,6,['GEMM'],0.21312793083371087,99.24911036216984 -aten::mean,False,40.2744140625,40.2744140625,0.0402744140625,0.0402744140625,6,['reduce'],0.1930000657747369,99.44211042794458 -aten::sum,False,23.95703125,23.95703125,0.02395703125,0.02395703125,3,['reduce'],0.11480511174767455,99.55691553969226 -aten::mse_loss_backward,False,21.35693359375,21.35693359375,0.02135693359375,0.02135693359375,3,['elementwise'],0.10234511623046505,99.65926065592272 -aten::mse_loss,False,19.5966796875,37.7939453125,0.0195966796875,0.0377939453125,3,['elementwise'],0.09390975776294576,99.75317041368567 -aten::div,False,17.71630859375,17.71630859375,0.01771630859375,0.01771630859375,3,['elementwise'],0.0848987826011103,99.83806919628678 -aten::cat,False,17.1943359375,17.1943359375,0.0171943359375,0.0171943359375,6,['other'],0.0823974238766226,99.92046662016341 -aten::addmm,False,16.5966796875,16.5966796875,0.0165966796875,0.0165966796875,3,['GEMM'],0.07953337983661052,100.00000000000001 +aten::convolution_backward,False,5436.97119140625,5436.97119140625,5.43697119140625,5.43697119140625,60,['CONV_bwd'],25.651653614442843,25.651653614442843 +aten::native_batch_norm_backward,False,2951.205078125,2951.205078125,2.951205078125,2.951205078125,60,['NORM_bwd'],13.923798332590925,39.57545194703377 +aten::miopen_convolution,False,2631.85546875,2631.85546875,2.63185546875,2.63185546875,60,['CONV_fwd'],12.417105493286705,51.992557440320475 +aten::miopen_convolution,True,2316.08056640625,2316.08056640625,2.31608056640625,2.31608056640625,57,['CONV_fwd'],10.927278137228685,62.91983557754916 +aten::native_batch_norm,False,2145.6875,2145.6875,2.1456875,2.1456875,60,['NORM_fwd'],10.123362912394587,73.04319848994375 +aten::copy_,False,1633.43310546875,1633.43310546875,1.63343310546875,1.63343310546875,366,['elementwise'],7.706544461754033,80.74974295169778 +aten::native_batch_norm,True,1368.7841796875,1368.7841796875,1.3687841796875,1.3687841796875,57,['NORM_fwd'],6.457929684411585,87.20767263610936 +aten::add_,False,517.0107421875,517.0107421875,0.5170107421875,0.5170107421875,108,['elementwise'],2.4392589194701166,89.64693155557949 +aten::mul,False,460.46533203125,460.46533203125,0.46046533203125,0.46046533203125,186,['elementwise'],2.172477429601755,91.81940898518124 +aten::clamp_min_,False,332.38671875,332.38671875,0.33238671875,0.33238671875,51,['elementwise'],1.568201977765299,93.38761096294654 +aten::add_,True,296.04052734375,296.04052734375,0.29604052734375,0.29604052734375,81,['elementwise'],1.3967204893897431,94.78433145233629 +aten::threshold_backward,False,239.38916015625,239.38916015625,0.23938916015625,0.23938916015625,51,['elementwise'],1.1294390937893188,95.9137705461256 +aten::clamp_min_,True,229.06787109375,229.06787109375,0.22906787109375,0.22906787109375,48,['elementwise'],1.0807432073177723,96.99451375344337 +aten::max_pool2d_with_indices_backward,False,156.23583984375,246.15283203125,0.15623583984375,0.24615283203125,3,['other'],0.7371213686340807,97.73163512207745 +aten::fill_,False,118.10986328125,118.10986328125,0.11810986328125,0.11810986328125,9,['elementwise'],0.5572428461877144,98.28887796826517 +aten::_foreach_add_,False,90.75634765625,90.75634765625,0.09075634765625,0.09075634765625,3,['multi_tensor_apply'],0.42818884107199695,98.71706680933717 +aten::max_pool2d_with_indices,False,70.755859375,70.755859375,0.070755859375,0.070755859375,3,['other'],0.3338264507909384,99.0508932601281 +aten::mm,False,44.474609375,44.474609375,0.044474609375,0.044474609375,6,['GEMM'],0.20983139953516602,99.26072465966327 +aten::mean,False,40.2744140625,40.2744140625,0.0402744140625,0.0402744140625,6,['reduce'],0.19001485987066405,99.45073951953393 +aten::sum,False,23.95703125,23.95703125,0.02395703125,0.02395703125,3,['reduce'],0.11302937713312312,99.56376889666704 +aten::mse_loss_backward,False,21.35693359375,21.35693359375,0.02135693359375,0.02135693359375,3,['elementwise'],0.10076210513667193,99.66453100180371 +aten::mse_loss,False,19.5966796875,37.7939453125,0.0195966796875,0.0377939453125,3,['elementwise'],0.09245721958790076,99.75698822139161 +aten::div,False,17.71630859375,17.71630859375,0.01771630859375,0.01771630859375,3,['elementwise'],0.08358562062858932,99.84057384202019 +aten::cat,False,17.1943359375,17.1943359375,0.0171943359375,0.0171943359375,6,['other'],0.08112295137709517,99.92169679339729 +aten::addmm,False,16.5966796875,16.5966796875,0.0165966796875,0.0165966796875,3,['GEMM'],0.07830320660269964,99.99999999999999 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary_by_category.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary_by_category.csv index cfc782da5..b256e2567 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary_by_category.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_summary_by_category.csv @@ -1,13 +1,13 @@ op category,is_recompute,Count,total_direct_kernel_time_ms,Percentage (%),Cumulative Percentage (%) -CONV_bwd,False,60,5.31284423828125,25.459818877761315,25.459818877761315 -elementwise,False,780,3.35946484375,16.098978741328924,41.55879761909024 -NORM_bwd,False,60,2.951205078125,14.142546513748242,55.701344132838486 -CONV_fwd,False,60,2.51588037109375,12.056415677430769,67.75775981026925 -CONV_fwd,True,57,2.22834521484375,10.678510986311483,78.43627079658073 -NORM_fwd,False,60,2.1456875,10.282404803937819,88.71867560051855 -NORM_fwd,True,57,1.3687841796875,6.559386222258756,95.2780618227773 -elementwise,True,129,0.5251083984375,2.516385596076709,97.794447418854 -other,False,12,0.24418603515625,1.1701702419132114,98.96461766076722 -multi_tensor_apply,False,3,0.09075634765625,0.4349158510400399,99.39953351180726 -reduce,False,9,0.0642314453125,0.30780517752241143,99.70733868932967 -GEMM,False,9,0.0610712890625,0.2926613106703213,100.0 +CONV_bwd,False,60,5.43697119140625,25.651653614442843,25.651653614442843 +elementwise,False,780,3.35946484375,15.849969673921397,41.50162328836424 +NORM_bwd,False,60,2.951205078125,13.923798332590923,55.42542162095516 +CONV_fwd,False,60,2.63185546875,12.417105493286703,67.84252711424186 +CONV_fwd,True,57,2.31608056640625,10.927278137228685,78.76980525147054 +NORM_fwd,False,60,2.1456875,10.123362912394585,88.89316816386513 +NORM_fwd,True,57,1.3687841796875,6.457929684411584,95.35109784827671 +elementwise,True,129,0.5251083984375,2.477463696707515,97.82856154498423 +other,False,12,0.24418603515625,1.152070770802114,98.98063231578634 +multi_tensor_apply,False,3,0.09075634765625,0.42818884107199695,99.40882115685834 +reduce,False,9,0.0642314453125,0.3030442370037871,99.71186539386213 +GEMM,False,9,0.0610712890625,0.2881346061378656,99.99999999999999 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_unique_args.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_unique_args.csv index 4790dbdc0..bae0fe715 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_unique_args.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/ops_unique_args.csv @@ -1,131 +1,131 @@ name,op category,process_name,process_label,thread_name,Input Dims,Input type,Input Strides,Concrete Inputs,is_recompute,operation_count,total_direct_kernel_time_mean,total_subtree_kernel_time_mean,total_direct_kernel_time_median,total_subtree_kernel_time_median,total_direct_kernel_time_std,total_subtree_kernel_time_std,total_direct_kernel_time_min,total_subtree_kernel_time_min,total_direct_kernel_time_max,total_subtree_kernel_time_max,total_direct_kernel_time_sum,total_subtree_kernel_time_sum,ex_UID,kernel_details_summary,trunc_kernel_details,Percentage (%),Cumulative Percentage (%) -aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), (64,), (64,), (64,), (64,), (64,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,3,399.2096354166667,399.2096354166667,395.8359375,395.8359375,5.878125137364244,5.878125137364244,395.7958984375,395.7958984375,405.9970703125,405.9970703125,1197.62890625,1197.62890625,1604,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(1197.6290000000001), 'mean_duration_us': np.float64(399.2096666666667), 'median_duration_us': np.float64(395.836), 'std_dev_duration_us': np.float64(4.799397207520504), 'min_duration_us': np.float64(395.796), 'max_duration_us': np.float64(405.997)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(1023.8620000000001), 'mean_duration_us': np.float64(85.32183333333334), 'median_duration_us': np.float64(85.6585), 'std_dev_duration_us': np.float64(1.298095709962182), 'min_duration_us': np.float64(82.959), 'max_duration_us': np.float64(87.318)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(441.06500000000005), 'mean_duration_us': np.float64(29.404333333333337), 'median_duration_us': np.float64(28.199), 'std_dev_duration_us': np.float64(3.0918341194543766), 'min_duration_us': np.float64(25.879), 'max_duration_us': np.float64(35.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(274.618), 'mean_duration_us': np.float64(4.576966666666666), 'median_duration_us': np.float64(4.459), 'std_dev_duration_us': np.float64(0.515218949142552), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(6.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}]",1.3160071772382065,63.57639824607253 -aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((100352, 784, 28, 1), (200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,91.42822265625,91.42822265625,90.908203125,90.908203125,1.5276087070124051,1.5276087070124051,90.228515625,90.228515625,93.14794921875,93.14794921875,274.28466796875,274.28466796875,1248,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.117), 'mean_duration_us': np.float64(1.7056666666666667), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(1.719)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.6370000000000005), 'mean_duration_us': np.float64(1.8790000000000002), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.919)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.597000000000001), 'mean_duration_us': np.float64(2.8656666666666673), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.0714890988194368), 'min_duration_us': np.float64(1.359), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757), 'mean_duration_us': np.float64(3.5856666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.08219218670625292), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3409789827345178), 'min_duration_us': np.float64(4.639), 'max_duration_us': np.float64(5.399)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.037), 'mean_duration_us': np.float64(7.678999999999999), 'median_duration_us': np.float64(8.079), 'std_dev_duration_us': np.float64(0.7118052168020874), 'min_duration_us': np.float64(6.679), 'max_duration_us': np.float64(8.279)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.156), 'mean_duration_us': np.float64(9.718666666666666), 'median_duration_us': np.float64(9.359), 'std_dev_duration_us': np.float64(0.5378973466708636), 'min_duration_us': np.float64(9.318), 'max_duration_us': np.float64(10.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1x1_ta1x8x1x1_1x4x1x32_tb1x8x1x2_1x4x1x32_mh', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.277), 'mean_duration_us': np.float64(13.425666666666666), 'median_duration_us': np.float64(13.439), 'std_dev_duration_us': np.float64(0.018856180831641704), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(13.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.997), 'mean_duration_us': np.float64(13.665666666666667), 'median_duration_us': np.float64(13.639), 'std_dev_duration_us': np.float64(0.06798692684790397), 'min_duration_us': np.float64(13.599), 'max_duration_us': np.float64(13.759)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x4x1x4_1x8x1x32_tb1x4x1x2_1x8x1x32_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.235), 'mean_duration_us': np.float64(28.078333333333333), 'median_duration_us': np.float64(28.078), 'std_dev_duration_us': np.float64(0.5229661132000395), 'min_duration_us': np.float64(27.438), 'max_duration_us': np.float64(28.719)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.87)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(7.68)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.72)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(13.43)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.67)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(28.08)}]",1.3144066820393763,64.8908049281119 -aten::native_batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (512,), (512,), (512,), (512,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar')","((25088, 49, 7, 1), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",True,15,16.820930989583335,16.820930989583335,17.07763671875,17.07763671875,1.0621585372054239,1.0621585372054239,14.59716796875,14.59716796875,18.4375,18.4375,252.31396484375,252.31396484375,79,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(238.17999999999998), 'mean_duration_us': np.float64(3.9696666666666665), 'median_duration_us': np.float64(4.539), 'std_dev_duration_us': np.float64(1.3463009404372495), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.97)}]",1.141412806250018,69.64468983186913 -aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((50176, 196, 14, 1), (100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,75.08235677083333,75.08235677083333,75.06884765625,75.06884765625,0.45986563848762135,0.45986563848762135,74.62939453125,74.62939453125,75.548828125,75.548828125,225.2470703125,225.2470703125,760,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5169999999999995), 'mean_duration_us': np.float64(2.172333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.199)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1319932658214888), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.799)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.717), 'mean_duration_us': np.float64(3.905666666666667), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(4.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.997), 'mean_duration_us': np.float64(3.999), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.1423610433604174), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.597), 'mean_duration_us': np.float64(7.199000000000001), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(7.079), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.636), 'mean_duration_us': np.float64(7.212), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.06844462481938694), 'min_duration_us': np.float64(7.118), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.677), 'mean_duration_us': np.float64(19.892333333333333), 'median_duration_us': np.float64(19.799), 'std_dev_duration_us': np.float64(0.9005677221743096), 'min_duration_us': np.float64(18.839), 'max_duration_us': np.float64(21.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(65.196), 'mean_duration_us': np.float64(21.732), 'median_duration_us': np.float64(21.799), 'std_dev_duration_us': np.float64(0.2171128738697909), 'min_duration_us': np.float64(21.439), 'max_duration_us': np.float64(21.958)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.51)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.17)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.2)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(7.21)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(19.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(21.73)}]",1.0794123365374357,70.72410216840656 -aten::native_batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (256,), (256,), (256,), (256,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",True,15,13.421061197916666,13.421061197916666,13.39697265625,13.39697265625,0.15624974568664163,0.15624974568664163,13.23681640625,13.23681640625,13.8369140625,13.8369140625,201.31591796875,201.31591796875,482,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(174.86399999999998), 'mean_duration_us': np.float64(11.657599999999999), 'median_duration_us': np.float64(11.159), 'std_dev_duration_us': np.float64(1.1193715975194891), 'min_duration_us': np.float64(10.679), 'max_duration_us': np.float64(14.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 57, 'total_duration_us': np.float64(171.62300000000002), 'mean_duration_us': np.float64(3.010929824561404), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.5473071555679883), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.01)}]",0.8224556402515463,75.93957784318434 -aten::max_pool2d_with_indices_backward,other,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 112, 112), (), (), (), (), (), (10, 64, 56, 56))","('c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'long int')","((200704, 3136, 56, 1), (802816, 12544, 112, 1), (), (), (), (), (), (200704, 3136, 56, 1))","('', '', '[3, 3]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '')",False,3,52.07861328125,82.05094401041667,52.31884765625,82.677734375,0.4503509848123843,2.284896461956863,51.55908203125,79.51806640625,52.35791015625,83.95703125,156.23583984375,246.15283203125,1594,"[{'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw(c10::BFloat16 const*, long const*, int, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(156.236), 'mean_duration_us': np.float64(52.07866666666666), 'median_duration_us': np.float64(52.319), 'std_dev_duration_us': np.float64(0.3678045978807537), 'min_duration_us': np.float64(51.559), 'max_duration_us': np.float64(52.358)}]","[{'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(146.37), 'mean_duration_us': np.float64(4.8790000000000004), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.5807581252122092), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(6.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.88)}]",0.7014357401294665,78.81683532820783 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,30,4.712369791666666,4.712369791666666,4.67919921875,4.67919921875,0.412890788540921,0.412890788540921,4.119140625,4.119140625,5.35888671875,5.35888671875,141.37109375,141.37109375,5745,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(141.37), 'mean_duration_us': np.float64(4.7123333333333335), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4059666105591554), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.359)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.71)}]",0.6774680905364567,79.49430341874428 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,30,4.597688802083334,4.597688802083334,4.638671875,4.638671875,0.4726140319865054,0.4726140319865054,3.71923828125,3.71923828125,6.0390625,6.0390625,137.9306640625,137.9306640625,5755,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(137.92800000000003), 'mean_duration_us': np.float64(4.597600000000001), 'median_duration_us': np.float64(4.6385000000000005), 'std_dev_duration_us': np.float64(0.46466702056418846), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(6.039)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",0.6609811180642956,80.15528453680858 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,30,4.593570963541667,4.593570963541667,4.6591796875,4.6591796875,1.0373284068708915,1.0373284068708915,1.55908203125,1.55908203125,6.31884765625,6.31884765625,137.80712890625,137.80712890625,5725,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(137.808), 'mean_duration_us': np.float64(4.5935999999999995), 'median_duration_us': np.float64(4.659000000000001), 'std_dev_duration_us': np.float64(1.0199425996920939), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(6.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.59)}]",0.6603891220331494,80.81567365884173 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (128,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,4.510904947916667,4.510904947916667,4.27880859375,4.27880859375,0.4786475103410302,0.4786475103410302,4.0390625,4.0390625,5.67919921875,5.67919921875,135.3271484375,135.3271484375,1771,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(135.32800000000003), 'mean_duration_us': np.float64(4.510933333333335), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4705758835960702), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.679)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.648504743210256,81.46417840205199 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,4.502962239583334,4.502962239583334,4.27880859375,4.27880859375,0.5168070532058079,0.5168070532058079,4.0390625,4.0390625,5.7587890625,5.7587890625,135.0888671875,135.0888671875,1801,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(135.09000000000003), 'mean_duration_us': np.float64(4.503000000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.5081312166491382), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.5)}]",0.6473628694426694,82.11154127149466 -aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,44.990397135416664,44.990397135416664,45.03125,45.03125,0.9803749232086446,0.9803749232086446,43.990234375,43.990234375,45.94970703125,45.94970703125,134.97119140625,134.97119140625,360,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.5969999999999995), 'mean_duration_us': np.float64(1.8656666666666666), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.957), 'mean_duration_us': np.float64(2.319), 'median_duration_us': np.float64(2.319), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757000000000001), 'mean_duration_us': np.float64(3.585666666666667), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.06798692684790367), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.13199326582148882), 'min_duration_us': np.float64(3.599), 'max_duration_us': np.float64(3.919)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.556000000000001), 'mean_duration_us': np.float64(4.518666666666667), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.08594701209983321), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(4.638)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.556999999999999), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.06798692684790346), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT3128_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR1_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVW2_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA256_LBSPPB256_LPA32_LPB16_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS16_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SCIUI1_SPO0_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_16_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA1_WSGRB0_WS64_WG16_8_2_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.916), 'mean_duration_us': np.float64(5.6386666666666665), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.06572839738060139), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(5.719)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(15.079), 'std_dev_duration_us': np.float64(0.4877157642179166), 'min_duration_us': np.float64(14.159), 'max_duration_us': np.float64(15.279)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.87)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.32)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.64)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]",0.6467989522746606,82.75834022376932 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,4.424300130208334,4.424300130208334,4.27880859375,4.27880859375,0.4238580059237626,0.4238580059237626,4.0390625,4.0390625,5.47900390625,5.47900390625,132.72900390625,132.72900390625,1741,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(132.729), 'mean_duration_us': np.float64(4.424300000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4167844486862084), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.42)}]",0.6360541073140922,83.39439433108342 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,41.62158203125,41.62158203125,41.87451171875,41.87451171875,1.082452905348479,1.082452905348479,40.43505859375,40.43505859375,42.55517578125,42.55517578125,124.86474609375,124.86474609375,6009,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.396999999999998), 'mean_duration_us': np.float64(4.4656666666666665), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.16759740119968727), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.639)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.997), 'mean_duration_us': np.float64(5.999), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.738286303995047), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(6.599)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.717), 'mean_duration_us': np.float64(6.905666666666666), 'median_duration_us': np.float64(7.359), 'std_dev_duration_us': np.float64(0.6411101482758033), 'min_duration_us': np.float64(5.999), 'max_duration_us': np.float64(7.359)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.476999999999997), 'mean_duration_us': np.float64(10.492333333333333), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.5309948733797298), 'min_duration_us': np.float64(9.919), 'max_duration_us': np.float64(11.199)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(41.277), 'mean_duration_us': np.float64(13.759), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.4537253207246281), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(14.399)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.47)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.49)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.76)}]",0.5983675931732141,83.99276192425663 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,41.607259114583336,41.607259114583336,42.07373046875,42.07373046875,0.8786485534396721,0.8786485534396721,40.59375,40.59375,42.154296875,42.154296875,124.82177734375,124.82177734375,6267,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.277), 'mean_duration_us': np.float64(4.425666666666666), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.18571184369578841), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.437000000000001), 'mean_duration_us': np.float64(4.479), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.639)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.517), 'mean_duration_us': np.float64(4.8389999999999995), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.2902872140943631), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(5.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.757), 'mean_duration_us': np.float64(5.5856666666666674), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.1643843734125062), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(5.799)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.477), 'mean_duration_us': np.float64(17.159), 'median_duration_us': np.float64(17.159), 'std_dev_duration_us': np.float64(0.4898979485566353), 'min_duration_us': np.float64(16.559), 'max_duration_us': np.float64(17.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.43)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.48)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.84)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.59)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(17.16)}]",0.5981616815102067,84.59092360576683 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,41.473795572916664,41.473795572916664,41.033203125,41.033203125,1.5480063825290074,1.5480063825290074,40.19384765625,40.19384765625,43.1943359375,43.1943359375,124.42138671875,124.42138671875,72,"[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.357), 'mean_duration_us': np.float64(4.452333333333333), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.22939534045447024), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.916999999999998), 'mean_duration_us': np.float64(4.638999999999999), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.4079215610874227), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.557), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.27904599381941786), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.836), 'mean_duration_us': np.float64(5.611999999999999), 'median_duration_us': np.float64(5.478), 'std_dev_duration_us': np.float64(0.27792924759130083), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(5.999)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.397), 'mean_duration_us': np.float64(16.799), 'median_duration_us': np.float64(16.719), 'std_dev_duration_us': np.float64(0.851038581185758), 'min_duration_us': np.float64(15.799), 'max_duration_us': np.float64(17.879)}]","[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.61)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(16.8)}]",0.5962429591958195,85.18716656496265 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,40.700520833333336,40.700520833333336,40.75390625,40.75390625,0.8011398380941223,0.8011398380941223,39.8740234375,39.8740234375,41.4736328125,41.4736328125,122.1015625,122.1015625,6138,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.917), 'mean_duration_us': np.float64(4.639), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4418144406874905), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(5.159)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.957), 'mean_duration_us': np.float64(4.652333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.30346151137976096), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.079)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.3785351884420904), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.997), 'mean_duration_us': np.float64(5.665666666666667), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.46341725858620714), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.877000000000002), 'mean_duration_us': np.float64(5.9590000000000005), 'median_duration_us': np.float64(5.839), 'std_dev_duration_us': np.float64(0.19866219234335095), 'min_duration_us': np.float64(5.799), 'max_duration_us': np.float64(6.239)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(14.759), 'std_dev_duration_us': np.float64(0.4607240678178929), 'min_duration_us': np.float64(14.319), 'max_duration_us': np.float64(15.439)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.95)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.67)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.96)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]",0.5851260692986809,85.77229263426133 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,3.868310546875,3.868310546875,4.19873046875,4.19873046875,1.3189206115385315,1.3189206115385315,0.798828125,0.798828125,5.59912109375,5.59912109375,116.04931640625,116.04931640625,1654,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(116.04899999999999), 'mean_duration_us': np.float64(3.8682999999999996), 'median_duration_us': np.float64(4.1985), 'std_dev_duration_us': np.float64(1.296753976923405), 'min_duration_us': np.float64(0.799), 'max_duration_us': np.float64(5.599)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]",0.5561229435830356,86.32841557784437 -aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), (512,), (512,), (512,), (512,), (512,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (25088, 49, 7, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,15,7.585579427083333,7.585579427083333,7.31884765625,7.31884765625,1.1608900026613005,1.1608900026613005,6.47900390625,6.47900390625,10.67919921875,10.67919921875,113.78369140625,113.78369140625,234,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(113.78399999999999), 'mean_duration_us': np.float64(7.5855999999999995), 'median_duration_us': np.float64(7.319), 'std_dev_duration_us': np.float64(1.1215021949748174), 'min_duration_us': np.float64(6.479), 'max_duration_us': np.float64(10.679)}]","[{'name': 'void at::native::batch_norm_backward_kernel, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float>(at::native::(anonymous namespace)::TensorListMetadata<2>, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(90.756), 'mean_duration_us': np.float64(30.252), 'median_duration_us': np.float64(30.119), 'std_dev_duration_us': np.float64(1.5382992773406174), 'min_duration_us': np.float64(28.438), 'max_duration_us': np.float64(32.199)}]","[{'name': 'void at::native::(anonymous namespace)::multi_tensor_apply_kerne...', 'stream': 0, 'mean_duration_us': np.float64(30.25)}]",0.43491585104003994,87.30859721205434 -aten::fill_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), ())","('c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), ())","('', '0')",False,3,29.972330729166668,29.972330729166668,30.35888671875,30.35888671875,1.8505993576703914,1.8505993576703914,27.958984375,27.958984375,31.59912109375,31.59912109375,89.9169921875,89.9169921875,1596,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.917), 'mean_duration_us': np.float64(29.972333333333335), 'median_duration_us': np.float64(30.359), 'std_dev_duration_us': np.float64(1.510967313419527), 'min_duration_us': np.float64(27.959), 'max_duration_us': np.float64(31.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(29.97)}]",0.4308935538956111,87.73949076594995 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), ())","('c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), ())","('', '0')",False,12,7.302205403645833,7.302205403645833,7.158935546875,7.158935546875,0.893610122762632,0.893610122762632,6.119140625,6.119140625,9.39892578125,9.39892578125,87.62646484375,87.62646484375,5922,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(87.62700000000002), 'mean_duration_us': np.float64(7.302250000000002), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.8555424327096035), 'min_duration_us': np.float64(6.119), 'max_duration_us': np.float64(9.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.3)}]",0.41991705831415954,88.15940782426411 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (), (512,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.7550455729166665,2.7550455729166665,3.43896484375,3.43896484375,1.6544370356456592,1.6544370356456592,0.63916015625,0.63916015625,5.9990234375,5.9990234375,82.6513671875,82.6513671875,251,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(82.649), 'mean_duration_us': np.float64(2.754966666666667), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(1.6267029329973628), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.999)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.75)}]",0.39607576360526797,88.55548358786938 -aten::max_pool2d_with_indices,other,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), (), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar')","((802816, 12544, 112, 1), (), (), (), (), ())","('', '[3, 3]', '[2, 2]', '[1, 1]', '[1, 1]', 'False')",False,3,23.585286458333332,23.585286458333332,23.23779296875,23.23779296875,0.7803342920411799,0.7803342920411799,23.0390625,23.0390625,24.47900390625,24.47900390625,70.755859375,70.755859375,5893,"[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw(int, c10::BFloat16 const*, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*, long*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(70.756), 'mean_duration_us': np.float64(23.585333333333335), 'median_duration_us': np.float64(23.238), 'std_dev_duration_us': np.float64(0.6371186877044349), 'min_duration_us': np.float64(23.039), 'max_duration_us': np.float64(24.479)}]","[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.46600000000001), 'mean_duration_us': np.float64(5.622166666666668), 'median_duration_us': np.float64(5.7989999999999995), 'std_dev_duration_us': np.float64(0.5222931541662104), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.62)}]",0.3233070498795031,89.21786162937475 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,22.236653645833332,22.236653645833332,22.27685546875,22.27685546875,0.14463376370416037,0.14463376370416037,22.076171875,22.076171875,22.35693359375,22.35693359375,66.7099609375,66.7099609375,935,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.596), 'mean_duration_us': np.float64(4.865333333333333), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.037950259843935186), 'min_duration_us': np.float64(4.838), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.277), 'mean_duration_us': np.float64(7.092333333333333), 'median_duration_us': np.float64(7.119), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(6.959), 'max_duration_us': np.float64(7.199)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(30.837), 'mean_duration_us': np.float64(10.279), 'median_duration_us': np.float64(10.319), 'std_dev_duration_us': np.float64(0.18184242262647798), 'min_duration_us': np.float64(10.039), 'max_duration_us': np.float64(10.479)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.87)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(10.28)}]",0.3196825366295204,89.53754416600427 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",False,12,5.5555419921875,5.5555419921875,5.71923828125,5.71923828125,0.48117926954934276,0.48117926954934276,4.8388671875,4.8388671875,6.35888671875,6.35888671875,66.66650390625,66.66650390625,6029,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(66.66699999999999), 'mean_duration_us': np.float64(5.555583333333332), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.46067531196663397), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.56)}]",0.3194742850612516,89.85701845106551 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",False,12,5.459025065104167,5.459025065104167,5.37890625,5.37890625,0.3592526349408488,0.3592526349408488,4.9189453125,4.9189453125,6.19921875,6.19921875,65.50830078125,65.50830078125,6158,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(65.508), 'mean_duration_us': np.float64(5.459), 'median_duration_us': np.float64(5.379), 'std_dev_duration_us': np.float64(0.3438992100407715), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.46)}]",0.3139240297810974,90.1709424808466 -aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",True,12,5.318806966145833,5.318806966145833,5.279052734375,5.279052734375,0.5309911273970868,0.5309911273970868,4.55810546875,4.55810546875,6.27880859375,6.27880859375,63.82568359375,63.82568359375,94,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(63.826), 'mean_duration_us': np.float64(5.318833333333333), 'median_duration_us': np.float64(5.279), 'std_dev_duration_us': np.float64(0.5084422014567852), 'min_duration_us': np.float64(4.558), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]",0.3058607162501483,90.47680319709676 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (), (256,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.08974609375,2.08974609375,2.01904296875,2.01904296875,1.4501653361546871,1.4501653361546871,0.63916015625,0.63916015625,3.67919921875,3.67919921875,62.6923828125,62.6923828125,654,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.68900000000001), 'mean_duration_us': np.float64(2.0896333333333335), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.425860780565745), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]",0.300429796138328,90.77723299323509 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (), (128,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.087109375,2.087109375,2.0390625,2.0390625,1.4501753944792757,1.4501753944792757,0.63916015625,0.63916015625,3.67919921875,3.67919921875,62.61328125,62.61328125,1054,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.039), 'std_dev_duration_us': np.float64(1.425871429454049), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]",0.30005073148597344,91.07728372472106 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (), (64,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.087109375,2.087109375,2.01904296875,2.01904296875,1.4530668185492028,1.4530668185492028,0.63916015625,0.63916015625,3.67919921875,3.67919921875,62.61328125,62.61328125,1426,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.4287113074375803), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]",0.30005073148597344,91.37733445620702 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '0')",False,12,5.1123046875,5.1123046875,3.458984375,3.458984375,3.398747629905021,3.398747629905021,2.71923828125,2.71923828125,10.958984375,10.958984375,61.34765625,61.34765625,1402,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.348), 'mean_duration_us': np.float64(5.112333333333333), 'median_duration_us': np.float64(3.4589999999999996), 'std_dev_duration_us': np.float64(3.254036809188789), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(10.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.11)}]",0.29398569704830074,91.67132015325532 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",False,12,5.065714518229167,5.065714518229167,5.01904296875,5.01904296875,0.33309153344527864,0.33309153344527864,4.55908203125,4.55908203125,5.67919921875,5.67919921875,60.78857421875,60.78857421875,6287,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(60.788000000000004), 'mean_duration_us': np.float64(5.065666666666667), 'median_duration_us': np.float64(5.019), 'std_dev_duration_us': np.float64(0.3188869531493706), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.07)}]",0.29130650552394305,91.96262665877927 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (64, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,12,4.738972981770833,4.738972981770833,4.618896484375,4.618896484375,0.5046606226144523,0.5046606226144523,4.119140625,4.119140625,5.51904296875,5.51904296875,56.86767578125,56.86767578125,1805,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(56.868), 'mean_duration_us': np.float64(4.739), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.4831838849409888), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.519)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]",0.2725170662745173,92.23514372505379 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,9,6.270073784722222,6.270073784722222,6.0390625,6.0390625,0.5623815435318228,0.5623815435318228,5.59912109375,5.59912109375,7.31884765625,7.31884765625,56.4306640625,56.4306640625,1254,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(56.431), 'mean_duration_us': np.float64(6.2701111111111105), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.5302503485135729), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(7.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.27)}]",0.2704228510655215,92.5055665761193 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '0')",False,12,4.608968098958333,4.608968098958333,3.85888671875,3.85888671875,2.3743423923450107,2.3743423923450107,2.19921875,2.19921875,8.51904296875,8.51904296875,55.3076171875,55.3076171875,1030,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(55.308), 'mean_duration_us': np.float64(4.609), 'median_duration_us': np.float64(3.859), 'std_dev_duration_us': np.float64(2.273213584333861), 'min_duration_us': np.float64(2.199), 'max_duration_us': np.float64(8.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]",0.2650410689641916,92.7706076450835 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,18.410481770833332,18.410481770833332,18.43701171875,18.43701171875,1.3202682878965732,1.3202682878965732,17.0771484375,17.0771484375,19.71728515625,19.71728515625,55.2314453125,55.2314453125,6056,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.477), 'mean_duration_us': np.float64(5.825666666666667), 'median_duration_us': np.float64(6.119), 'std_dev_duration_us': np.float64(0.716534871602368), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.157), 'mean_duration_us': np.float64(6.052333333333333), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.4847909056719425), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.559)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.639), 'std_dev_duration_us': np.float64(0.3670906639449654), 'min_duration_us': np.float64(6.039), 'max_duration_us': np.float64(6.919)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.2646760437434057,93.03528368882691 -aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",True,12,4.4456787109375,4.4456787109375,4.55908203125,4.55908203125,0.7578874066557242,0.7578874066557242,3.0791015625,3.0791015625,5.35888671875,5.35888671875,53.34814453125,53.34814453125,897,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(53.348), 'mean_duration_us': np.float64(4.445666666666667), 'median_duration_us': np.float64(4.559), 'std_dev_duration_us': np.float64(0.725687413575723), 'min_duration_us': np.float64(3.079), 'max_duration_us': np.float64(5.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]",0.25565102915000154,93.29093471797691 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), ())","('c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), ())","('', '0')",False,3,17.265625,17.265625,17.0390625,17.0390625,0.4635000603108948,0.4635000603108948,16.958984375,16.958984375,17.798828125,17.798828125,51.796875,51.796875,5891,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.797), 'mean_duration_us': np.float64(17.265666666666664), 'median_duration_us': np.float64(17.039), 'std_dev_duration_us': np.float64(0.37853518844208994), 'min_duration_us': np.float64(16.959), 'max_duration_us': np.float64(17.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(17.27)}]",0.24821715013438195,93.53915186811129 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,17.1572265625,17.1572265625,17.197265625,17.197265625,1.3007552227360448,1.3007552227360448,15.8369140625,15.8369140625,18.4375,18.4375,51.4716796875,51.4716796875,132,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.677), 'mean_duration_us': np.float64(5.559), 'median_duration_us': np.float64(5.359), 'std_dev_duration_us': np.float64(0.40133111848779757), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.119)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.29454296045832684), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.119)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.557000000000002), 'mean_duration_us': np.float64(5.852333333333334), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.547803695577977), 'min_duration_us': np.float64(5.079), 'max_duration_us': np.float64(6.279)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.56)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.85)}]",0.24665877323025767,93.78581064134154 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,17.063802083333332,17.063802083333332,16.63720703125,16.63720703125,1.2943239361047492,1.2943239361047492,16.03662109375,16.03662109375,18.517578125,18.517578125,51.19140625,51.19140625,6314,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.877), 'mean_duration_us': np.float64(5.625666666666667), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.37853518844209033), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(6.159)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.076999999999998), 'mean_duration_us': np.float64(5.692333333333333), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.3612324582438417), 'min_duration_us': np.float64(5.279), 'max_duration_us': np.float64(6.159)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.3461534662865911), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.199)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.63)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]",0.24531566761018664,94.03112630895173 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,16.383951822916668,16.383951822916668,16.1572265625,16.1572265625,0.8043624567112516,0.8043624567112516,15.71728515625,15.71728515625,17.27734375,17.27734375,49.15185546875,49.15185546875,6185,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.877), 'mean_duration_us': np.float64(5.292333333333334), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.7052816616233701), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(6.199)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.117), 'mean_duration_us': np.float64(5.372333333333334), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.2659991645768003), 'min_duration_us': np.float64(4.999), 'max_duration_us': np.float64(5.599)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.157), 'mean_duration_us': np.float64(5.719), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.26733250207684545), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(6.079)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.29)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.37)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.72)}]",0.23554188333311923,94.26666819228484 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '0')",False,12,3.9957682291666665,3.9957682291666665,3.619140625,3.619140625,1.984446512224859,1.984446512224859,1.67919921875,1.67919921875,7.19921875,7.19921875,47.94921875,47.94921875,630,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(47.94800000000001), 'mean_duration_us': np.float64(3.995666666666667), 'median_duration_us': np.float64(3.6189999999999998), 'std_dev_duration_us': np.float64(1.8999268991785507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]",0.2297786966741733,94.49644688895901 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (512, 512, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4608, 9, 3, 1), (4608, 9, 3, 1), ())","('', '', 'False')",False,9,5.150119357638889,5.150119357638889,4.8388671875,4.8388671875,0.6976119225404901,0.6976119225404901,4.35888671875,4.35888671875,6.27880859375,6.27880859375,46.35107421875,46.35107421875,1658,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(46.35100000000001), 'mean_duration_us': np.float64(5.150111111111112), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.6577477470622245), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(6.279)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.15)}]",0.22212018675345468,94.71856707571247 -aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",True,12,3.7023111979166665,3.7023111979166665,3.638916015625,3.638916015625,0.6702554335583752,0.6702554335583752,2.958984375,2.958984375,4.59912109375,4.59912109375,44.427734375,44.427734375,497,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(44.428000000000004), 'mean_duration_us': np.float64(3.7023333333333337), 'median_duration_us': np.float64(3.6390000000000002), 'std_dev_duration_us': np.float64(0.6417597335105681), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(4.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.7)}]",0.21290329992861182,94.93147037564108 -aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,14.63671875,14.63671875,14.63671875,14.63671875,0.1201171875,0.1201171875,14.5166015625,14.5166015625,14.7568359375,14.7568359375,43.91015625,43.91015625,535,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.477), 'mean_duration_us': np.float64(4.492333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(4.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.397), 'mean_duration_us': np.float64(4.799), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.05656854249492343), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.879)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.037), 'mean_duration_us': np.float64(5.345666666666666), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(5.399)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.8)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.35)}]",0.21042300035147718,95.14189337599257 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (128, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,9,4.821180555555555,4.821180555555555,4.7587890625,4.7587890625,0.44821790427644176,0.44821790427644176,4.23876953125,4.23876953125,5.47900390625,5.47900390625,43.390625,43.390625,1775,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.391), 'mean_duration_us': np.float64(4.821222222222222), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.4225262063608935), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.82)}]",0.2079333411532967,95.34982671714586 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 256, 3, 3), (256, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,9,4.701171875,4.701171875,4.47900390625,4.47900390625,0.4952850959970768,0.4952850959970768,4.31884765625,4.31884765625,5.63916015625,5.63916015625,42.310546875,42.310546875,1745,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(42.311), 'mean_duration_us': np.float64(4.701222222222222), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.46689941285933856), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.639)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.7)}]",0.2027574707149742,95.55258418786083 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,6,7.012451171875,7.012451171875,6.71923828125,6.71923828125,0.8351389698492557,0.8351389698492557,6.43896484375,6.43896484375,8.63916015625,8.63916015625,42.07470703125,42.07470703125,5945,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(42.074), 'mean_duration_us': np.float64(7.012333333333333), 'median_duration_us': np.float64(6.719), 'std_dev_duration_us': np.float64(0.7623355924758827), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(8.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.01)}]",0.2016272964736949,95.75421148433452 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '0')",False,12,3.1856282552083335,3.1856282552083335,2.959228515625,2.959228515625,1.3758855731737367,1.3758855731737367,1.9189453125,1.9189453125,6.27880859375,6.27880859375,38.2275390625,38.2275390625,227,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(38.228), 'mean_duration_us': np.float64(3.1856666666666666), 'median_duration_us': np.float64(2.9589999999999996), 'std_dev_duration_us': np.float64(1.3174048563579668), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.19)}]",0.18319118291874775,95.93740266725327 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",True,6,6.258951822916667,6.258951822916667,6.298828125,6.298828125,0.47782093094713657,0.47782093094713657,5.71923828125,5.71923828125,7.0390625,7.0390625,37.5537109375,37.5537109375,1328,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(37.554), 'mean_duration_us': np.float64(6.259), 'median_duration_us': np.float64(6.2989999999999995), 'std_dev_duration_us': np.float64(0.4361956747454822), 'min_duration_us': np.float64(5.719), 'max_duration_us': np.float64(7.039)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.26)}]",0.17996211365794978,96.11736478091122 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), ())","('', '', '0')",False,3,12.185709635416666,12.185709635416666,11.9990234375,11.9990234375,0.698889002841252,0.698889002841252,11.59912109375,11.59912109375,12.958984375,12.958984375,36.55712890625,36.55712890625,1600,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.557), 'mean_duration_us': np.float64(12.185666666666668), 'median_duration_us': np.float64(11.999), 'std_dev_duration_us': np.float64(0.5706915882408716), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(12.19)}]",0.17518636701933485,96.29255114793055 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (), (512, 512, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((4608, 9, 3, 1), (), (4608, 9, 3, 1))","('', '', '')",False,9,3.710177951388889,3.710177951388889,3.9990234375,3.9990234375,0.8288603382936338,0.8288603382936338,2.59912109375,2.59912109375,4.63916015625,4.63916015625,33.3916015625,33.3916015625,272,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.391), 'mean_duration_us': np.float64(3.710111111111111), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.7815148316562939), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(4.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]",0.1600167612093688,96.45256790913992 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,6,5.445638020833333,5.445638020833333,5.739013671875,5.739013671875,0.6823692762967902,0.6823692762967902,4.31884765625,4.31884765625,6.0791015625,6.0791015625,32.673828125,32.673828125,6074,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.674), 'mean_duration_us': np.float64(5.445666666666667), 'median_duration_us': np.float64(5.739000000000001), 'std_dev_duration_us': np.float64(0.6228607834464742), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]",0.15657710047504053,96.60914500961496 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,6,5.399007161458333,5.399007161458333,5.19921875,5.19921875,1.1462242511559813,1.1462242511559813,4.27880859375,4.27880859375,7.27880859375,7.27880859375,32.39404296875,32.39404296875,6332,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.394000000000005), 'mean_duration_us': np.float64(5.399000000000001), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(1.0463906217724492), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(7.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.4)}]",0.15523633476023097,96.7643813443752 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,6,5.392252604166667,5.392252604166667,5.39892578125,5.39892578125,0.3687834988480689,0.3687834988480689,4.7587890625,4.7587890625,5.8388671875,5.8388671875,32.353515625,32.353515625,6203,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.354), 'mean_duration_us': np.float64(5.392333333333333), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.33658414830304906), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.39)}]",0.1550421226235308,96.91942346699872 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",True,6,5.212483723958333,5.212483723958333,5.05908203125,5.05908203125,0.8603393923316893,0.8603393923316893,4.1591796875,4.1591796875,6.55908203125,6.55908203125,31.27490234375,31.27490234375,153,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(31.274), 'mean_duration_us': np.float64(5.2123333333333335), 'median_duration_us': np.float64(5.059), 'std_dev_duration_us': np.float64(0.7854227453345676), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(6.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",0.14987327190099262,97.06929673889971 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (), (64, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,12,2.5723876953125,2.5723876953125,2.51904296875,2.51904296875,1.0093065844733184,1.0093065844733184,1.55908203125,1.55908203125,3.7587890625,3.7587890625,30.86865234375,30.86865234375,1447,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(30.868), 'mean_duration_us': np.float64(2.5723333333333334), 'median_duration_us': np.float64(2.519), 'std_dev_duration_us': np.float64(0.9664137600197731), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.57)}]",0.14792647072346807,97.21722320962317 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",True,6,4.932210286458333,4.932210286458333,4.89892578125,4.89892578125,0.38339940966681924,0.38339940966681924,4.31884765625,4.31884765625,5.39892578125,5.39892578125,29.59326171875,29.59326171875,956,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(29.593999999999998), 'mean_duration_us': np.float64(4.932333333333333), 'median_duration_us': np.float64(4.898999999999999), 'std_dev_duration_us': np.float64(0.3499841266241783), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.93)}]",0.14181463818056642,97.35903784780373 -aten::mm,GEMM,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (1000, 512))","('c10::BFloat16', 'c10::BFloat16')","((1000, 1), (512, 1))","('', '')",False,3,8.86572265625,8.86572265625,9.119140625,9.119140625,0.6575774436567361,0.6575774436567361,8.119140625,8.119140625,9.35888671875,9.35888671875,26.59716796875,26.59716796875,16,"[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LBSPPA256_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD0_NTM0_NEPBS0_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.597), 'mean_duration_us': np.float64(8.865666666666668), 'median_duration_us': np.float64(9.119), 'std_dev_duration_us': np.float64(0.5369874817493938), 'min_duration_us': np.float64(8.119), 'max_duration_us': np.float64(9.359)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]",0.12745697949632276,97.48649482730006 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",True,6,4.33203125,4.33203125,4.29833984375,4.29833984375,0.09015475637167203,0.09015475637167203,4.23876953125,4.23876953125,4.47900390625,4.47900390625,25.9921875,25.9921875,556,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.993), 'mean_duration_us': np.float64(4.332166666666667), 'median_duration_us': np.float64(4.2985), 'std_dev_duration_us': np.float64(0.08222006378548305), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.479)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]",0.12455783687738894,97.61105266417745 -aten::sum,reduce,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '')","((1000, 1), (), (), ())","('', '[0]', 'True', '')",False,3,7.985677083333333,7.985677083333333,7.958984375,7.958984375,0.36060498707123123,0.36060498707123123,7.63916015625,7.63916015625,8.35888671875,8.35888671875,23.95703125,23.95703125,26,"[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.956999999999997), 'mean_duration_us': np.float64(7.985666666666666), 'median_duration_us': np.float64(7.959), 'std_dev_duration_us': np.float64(0.2945429604583269), 'min_duration_us': np.float64(7.639), 'max_duration_us': np.float64(8.359)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.076999999999998), 'mean_duration_us': np.float64(7.358999999999999), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.31155523854794487), 'min_duration_us': np.float64(7.119), 'max_duration_us': np.float64(7.799)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.991), 'mean_duration_us': np.float64(2.4434444444444443), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.895111552465962), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]",0.10538231325982426,97.93703656567604 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (), (128, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,9,2.4078776041666665,2.4078776041666665,1.87890625,1.87890625,0.9181949417968699,0.9181949417968699,1.67919921875,1.67919921875,3.7587890625,3.7587890625,21.6708984375,21.6708984375,1075,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.670999999999996), 'mean_duration_us': np.float64(2.4078888888888885), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.8656974637628507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.41)}]",0.10384967531357597,98.04088624098961 -aten::mse_loss_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((), (10, 1000), (10, 1000), (), (10, 1000))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'c10::BFloat16')","((), (1000, 1), (1000, 1), (), (1000, 1))","('', '', '', '1', '')",False,3,7.118977864583333,7.118977864583333,7.47900390625,7.47900390625,0.7664773569099081,0.7664773569099081,6.23876953125,6.23876953125,7.63916015625,7.63916015625,21.35693359375,21.35693359375,9,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.357), 'mean_duration_us': np.float64(7.119), 'median_duration_us': np.float64(7.479), 'std_dev_duration_us': np.float64(0.625672971021337), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(7.639)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.12)}]",0.10234511623046502,98.14323135722007 -aten::mse_loss,elementwise,python3,CPU,thread 542 (python3),"((10, 1000), (10, 1000), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1000, 1), (1000, 1), ())","('', '', '1')",False,3,6.5322265625,12.597981770833334,6.59912109375,12.43798828125,0.26638550439867287,0.7331822767157538,6.23876953125,11.9580078125,6.7587890625,13.39794921875,19.5966796875,37.7939453125,6404,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.599), 'std_dev_duration_us': np.float64(0.21746008573733472), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(6.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.09390975776294574,98.23714111498302 -aten::mean,reduce,python3,CPU,thread 542 (python3),"((10, 1000), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '', 'c10::BFloat16')","((1000, 1), (), (), (), ())","('', '[]', 'False', '', '')",False,3,6.065755208333333,6.065755208333333,6.19921875,6.19921875,0.6504878218749942,0.6504878218749942,5.35888671875,5.35888671875,6.63916015625,6.63916015625,18.197265625,18.197265625,6408,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.197000000000003), 'mean_duration_us': np.float64(6.065666666666668), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.5309948733797302), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.639)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]",0.08489878260111029,98.49491443820516 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,6,2.9457194010416665,2.9457194010416665,2.63916015625,2.63916015625,0.7493654374675626,0.7493654374675626,2.119140625,2.119140625,3.87890625,3.87890625,17.67431640625,17.67431640625,454,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.6390000000000002), 'std_dev_duration_us': np.float64(0.6841702192355998), 'min_duration_us': np.float64(2.119), 'max_duration_us': np.float64(3.879)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]",0.08469755074862578,98.57961198895379 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,6,2.9456380208333335,2.9456380208333335,2.9189453125,2.9189453125,0.27438967631487227,0.27438967631487227,2.59912109375,2.59912109375,3.43896484375,3.43896484375,17.673828125,17.673828125,854,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.919), 'std_dev_duration_us': np.float64(0.25051058970741247), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(3.439)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]",0.08469521084336433,98.66430719979715 -aten::addmm,GEMM,python3,CPU,thread 542 (python3),"((1000,), (10, 512), (512, 1000), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",False,3,5.5322265625,5.5322265625,5.31884765625,5.31884765625,0.36958310688847623,0.36958310688847623,5.31884765625,5.31884765625,5.958984375,5.958984375,16.5966796875,16.5966796875,6400,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.597), 'mean_duration_us': np.float64(5.532333333333334), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(5.959)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]",0.07953337983661049,98.74384057963375 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (256, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,3,4.985677083333333,4.985677083333333,5.0390625,5.0390625,0.4822019830070951,0.4822019830070951,4.47900390625,4.47900390625,5.43896484375,5.43896484375,14.95703125,14.95703125,1769,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.957), 'mean_duration_us': np.float64(4.985666666666667), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.3937286149395573), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(5.439)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.99)}]",0.07167597796866881,98.81551655760242 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (512, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,3,4.945638020833333,4.945638020833333,4.7587890625,4.7587890625,0.5446142789205571,0.5446142789205571,4.51904296875,4.51904296875,5.55908203125,5.55908203125,14.8369140625,14.8369140625,1739,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837000000000002), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.44462218668088177), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.95)}]",0.07110036127435265,98.88661691887677 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (), (1000, 512))","('c10::BFloat16', 'double', 'c10::BFloat16')","((512, 1), (), (512, 1))","('', '', '')",False,3,4.86572265625,4.86572265625,5.0791015625,5.0791015625,0.36958310688847623,0.36958310688847623,4.43896484375,4.43896484375,5.0791015625,5.0791015625,14.59716796875,14.59716796875,45,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.597), 'mean_duration_us': np.float64(4.865666666666667), 'median_duration_us': np.float64(5.079), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.87)}]",0.06995146779098178,98.95656838666775 -aten::fill_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), ())","('c10::BFloat16', 'Scalar')","((1000, 1), ())","('', '0')",False,3,4.798665364583333,4.798665364583333,4.67822265625,4.67822265625,0.4716395854027524,0.4716395854027524,4.39892578125,4.39892578125,5.31884765625,5.31884765625,14.39599609375,14.39599609375,8,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.396), 'mean_duration_us': np.float64(4.798666666666667), 'median_duration_us': np.float64(4.678), 'std_dev_duration_us': np.float64(0.38515826472878506), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.8)}]",0.0689874268232653,99.02555581349102 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (256, 128, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((128, 1, 1, 1), (128, 1, 1, 1), ())","('', '', 'False')",False,3,4.772298177083333,4.772298177083333,4.71923828125,4.71923828125,0.5220458095712031,0.5220458095712031,4.27880859375,4.27880859375,5.31884765625,5.31884765625,14.31689453125,14.31689453125,1757,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.317), 'mean_duration_us': np.float64(4.772333333333333), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.77)}]",0.06860836217091075,99.09416417566193 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (64, 3, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((147, 49, 7, 1), (147, 49, 7, 1), ())","('', '', 'False')",False,3,4.758951822916667,4.758951822916667,4.59912109375,4.59912109375,0.5769098932439007,0.5769098932439007,4.27880859375,4.27880859375,5.39892578125,5.39892578125,14.27685546875,14.27685546875,1829,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.277000000000001), 'mean_duration_us': np.float64(4.759), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.4710272462041519), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.76)}]",0.06841648993947202,99.1625806656014 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (128, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,3,4.625651041666667,4.625651041666667,4.35888671875,4.35888671875,0.4971274672189554,0.4971274672189554,4.31884765625,4.31884765625,5.19921875,5.19921875,13.876953125,13.876953125,1799,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.876999999999999), 'mean_duration_us': np.float64(4.625666666666667), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.405736641458745), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.199)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.63)}]",0.0665001075303463,99.22908077313174 -aten::fill_,elementwise,python3,CPU,thread 542 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '1.')",False,3,4.598958333333333,4.598958333333333,4.59912109375,4.59912109375,0.3200683904124541,0.3200683904124541,4.27880859375,4.27880859375,4.9189453125,4.9189453125,13.796875,13.796875,6413,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.797), 'mean_duration_us': np.float64(4.599), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.2612789058968722), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",0.06611636306746886,99.2951971361992 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (1000,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,3,4.518880208333333,4.518880208333333,4.7587890625,4.7587890625,0.48653430985275825,0.48653430985275825,3.958984375,3.958984375,4.8388671875,4.8388671875,13.556640625,13.556640625,1650,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.557), 'mean_duration_us': np.float64(4.519), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.39732438468670256), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(4.839)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.52)}]",0.06496512967883654,99.36016226587805 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (), (1000,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,3,4.412272135416667,4.412272135416667,4.23876953125,4.23876953125,0.44599523130071334,0.44599523130071334,4.0791015625,4.0791015625,4.9189453125,4.9189453125,13.23681640625,13.23681640625,33,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.236999999999998), 'mean_duration_us': np.float64(4.412333333333333), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(0.3641733408999376), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}]",0.06343249173258823,99.42359475761063 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (128, 64, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1, 1, 1), (64, 1, 1, 1), ())","('', '', 'False')",False,3,4.372395833333333,4.372395833333333,4.19921875,4.19921875,0.3352246668890176,0.3352246668890176,4.1591796875,4.1591796875,4.7587890625,4.7587890625,13.1171875,13.1171875,1787,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.116999999999999), 'mean_duration_us': np.float64(4.372333333333333), 'median_duration_us': np.float64(4.199), 'std_dev_duration_us': np.float64(0.27390184778898874), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]",0.06285921494353353,99.48645397255416 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (512, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1, 1, 1), (256, 1, 1, 1), ())","('', '', 'False')",False,3,4.372233072916667,4.372233072916667,4.39892578125,4.39892578125,0.046233127024950436,0.046233127024950436,4.31884765625,4.31884765625,4.39892578125,4.39892578125,13.11669921875,13.11669921875,1727,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.117), 'mean_duration_us': np.float64(4.372333333333334), 'median_duration_us': np.float64(4.399), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]",0.06285687503827207,99.54931084759244 -aten::cat,other,python3,CPU,thread 542 (python3),"((), ())","('TensorList', 'Scalar')","((), ())","('', '0')",False,3,4.065592447916667,4.065592447916667,4.0791015625,4.0791015625,0.18031158429403077,0.18031158429403077,3.87890625,3.87890625,4.23876953125,4.23876953125,12.19677734375,12.19677734375,5534,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.197), 'mean_duration_us': np.float64(4.065666666666666), 'median_duration_us': np.float64(4.079), 'std_dev_duration_us': np.float64(0.14727148022916342), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.239)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.07)}]",0.058448493525704436,99.60775934111814 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (1000, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1), (512, 1), ())","('', '', 'False')",False,3,3.86572265625,3.86572265625,4.0390625,4.0390625,0.6377912043259547,0.6377912043259547,3.1591796875,3.1591796875,4.39892578125,4.39892578125,11.59716796875,11.59716796875,1652,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.597), 'mean_duration_us': np.float64(3.8656666666666664), 'median_duration_us': np.float64(4.039), 'std_dev_duration_us': np.float64(0.5208539995899897), 'min_duration_us': np.float64(3.159), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]",0.05557508986464654,99.66333443098279 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,3,3.7057291666666665,3.7057291666666665,3.67919921875,3.67919921875,0.0830743261395091,0.0830743261395091,3.63916015625,3.63916015625,3.798828125,3.798828125,11.1171875,11.1171875,316,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.06798692684790385), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]",0.05327496299264336,99.71660939397543 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (), (64, 3, 7, 7))","('c10::BFloat16', 'double', 'c10::BFloat16')","((147, 49, 7, 1), (), (147, 49, 7, 1))","('', '', '')",False,3,3.59912109375,3.59912109375,3.63916015625,3.63916015625,0.1443628928652574,0.1443628928652574,3.43896484375,3.43896484375,3.71923828125,3.71923828125,10.79736328125,10.79736328125,1640,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.796999999999999), 'mean_duration_us': np.float64(3.5989999999999998), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.11775681155103787), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]",0.05174232504639506,99.76835171902182 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (), (256, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,3,3.5719401041666665,3.5719401041666665,3.47900390625,3.47900390625,0.16181668128245583,0.16181668128245583,3.47802734375,3.47802734375,3.7587890625,3.7587890625,10.7158203125,10.7158203125,860,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.716000000000001), 'mean_duration_us': np.float64(3.5720000000000005), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(0.13222959830033), 'min_duration_us': np.float64(3.478), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.57)}]",0.05135156086773328,99.81970327988955 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (), (512, 256, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((2304, 9, 3, 1), (), (2304, 9, 3, 1))","('', '', '')",False,3,3.2257486979166665,3.2257486979166665,3.71923828125,3.71923828125,0.9245327069892811,0.9245327069892811,2.1591796875,2.1591796875,3.798828125,3.798828125,9.67724609375,9.67724609375,460,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.677), 'mean_duration_us': np.float64(3.2256666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.7549540089009102), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.23)}]",0.04637458237663382,99.86607786226618 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (), (128, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,3,2.8390299479166665,2.8390299479166665,3.43896484375,3.43896484375,1.1447188535008865,1.1447188535008865,1.51904296875,1.51904296875,3.55908203125,3.55908203125,8.51708984375,8.51708984375,1260,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.517), 'mean_duration_us': np.float64(2.839), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.9346657156438339), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(3.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]",0.04081496747543386,99.90689282974161 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (), (512, 256, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((256, 1, 1, 1), (), (256, 1, 1, 1))","('', '', '')",False,3,1.67919921875,1.67919921875,1.67919921875,1.67919921875,0.0400390625,0.0400390625,1.63916015625,1.63916015625,1.71923828125,1.71923828125,5.03759765625,5.03759765625,371,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.037), 'mean_duration_us': np.float64(1.679), 'median_duration_us': np.float64(1.679), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.639), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.68)}]",0.024140802582356884,99.93103363232396 -aten::cat,other,python3,CPU,thread 542 (python3),"(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('', '0')",False,3,1.6658528645833333,1.6658528645833333,1.71923828125,1.71923828125,0.09246625404990101,0.09246625404990101,1.55908203125,1.55908203125,1.71923828125,1.71923828125,4.99755859375,4.99755859375,5559,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<8u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.997), 'mean_duration_us': np.float64(1.6656666666666666), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(1.67)}]",0.023948930350918166,99.95498256267487 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (), (128, 64, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((64, 1, 1, 1), (), (64, 1, 1, 1))","('', '', '')",False,3,1.6256510416666667,1.6256510416666667,1.55908203125,1.55908203125,0.15130600872189426,0.15130600872189426,1.51904296875,1.51904296875,1.798828125,1.798828125,4.876953125,4.876953125,1171,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.877), 'mean_duration_us': np.float64(1.6256666666666666), 'median_duration_us': np.float64(1.559), 'std_dev_duration_us': np.float64(0.12364824660660939), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(1.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.63)}]",0.023370973751340562,99.97835353642621 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (), (256, 128, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((128, 1, 1, 1), (), (128, 1, 1, 1))","('', '', '')",False,3,1.5056966145833333,1.5056966145833333,1.47900390625,1.47900390625,0.046233127024950485,0.046233127024950485,1.47900390625,1.47900390625,1.55908203125,1.55908203125,4.51708984375,4.51708984375,771,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.51)}]",0.021646463573653536,99.99999999999987 +aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), (64,), (64,), (64,), (64,), (64,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,3,399.2096354166667,399.2096354166667,395.8359375,395.8359375,5.878125137364244,5.878125137364244,395.7958984375,395.7958984375,405.9970703125,405.9970703125,1197.62890625,1197.62890625,1604,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(1197.6290000000001), 'mean_duration_us': np.float64(399.2096666666667), 'median_duration_us': np.float64(395.836), 'std_dev_duration_us': np.float64(4.799397207520504), 'min_duration_us': np.float64(395.796), 'max_duration_us': np.float64(405.997)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(1023.8620000000001), 'mean_duration_us': np.float64(85.32183333333334), 'median_duration_us': np.float64(85.6585), 'std_dev_duration_us': np.float64(1.298095709962182), 'min_duration_us': np.float64(82.959), 'max_duration_us': np.float64(87.318)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(441.06500000000005), 'mean_duration_us': np.float64(29.404333333333337), 'median_duration_us': np.float64(28.199), 'std_dev_duration_us': np.float64(3.0918341194543766), 'min_duration_us': np.float64(25.879), 'max_duration_us': np.float64(35.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(274.618), 'mean_duration_us': np.float64(4.576966666666666), 'median_duration_us': np.float64(4.459), 'std_dev_duration_us': np.float64(0.515218949142552), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(6.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}]",1.2956519904172907,63.96148477439185 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((100352, 784, 28, 1), (200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,91.42822265625,91.42822265625,90.908203125,90.908203125,1.5276087070124051,1.5276087070124051,90.228515625,90.228515625,93.14794921875,93.14794921875,274.28466796875,274.28466796875,1248,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.117), 'mean_duration_us': np.float64(1.7056666666666667), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(1.719)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.6370000000000005), 'mean_duration_us': np.float64(1.8790000000000002), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.919)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.597000000000001), 'mean_duration_us': np.float64(2.8656666666666673), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.0714890988194368), 'min_duration_us': np.float64(1.359), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757), 'mean_duration_us': np.float64(3.5856666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.08219218670625292), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3409789827345178), 'min_duration_us': np.float64(4.639), 'max_duration_us': np.float64(5.399)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.037), 'mean_duration_us': np.float64(7.678999999999999), 'median_duration_us': np.float64(8.079), 'std_dev_duration_us': np.float64(0.7118052168020874), 'min_duration_us': np.float64(6.679), 'max_duration_us': np.float64(8.279)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.156), 'mean_duration_us': np.float64(9.718666666666666), 'median_duration_us': np.float64(9.359), 'std_dev_duration_us': np.float64(0.5378973466708636), 'min_duration_us': np.float64(9.318), 'max_duration_us': np.float64(10.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1x1_ta1x8x1x1_1x4x1x32_tb1x8x1x2_1x4x1x32_mh', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.277), 'mean_duration_us': np.float64(13.425666666666666), 'median_duration_us': np.float64(13.439), 'std_dev_duration_us': np.float64(0.018856180831641704), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(13.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.997), 'mean_duration_us': np.float64(13.665666666666667), 'median_duration_us': np.float64(13.639), 'std_dev_duration_us': np.float64(0.06798692684790397), 'min_duration_us': np.float64(13.599), 'max_duration_us': np.float64(13.759)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x4x1x4_1x8x1x32_tb1x4x1x2_1x8x1x32_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.235), 'mean_duration_us': np.float64(28.078333333333333), 'median_duration_us': np.float64(28.078), 'std_dev_duration_us': np.float64(0.5229661132000395), 'min_duration_us': np.float64(27.438), 'max_duration_us': np.float64(28.719)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.87)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(7.68)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.72)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(13.43)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.67)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(28.08)}]",1.2940762506904229,65.25556102508227 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((50176, 196, 14, 1), (100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,87.58805338541667,87.58805338541667,86.5078125,86.5078125,1.9403670437970018,1.9403670437970018,86.42822265625,86.42822265625,89.828125,89.828125,262.76416015625,262.76416015625,848,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.476999999999999), 'mean_duration_us': np.float64(2.159), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.159)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5569999999999995), 'mean_duration_us': np.float64(2.1856666666666666), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.997), 'mean_duration_us': np.float64(2.332333333333333), 'median_duration_us': np.float64(2.359), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.957), 'mean_duration_us': np.float64(3.6523333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1359738536958075), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.477), 'mean_duration_us': np.float64(3.8256666666666668), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.12364824660660949), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.637), 'mean_duration_us': np.float64(3.879), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.799), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.997), 'mean_duration_us': np.float64(4.999), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(1.4580352076224588), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(7.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.997), 'mean_duration_us': np.float64(7.332333333333334), 'median_duration_us': np.float64(7.279), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.239), 'max_duration_us': np.float64(7.479)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.357), 'mean_duration_us': np.float64(12.119), 'median_duration_us': np.float64(12.079), 'std_dev_duration_us': np.float64(0.44181444068749043), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.679)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr1x1_ta1x4x1x1_1x8x1x32_tb1x4x1x4_1x8x1x32_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.357), 'mean_duration_us': np.float64(19.785666666666668), 'median_duration_us': np.float64(19.679), 'std_dev_duration_us': np.float64(0.24073960113690362), 'min_duration_us': np.float64(19.559), 'max_duration_us': np.float64(20.119)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi32ELi4ELi32ELi32ELi8ELi2ELi1ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ENSL_IJLi1ELi4ELi4ELi4EEEES28_S29_Li2ELi8ELi2ELb0ELb1ELi8ELi4ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEENSH_INS6_IJiNS9_IiLi32EEEEEELb0EEEEEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi32ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(64.437), 'mean_duration_us': np.float64(21.479), 'median_duration_us': np.float64(21.439), 'std_dev_duration_us': np.float64(0.18184242262647862), 'min_duration_us': np.float64(21.279), 'max_duration_us': np.float64(21.719)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.16)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.19)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.33)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.83)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.88)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.0)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(12.12)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(19.79)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(21.48)}]",1.2397224449656774,66.49528347004795 +aten::native_batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (512,), (512,), (512,), (512,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar')","((25088, 49, 7, 1), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",True,15,16.820930989583335,16.820930989583335,17.07763671875,17.07763671875,1.0621585372054239,1.0621585372054239,14.59716796875,14.59716796875,18.4375,18.4375,252.31396484375,252.31396484375,79,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(238.17999999999998), 'mean_duration_us': np.float64(3.9696666666666665), 'median_duration_us': np.float64(4.539), 'std_dev_duration_us': np.float64(1.3463009404372495), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.97)}]",1.12375813740561,69.98761109195446 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((50176, 196, 14, 1), (100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,75.08235677083333,75.08235677083333,75.06884765625,75.06884765625,0.45986563848762135,0.45986563848762135,74.62939453125,74.62939453125,75.548828125,75.548828125,225.2470703125,225.2470703125,760,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5169999999999995), 'mean_duration_us': np.float64(2.172333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.199)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1319932658214888), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.799)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.717), 'mean_duration_us': np.float64(3.905666666666667), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(4.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.997), 'mean_duration_us': np.float64(3.999), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.1423610433604174), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.597), 'mean_duration_us': np.float64(7.199000000000001), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(7.079), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.636), 'mean_duration_us': np.float64(7.212), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.06844462481938694), 'min_duration_us': np.float64(7.118), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.677), 'mean_duration_us': np.float64(19.892333333333333), 'median_duration_us': np.float64(19.799), 'std_dev_duration_us': np.float64(0.9005677221743096), 'min_duration_us': np.float64(18.839), 'max_duration_us': np.float64(21.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(65.196), 'mean_duration_us': np.float64(21.732), 'median_duration_us': np.float64(21.799), 'std_dev_duration_us': np.float64(0.2171128738697909), 'min_duration_us': np.float64(21.439), 'max_duration_us': np.float64(21.958)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.51)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.17)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.2)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(7.21)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(19.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(21.73)}]",1.0627166526938792,71.05032774464834 +aten::native_batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (256,), (256,), (256,), (256,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",True,15,13.421061197916666,13.421061197916666,13.39697265625,13.39697265625,0.15624974568664163,0.15624974568664163,13.23681640625,13.23681640625,13.8369140625,13.8369140625,201.31591796875,201.31591796875,482,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(174.86399999999998), 'mean_duration_us': np.float64(11.657599999999999), 'median_duration_us': np.float64(11.159), 'std_dev_duration_us': np.float64(1.1193715975194891), 'min_duration_us': np.float64(10.679), 'max_duration_us': np.float64(14.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 57, 'total_duration_us': np.float64(171.62300000000002), 'mean_duration_us': np.float64(3.010929824561404), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.5473071555679883), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.01)}]",0.8097344040008676,76.18513366050973 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,53.047200520833336,53.047200520833336,52.79443359375,52.79443359375,1.7144715434542532,1.7144715434542532,51.47314453125,51.47314453125,54.8740234375,54.8740234375,159.1416015625,159.1416015625,875,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.15434449203720302), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.919)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.277), 'mean_duration_us': np.float64(3.759), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.09797958971132721), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.477), 'mean_duration_us': np.float64(7.492333333333334), 'median_duration_us': np.float64(7.439), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.399), 'max_duration_us': np.float64(7.639)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.357), 'mean_duration_us': np.float64(9.785666666666666), 'median_duration_us': np.float64(9.679), 'std_dev_duration_us': np.float64(0.20997354330698184), 'min_duration_us': np.float64(9.599), 'max_duration_us': np.float64(10.079)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(39.837), 'mean_duration_us': np.float64(13.279000000000002), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.2993325909419156), 'min_duration_us': np.float64(12.879), 'max_duration_us': np.float64(13.599)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(45.076), 'mean_duration_us': np.float64(15.025333333333334), 'median_duration_us': np.float64(15.719), 'std_dev_duration_us': np.float64(1.7995185158505285), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(16.799)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.76)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.03)}]",0.7508307650004433,76.93596442551018 +aten::max_pool2d_with_indices_backward,other,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 112, 112), (), (), (), (), (), (10, 64, 56, 56))","('c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'long int')","((200704, 3136, 56, 1), (802816, 12544, 112, 1), (), (), (), (), (), (200704, 3136, 56, 1))","('', '', '[3, 3]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '')",False,3,52.07861328125,82.05094401041667,52.31884765625,82.677734375,0.4503509848123843,2.284896461956863,51.55908203125,79.51806640625,52.35791015625,83.95703125,156.23583984375,246.15283203125,1594,"[{'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw(c10::BFloat16 const*, long const*, int, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(156.236), 'mean_duration_us': np.float64(52.07866666666666), 'median_duration_us': np.float64(52.319), 'std_dev_duration_us': np.float64(0.3678045978807537), 'min_duration_us': np.float64(51.559), 'max_duration_us': np.float64(52.358)}]","[{'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(146.37), 'mean_duration_us': np.float64(4.8790000000000004), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.5807581252122092), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(6.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.88)}]",0.6905863650043503,79.07109175541645 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,30,4.712369791666666,4.712369791666666,4.67919921875,4.67919921875,0.412890788540921,0.412890788540921,4.119140625,4.119140625,5.35888671875,5.35888671875,141.37109375,141.37109375,5745,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(141.37), 'mean_duration_us': np.float64(4.7123333333333335), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4059666105591554), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.359)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.71)}]",0.6669894322231955,79.73808118763964 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,46.806803385416664,46.806803385416664,47.193359375,47.193359375,0.9608392846176006,0.9608392846176006,45.712890625,45.712890625,47.51416015625,47.51416015625,140.42041015625,140.42041015625,6009,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.396999999999998), 'mean_duration_us': np.float64(4.4656666666666665), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.16759740119968727), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.639)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.556), 'mean_duration_us': np.float64(5.185333333333333), 'median_duration_us': np.float64(5.278), 'std_dev_duration_us': np.float64(0.16091474623400923), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(5.319)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.997), 'mean_duration_us': np.float64(5.999), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.738286303995047), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(6.599)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.717), 'mean_duration_us': np.float64(6.905666666666666), 'median_duration_us': np.float64(7.359), 'std_dev_duration_us': np.float64(0.6411101482758033), 'min_duration_us': np.float64(5.999), 'max_duration_us': np.float64(7.359)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.476999999999997), 'mean_duration_us': np.float64(10.492333333333333), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.5309948733797298), 'min_duration_us': np.float64(9.919), 'max_duration_us': np.float64(11.199)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(41.277), 'mean_duration_us': np.float64(13.759), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.4537253207246281), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(14.399)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.47)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(5.19)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.49)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.76)}]",0.6625041029129437,80.40058529055258 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,30,4.597688802083334,4.597688802083334,4.638671875,4.638671875,0.4726140319865054,0.4726140319865054,3.71923828125,3.71923828125,6.0390625,6.0390625,137.9306640625,137.9306640625,5755,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(137.92800000000003), 'mean_duration_us': np.float64(4.597600000000001), 'median_duration_us': np.float64(4.6385000000000005), 'std_dev_duration_us': np.float64(0.46466702056418846), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(6.039)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",0.6507574700660134,81.0513427606186 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,30,4.593570963541667,4.593570963541667,4.6591796875,4.6591796875,1.0373284068708915,1.0373284068708915,1.55908203125,1.55908203125,6.31884765625,6.31884765625,137.80712890625,137.80712890625,5725,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(137.808), 'mean_duration_us': np.float64(4.5935999999999995), 'median_duration_us': np.float64(4.659000000000001), 'std_dev_duration_us': np.float64(1.0199425996920939), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(6.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.59)}]",0.6501746306641162,81.7015173912827 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (128,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,4.510904947916667,4.510904947916667,4.27880859375,4.27880859375,0.4786475103410302,0.4786475103410302,4.0390625,4.0390625,5.67919921875,5.67919921875,135.3271484375,135.3271484375,1771,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(135.32800000000003), 'mean_duration_us': np.float64(4.510933333333335), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4705758835960702), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.679)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]",0.6384740720782054,82.33999146336092 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,4.502962239583334,4.502962239583334,4.27880859375,4.27880859375,0.5168070532058079,0.5168070532058079,4.0390625,4.0390625,5.7587890625,5.7587890625,135.0888671875,135.0888671875,1801,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(135.09000000000003), 'mean_duration_us': np.float64(4.503000000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.5081312166491382), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.5)}]",0.6373498601093287,82.97734132347024 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,3,44.990397135416664,44.990397135416664,45.03125,45.03125,0.9803749232086446,0.9803749232086446,43.990234375,43.990234375,45.94970703125,45.94970703125,134.97119140625,134.97119140625,360,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.5969999999999995), 'mean_duration_us': np.float64(1.8656666666666666), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.957), 'mean_duration_us': np.float64(2.319), 'median_duration_us': np.float64(2.319), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757000000000001), 'mean_duration_us': np.float64(3.585666666666667), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.06798692684790367), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.13199326582148882), 'min_duration_us': np.float64(3.599), 'max_duration_us': np.float64(3.919)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.556000000000001), 'mean_duration_us': np.float64(4.518666666666667), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.08594701209983321), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(4.638)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.556999999999999), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.06798692684790346), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT3128_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR1_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVW2_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA256_LBSPPB256_LPA32_LPB16_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS16_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SCIUI1_SPO0_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_16_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA1_WSGRB0_WS64_WG16_8_2_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.916), 'mean_duration_us': np.float64(5.6386666666666665), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.06572839738060139), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(5.719)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(15.079), 'std_dev_duration_us': np.float64(0.4877157642179166), 'min_duration_us': np.float64(14.159), 'max_duration_us': np.float64(15.279)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.87)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.32)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.64)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]",0.6367946652640433,83.61413598873429 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,4.424300130208334,4.424300130208334,4.27880859375,4.27880859375,0.4238580059237626,0.4238580059237626,4.0390625,4.0390625,5.47900390625,5.47900390625,132.72900390625,132.72900390625,1741,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(132.729), 'mean_duration_us': np.float64(4.424300000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4167844486862084), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.42)}]",0.6262160149339581,84.24035200366825 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,41.607259114583336,41.607259114583336,42.07373046875,42.07373046875,0.8786485534396721,0.8786485534396721,40.59375,40.59375,42.154296875,42.154296875,124.82177734375,124.82177734375,6267,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.277), 'mean_duration_us': np.float64(4.425666666666666), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.18571184369578841), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.437000000000001), 'mean_duration_us': np.float64(4.479), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.639)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.517), 'mean_duration_us': np.float64(4.8389999999999995), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.2902872140943631), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(5.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.757), 'mean_duration_us': np.float64(5.5856666666666674), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.1643843734125062), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(5.799)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.477), 'mean_duration_us': np.float64(17.159), 'median_duration_us': np.float64(17.159), 'std_dev_duration_us': np.float64(0.4898979485566353), 'min_duration_us': np.float64(16.559), 'max_duration_us': np.float64(17.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.43)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.48)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.84)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.59)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(17.16)}]",0.5889096857864407,84.8292616894547 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,41.473795572916664,41.473795572916664,41.033203125,41.033203125,1.5480063825290074,1.5480063825290074,40.19384765625,40.19384765625,43.1943359375,43.1943359375,124.42138671875,124.42138671875,72,"[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.357), 'mean_duration_us': np.float64(4.452333333333333), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.22939534045447024), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.916999999999998), 'mean_duration_us': np.float64(4.638999999999999), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.4079215610874227), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.557), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.27904599381941786), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.836), 'mean_duration_us': np.float64(5.611999999999999), 'median_duration_us': np.float64(5.478), 'std_dev_duration_us': np.float64(0.27792924759130083), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(5.999)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.397), 'mean_duration_us': np.float64(16.799), 'median_duration_us': np.float64(16.719), 'std_dev_duration_us': np.float64(0.851038581185758), 'min_duration_us': np.float64(15.799), 'max_duration_us': np.float64(17.879)}]","[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.61)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(16.8)}]",0.5870206410846397,85.41628233053933 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[1, 1]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,40.700520833333336,40.700520833333336,40.75390625,40.75390625,0.8011398380941223,0.8011398380941223,39.8740234375,39.8740234375,41.4736328125,41.4736328125,122.1015625,122.1015625,6138,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.917), 'mean_duration_us': np.float64(4.639), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4418144406874905), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(5.159)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.957), 'mean_duration_us': np.float64(4.652333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.30346151137976096), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.079)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.3785351884420904), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.997), 'mean_duration_us': np.float64(5.665666666666667), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.46341725858620714), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.877000000000002), 'mean_duration_us': np.float64(5.9590000000000005), 'median_duration_us': np.float64(5.839), 'std_dev_duration_us': np.float64(0.19866219234335095), 'min_duration_us': np.float64(5.799), 'max_duration_us': np.float64(6.239)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(14.759), 'std_dev_duration_us': np.float64(0.4607240678178929), 'min_duration_us': np.float64(14.319), 'max_duration_us': np.float64(15.439)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.95)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.67)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.96)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]",0.5760757003794492,85.99235803091878 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,30,3.868310546875,3.868310546875,4.19873046875,4.19873046875,1.3189206115385315,1.3189206115385315,0.798828125,0.798828125,5.59912109375,5.59912109375,116.04931640625,116.04931640625,1654,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(116.04899999999999), 'mean_duration_us': np.float64(3.8682999999999996), 'median_duration_us': np.float64(4.1985), 'std_dev_duration_us': np.float64(1.296753976923405), 'min_duration_us': np.float64(0.799), 'max_duration_us': np.float64(5.599)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]",0.5475211771125924,86.53987920803137 +aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), (512,), (512,), (512,), (512,), (512,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (25088, 49, 7, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,15,7.585579427083333,7.585579427083333,7.31884765625,7.31884765625,1.1608900026613005,1.1608900026613005,6.47900390625,6.47900390625,10.67919921875,10.67919921875,113.78369140625,113.78369140625,234,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(113.78399999999999), 'mean_duration_us': np.float64(7.5855999999999995), 'median_duration_us': np.float64(7.319), 'std_dev_duration_us': np.float64(1.1215021949748174), 'min_duration_us': np.float64(6.479), 'max_duration_us': np.float64(10.679)}]","[{'name': 'void at::native::batch_norm_backward_kernel, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float>(at::native::(anonymous namespace)::TensorListMetadata<2>, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(90.756), 'mean_duration_us': np.float64(30.252), 'median_duration_us': np.float64(30.119), 'std_dev_duration_us': np.float64(1.5382992773406174), 'min_duration_us': np.float64(28.438), 'max_duration_us': np.float64(32.199)}]","[{'name': 'void at::native::(anonymous namespace)::multi_tensor_apply_kerne...', 'stream': 0, 'mean_duration_us': np.float64(30.25)}]",0.42818884107199695,87.50489999765942 +aten::fill_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), ())","('c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), ())","('', '0')",False,3,29.972330729166668,29.972330729166668,30.35888671875,30.35888671875,1.8505993576703914,1.8505993576703914,27.958984375,27.958984375,31.59912109375,31.59912109375,89.9169921875,89.9169921875,1596,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.917), 'mean_duration_us': np.float64(29.972333333333335), 'median_duration_us': np.float64(30.359), 'std_dev_duration_us': np.float64(1.510967313419527), 'min_duration_us': np.float64(27.959), 'max_duration_us': np.float64(31.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(29.97)}]",0.4242287583373679,87.92912875599679 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), ())","('c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), ())","('', '0')",False,12,7.302205403645833,7.302205403645833,7.158935546875,7.158935546875,0.893610122762632,0.893610122762632,6.119140625,6.119140625,9.39892578125,9.39892578125,87.62646484375,87.62646484375,5922,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(87.62700000000002), 'mean_duration_us': np.float64(7.302250000000002), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.8555424327096035), 'min_duration_us': np.float64(6.119), 'max_duration_us': np.float64(9.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.3)}]",0.413422040415236,88.34255079641203 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (), (512,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.7550455729166665,2.7550455729166665,3.43896484375,3.43896484375,1.6544370356456592,1.6544370356456592,0.63916015625,0.63916015625,5.9990234375,5.9990234375,82.6513671875,82.6513671875,251,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(82.649), 'mean_duration_us': np.float64(2.754966666666667), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(1.6267029329973628), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.999)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.75)}]",0.3899495081388339,88.73250030455087 +aten::max_pool2d_with_indices,other,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), (), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar')","((802816, 12544, 112, 1), (), (), (), (), ())","('', '[3, 3]', '[2, 2]', '[1, 1]', '[1, 1]', 'False')",False,3,23.585286458333332,23.585286458333332,23.23779296875,23.23779296875,0.7803342920411799,0.7803342920411799,23.0390625,23.0390625,24.47900390625,24.47900390625,70.755859375,70.755859375,5893,"[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw(int, c10::BFloat16 const*, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*, long*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(70.756), 'mean_duration_us': np.float64(23.585333333333335), 'median_duration_us': np.float64(23.238), 'std_dev_duration_us': np.float64(0.6371186877044349), 'min_duration_us': np.float64(23.039), 'max_duration_us': np.float64(24.479)}]","[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.46600000000001), 'mean_duration_us': np.float64(5.622166666666668), 'median_duration_us': np.float64(5.7989999999999995), 'std_dev_duration_us': np.float64(0.5222931541662104), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.62)}]",0.31830633596650804,89.38463309130832 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,22.236653645833332,22.236653645833332,22.27685546875,22.27685546875,0.14463376370416037,0.14463376370416037,22.076171875,22.076171875,22.35693359375,22.35693359375,66.7099609375,66.7099609375,935,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.596), 'mean_duration_us': np.float64(4.865333333333333), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.037950259843935186), 'min_duration_us': np.float64(4.838), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.277), 'mean_duration_us': np.float64(7.092333333333333), 'median_duration_us': np.float64(7.119), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(6.959), 'max_duration_us': np.float64(7.199)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(30.837), 'mean_duration_us': np.float64(10.279), 'median_duration_us': np.float64(10.319), 'std_dev_duration_us': np.float64(0.18184242262647798), 'min_duration_us': np.float64(10.039), 'max_duration_us': np.float64(10.479)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.87)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(10.28)}]",0.31473788445054507,89.69937097575887 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",False,12,5.5555419921875,5.5555419921875,5.71923828125,5.71923828125,0.48117926954934276,0.48117926954934276,4.8388671875,4.8388671875,6.35888671875,6.35888671875,66.66650390625,66.66650390625,6029,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(66.66699999999999), 'mean_duration_us': np.float64(5.555583333333332), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.46067531196663397), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.56)}]",0.31453285398900815,90.01390382974787 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",False,12,5.459025065104167,5.459025065104167,5.37890625,5.37890625,0.3592526349408488,0.3592526349408488,4.9189453125,4.9189453125,6.19921875,6.19921875,65.50830078125,65.50830078125,6158,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(65.508), 'mean_duration_us': np.float64(5.459), 'median_duration_us': np.float64(5.379), 'std_dev_duration_us': np.float64(0.3438992100407715), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.46)}]",0.3090684466320913,90.32297227637997 +aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",True,12,5.318806966145833,5.318806966145833,5.279052734375,5.279052734375,0.5309911273970868,0.5309911273970868,4.55810546875,4.55810546875,6.27880859375,6.27880859375,63.82568359375,63.82568359375,94,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(63.826), 'mean_duration_us': np.float64(5.318833333333333), 'median_duration_us': np.float64(5.279), 'std_dev_duration_us': np.float64(0.5084422014567852), 'min_duration_us': np.float64(4.558), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]",0.30112985145842547,90.6241021278384 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (), (256,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.08974609375,2.08974609375,2.01904296875,2.01904296875,1.4501653361546871,1.4501653361546871,0.63916015625,0.63916015625,3.67919921875,3.67919921875,62.6923828125,62.6923828125,654,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.68900000000001), 'mean_duration_us': np.float64(2.0896333333333335), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.425860780565745), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]",0.29578293346710843,90.91988506130551 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (), (128,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.087109375,2.087109375,2.0390625,2.0390625,1.4501753944792757,1.4501753944792757,0.63916015625,0.63916015625,3.67919921875,3.67919921875,62.61328125,62.61328125,1054,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.039), 'std_dev_duration_us': np.float64(1.425871429454049), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]",0.2954097319528502,91.21529479325835 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (), (64,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,30,2.087109375,2.087109375,2.01904296875,2.01904296875,1.4530668185492028,1.4530668185492028,0.63916015625,0.63916015625,3.67919921875,3.67919921875,62.61328125,62.61328125,1426,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.4287113074375803), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]",0.2954097319528502,91.5107045252112 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '0')",False,12,5.1123046875,5.1123046875,3.458984375,3.458984375,3.398747629905021,3.398747629905021,2.71923828125,2.71923828125,10.958984375,10.958984375,61.34765625,61.34765625,1402,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.348), 'mean_duration_us': np.float64(5.112333333333333), 'median_duration_us': np.float64(3.4589999999999996), 'std_dev_duration_us': np.float64(3.254036809188789), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(10.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.11)}]",0.28943850772471846,91.80014303293592 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",False,12,5.065714518229167,5.065714518229167,5.01904296875,5.01904296875,0.33309153344527864,0.33309153344527864,4.55908203125,4.55908203125,5.67919921875,5.67919921875,60.78857421875,60.78857421875,6287,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(60.788000000000004), 'mean_duration_us': np.float64(5.065666666666667), 'median_duration_us': np.float64(5.019), 'std_dev_duration_us': np.float64(0.3188869531493706), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.07)}]",0.2868007562813501,92.08694378921727 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (64, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,12,4.738972981770833,4.738972981770833,4.618896484375,4.618896484375,0.5046606226144523,0.5046606226144523,4.119140625,4.119140625,5.51904296875,5.51904296875,56.86767578125,56.86767578125,1805,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(56.868), 'mean_duration_us': np.float64(4.739), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.4831838849409888), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.519)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]",0.26830194048200684,92.35524572969928 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,9,6.270073784722222,6.270073784722222,6.0390625,6.0390625,0.5623815435318228,0.5623815435318228,5.59912109375,5.59912109375,7.31884765625,7.31884765625,56.4306640625,56.4306640625,1254,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(56.431), 'mean_duration_us': np.float64(6.2701111111111105), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.5302503485135729), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(7.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.27)}]",0.26624011730138264,92.62148584700066 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '0')",False,12,4.608968098958333,4.608968098958333,3.85888671875,3.85888671875,2.3743423923450107,2.3743423923450107,2.19921875,2.19921875,8.51904296875,8.51904296875,55.3076171875,55.3076171875,1030,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(55.308), 'mean_duration_us': np.float64(4.609), 'median_duration_us': np.float64(3.859), 'std_dev_duration_us': np.float64(2.273213584333861), 'min_duration_us': np.float64(2.199), 'max_duration_us': np.float64(8.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]",0.26094157728413614,92.8824274242848 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,18.410481770833332,18.410481770833332,18.43701171875,18.43701171875,1.3202682878965732,1.3202682878965732,17.0771484375,17.0771484375,19.71728515625,19.71728515625,55.2314453125,55.2314453125,6056,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.477), 'mean_duration_us': np.float64(5.825666666666667), 'median_duration_us': np.float64(6.119), 'std_dev_duration_us': np.float64(0.716534871602368), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.157), 'mean_duration_us': np.float64(6.052333333333333), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.4847909056719425), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.559)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.639), 'std_dev_duration_us': np.float64(0.3670906639449654), 'min_duration_us': np.float64(6.039), 'max_duration_us': np.float64(6.919)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.2605821980481837,93.14300962233298 +aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",True,12,4.4456787109375,4.4456787109375,4.55908203125,4.55908203125,0.7578874066557242,0.7578874066557242,3.0791015625,3.0791015625,5.35888671875,5.35888671875,53.34814453125,53.34814453125,897,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(53.348), 'mean_duration_us': np.float64(4.445666666666667), 'median_duration_us': np.float64(4.559), 'std_dev_duration_us': np.float64(0.725687413575723), 'min_duration_us': np.float64(3.079), 'max_duration_us': np.float64(5.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]",0.25169677681056646,93.39470639914354 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), ())","('c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), ())","('', '0')",False,3,17.265625,17.265625,17.0390625,17.0390625,0.4635000603108948,0.4635000603108948,16.958984375,16.958984375,17.798828125,17.798828125,51.796875,51.796875,5891,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.797), 'mean_duration_us': np.float64(17.265666666666664), 'median_duration_us': np.float64(17.039), 'std_dev_duration_us': np.float64(0.37853518844208994), 'min_duration_us': np.float64(16.959), 'max_duration_us': np.float64(17.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(17.27)}]",0.2443778804476133,93.63908427959116 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,17.1572265625,17.1572265625,17.197265625,17.197265625,1.3007552227360448,1.3007552227360448,15.8369140625,15.8369140625,18.4375,18.4375,51.4716796875,51.4716796875,132,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.677), 'mean_duration_us': np.float64(5.559), 'median_duration_us': np.float64(5.359), 'std_dev_duration_us': np.float64(0.40133111848779757), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.119)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.29454296045832684), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.119)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.557000000000002), 'mean_duration_us': np.float64(5.852333333333334), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.547803695577977), 'min_duration_us': np.float64(5.079), 'max_duration_us': np.float64(6.279)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.56)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.85)}]",0.24284360755566278,93.88192788714682 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,17.063802083333332,17.063802083333332,16.63720703125,16.63720703125,1.2943239361047492,1.2943239361047492,16.03662109375,16.03662109375,18.517578125,18.517578125,51.19140625,51.19140625,6314,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.877), 'mean_duration_us': np.float64(5.625666666666667), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.37853518844209033), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(6.159)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.076999999999998), 'mean_duration_us': np.float64(5.692333333333333), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.3612324582438417), 'min_duration_us': np.float64(5.279), 'max_duration_us': np.float64(6.159)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.3461534662865911), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.199)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.63)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]",0.24152127626440212,94.12344916341122 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",False,3,16.383951822916668,16.383951822916668,16.1572265625,16.1572265625,0.8043624567112516,0.8043624567112516,15.71728515625,15.71728515625,17.27734375,17.27734375,49.15185546875,49.15185546875,6185,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.877), 'mean_duration_us': np.float64(5.292333333333334), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.7052816616233701), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(6.199)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.117), 'mean_duration_us': np.float64(5.372333333333334), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.2659991645768003), 'min_duration_us': np.float64(4.999), 'max_duration_us': np.float64(5.599)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.157), 'mean_duration_us': np.float64(5.719), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.26733250207684545), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(6.079)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.29)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.37)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.72)}]",0.23189866685047222,94.35534783026169 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '0')",False,12,3.9957682291666665,3.9957682291666665,3.619140625,3.619140625,1.984446512224859,1.984446512224859,1.67919921875,1.67919921875,7.19921875,7.19921875,47.94921875,47.94921875,630,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(47.94800000000001), 'mean_duration_us': np.float64(3.995666666666667), 'median_duration_us': np.float64(3.6189999999999998), 'std_dev_duration_us': np.float64(1.8999268991785507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]",0.22622462160591653,94.58157245186761 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (512, 512, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4608, 9, 3, 1), (4608, 9, 3, 1), ())","('', '', 'False')",False,9,5.150119357638889,5.150119357638889,4.8388671875,4.8388671875,0.6976119225404901,0.6976119225404901,4.35888671875,4.35888671875,6.27880859375,6.27880859375,46.35107421875,46.35107421875,1658,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(46.35100000000001), 'mean_duration_us': np.float64(5.150111111111112), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.6577477470622245), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(6.279)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.15)}]",0.21868456879006962,94.80025702065768 +aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",True,12,3.7023111979166665,3.7023111979166665,3.638916015625,3.638916015625,0.6702554335583752,0.6702554335583752,2.958984375,2.958984375,4.59912109375,4.59912109375,44.427734375,44.427734375,497,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(44.428000000000004), 'mean_duration_us': np.float64(3.7023333333333337), 'median_duration_us': np.float64(3.6390000000000002), 'std_dev_duration_us': np.float64(0.6417597335105681), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(4.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.7)}]",0.20961024308227225,95.00986726373995 +aten::miopen_convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'Scalar', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[0, 0]', '[2, 2]', '[1, 1]', '1', 'False', 'False')",True,3,14.63671875,14.63671875,14.63671875,14.63671875,0.1201171875,0.1201171875,14.5166015625,14.5166015625,14.7568359375,14.7568359375,43.91015625,43.91015625,535,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.477), 'mean_duration_us': np.float64(4.492333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(4.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.397), 'mean_duration_us': np.float64(4.799), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.05656854249492343), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.879)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.037), 'mean_duration_us': np.float64(5.345666666666666), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(5.399)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.8)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.35)}]",0.20716830724823687,95.21703557098819 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (128, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,9,4.821180555555555,4.821180555555555,4.7587890625,4.7587890625,0.44821790427644176,0.44821790427644176,4.23876953125,4.23876953125,5.47900390625,5.47900390625,43.390625,43.390625,1775,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.391), 'mean_duration_us': np.float64(4.821222222222222), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.4225262063608935), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.82)}]",0.20471715656199763,95.42175272755019 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 256, 3, 3), (256, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,9,4.701171875,4.701171875,4.47900390625,4.47900390625,0.4952850959970768,0.4952850959970768,4.31884765625,4.31884765625,5.63916015625,5.63916015625,42.310546875,42.310546875,1745,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(42.311), 'mean_duration_us': np.float64(4.701222222222222), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.46689941285933856), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.639)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.7)}]",0.19962134329323705,95.62137407084342 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,6,7.012451171875,7.012451171875,6.71923828125,6.71923828125,0.8351389698492557,0.8351389698492557,6.43896484375,6.43896484375,8.63916015625,8.63916015625,42.07470703125,42.07470703125,5945,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(42.074), 'mean_duration_us': np.float64(7.012333333333333), 'median_duration_us': np.float64(6.719), 'std_dev_duration_us': np.float64(0.7623355924758827), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(8.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.01)}]",0.19850864988961528,95.81988272073303 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '0')",False,12,3.1856282552083335,3.1856282552083335,2.959228515625,2.959228515625,1.3758855731737367,1.3758855731737367,1.9189453125,1.9189453125,6.27880859375,6.27880859375,38.2275390625,38.2275390625,227,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(38.228), 'mean_duration_us': np.float64(3.1856666666666666), 'median_duration_us': np.float64(2.9589999999999996), 'std_dev_duration_us': np.float64(1.3174048563579668), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.19)}]",0.1803576947609695,96.000240415494 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",True,6,6.258951822916667,6.258951822916667,6.298828125,6.298828125,0.47782093094713657,0.47782093094713657,5.71923828125,5.71923828125,7.0390625,7.0390625,37.5537109375,37.5537109375,1328,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(37.554), 'mean_duration_us': np.float64(6.259), 'median_duration_us': np.float64(6.2989999999999995), 'std_dev_duration_us': np.float64(0.4361956747454822), 'min_duration_us': np.float64(5.719), 'max_duration_us': np.float64(7.039)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.26)}]",0.17717857075062157,96.17741898624463 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), ())","('', '', '0')",False,3,12.185709635416666,12.185709635416666,11.9990234375,11.9990234375,0.698889002841252,0.698889002841252,11.59912109375,11.59912109375,12.958984375,12.958984375,36.55712890625,36.55712890625,1600,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.557), 'mean_duration_us': np.float64(12.185666666666668), 'median_duration_us': np.float64(11.999), 'std_dev_duration_us': np.float64(0.5706915882408716), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(12.19)}]",0.17247669241357805,96.34989567865821 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (), (512, 512, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((4608, 9, 3, 1), (), (4608, 9, 3, 1))","('', '', '')",False,9,3.710177951388889,3.710177951388889,3.9990234375,3.9990234375,0.8288603382936338,0.8288603382936338,2.59912109375,2.59912109375,4.63916015625,4.63916015625,33.3916015625,33.3916015625,272,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.391), 'mean_duration_us': np.float64(3.710111111111111), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.7815148316562939), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(4.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]",0.15754172070409578,96.50743739936232 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,6,5.445638020833333,5.445638020833333,5.739013671875,5.739013671875,0.6823692762967902,0.6823692762967902,4.31884765625,4.31884765625,6.0791015625,6.0791015625,32.673828125,32.673828125,6074,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.674), 'mean_duration_us': np.float64(5.445666666666667), 'median_duration_us': np.float64(5.739000000000001), 'std_dev_duration_us': np.float64(0.6228607834464742), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]",0.15415526251915998,96.66159266188147 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,6,5.399007161458333,5.399007161458333,5.19921875,5.19921875,1.1462242511559813,1.1462242511559813,4.27880859375,4.27880859375,7.27880859375,7.27880859375,32.39404296875,32.39404296875,6332,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.394000000000005), 'mean_duration_us': np.float64(5.399000000000001), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(1.0463906217724492), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(7.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.4)}]",0.1528352349409503,96.81442789682242 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,6,5.392252604166667,5.392252604166667,5.39892578125,5.39892578125,0.3687834988480689,0.3687834988480689,4.7587890625,4.7587890625,5.8388671875,5.8388671875,32.353515625,32.353515625,6203,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.354), 'mean_duration_us': np.float64(5.392333333333333), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.33658414830304906), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.39)}]",0.15264402675771924,96.96707192358014 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",True,6,5.212483723958333,5.212483723958333,5.05908203125,5.05908203125,0.8603393923316893,0.8603393923316893,4.1591796875,4.1591796875,6.55908203125,6.55908203125,31.27490234375,31.27490234375,153,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(31.274), 'mean_duration_us': np.float64(5.2123333333333335), 'median_duration_us': np.float64(5.059), 'std_dev_duration_us': np.float64(0.7854227453345676), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(6.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]",0.1475551246281116,97.11462704820825 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (), (64, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,12,2.5723876953125,2.5723876953125,2.51904296875,2.51904296875,1.0093065844733184,1.0093065844733184,1.55908203125,1.55908203125,3.7587890625,3.7587890625,30.86865234375,30.86865234375,1447,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(30.868), 'mean_duration_us': np.float64(2.5723333333333334), 'median_duration_us': np.float64(2.519), 'std_dev_duration_us': np.float64(0.9664137600197731), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.57)}]",0.14563843536969895,97.26026548357795 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",True,6,4.932210286458333,4.932210286458333,4.89892578125,4.89892578125,0.38339940966681924,0.38339940966681924,4.31884765625,4.31884765625,5.39892578125,5.39892578125,29.59326171875,29.59326171875,956,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(29.593999999999998), 'mean_duration_us': np.float64(4.932333333333333), 'median_duration_us': np.float64(4.898999999999999), 'std_dev_duration_us': np.float64(0.3499841266241783), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.93)}]",0.1396211368805477,97.3998866204585 +aten::mm,GEMM,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (1000, 512))","('c10::BFloat16', 'c10::BFloat16')","((1000, 1), (512, 1))","('', '')",False,3,8.86572265625,8.86572265625,9.119140625,9.119140625,0.6575774436567361,0.6575774436567361,8.119140625,8.119140625,9.35888671875,9.35888671875,26.59716796875,26.59716796875,16,"[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LBSPPA256_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD0_NTM0_NEPBS0_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.597), 'mean_duration_us': np.float64(8.865666666666668), 'median_duration_us': np.float64(9.119), 'std_dev_duration_us': np.float64(0.5369874817493938), 'min_duration_us': np.float64(8.119), 'max_duration_us': np.float64(9.359)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]",0.12548555359975436,97.52537217405826 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",True,6,4.33203125,4.33203125,4.29833984375,4.29833984375,0.09015475637167203,0.09015475637167203,4.23876953125,4.23876953125,4.47900390625,4.47900390625,25.9921875,25.9921875,556,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.993), 'mean_duration_us': np.float64(4.332166666666667), 'median_duration_us': np.float64(4.2985), 'std_dev_duration_us': np.float64(0.08222006378548305), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.479)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]",0.12263125312959418,97.64800342718786 +aten::sum,reduce,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '')","((1000, 1), (), (), ())","('', '[0]', 'True', '')",False,3,7.985677083333333,7.985677083333333,7.958984375,7.958984375,0.36060498707123123,0.36060498707123123,7.63916015625,7.63916015625,8.35888671875,8.35888671875,23.95703125,23.95703125,26,"[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.956999999999997), 'mean_duration_us': np.float64(7.985666666666666), 'median_duration_us': np.float64(7.959), 'std_dev_duration_us': np.float64(0.2945429604583269), 'min_duration_us': np.float64(7.639), 'max_duration_us': np.float64(8.359)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.076999999999998), 'mean_duration_us': np.float64(7.358999999999999), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.31155523854794487), 'min_duration_us': np.float64(7.119), 'max_duration_us': np.float64(7.799)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.991), 'mean_duration_us': np.float64(2.4434444444444443), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.895111552465962), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]",0.10375232467683974,97.96894521088467 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (), (128, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,9,2.4078776041666665,2.4078776041666665,1.87890625,1.87890625,0.9181949417968699,0.9181949417968699,1.67919921875,1.67919921875,3.7587890625,3.7587890625,21.6708984375,21.6708984375,1075,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.670999999999996), 'mean_duration_us': np.float64(2.4078888888888885), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.8656974637628507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.41)}]",0.10224339262844998,98.07118860351312 +aten::mse_loss_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((), (10, 1000), (10, 1000), (), (10, 1000))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'c10::BFloat16')","((), (1000, 1), (1000, 1), (), (1000, 1))","('', '', '', '1', '')",False,3,7.118977864583333,7.118977864583333,7.47900390625,7.47900390625,0.7664773569099081,0.7664773569099081,6.23876953125,6.23876953125,7.63916015625,7.63916015625,21.35693359375,21.35693359375,9,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.357), 'mean_duration_us': np.float64(7.119), 'median_duration_us': np.float64(7.479), 'std_dev_duration_us': np.float64(0.625672971021337), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(7.639)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.12)}]",0.10076210513667193,98.17195070864979 +aten::mse_loss,elementwise,python3,CPU,thread 542 (python3),"((10, 1000), (10, 1000), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1000, 1), (1000, 1), ())","('', '', '1')",False,3,6.5322265625,12.597981770833334,6.59912109375,12.43798828125,0.26638550439867287,0.7331822767157538,6.23876953125,11.9580078125,6.7587890625,13.39794921875,19.5966796875,37.7939453125,6404,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.599), 'std_dev_duration_us': np.float64(0.21746008573733472), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(6.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",0.09245721958790075,98.26440792823769 +aten::mean,reduce,python3,CPU,thread 542 (python3),"((10, 1000), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '', 'c10::BFloat16')","((1000, 1), (), (), (), ())","('', '[]', 'False', '', '')",False,3,6.065755208333333,6.065755208333333,6.19921875,6.19921875,0.6504878218749942,0.6504878218749942,5.35888671875,5.35888671875,6.63916015625,6.63916015625,18.197265625,18.197265625,6408,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.197000000000003), 'mean_duration_us': np.float64(6.065666666666668), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.5309948733797302), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.639)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]",0.0835856206285893,98.51819417278548 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,6,2.9457194010416665,2.9457194010416665,2.63916015625,2.63916015625,0.7493654374675626,0.7493654374675626,2.119140625,2.119140625,3.87890625,3.87890625,17.67431640625,17.67431640625,454,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.6390000000000002), 'std_dev_duration_us': np.float64(0.6841702192355998), 'min_duration_us': np.float64(2.119), 'max_duration_us': np.float64(3.879)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]",0.0833875013062053,98.60158167409169 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,6,2.9456380208333335,2.9456380208333335,2.9189453125,2.9189453125,0.27438967631487227,0.27438967631487227,2.59912109375,2.59912109375,3.43896484375,3.43896484375,17.673828125,17.673828125,854,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.919), 'std_dev_duration_us': np.float64(0.25051058970741247), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(3.439)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]",0.08338519759315433,98.68496687168485 +aten::addmm,GEMM,python3,CPU,thread 542 (python3),"((1000,), (10, 512), (512, 1000), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",False,3,5.5322265625,5.5322265625,5.31884765625,5.31884765625,0.36958310688847623,0.36958310688847623,5.31884765625,5.31884765625,5.958984375,5.958984375,16.5966796875,16.5966796875,6400,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.597), 'mean_duration_us': np.float64(5.532333333333334), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(5.959)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]",0.07830320660269961,98.76327007828755 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (256, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,3,4.985677083333333,4.985677083333333,5.0390625,5.0390625,0.4822019830070951,0.4822019830070951,4.47900390625,4.47900390625,5.43896484375,5.43896484375,14.95703125,14.95703125,1769,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.957), 'mean_duration_us': np.float64(4.985666666666667), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.3937286149395573), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(5.439)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.99)}]",0.0705673381775197,98.83383741646507 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (512, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,3,4.945638020833333,4.945638020833333,4.7587890625,4.7587890625,0.5446142789205571,0.5446142789205571,4.51904296875,4.51904296875,5.55908203125,5.55908203125,14.8369140625,14.8369140625,1739,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837000000000002), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.44462218668088177), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.95)}]",0.07000062476697942,98.90383804123205 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (), (1000, 512))","('c10::BFloat16', 'double', 'c10::BFloat16')","((512, 1), (), (512, 1))","('', '', '')",False,3,4.86572265625,4.86572265625,5.0791015625,5.0791015625,0.36958310688847623,0.36958310688847623,4.43896484375,4.43896484375,5.0791015625,5.0791015625,14.59716796875,14.59716796875,45,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.597), 'mean_duration_us': np.float64(4.865666666666667), 'median_duration_us': np.float64(5.079), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.87)}]",0.06886950165894984,98.972707542891 +aten::fill_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), ())","('c10::BFloat16', 'Scalar')","((1000, 1), ())","('', '0')",False,3,4.798665364583333,4.798665364583333,4.67822265625,4.67822265625,0.4716395854027524,0.4716395854027524,4.39892578125,4.39892578125,5.31884765625,5.31884765625,14.39599609375,14.39599609375,8,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.396), 'mean_duration_us': np.float64(4.798666666666667), 'median_duration_us': np.float64(4.678), 'std_dev_duration_us': np.float64(0.38515826472878506), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.8)}]",0.06792037188194741,99.04062791477295 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (256, 128, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((128, 1, 1, 1), (128, 1, 1, 1), ())","('', '', 'False')",False,3,4.772298177083333,4.772298177083333,4.71923828125,4.71923828125,0.5220458095712031,0.5220458095712031,4.27880859375,4.27880859375,5.31884765625,5.31884765625,14.31689453125,14.31689453125,1757,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.317), 'mean_duration_us': np.float64(4.772333333333333), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.77)}]",0.06754717036768919,99.10817508514064 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (64, 3, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((147, 49, 7, 1), (147, 49, 7, 1), ())","('', '', 'False')",False,3,4.758951822916667,4.758951822916667,4.59912109375,4.59912109375,0.5769098932439007,0.5769098932439007,4.27880859375,4.27880859375,5.39892578125,5.39892578125,14.27685546875,14.27685546875,1829,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.277000000000001), 'mean_duration_us': np.float64(4.759), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.4710272462041519), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.76)}]",0.0673582658975091,99.17553335103815 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (128, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,3,4.625651041666667,4.625651041666667,4.35888671875,4.35888671875,0.4971274672189554,0.4971274672189554,4.31884765625,4.31884765625,5.19921875,5.19921875,13.876953125,13.876953125,1799,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.876999999999999), 'mean_duration_us': np.float64(4.625666666666667), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.405736641458745), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.199)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.63)}]",0.06547152490875914,99.24100487594691 +aten::fill_,elementwise,python3,CPU,thread 542 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '1.')",False,3,4.598958333333333,4.598958333333333,4.59912109375,4.59912109375,0.3200683904124541,0.3200683904124541,4.27880859375,4.27880859375,4.9189453125,4.9189453125,13.796875,13.796875,6413,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.797), 'mean_duration_us': np.float64(4.599), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.2612789058968722), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",0.06509371596839895,99.30609859191532 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (1000,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,3,4.518880208333333,4.518880208333333,4.7587890625,4.7587890625,0.48653430985275825,0.48653430985275825,3.958984375,3.958984375,4.8388671875,4.8388671875,13.556640625,13.556640625,1650,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.557), 'mean_duration_us': np.float64(4.519), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.39732438468670256), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(4.839)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.52)}]",0.0639602891473184,99.37005888106263 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (), (1000,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,3,4.412272135416667,4.412272135416667,4.23876953125,4.23876953125,0.44599523130071334,0.44599523130071334,4.0791015625,4.0791015625,4.9189453125,4.9189453125,13.23681640625,13.23681640625,33,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.236999999999998), 'mean_duration_us': np.float64(4.412333333333333), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(0.3641733408999376), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}]",0.06245135709892863,99.43251023816156 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (128, 64, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1, 1, 1), (64, 1, 1, 1), ())","('', '', 'False')",False,3,4.372395833333333,4.372395833333333,4.19921875,4.19921875,0.3352246668890176,0.3352246668890176,4.1591796875,4.1591796875,4.7587890625,4.7587890625,13.1171875,13.1171875,1787,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.116999999999999), 'mean_duration_us': np.float64(4.372333333333333), 'median_duration_us': np.float64(4.199), 'std_dev_duration_us': np.float64(0.27390184778898874), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]",0.061886947401439324,99.49439718556299 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (512, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1, 1, 1), (256, 1, 1, 1), ())","('', '', 'False')",False,3,4.372233072916667,4.372233072916667,4.39892578125,4.39892578125,0.046233127024950436,0.046233127024950436,4.31884765625,4.31884765625,4.39892578125,4.39892578125,13.11669921875,13.11669921875,1727,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.117), 'mean_duration_us': np.float64(4.372333333333334), 'median_duration_us': np.float64(4.399), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]",0.06188464368838835,99.55628182925138 +aten::cat,other,python3,CPU,thread 542 (python3),"((), ())","('TensorList', 'Scalar')","((), ())","('', '0')",False,3,4.065592447916667,4.065592447916667,4.0791015625,4.0791015625,0.18031158429403077,0.18031158429403077,3.87890625,3.87890625,4.23876953125,4.23876953125,12.19677734375,12.19677734375,5534,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.197), 'mean_duration_us': np.float64(4.065666666666666), 'median_duration_us': np.float64(4.079), 'std_dev_duration_us': np.float64(0.14727148022916342), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.239)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.07)}]",0.057544448300348154,99.61382627755172 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (1000, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1), (512, 1), ())","('', '', 'False')",False,3,3.86572265625,3.86572265625,4.0390625,4.0390625,0.6377912043259547,0.6377912043259547,3.1591796875,3.1591796875,4.39892578125,4.39892578125,11.59716796875,11.59716796875,1652,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.597), 'mean_duration_us': np.float64(3.8656666666666664), 'median_duration_us': np.float64(4.039), 'std_dev_duration_us': np.float64(0.5208539995899897), 'min_duration_us': np.float64(3.159), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]",0.054715488673748716,99.66854176622547 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,3,3.7057291666666665,3.7057291666666665,3.67919921875,3.67919921875,0.0830743261395091,0.0830743261395091,3.63916015625,3.63916015625,3.798828125,3.798828125,11.1171875,11.1171875,316,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.06798692684790385), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]",0.05245093874463857,99.72099270497012 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (), (64, 3, 7, 7))","('c10::BFloat16', 'double', 'c10::BFloat16')","((147, 49, 7, 1), (), (147, 49, 7, 1))","('', '', '')",False,3,3.59912109375,3.59912109375,3.63916015625,3.63916015625,0.1443628928652574,0.1443628928652574,3.43896484375,3.43896484375,3.71923828125,3.71923828125,10.79736328125,10.79736328125,1640,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.796999999999999), 'mean_duration_us': np.float64(3.5989999999999998), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.11775681155103787), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]",0.0509420066962488,99.77193471166636 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (), (256, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,3,3.5719401041666665,3.5719401041666665,3.47900390625,3.47900390625,0.16181668128245583,0.16181668128245583,3.47802734375,3.47802734375,3.7587890625,3.7587890625,10.7158203125,10.7158203125,860,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.716000000000001), 'mean_duration_us': np.float64(3.5720000000000005), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(0.13222959830033), 'min_duration_us': np.float64(3.478), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.57)}]",0.05055728661673568,99.8224919982831 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (), (512, 256, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((2304, 9, 3, 1), (), (2304, 9, 3, 1))","('', '', '')",False,3,3.2257486979166665,3.2257486979166665,3.71923828125,3.71923828125,0.9245327069892811,0.9245327069892811,2.1591796875,2.1591796875,3.798828125,3.798828125,9.67724609375,9.67724609375,460,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.677), 'mean_duration_us': np.float64(3.2256666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.7549540089009102), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.23)}]",0.04565728895730814,99.86814928724041 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (), (128, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,3,2.8390299479166665,2.8390299479166665,3.43896484375,3.43896484375,1.1447188535008865,1.1447188535008865,1.51904296875,1.51904296875,3.55908203125,3.55908203125,8.51708984375,8.51708984375,1260,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.517), 'mean_duration_us': np.float64(2.839), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.9346657156438339), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(3.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]",0.040183666748187394,99.9083329539886 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (), (512, 256, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((256, 1, 1, 1), (), (256, 1, 1, 1))","('', '', '')",False,3,1.67919921875,1.67919921875,1.67919921875,1.67919921875,0.0400390625,0.0400390625,1.63916015625,1.63916015625,1.71923828125,1.71923828125,5.03759765625,5.03759765625,371,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.037), 'mean_duration_us': np.float64(1.679), 'median_duration_us': np.float64(1.679), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.639), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.68)}]",0.023767407546927095,99.93210036153553 +aten::cat,other,python3,CPU,thread 542 (python3),"(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('', '0')",False,3,1.6658528645833333,1.6658528645833333,1.71923828125,1.71923828125,0.09246625404990101,0.09246625404990101,1.55908203125,1.55908203125,1.71923828125,1.71923828125,4.99755859375,4.99755859375,5559,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<8u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.997), 'mean_duration_us': np.float64(1.6656666666666666), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(1.67)}]",0.023578503076747002,99.95567886461228 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (), (128, 64, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((64, 1, 1, 1), (), (64, 1, 1, 1))","('', '', '')",False,3,1.6256510416666667,1.6256510416666667,1.55908203125,1.55908203125,0.15130600872189426,0.15130600872189426,1.51904296875,1.51904296875,1.798828125,1.798828125,4.876953125,4.876953125,1171,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.877), 'mean_duration_us': np.float64(1.6256666666666666), 'median_duration_us': np.float64(1.559), 'std_dev_duration_us': np.float64(0.12364824660660939), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(1.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.63)}]",0.02300948595315575,99.97868835056543 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (), (256, 128, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((128, 1, 1, 1), (), (128, 1, 1, 1))","('', '', '')",False,3,1.5056966145833333,1.5056966145833333,1.47900390625,1.47900390625,0.046233127024950485,0.046233127024950485,1.47900390625,1.47900390625,1.55908203125,1.55908203125,4.51708984375,4.51708984375,771,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.51)}]",0.021311649434585883,100.00000000000001 diff --git a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/unified_perf_summary.csv b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/unified_perf_summary.csv index 9611f9028..8528ac0ef 100644 --- a/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/unified_perf_summary.csv +++ b/tests/traces/mi300/resnet_act_checkpoint_recompute_perf_report_csvs/unified_perf_summary.csv @@ -1,130 +1,130 @@ name,op category,process_name,process_label,thread_name,Input Dims,Input type,Input Strides,Concrete Inputs,is_recompute,ex_UID,operation_count,total_duration_us,mean_duration_us,std_duration_us,GFLOPS,Data Moved (MB),FLOPS/Byte,Compute Spec,TB/s_mean,TB/s_std,TFLOPS/s_mean,TFLOPS/s_std,Kernel Time (µs)_mean,Kernel Time (µs)_std,Kernel Time (µs)_sum,duration_us_median,duration_us_min,duration_us_max,TB/s_median,TB/s_min,TB/s_max,TFLOPS/s_median,TFLOPS/s_min,TFLOPS/s_max,Kernel Time (µs)_median,Kernel Time (µs)_min,Kernel Time (µs)_max,kernel_details_summary,trunc_kernel_details,perf_params,has_perf_model,Percentage (%),Cumulative Percentage (%) -aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), (64,), (64,), (64,), (64,), (64,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,1604,3,42.5,14.166666666666666,3.357295538574661,0.07225344,45.93798828125,1.4999840562919187,vector_bf16,0.12067939344638634,0.0017619546798114713,0.18101716609255902,0.0026429039276261376,399.2096354166667,5.878125137364244,1197.62890625,12.81,11.7,17.99,0.12169049708883495,0.11864487584337362,0.12170280740695048,0.18253380543549058,0.17796542212579466,0.18255227071639177,395.8359375,395.7958984375,405.9970703125,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(1197.6290000000001), 'mean_duration_us': np.float64(399.2096666666667), 'median_duration_us': np.float64(395.836), 'std_dev_duration_us': np.float64(4.799397207520504), 'min_duration_us': np.float64(395.796), 'max_duration_us': np.float64(405.997)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(1023.8620000000001), 'mean_duration_us': np.float64(85.32183333333334), 'median_duration_us': np.float64(85.6585), 'std_dev_duration_us': np.float64(1.298095709962182), 'min_duration_us': np.float64(82.959), 'max_duration_us': np.float64(87.318)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(441.06500000000005), 'mean_duration_us': np.float64(29.404333333333337), 'median_duration_us': np.float64(28.199), 'std_dev_duration_us': np.float64(3.0918341194543766), 'min_duration_us': np.float64(25.879), 'max_duration_us': np.float64(35.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(274.618), 'mean_duration_us': np.float64(4.576966666666666), 'median_duration_us': np.float64(4.459), 'std_dev_duration_us': np.float64(0.515218949142552), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(6.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}]","{'shape_in1': (), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (), 'stride_input2': (), 'stride_output': None}",True,1.3160071772382065,63.57639824607253 -aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((100352, 784, 28, 1), (200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,1248,3,212.887,70.96233333333333,2.7528591197758936,2.31211008,11.765625,187.41035856573706,matrix_bf16,0.1349630457335169,0.0022382409041266167,25.293472794042373,0.4194695303988689,91.42822265625,1.5276087070124051,274.28466796875,71.759,67.899,73.229,0.1357099972929423,0.13244684508326912,0.13673229482433924,25.433459253625525,24.821910727956094,25.62504840054549,90.908203125,90.228515625,93.14794921875,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.117), 'mean_duration_us': np.float64(1.7056666666666667), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(1.719)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.6370000000000005), 'mean_duration_us': np.float64(1.8790000000000002), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.919)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.597000000000001), 'mean_duration_us': np.float64(2.8656666666666673), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.0714890988194368), 'min_duration_us': np.float64(1.359), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757), 'mean_duration_us': np.float64(3.5856666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.08219218670625292), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3409789827345178), 'min_duration_us': np.float64(4.639), 'max_duration_us': np.float64(5.399)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.037), 'mean_duration_us': np.float64(7.678999999999999), 'median_duration_us': np.float64(8.079), 'std_dev_duration_us': np.float64(0.7118052168020874), 'min_duration_us': np.float64(6.679), 'max_duration_us': np.float64(8.279)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.156), 'mean_duration_us': np.float64(9.718666666666666), 'median_duration_us': np.float64(9.359), 'std_dev_duration_us': np.float64(0.5378973466708636), 'min_duration_us': np.float64(9.318), 'max_duration_us': np.float64(10.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1x1_ta1x8x1x1_1x4x1x32_tb1x8x1x2_1x4x1x32_mh', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.277), 'mean_duration_us': np.float64(13.425666666666666), 'median_duration_us': np.float64(13.439), 'std_dev_duration_us': np.float64(0.018856180831641704), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(13.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(40.997), 'mean_duration_us': np.float64(13.665666666666667), 'median_duration_us': np.float64(13.639), 'std_dev_duration_us': np.float64(0.06798692684790397), 'min_duration_us': np.float64(13.599), 'max_duration_us': np.float64(13.759)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x4x1x4_1x8x1x32_tb1x4x1x2_1x8x1x32_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.235), 'mean_duration_us': np.float64(28.078333333333333), 'median_duration_us': np.float64(28.078), 'std_dev_duration_us': np.float64(0.5229661132000395), 'min_duration_us': np.float64(27.438), 'max_duration_us': np.float64(28.719)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.87)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(7.68)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.72)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(13.43)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.67)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(28.08)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (576, 9, 3, 1), 'bias': [], 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,1.3144066820393763,64.8908049281119 -aten::batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (512,), (512,), (512,), (512,), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((25088, 49, 7, 1), (1,), (1,), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",True,76,15,827.038,55.135866666666665,14.266122122340175,0.001257472,0.962890625,1.2454361054766734,vector_bf16,0.06025762574731561,0.003969722940015474,0.07504702273600766,0.0049440362782342895,16.820930989583335,1.0621585372054239,252.31396484375,48.78,43.67,98.52,0.059121997769835594,0.05476143728813559,0.06916848543234654,0.07363267065046461,0.06820187118644067,0.0861449291185817,17.07763671875,14.59716796875,18.4375,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(89.917), 'mean_duration_us': np.float64(29.972333333333335), 'median_duration_us': np.float64(30.359), 'std_dev_duration_us': np.float64(1.510967313419527), 'min_duration_us': np.float64(27.959), 'max_duration_us': np.float64(31.599)}, {'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw(c10::BFloat16 const*, long const*, int, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(156.236), 'mean_duration_us': np.float64(52.07866666666666), 'median_duration_us': np.float64(52.319), 'std_dev_duration_us': np.float64(0.3678045978807537), 'min_duration_us': np.float64(51.559), 'max_duration_us': np.float64(52.358)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(29.97)}, {'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw Device)', 'stream': 0, 'count': 60, 'total_duration_us': np.float64(238.17999999999998), 'mean_duration_us': np.float64(3.9696666666666665), 'median_duration_us': np.float64(4.539), 'std_dev_duration_us': np.float64(1.3463009404372495), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.97)}]","{'op_shape': (), 'dtype_in_out': ('long int', None), 'stride_input': (), 'stride_output': None}",True,1.141412806250018,70.82428521217545 -aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((50176, 196, 14, 1), (100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,760,3,220.12900000000002,73.37633333333333,3.947623377848164,0.25690112,5.8671875,41.75765645805592,matrix_bf16,0.08194129870898983,0.0005017494598043458,3.4216766012169386,0.020951881570525563,75.08235677083333,0.45986563848762135,225.2470703125,71.74,70.51,77.879,0.08195399545989684,0.08143332137224994,0.08243657929482272,3.422206787779447,3.400464658100876,3.4423583577704933,75.06884765625,74.62939453125,75.548828125,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.5169999999999995), 'mean_duration_us': np.float64(2.172333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.199)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1319932658214888), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.799)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.717), 'mean_duration_us': np.float64(3.905666666666667), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(4.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.997), 'mean_duration_us': np.float64(3.999), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.1423610433604174), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.597), 'mean_duration_us': np.float64(7.199000000000001), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(7.079), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.636), 'mean_duration_us': np.float64(7.212), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.06844462481938694), 'min_duration_us': np.float64(7.118), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(59.677), 'mean_duration_us': np.float64(19.892333333333333), 'median_duration_us': np.float64(19.799), 'std_dev_duration_us': np.float64(0.9005677221743096), 'min_duration_us': np.float64(18.839), 'max_duration_us': np.float64(21.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(65.196), 'mean_duration_us': np.float64(21.732), 'median_duration_us': np.float64(21.799), 'std_dev_duration_us': np.float64(0.2171128738697909), 'min_duration_us': np.float64(21.439), 'max_duration_us': np.float64(21.958)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.51)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.17)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.2)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(7.21)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(19.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(21.73)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (128, 1, 1, 1), 'bias': [], 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,1.0794123365374357,71.90369754871288 -aten::batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (256,), (256,), (256,), (256,), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (1,), (1,), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",True,479,15,1203.203,80.21353333333333,45.292811649574254,0.002510336,1.9169921875,1.2488537952114112,vector_bf16,0.1497916781274734,0.0017232861501095906,0.18706790572058132,0.0021521324487996265,13.421061197916666,0.15624974568664163,201.31591796875,58.989,44.7,180.009,0.15004225593177095,0.14527169793210531,0.15185766262126968,0.18738084076247405,0.18142311129931543,0.18964801829650668,13.39697265625,13.23681640625,13.8369140625,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(174.86399999999998), 'mean_duration_us': np.float64(11.657599999999999), 'median_duration_us': np.float64(11.159), 'std_dev_duration_us': np.float64(1.1193715975194891), 'min_duration_us': np.float64(10.679), 'max_duration_us': np.float64(14.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 57, 'total_duration_us': np.float64(171.62300000000002), 'mean_duration_us': np.float64(3.010929824561404), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.5473071555679883), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.01)}]","{'shape_in1': (), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (), 'stride_input2': (), 'stride_output': None}",True,0.8224556402515463,77.11917322349066 -aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",True,469,3,232.279,77.42633333333333,1.6352340301416541,1.15605504,3.43359375,321.09215017064844,matrix_bf16,0.0745927716124512,0.015942201878728298,23.95115342423007,5.118915879695417,49.980143229166664,12.039248815535107,149.9404296875,77.76,75.65,78.869,0.0810293127616787,0.056438571061172005,0.08631043101450292,26.01787626149738,18.12198213459066,27.71360187660217,44.43310546875,41.71435546875,63.79296875,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.997), 'mean_duration_us': np.float64(2.999), 'median_duration_us': np.float64(3.039), 'std_dev_duration_us': np.float64(0.768027777275449), 'min_duration_us': np.float64(2.039), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.879)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.917), 'mean_duration_us': np.float64(4.972333333333333), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.21746008573733433), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.917), 'mean_duration_us': np.float64(7.305666666666667), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(5.044054806293136), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(14.439)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.917), 'mean_duration_us': np.float64(14.972333333333333), 'median_duration_us': np.float64(12.399), 'std_dev_duration_us': np.float64(3.724417926185096), 'min_duration_us': np.float64(12.279), 'max_duration_us': np.float64(20.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(47.955), 'mean_duration_us': np.float64(15.985), 'median_duration_us': np.float64(17.158), 'std_dev_duration_us': np.float64(2.1576386784322046), 'min_duration_us': np.float64(12.959), 'max_duration_us': np.float64(17.838)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.0)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.31)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.98)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.7185334278748655,77.83770665136552 -aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",True,869,3,219.039,73.01299999999999,3.4858753563488203,1.15605504,5.8828125,187.41035856573706,matrix_bf16,0.12525968614239344,0.0044684306939032645,23.47496269377764,0.837430198570557,49.288248697916664,1.7642605215678475,147.86474609375,71.77,70.319,76.95,0.12549164247541472,0.12067979488747087,0.12960762106429471,23.518433713320753,22.616643631500516,24.28981073651165,49.1552734375,47.59423828125,51.115234375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.15434449203720302), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.477), 'mean_duration_us': np.float64(7.492333333333334), 'median_duration_us': np.float64(7.439), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.399), 'max_duration_us': np.float64(7.639)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(29.357), 'mean_duration_us': np.float64(9.785666666666666), 'median_duration_us': np.float64(9.679), 'std_dev_duration_us': np.float64(0.20997354330698184), 'min_duration_us': np.float64(9.599), 'max_duration_us': np.float64(10.079)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(39.837), 'mean_duration_us': np.float64(13.279000000000002), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.2993325909419156), 'min_duration_us': np.float64(12.879), 'max_duration_us': np.float64(13.599)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(45.076), 'mean_duration_us': np.float64(15.025333333333334), 'median_duration_us': np.float64(15.719), 'std_dev_duration_us': np.float64(1.7995185158505285), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(16.799)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.03)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (576, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.7085864906084509,78.54629314197398 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((128,), (128,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5735,30,122.208,4.0736,0.36744566569954146,1.28e-07,0.00048828125,0.25,vector_bf16,0.00010629745268836305,1.1739641893917567e-05,2.6574363172090762e-05,2.9349104734793917e-06,4.879085286458333,0.5906942348665651,146.37255859375,4.1145,3.38,4.78,0.00010942043201502661,7.902449317959153e-05,0.00012676208897485493,2.7355108003756652e-05,1.9756123294897883e-05,3.169052224371373e-05,4.67919921875,4.0390625,6.47900390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(146.37), 'mean_duration_us': np.float64(4.8790000000000004), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.5807581252122092), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(6.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.88)}]","{'op_shape': (128,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.7014357401294665,79.24772888210344 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5745,30,117.27,3.909,0.4530992888068147,2.56e-07,0.0009765625,0.25,vector_bf16,0.0002189128231331666,1.908323453978501e-05,5.472820578329165e-05,4.770808634946253e-06,4.712369791666666,0.412890788540921,141.37109375,3.83,3.22,4.9,0.00021884086403005322,0.0001910844646924829,0.0002485955429113324,5.4710216007513305e-05,4.7771116173120725e-05,6.21488857278331e-05,4.67919921875,4.119140625,5.35888671875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(141.37), 'mean_duration_us': np.float64(4.7123333333333335), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4059666105591554), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.359)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.71)}]","{'op_shape': (256,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6774680905364567,79.9251969726399 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5755,30,108.37,3.6123333333333334,0.3327905350665568,5.12e-07,0.001953125,0.25,vector_bf16,0.0004498108283717333,4.445849585013526e-05,0.00011245270709293332,1.1114623962533814e-05,4.597688802083334,0.4726140319865054,137.9306640625,3.665,2.96,4.42,0.00044150568910255607,0.00033912548512289776,0.0005506503872915846,0.00011037642227563902,8.478137128072444e-05,0.00013766259682289616,4.638671875,3.71923828125,6.0390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(137.92800000000003), 'mean_duration_us': np.float64(4.597600000000001), 'median_duration_us': np.float64(4.6385000000000005), 'std_dev_duration_us': np.float64(0.46466702056418846), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(6.039)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]","{'op_shape': (512,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6609811180642956,80.5861780907042 -aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5725,30,150.389,5.012966666666667,2.305494314313816,6.4e-08,0.000244140625,0.25,vector_bf16,6.115328106105659e-05,2.7096609139717043e-05,1.5288320265264148e-05,6.774152284929261e-06,4.593570963541667,1.0373284068708915,137.80712890625,4.17,3.26,11.97,5.4954425818261364e-05,4.0513716096128585e-05,0.00016419918571875978,1.3738606454565341e-05,1.0128429024032146e-05,4.1049796429689945e-05,4.6591796875,1.55908203125,6.31884765625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(137.808), 'mean_duration_us': np.float64(4.5935999999999995), 'median_duration_us': np.float64(4.659000000000001), 'std_dev_duration_us': np.float64(1.0199425996920939), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(6.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.59)}]","{'op_shape': (64,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6603891220331494,81.24656721273735 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (128,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1771,30,108.77,3.6256666666666666,1.2631833987393024,1.28e-07,0.00048828125,0.25,vector_bf16,0.00011460971326258692,1.081865846681428e-05,2.865242831564673e-05,2.70466461670357e-06,4.510904947916667,0.4786475103410302,135.3271484375,3.3899999999999997,2.82,9.97,0.0001196594773479402,9.015355515432894e-05,0.00012676208897485493,2.991486933698505e-05,2.2538388788582234e-05,3.169052224371373e-05,4.27880859375,4.0390625,5.67919921875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(135.32800000000003), 'mean_duration_us': np.float64(4.510933333333335), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4705758835960702), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.679)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","{'op_shape': (128,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.648504743210256,81.8950719559476 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1801,30,100.31,3.3436666666666666,0.4722468913998077,6.4e-08,0.000244140625,0.25,vector_bf16,5.749474553569203e-05,5.812158598455802e-06,1.4373686383923007e-05,1.4530396496139505e-06,4.502962239583334,0.5168070532058079,135.0888671875,3.36,2.77,4.34,5.98297386739701e-05,4.4453790062743766e-05,6.338104448742746e-05,1.4957434668492525e-05,1.1113447515685942e-05,1.5845261121856866e-05,4.27880859375,4.0390625,5.7587890625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(135.09000000000003), 'mean_duration_us': np.float64(4.503000000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.5081312166491382), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.5)}]","{'op_shape': (64,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6473628694426694,82.54243482539027 -aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,360,3,291.309,97.10300000000001,4.874355034258377,0.25690112,3.37109375,72.67670915411355,matrix_bf16,0.07859386145231952,0.0017153538306378634,5.711943210068921,0.12466627144566311,44.990397135416664,0.9803749232086446,134.97119140625,94.399,94.18,102.73,0.07849766551006246,0.07692862976462463,0.08035528908227145,5.7049520055517,5.5909196510281065,5.839957973626959,45.03125,43.990234375,45.94970703125,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.5969999999999995), 'mean_duration_us': np.float64(1.8656666666666666), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.957), 'mean_duration_us': np.float64(2.319), 'median_duration_us': np.float64(2.319), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.757000000000001), 'mean_duration_us': np.float64(3.585666666666667), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.06798692684790367), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.13199326582148882), 'min_duration_us': np.float64(3.599), 'max_duration_us': np.float64(3.919)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.556000000000001), 'mean_duration_us': np.float64(4.518666666666667), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.08594701209983321), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(4.638)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.556999999999999), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.06798692684790346), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT3128_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR1_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVW2_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA256_LBSPPB256_LPA32_LPB16_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS16_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SCIUI1_SPO0_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_16_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA1_WSGRB0_WS64_WG16_8_2_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.916), 'mean_duration_us': np.float64(5.6386666666666665), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.06572839738060139), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(5.719)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(15.079), 'std_dev_duration_us': np.float64(0.4877157642179166), 'min_duration_us': np.float64(14.159), 'max_duration_us': np.float64(15.279)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.87)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.32)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.64)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (256, 1, 1, 1), 'bias': [], 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.6467989522746606,83.18923377766494 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1741,30,111.66,3.722,1.4776551788513472,2.56e-07,0.0009765625,0.25,vector_bf16,0.0002332602622228708,1.961438154685428e-05,5.83150655557177e-05,4.90359538671357e-06,4.424300130208334,0.4238580059237626,132.72900390625,3.48,2.85,11.31,0.0002393189546958804,0.0001868952856251671,0.00025352417794970985,5.98297386739701e-05,4.672382140629177e-05,6.338104448742746e-05,4.27880859375,4.0390625,5.47900390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(132.729), 'mean_duration_us': np.float64(4.424300000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4167844486862084), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.42)}]","{'op_shape': (256,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6360541073140922,83.82528788497903 -aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",False,6006,3,213.297,71.099,13.028994588992655,1.15605504,5.8828125,187.41035856573706,matrix_bf16,0.14827363711599853,0.0038905511072880117,27.788015497755264,0.7291295780351684,41.62158203125,1.082452905348479,124.86474609375,65.239,62.029,86.029,0.1473109953241059,0.14495477663419504,0.15255513938969462,27.607606454366305,27.166026664830817,28.590413374068664,41.87451171875,40.43505859375,42.55517578125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.396999999999998), 'mean_duration_us': np.float64(4.4656666666666665), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.16759740119968727), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.639)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.997), 'mean_duration_us': np.float64(5.999), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.738286303995047), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(6.599)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.717), 'mean_duration_us': np.float64(6.905666666666666), 'median_duration_us': np.float64(7.359), 'std_dev_duration_us': np.float64(0.6411101482758033), 'min_duration_us': np.float64(5.999), 'max_duration_us': np.float64(7.359)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.476999999999997), 'mean_duration_us': np.float64(10.492333333333333), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.5309948733797298), 'min_duration_us': np.float64(9.919), 'max_duration_us': np.float64(11.199)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(41.277), 'mean_duration_us': np.float64(13.759), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.4537253207246281), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(14.399)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.47)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.49)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.76)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (576, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5983675931732141,84.42365547815224 -aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",False,6264,3,367.707,122.569,86.42108134014525,1.15605504,3.685546875,299.14149443561206,matrix_bf16,0.09291021412141652,0.001986041389297363,27.793300300613243,0.594107389205396,41.607259114583336,0.8786485534396721,124.82177734375,72.939,72.409,222.359,0.09185246843919367,0.0916769175740166,0.09520125635103927,27.476884676500287,27.42437012834175,28.478646096997693,42.07373046875,40.59375,42.154296875,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.277), 'mean_duration_us': np.float64(4.425666666666666), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.18571184369578841), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.437000000000001), 'mean_duration_us': np.float64(4.479), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.639)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.517), 'mean_duration_us': np.float64(4.8389999999999995), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.2902872140943631), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(5.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.757), 'mean_duration_us': np.float64(5.5856666666666674), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.1643843734125062), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(5.799)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.477), 'mean_duration_us': np.float64(17.159), 'median_duration_us': np.float64(17.159), 'std_dev_duration_us': np.float64(0.4898979485566353), 'min_duration_us': np.float64(16.559), 'max_duration_us': np.float64(17.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.43)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.48)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.84)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.59)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(17.16)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5981616815102067,85.02181715966245 -aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",True,66,3,449.947,149.98233333333334,77.67991782522259,1.15605504,3.685546875,299.14149443561206,matrix_bf16,0.09326654481051204,0.003432223314842696,27.899893595462554,1.0267204116387927,41.473795572916664,1.5480063825290074,124.42138671875,111.059,99.459,239.429,0.09418167985149223,0.08946950835386946,0.09614844622617444,28.17364845923176,26.764042435395993,28.761989891759907,41.033203125,40.19384765625,43.1943359375,"[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.357), 'mean_duration_us': np.float64(4.452333333333333), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.22939534045447024), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.916999999999998), 'mean_duration_us': np.float64(4.638999999999999), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.4079215610874227), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.557), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.27904599381941786), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.836), 'mean_duration_us': np.float64(5.611999999999999), 'median_duration_us': np.float64(5.478), 'std_dev_duration_us': np.float64(0.27792924759130083), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(5.999)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(50.397), 'mean_duration_us': np.float64(16.799), 'median_duration_us': np.float64(16.719), 'std_dev_duration_us': np.float64(0.851038581185758), 'min_duration_us': np.float64(15.799), 'max_duration_us': np.float64(17.879)}]","[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.61)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(16.8)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5962429591958195,85.61806011885827 -aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",False,6135,3,232.999,77.66633333333333,8.509544073176492,1.15605504,3.43359375,321.09215017064844,matrix_bf16,0.08848329434037287,0.0017454310118086836,28.41129123393269,0.560444196556177,40.700520833333336,0.8011398380941223,122.1015625,73.459,72.08,87.46,0.08834451298763539,0.08681139692481575,0.09029397310866744,28.36672963097863,27.87445809790671,28.99268597291274,40.75390625,39.8740234375,41.4736328125,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.917), 'mean_duration_us': np.float64(4.639), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4418144406874905), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(5.159)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.957), 'mean_duration_us': np.float64(4.652333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.30346151137976096), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.079)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.3785351884420904), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.997), 'mean_duration_us': np.float64(5.665666666666667), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.46341725858620714), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.877000000000002), 'mean_duration_us': np.float64(5.9590000000000005), 'median_duration_us': np.float64(5.839), 'std_dev_duration_us': np.float64(0.19866219234335095), 'min_duration_us': np.float64(5.799), 'max_duration_us': np.float64(6.239)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(14.759), 'std_dev_duration_us': np.float64(0.4607240678178929), 'min_duration_us': np.float64(14.319), 'max_duration_us': np.float64(15.439)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.95)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.67)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.96)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5851260692986809,86.20318618815695 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1654,30,104.799,3.4933,0.39374918938066533,5.12e-07,0.001953125,0.25,vector_bf16,0.0006993106735288572,0.0005527770176441737,0.0001748276683822143,0.00013819425441104343,3.868310546875,1.3189206115385315,116.04931640625,3.5345,2.77,4.14,0.0004877664910714769,0.0003657716926833522,0.0025637555012224937,0.00012194162276786922,9.144292317083806e-05,0.0006409388753056234,4.19873046875,0.798828125,5.59912109375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(116.04899999999999), 'mean_duration_us': np.float64(3.8682999999999996), 'median_duration_us': np.float64(4.1985), 'std_dev_duration_us': np.float64(1.296753976923405), 'min_duration_us': np.float64(0.799), 'max_duration_us': np.float64(5.599)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]","{'op_shape': (512,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.5561229435830356,86.75930913173998 -aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), (512,), (512,), (512,), (512,), (512,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (25088, 49, 7, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,234,15,233.968,15.597866666666667,1.447699498547692,0.00225792,1.439453125,1.4959294436906376,vector_bf16,0.20269897036383833,0.02635609183228633,0.30322335797304173,0.03942685379253144,7.585579427083333,1.1608900026613005,113.78369140625,15.279,13.29,18.41,0.20623137287344054,0.1413379382744273,0.23296420589343586,0.3085075828941224,0.21143158337524576,0.34849801492199867,7.31884765625,6.47900390625,10.67919921875,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'count': 15, 'total_duration_us': np.float64(113.78399999999999), 'mean_duration_us': np.float64(7.5855999999999995), 'median_duration_us': np.float64(7.319), 'std_dev_duration_us': np.float64(1.1215021949748174), 'min_duration_us': np.float64(6.479), 'max_duration_us': np.float64(10.679)}]","[{'name': 'void at::native::batch_norm_backward_kernel, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float>(at::native::(anonymous namespace)::TensorListMetadata<2>, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(90.756), 'mean_duration_us': np.float64(30.252), 'median_duration_us': np.float64(30.119), 'std_dev_duration_us': np.float64(1.5382992773406174), 'min_duration_us': np.float64(28.438), 'max_duration_us': np.float64(32.199)}]","[{'name': 'void at::native::(anonymous namespace)::multi_tensor_apply_kerne...', 'stream': 0, 'mean_duration_us': np.float64(30.25)}]",,False,0.43491585104003994,87.73949076594995 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), ())","('c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), ())","('', '0')",False,5922,12,56.07,4.6725,1.5946793636111534,0.00200704,7.65625,0.24999999999999997,vector_bf16,1.1135704722370185,0.12752058629825047,0.27839261805925464,0.03188014657456262,7.302205403645833,0.893610122762632,87.62646484375,4.425,3.38,9.54,1.1231365867000933,0.8541571863473427,1.3119750781998085,0.2807841466750233,0.21353929658683568,0.32799376954995213,7.158935546875,6.119140625,9.39892578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(87.62700000000002), 'mean_duration_us': np.float64(7.302250000000002), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.8555424327096035), 'min_duration_us': np.float64(6.119), 'max_duration_us': np.float64(9.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.3)}]","{'op_shape': (10, 64, 56, 56), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (200704, 3136, 56, 1), 'stride_output': None}",True,0.41991705831415954,88.15940782426411 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (), (512,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,251,30,138.669,4.6223,1.045535703310294,5.12e-07,0.00196075439453125,0.2490272373540856,vector_bf16,0.001403201957640396,0.0011944753466311248,0.0003494355069610325,0.0002974568956591127,2.7550455729166665,1.6544370356456592,82.6513671875,4.32,3.45,7.64,0.0005978543234417151,0.00034272244831515546,0.0032167211611917493,0.00014888201050688627,8.534722448315156e-05,0.0008010511841100076,3.43896484375,0.63916015625,5.9990234375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(82.649), 'mean_duration_us': np.float64(2.754966666666667), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(1.6267029329973628), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.999)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.75)}]","{'shape_in1': (512,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.39607576360526797,88.55548358786938 -aten::max_pool2d_with_indices,other,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), (), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar')","((802816, 12544, 112, 1), (), (), (), (), ())","('', '[3, 3]', '[2, 2]', '[1, 1]', '[1, 1]', 'False')",False,5893,3,33.01,11.003333333333332,1.0217794934981492,,,,,,,,,23.585286458333332,0.7803342920411799,70.755859375,10.49,10.34,12.18,,,,,,,23.23779296875,23.0390625,24.47900390625,"[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw(int, c10::BFloat16 const*, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*, long*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(70.756), 'mean_duration_us': np.float64(23.585333333333335), 'median_duration_us': np.float64(23.238), 'std_dev_duration_us': np.float64(0.6371186877044349), 'min_duration_us': np.float64(23.039), 'max_duration_us': np.float64(24.479)}]","[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(67.46600000000001), 'mean_duration_us': np.float64(5.622166666666668), 'median_duration_us': np.float64(5.7989999999999995), 'std_dev_duration_us': np.float64(0.5222931541662104), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.62)}]","{'op_shape': (10, 64, 56, 56), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (200704, 3136, 56, 1), 'stride_output': None}",True,0.3233070498795031,89.21786162937475 -aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",True,929,3,214.709,71.56966666666666,1.479810911344199,0.12845056,5.7578125,21.275440976933513,matrix_bf16,0.27151903387499976,0.0017704911132208805,5.776687179321569,0.03766797917951613,22.236653645833332,0.14463376370416037,66.7099609375,71.7,70.029,72.98,0.27102137500821954,0.27005062991678863,0.27348509669999116,5.766099267474739,5.745446237578351,5.8185160329116155,22.27685546875,22.076171875,22.35693359375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.596), 'mean_duration_us': np.float64(4.865333333333333), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.037950259843935186), 'min_duration_us': np.float64(4.838), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.277), 'mean_duration_us': np.float64(7.092333333333333), 'median_duration_us': np.float64(7.119), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(6.959), 'max_duration_us': np.float64(7.199)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(30.837), 'mean_duration_us': np.float64(10.279), 'median_duration_us': np.float64(10.319), 'std_dev_duration_us': np.float64(0.18184242262647798), 'min_duration_us': np.float64(10.039), 'max_duration_us': np.float64(10.479)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.87)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(10.28)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (64, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.3196825366295204,89.53754416600427 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",False,6029,12,59.17,4.930833333333333,0.9774964155557002,0.00100352,3.828125,0.24999999999999997,vector_bf16,0.7276497399843521,0.06460940177098536,0.18191243499608803,0.01615235044274634,5.5555419921875,0.48117926954934276,66.66650390625,4.615,3.76,6.51,0.7018557022112183,0.6312551516547646,0.8295495297679111,0.17546392555280457,0.15781378791369116,0.20738738244197777,5.71923828125,4.8388671875,6.35888671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(66.66699999999999), 'mean_duration_us': np.float64(5.555583333333332), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.46067531196663397), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.56)}]","{'op_shape': (10, 128, 28, 28), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (100352, 784, 28, 1), 'stride_output': None}",True,0.3194742850612516,89.85701845106551 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",False,6158,12,61.31,5.109166666666667,0.740177599490743,0.00050176,1.9140625,0.24999999999999997,vector_bf16,0.3690627712191356,0.023393149398912485,0.0922656928047839,0.005848287349728121,5.459025065104167,0.3592526349408488,65.50830078125,4.895,4.15,6.51,0.3731781436255698,0.3237569250157529,0.4080224260472503,0.09329453590639245,0.08093923125393823,0.10200560651181258,5.37890625,4.9189453125,6.19921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(65.508), 'mean_duration_us': np.float64(5.459), 'median_duration_us': np.float64(5.379), 'std_dev_duration_us': np.float64(0.3438992100407715), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.46)}]","{'op_shape': (10, 256, 14, 14), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (50176, 196, 14, 1), 'stride_output': None}",True,0.3139240297810974,90.1709424808466 -aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",True,94,12,56.76,4.7299999999999995,1.1467265664411102,0.00025088,0.95703125,0.24999999999999997,vector_bf16,0.1903412584785916,0.018326339750038282,0.0475853146196479,0.0045815849375095705,5.318806966145833,0.5309911273970868,63.82568359375,4.390000000000001,3.35,6.5,0.1901381946114128,0.15982649972781707,0.22016164542046063,0.0475345486528532,0.03995662493195427,0.05504041135511516,5.279052734375,4.55810546875,6.27880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(63.826), 'mean_duration_us': np.float64(5.318833333333333), 'median_duration_us': np.float64(5.279), 'std_dev_duration_us': np.float64(0.5084422014567852), 'min_duration_us': np.float64(4.558), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","{'op_shape': (10, 512, 7, 7), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (25088, 49, 7, 1), 'stride_output': None}",True,0.3058607162501483,90.47680319709676 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (), (256,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,654,30,143.568,4.7856000000000005,1.1527475603665505,2.56e-07,0.00098419189453125,0.24806201550387597,vector_bf16,0.0009225621914914683,0.0006401909615510164,0.0002288526366490464,0.00015880706022970952,2.08974609375,1.4501653361546871,62.6923828125,4.4350000000000005,3.78,8.809,0.0009133405171805666,0.00028049581950895816,0.001614618792971734,0.0002265650895331638,6.958035832780358e-05,0.0004005255920550038,2.01904296875,0.63916015625,3.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.68900000000001), 'mean_duration_us': np.float64(2.0896333333333335), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.425860780565745), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","{'shape_in1': (256,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.300429796138328,90.77723299323509 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (), (128,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,1054,30,127.369,4.245633333333333,1.0058190857869687,1.28e-07,0.00049591064453125,0.24615384615384617,vector_bf16,0.0004665090466028926,0.0003241785608034115,0.00011483299608686586,7.979779958237824e-05,2.087109375,1.4501753944792757,62.61328125,4.0,3.12,7.35,0.00045929849481825974,0.00014133510285335103,0.0008135676088617264,0.00011305809103218701,3.479017916390179e-05,0.0002002627960275019,2.0390625,0.63916015625,3.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.039), 'std_dev_duration_us': np.float64(1.425871429454049), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","{'shape_in1': (128,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.30005073148597344,91.07728372472106 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (), (64,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,1426,30,124.159,4.138633333333334,0.8446355052811889,6.4e-08,0.00025177001953125,0.24242424242424243,vector_bf16,0.0002376293523446567,0.00016544210163953982,5.7607115719916775e-05,4.010717615503995e-05,2.087109375,1.4530668185492028,62.61328125,3.91,3.179,6.58,0.0002336452485810752,7.175474452554745e-05,0.0004130420168067227,5.664127238329095e-05,1.7395089581950895e-05,0.00010013139801375095,2.01904296875,0.63916015625,3.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.4287113074375803), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","{'shape_in1': (64,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.30005073148597344,91.37733445620702 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '0')",False,1402,12,68.569,5.714083333333334,1.4651323525900517,0.00200704,11.484375,0.16666666666666666,vector_bf16,3.165084549111451,1.3915160070258372,0.5275140915185751,0.23191933450430616,5.1123046875,3.398747629905021,61.34765625,5.1395,4.06,8.25,3.6130421691504555,1.0988463518089469,4.428534300592566,0.6021736948584092,0.18314105863482444,0.7380890500987609,3.458984375,2.71923828125,10.958984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(61.348), 'mean_duration_us': np.float64(5.112333333333333), 'median_duration_us': np.float64(3.4589999999999996), 'std_dev_duration_us': np.float64(3.254036809188789), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(10.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.11)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.29398569704830074,91.67132015325532 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",False,6287,12,58.11,4.8425,1.4555544085892622,0.00025088,0.95703125,0.24999999999999997,vector_bf16,0.1988810296057187,0.012983218725457043,0.04972025740142968,0.0032458046813642607,5.065714518229167,0.33309153344527864,60.78857421875,4.51,3.55,8.88,0.19994568134825264,0.1767009681024847,0.22011448645175108,0.04998642033706316,0.044175242025621175,0.05502862161293777,5.01904296875,4.55908203125,5.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(60.788000000000004), 'mean_duration_us': np.float64(5.065666666666667), 'median_duration_us': np.float64(5.019), 'std_dev_duration_us': np.float64(0.3188869531493706), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.07)}]","{'op_shape': (10, 512, 7, 7), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (25088, 49, 7, 1), 'stride_output': None}",True,0.29130650552394305,91.96262665877927 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (64, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,1805,12,39.639,3.3032500000000002,0.40490787392150895,3.6864e-05,0.140625,0.25,vector_bf16,0.03143695960242978,0.0032985443652827815,0.007859239900607445,0.0008246360913206954,4.738972981770833,0.5046606226144523,56.86767578125,3.1950000000000003,2.82,4.009,0.031953819823427855,0.02671767566132885,0.03579775817923186,0.007988454955856964,0.006679418915332212,0.008949439544807964,4.618896484375,4.119140625,5.51904296875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(56.868), 'mean_duration_us': np.float64(4.739), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.4831838849409888), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.519)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","{'op_shape': (64, 64, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (576, 9, 3, 1), 'stride_output': (576, 9, 3, 1)}",True,0.2725170662745173,92.23514372505379 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,1254,9,44.76,4.973333333333333,0.30765240125830323,0.00200704,11.484375,0.16666666666666666,vector_bf16,1.933778612946109,0.16589069439747692,0.32229643549101816,0.027648449066246143,6.270073784722222,0.5623815435318228,56.4306640625,5.05,4.38,5.33,1.9940578525226391,1.6453737754353193,2.150737552978111,0.3323429754204398,0.2742289625725532,0.3584562588296852,6.0390625,5.59912109375,7.31884765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(56.431), 'mean_duration_us': np.float64(6.2701111111111105), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.5302503485135729), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(7.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.27)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.2704228510655215,92.5055665761193 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '0')",False,1030,12,73.18,6.098333333333334,1.257145636557337,0.00100352,5.7421875,0.16666666666666666,vector_bf16,1.6190023371009568,0.727229851991352,0.26983372285015944,0.12120497533189199,4.608968098958333,2.3743423923450107,55.3076171875,5.64,4.98,8.26,1.5603676650007188,0.7067836166676219,2.7378449733570163,0.26006127750011976,0.11779726944460364,0.4563074955595026,3.85888671875,2.19921875,8.51904296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(55.308), 'mean_duration_us': np.float64(4.609), 'median_duration_us': np.float64(3.859), 'std_dev_duration_us': np.float64(2.273213584333861), 'min_duration_us': np.float64(2.199), 'max_duration_us': np.float64(8.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.2650410689641916,92.7706076450835 -aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",False,6053,3,220.558,73.51933333333334,11.818136500029654,0.12845056,5.7578125,21.275440976933513,matrix_bf16,0.32907099921474836,0.02371037608768371,7.001130621013913,0.5044487069944104,18.410481770833332,1.3202682878965732,55.2314453125,67.449,65.97,87.139,0.32746651638020075,0.30620361536366114,0.3535428659003832,6.966994541168992,6.514616945593224,7.521780376279522,18.43701171875,17.0771484375,19.71728515625,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.477), 'mean_duration_us': np.float64(5.825666666666667), 'median_duration_us': np.float64(6.119), 'std_dev_duration_us': np.float64(0.716534871602368), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.157), 'mean_duration_us': np.float64(6.052333333333333), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.4847909056719425), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.559)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.639), 'std_dev_duration_us': np.float64(0.3670906639449654), 'min_duration_us': np.float64(6.039), 'max_duration_us': np.float64(6.919)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (64, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.2646760437434057,93.03528368882691 -aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",True,897,12,59.75,4.979166666666667,1.0226032584743818,0.00100352,3.828125,0.24999999999999997,vector_bf16,0.9298180230887522,0.1745056838628018,0.23245450577218804,0.04362642096570045,4.4456787109375,0.7578874066557242,53.34814453125,4.885,3.64,7.28,0.8805258591489127,0.7490511015945329,1.3036530034887408,0.22013146478722817,0.18726277539863323,0.3259132508721852,4.55908203125,3.0791015625,5.35888671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(53.348), 'mean_duration_us': np.float64(4.445666666666667), 'median_duration_us': np.float64(4.559), 'std_dev_duration_us': np.float64(0.725687413575723), 'min_duration_us': np.float64(3.079), 'max_duration_us': np.float64(5.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]","{'op_shape': (10, 128, 28, 28), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (100352, 784, 28, 1), 'stride_output': None}",True,0.25565102915000154,93.29093471797691 -aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), ())","('c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), ())","('', '0')",False,5891,3,18.05,6.016666666666667,0.20744477176668816,0.00802816,30.625,0.24999999999999997,vector_bf16,1.8607984413183,0.04921750919684054,0.465199610329575,0.012304377299210136,17.265625,0.4635000603108948,51.796875,5.98,5.83,6.24,1.884648289775332,1.804199679578624,1.8935473546009443,0.471162072443833,0.451049919894656,0.47338683865023606,17.0390625,16.958984375,17.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(51.797), 'mean_duration_us': np.float64(17.265666666666664), 'median_duration_us': np.float64(17.039), 'std_dev_duration_us': np.float64(0.37853518844208994), 'min_duration_us': np.float64(16.959), 'max_duration_us': np.float64(17.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(17.27)}]","{'op_shape': (10, 64, 112, 112), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (802816, 12544, 112, 1), 'stride_output': None}",True,0.24821715013438195,93.53915186811129 -aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",True,126,3,206.999,68.99966666666667,3.083175365322795,0.12845056,1.685546875,72.67670915411355,matrix_bf16,0.10341179087164896,0.007890012410202976,7.515628648284847,0.5734201371586678,17.1572265625,1.3007552227360448,51.4716796875,70.729,65.44,70.83,0.10277354775695627,0.0958602847457627,0.11160154011222792,7.46924323906871,6.966810033898304,8.110832671887525,17.197265625,15.8369140625,18.4375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.677), 'mean_duration_us': np.float64(5.559), 'median_duration_us': np.float64(5.359), 'std_dev_duration_us': np.float64(0.40133111848779757), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.119)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.29454296045832684), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.119)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.557000000000002), 'mean_duration_us': np.float64(5.852333333333334), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.547803695577977), 'min_duration_us': np.float64(5.079), 'max_duration_us': np.float64(6.279)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.56)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.85)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (256, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.24665877323025767,93.78581064134154 -aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",False,6311,3,194.428,64.80933333333333,7.873588148571995,0.12845056,1.685546875,72.67670915411355,matrix_bf16,0.10396356789862353,0.007640169010598823,7.555729986792198,0.5552623410715624,17.063802083333332,1.2943239361047492,51.19140625,60.379,60.149,73.9,0.10623321550788015,0.09544574285412931,0.1102117453338611,7.720680505972471,6.936682493407868,8.009826960996255,16.63720703125,16.03662109375,18.517578125,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.877), 'mean_duration_us': np.float64(5.625666666666667), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.37853518844209033), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(6.159)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.076999999999998), 'mean_duration_us': np.float64(5.692333333333333), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.3612324582438417), 'min_duration_us': np.float64(5.279), 'max_duration_us': np.float64(6.159)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.3461534662865911), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.199)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.63)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (256, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.24531566761018664,94.03112630895173 -aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",False,6182,3,190.139,63.37966666666667,9.018666216982055,0.12845056,2.93359375,41.75765645805592,matrix_bf16,0.18804717997750622,0.009065025309499552,7.852409539406916,0.3785342126576635,16.383951822916668,0.8043624567112516,49.15185546875,58.639,57.72,73.78,0.19038514983378663,0.17804218313361972,0.1957142069651123,7.950037681474765,7.43462431833597,8.172566618410015,16.1572265625,15.71728515625,17.27734375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.877), 'mean_duration_us': np.float64(5.292333333333334), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.7052816616233701), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(6.199)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.117), 'mean_duration_us': np.float64(5.372333333333334), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.2659991645768003), 'min_duration_us': np.float64(4.999), 'max_duration_us': np.float64(5.599)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.157), 'mean_duration_us': np.float64(5.719), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.26733250207684545), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(6.079)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.29)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.37)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.72)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (128, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.23554188333311923,94.26666819228484 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '0')",False,630,12,84.658,7.054833333333334,3.44171180541241,0.00050176,2.87109375,0.16666666666666666,vector_bf16,0.959759619857854,0.5073463271319937,0.15995993664297567,0.0845577211886656,3.9957682291666665,1.984446512224859,47.94921875,5.625,5.229,17.3,0.8318693393547332,0.4181787086272382,1.7928545740040709,0.13864488989245552,0.06969645143787302,0.2988090956673451,3.619140625,1.67919921875,7.19921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(47.94800000000001), 'mean_duration_us': np.float64(3.995666666666667), 'median_duration_us': np.float64(3.6189999999999998), 'std_dev_duration_us': np.float64(1.8999268991785507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.2297786966741733,94.49644688895901 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (512, 512, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4608, 9, 3, 1), (4608, 9, 3, 1), ())","('', '', 'False')",False,1658,9,33.04,3.671111111111111,0.403312671647087,0.002359296,9.0,0.25,vector_bf16,1.8616538552030524,0.2435625724804497,0.4654134638007631,0.06089064312011243,5.150119357638889,0.6976119225404901,46.35107421875,3.82,3.09,4.08,1.9502878740665992,1.503021450501594,2.165044565027445,0.4875719685166498,0.3757553626253985,0.5412611412568612,4.8388671875,4.35888671875,6.27880859375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(46.35100000000001), 'mean_duration_us': np.float64(5.150111111111112), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.6577477470622245), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(6.279)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.15)}]","{'op_shape': (512, 512, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (4608, 9, 3, 1), 'stride_output': (4608, 9, 3, 1)}",True,0.22212018675345468,94.71856707571247 -aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",True,497,12,79.19,6.599166666666666,4.488936821551267,0.00050176,1.9140625,0.24999999999999997,vector_bf16,0.5587514956047688,0.10057935081336584,0.1396878739011922,0.02514483770334146,3.7023111979166665,0.6702554335583752,44.427734375,5.164999999999999,4.56,20.71,0.5570036566177266,0.43639642424885866,0.6782867854785478,0.13925091415443164,0.10909910606221467,0.16957169636963695,3.638916015625,2.958984375,4.59912109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(44.428000000000004), 'mean_duration_us': np.float64(3.7023333333333337), 'median_duration_us': np.float64(3.6390000000000002), 'std_dev_duration_us': np.float64(0.6417597335105681), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(4.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.7)}]","{'op_shape': (10, 256, 14, 14), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (50176, 196, 14, 1), 'stride_output': None}",True,0.21290329992861182,94.93147037564108 -aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",True,529,3,306.349,102.11633333333333,57.856441130900315,0.12845056,2.93359375,41.75765645805592,matrix_bf16,0.21017238725879214,0.0017248514918915291,8.776306344122132,0.07202575603957062,14.63671875,0.1201171875,43.91015625,71.07,66.41,168.869,0.21016295062716842,0.2084522734431871,0.21190193770602087,8.775912292500667,8.70447842234134,8.848528317524385,14.63671875,14.5166015625,14.7568359375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.477), 'mean_duration_us': np.float64(4.492333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(4.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.397), 'mean_duration_us': np.float64(4.799), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.05656854249492343), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.879)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.037), 'mean_duration_us': np.float64(5.345666666666666), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(5.399)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.8)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.35)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (128, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.21042300035147718,95.14189337599257 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (128, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,1775,9,31.8,3.533333333333333,0.30442568879777554,0.000147456,0.5625,0.25,vector_bf16,0.12328301444114621,0.011430523082899711,0.030820753610286553,0.0028576307707249278,4.821180555555555,0.44821790427644176,43.390625,3.54,3.09,4.09,0.12394413626103017,0.10765168452009624,0.13914981591982492,0.03098603406525754,0.02691292113002406,0.03478745397995623,4.7587890625,4.23876953125,5.47900390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(43.391), 'mean_duration_us': np.float64(4.821222222222222), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.4225262063608935), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.82)}]","{'op_shape': (128, 128, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1152, 9, 3, 1), 'stride_output': (1152, 9, 3, 1)}",True,0.2079333411532967,95.34982671714586 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 256, 3, 3), (256, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,1745,9,30.699,3.411,0.3342401831019125,0.000589824,2.25,0.25,vector_bf16,0.5064330496442352,0.04900106631659805,0.1266082624110588,0.012250266579149512,4.701171875,0.4952850959970768,42.310546875,3.36,2.92,3.889,0.5267456893055706,0.41837719352324876,0.5462790512153759,0.13168642232639266,0.10459429838081219,0.13656976280384397,4.47900390625,4.31884765625,5.63916015625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(42.311), 'mean_duration_us': np.float64(4.701222222222222), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.46689941285933856), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.639)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.7)}]","{'op_shape': (256, 256, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304, 9, 3, 1), 'stride_output': (2304, 9, 3, 1)}",True,0.2027574707149742,95.55258418786083 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,5945,6,44.419,7.4031666666666665,3.0211554357011603,0.00200704,11.484375,0.16666666666666666,vector_bf16,1.7350461490021605,0.17963276476169893,0.28917435816702675,0.029938794126949837,7.012451171875,0.8351389698492557,42.07470703125,6.6645,5.21,13.33,1.7922031480270328,1.3939132719154468,1.8702136589064988,0.29870052467117214,0.23231887865257445,0.31170227648441645,6.71923828125,6.43896484375,8.63916015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(42.074), 'mean_duration_us': np.float64(7.012333333333333), 'median_duration_us': np.float64(6.719), 'std_dev_duration_us': np.float64(0.7623355924758827), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(8.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.01)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.2016272964736949,95.75421148433452 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '0')",False,227,12,88.21,7.350833333333333,1.7181303704017834,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.5506234561117808,0.20692332879085323,0.0917705760186301,0.0344872214651422,3.1856282552083335,1.3758855731737367,38.2275390625,7.665,5.24,10.24,0.5445946389992844,0.23973974959172564,0.7844309007633588,0.09076577316654738,0.03995662493195427,0.13073848346055977,2.959228515625,1.9189453125,6.27880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(38.228), 'mean_duration_us': np.float64(3.1856666666666666), 'median_duration_us': np.float64(2.9589999999999996), 'std_dev_duration_us': np.float64(1.3174048563579668), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.19)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.18319118291874775,95.93740266725327 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",True,1328,6,33.39,5.565,0.5423190942609342,0.00200704,11.484375,0.16666666666666666,vector_bf16,1.9331527244233129,0.14419505308634836,0.32219212073721876,0.02403250884772472,6.258951822916667,0.47782093094713657,37.5537109375,5.744999999999999,4.77,6.22,1.9119961156014238,1.7107732741398447,2.105567106633655,0.31866601926690397,0.2851288790233074,0.35092785110560915,6.298828125,5.71923828125,7.0390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(37.554), 'mean_duration_us': np.float64(6.259), 'median_duration_us': np.float64(6.2989999999999995), 'std_dev_duration_us': np.float64(0.4361956747454822), 'min_duration_us': np.float64(5.719), 'max_duration_us': np.float64(7.039)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.26)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.17996211365794978,96.11736478091122 -aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), ())","('', '', '0')",False,1600,3,14.969999999999999,4.989999999999999,0.2535744466621197,0.00802816,45.9375,0.16666666666666666,vector_bf16,3.961416641468842,0.22266977934034973,0.6602361069114736,0.037111629890058284,12.185709635416666,0.698889002841252,36.55712890625,4.88,4.81,5.28,4.014406693253032,3.71703203014318,4.152811201010314,0.6690677822088386,0.6195053383571966,0.6921352001683856,11.9990234375,11.59912109375,12.958984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(36.557), 'mean_duration_us': np.float64(12.185666666666668), 'median_duration_us': np.float64(11.999), 'std_dev_duration_us': np.float64(0.5706915882408716), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(12.19)}]","{'shape_in1': (10, 64, 112, 112), 'shape_in2': (10, 64, 112, 112), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (802816, 12544, 112, 1), 'stride_input2': (802816, 12544, 112, 1), 'stride_output': None}",True,0.17518636701933485,96.29255114793055 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (), (512, 512, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((4608, 9, 3, 1), (), (4608, 9, 3, 1))","('', '', '')",False,272,9,47.149,5.238777777777778,0.5600678034349453,0.002359296,9.000007629394531,0.2499997880725538,vector_bf16,2.6787217353571995,0.6836274955838052,0.6696798661446434,0.17090672901652196,3.710177951388889,0.8288603382936338,33.3916015625,5.13,4.55,6.26,2.359874141147741,2.03424578633828,3.630916628968627,0.5899680351648352,0.5085610154720555,0.9077283877512681,3.9990234375,2.59912109375,4.63916015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(33.391), 'mean_duration_us': np.float64(3.710111111111111), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.7815148316562939), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(4.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]","{'shape_in1': (512, 512, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (4608, 9, 3, 1), 'stride_input2': (), 'stride_output': (4608, 9, 3, 1)}",True,0.1600167612093688,96.45256790913992 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,6074,6,38.81,6.468333333333334,1.0910255114646337,0.00100352,5.7421875,0.16666666666666666,vector_bf16,1.1219694653014638,0.15654971643840035,0.18699491088357725,0.026091619406400056,5.445638020833333,0.6823692762967902,32.673828125,6.8100000000000005,4.89,7.75,1.0494735953428131,0.9904621493975905,1.3941496619559073,0.17491226589046885,0.16507702489959838,0.23235827699265119,5.739013671875,4.31884765625,6.0791015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.674), 'mean_duration_us': np.float64(5.445666666666667), 'median_duration_us': np.float64(5.739000000000001), 'std_dev_duration_us': np.float64(0.6228607834464742), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.15657710047504053,96.60914500961496 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,6332,6,36.2,6.033333333333334,1.155225807652628,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.2886959041489444,0.05652407689825793,0.04811598402482407,0.00942067948304299,5.399007161458333,1.1462242511559813,32.39404296875,6.16,4.54,7.72,0.2924459792266926,0.20680307506540552,0.3517988634029442,0.04874099653778209,0.034467179177567586,0.058633143900490695,5.19921875,4.27880859375,7.27880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.394000000000005), 'mean_duration_us': np.float64(5.399000000000001), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(1.0463906217724492), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(7.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.4)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.15523633476023097,96.7643813443752 -aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,6203,6,43.78,7.296666666666667,1.2449524756659052,0.00050176,2.87109375,0.16666666666666666,vector_bf16,0.5606019905108158,0.040274347844888564,0.09343366508513595,0.006712391307481421,5.392252604166667,0.3687834988480689,32.353515625,7.21,5.66,9.12,0.5577447396569328,0.5156068640240843,0.6326315288323415,0.0929574566094888,0.08593447733734738,0.10543858813872357,5.39892578125,4.7587890625,5.8388671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.354), 'mean_duration_us': np.float64(5.392333333333333), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.33658414830304906), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.39)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.1550421226235308,96.91942346699872 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",True,153,6,38.639,6.4398333333333335,1.2328763793124864,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.29522556932188054,0.047309360287814316,0.049204261553646746,0.007884893381302379,5.212483723958333,0.8603393923316893,31.27490234375,6.574999999999999,5.07,7.75,0.29888887434996225,0.2294955289213132,0.36191752054472887,0.049814812391660364,0.03824925482021886,0.0603195867574548,5.05908203125,4.1591796875,6.55908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(31.274), 'mean_duration_us': np.float64(5.2123333333333335), 'median_duration_us': np.float64(5.059), 'std_dev_duration_us': np.float64(0.7854227453345676), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(6.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.14987327190099262,97.06929673889971 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (), (64, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,1447,12,53.01,4.4174999999999995,0.37675950853658224,3.6864e-05,0.14063262939453125,0.24998643736776432,vector_bf16,0.06668872402117339,0.026107861124065823,0.016671276530655182,0.006526611189697569,2.5723876953125,1.0093065844733184,30.86865234375,4.38,3.78,5.08,0.06586034554800356,0.03923178383995843,0.09458386219855935,0.016464193147355307,0.009807413873733437,0.023644682743501406,2.51904296875,1.55908203125,3.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(30.868), 'mean_duration_us': np.float64(2.5723333333333334), 'median_duration_us': np.float64(2.519), 'std_dev_duration_us': np.float64(0.9664137600197731), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.57)}]","{'shape_in1': (64, 64, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (576, 9, 3, 1), 'stride_input2': (), 'stride_output': (576, 9, 3, 1)}",True,0.14792647072346807,97.21722320962317 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",True,956,6,37.06,6.176666666666667,0.7811956647771842,0.00100352,5.7421875,0.16666666666666666,vector_bf16,1.22715017000074,0.09870807605136768,0.20452502833345665,0.016451346008561282,4.932210286458333,0.38339940966681924,29.59326171875,6.494999999999999,4.92,6.84,1.229089972137329,1.1152440770552592,1.3941496619559073,0.20484832868955477,0.18587401284254315,0.23235827699265119,4.89892578125,4.31884765625,5.39892578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(29.593999999999998), 'mean_duration_us': np.float64(4.932333333333333), 'median_duration_us': np.float64(4.898999999999999), 'std_dev_duration_us': np.float64(0.3499841266241783), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.93)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.14181463818056642,97.35903784780373 -aten::mm,GEMM,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (1000, 512))","('c10::BFloat16', 'c10::BFloat16')","((1000, 1), (512, 1))","('', '')",False,16,3,438.926,146.30866666666665,166.77260011864462,0.01024,1.005401611328125,9.713158294126574,matrix_bf16,0.11936650538560463,0.009195732100480506,1.15942576182709,0.08931960152234825,8.86572265625,0.6575774436567361,26.59716796875,58.159,42.109,338.658,0.11560738487898907,0.11264587676736057,0.12984625451046428,1.1229128292996358,1.0941472322220482,1.2612172239595862,9.119140625,8.119140625,9.35888671875,"[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LBSPPA256_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD0_NTM0_NEPBS0_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(26.597), 'mean_duration_us': np.float64(8.865666666666668), 'median_duration_us': np.float64(9.119), 'std_dev_duration_us': np.float64(0.5369874817493938), 'min_duration_us': np.float64(8.119), 'max_duration_us': np.float64(9.359)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]","{'M': 10, 'N': 512, 'K': 1000, 'bias': False, 'stride_A': (1000, 1), 'stride_B': (512, 1), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (False, False)}",True,0.12745697949632276,97.48649482730006 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",True,556,6,45.619,7.603166666666667,2.697739825607108,0.00050176,2.87109375,0.16666666666666666,vector_bf16,0.6952010846285724,0.01428130609525998,0.11586684743809539,0.0023802176825433335,4.33203125,0.09015475637167203,25.9921875,6.495,5.29,12.43,0.7004151067592712,0.6721494472909626,0.710243852090773,0.11673585112654519,0.11202490788182709,0.11837397534846215,4.29833984375,4.23876953125,4.47900390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.993), 'mean_duration_us': np.float64(4.332166666666667), 'median_duration_us': np.float64(4.2985), 'std_dev_duration_us': np.float64(0.08222006378548305), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.479)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.12455783687738894,97.61105266417745 -aten::sum,reduce,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '')","((1000, 1), (), (), ())","('', '[0]', 'True', '')",False,26,3,39.019999999999996,13.006666666666666,3.703138308696197,1e-05,0.019075393676757812,0.49995000499950004,vector_bf16,0.0025081292560820063,0.00011280745184699644,0.0012539392341175916,5.639808611488654e-05,7.985677083333333,0.36060498707123123,23.95703125,11.16,10.59,17.27,0.0025131347239263804,0.0023929023891582453,0.0026183506551613936,0.0012564417177914112,0.0011963315614229805,0.001309044423138383,7.958984375,7.63916015625,8.35888671875,"[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(23.956999999999997), 'mean_duration_us': np.float64(7.985666666666666), 'median_duration_us': np.float64(7.959), 'std_dev_duration_us': np.float64(0.2945429604583269), 'min_duration_us': np.float64(7.639), 'max_duration_us': np.float64(8.359)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(22.076999999999998), 'mean_duration_us': np.float64(7.358999999999999), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.31155523854794487), 'min_duration_us': np.float64(7.119), 'max_duration_us': np.float64(7.799)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.991), 'mean_duration_us': np.float64(2.4434444444444443), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.895111552465962), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]","{'shape_in1': (256, 256, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (2304, 9, 3, 1), 'stride_input2': (), 'stride_output': (2304, 9, 3, 1)}",True,0.10538231325982426,97.93703656567604 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (), (128, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,1075,9,45.0,5.0,0.5905929224093363,0.000147456,0.5625076293945312,0.24999660920397673,vector_bf16,0.2733472121251077,0.0840759242798106,0.06833587616663707,0.02101869598564295,2.4078776041666665,0.9181949417968699,21.6708984375,4.63,4.39,5.86,0.3139230602910603,0.15692075032475966,0.35125790520500144,0.07847970062370062,0.03922965549493375,0.08781328525734224,1.87890625,1.67919921875,3.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 9, 'total_duration_us': np.float64(21.670999999999996), 'mean_duration_us': np.float64(2.4078888888888885), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.8656974637628507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.41)}]","{'shape_in1': (128, 128, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1152, 9, 3, 1), 'stride_input2': (), 'stride_output': (1152, 9, 3, 1)}",True,0.10384967531357597,98.04088624098961 -aten::mse_loss_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((), (10, 1000), (10, 1000), (), (10, 1000))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'c10::BFloat16')","((), (1000, 1), (1000, 1), (), (1000, 1))","('', '', '', '1', '')",False,9,3,26.05,8.683333333333334,2.602428353160435,,,,,,,,,7.118977864583333,0.7664773569099081,21.35693359375,7.67,6.74,11.64,,,,,,,7.47900390625,6.23876953125,7.63916015625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.357), 'mean_duration_us': np.float64(7.119), 'median_duration_us': np.float64(7.479), 'std_dev_duration_us': np.float64(0.625672971021337), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(7.639)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.12)}]",,False,0.10234511623046502,98.14323135722007 -"aten::mse_loss->void at::native::vectorized_elementwise_kernel<8, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array) (Synthetic Op)",elementwise,python3,CPU,thread 542 (python3),"((10, 1000), (10, 1000), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1000, 1), (1000, 1), ())","('', '', '1')",False,56451,3,78.18,26.060000000000002,2.977263844539146,,,,,,,,,6.5322265625,0.26638550439867287,19.5966796875,27.11,22.7,28.37,,,,,,,6.59912109375,6.23876953125,6.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.599), 'std_dev_duration_us': np.float64(0.21746008573733472), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(6.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",,False,0.09390975776294574,98.23714111498302 -aten::mean,reduce,python3,CPU,thread 542 (python3),"((10, 1000), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '', 'c10::BFloat16')","((1000, 1), (), (), (), ())","('', '[]', 'False', '', '')",False,6408,3,25.23,8.41,0.9355212450821205,1e-05,0.019075393676757812,0.49995000499950004,vector_bf16,0.0033239192399606584,0.000369630530044365,0.0016617934406362655,0.00018479678534364817,6.065755208333333,0.6504878218749942,18.197265625,7.89,7.85,9.49,0.003226535601764335,0.003012730455247481,0.003732491662870159,0.0016131064902331442,0.0015062146061631243,0.0018660592255125283,6.19921875,5.35888671875,6.63916015625,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.197000000000003), 'mean_duration_us': np.float64(6.065666666666668), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.5309948733797302), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.639)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'Scalar', None), 'stride_input1': (512, 1, 0, 0), 'stride_input2': (), 'stride_output': None}",True,0.08489878260111029,98.49491443820516 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,454,6,35.81,5.968333333333334,0.6816866337743955,0.00050176,2.87109375,0.16666666666666666,vector_bf16,1.0752666573810312,0.25450396443104517,0.17921110956350517,0.042417327405174204,2.9457194010416665,0.7493654374675626,17.67431640625,5.744999999999999,5.21,7.2,1.141777709153922,0.7761363141993959,1.4206513548387096,0.19029628485898697,0.12935605236656594,0.23677522580645158,2.63916015625,2.119140625,3.87890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.6390000000000002), 'std_dev_duration_us': np.float64(0.6841702192355998), 'min_duration_us': np.float64(2.119), 'max_duration_us': np.float64(3.879)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.08469755074862578,98.57961198895379 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,854,6,39.33,6.555,2.9827017953526624,0.00100352,5.7421875,0.16666666666666666,vector_bf16,2.058135814442255,0.18207552315729217,0.34302263574037584,0.030345920526215354,2.9456380208333335,0.27438967631487227,17.673828125,5.355,5.02,12.61,2.0627724590163936,1.7508524435609827,2.316598489573549,0.34379540983606555,0.2918087405934971,0.3860997482622581,2.9189453125,2.59912109375,3.43896484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.919), 'std_dev_duration_us': np.float64(0.25051058970741247), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(3.439)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.08469521084336433,98.66430719979715 -aten::addmm,GEMM,python3,CPU,thread 542 (python3),"((1000,), (10, 512), (512, 1000), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",False,6400,3,131.53,43.843333333333334,8.790109972766741,0.01025,1.0073089599609375,9.704233886237976,matrix_bf16,0.19147347243378673,0.012316432308777972,1.8581033595076064,0.1195215397683994,5.5322265625,0.36958310688847623,16.5966796875,39.78,37.82,53.93,0.1985843679427155,0.1772516814159292,0.1985843679427155,1.9271091526668502,1.7200917731891183,1.9271091526668502,5.31884765625,5.31884765625,5.958984375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.597), 'mean_duration_us': np.float64(5.532333333333334), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(5.959)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]","{'M': 10, 'N': 1000, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,0.07953337983661049,98.74384057963375 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (256, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,1769,3,10.28,3.4266666666666663,0.37004504230341106,0.000294912,1.125,0.25,vector_bf16,0.23812062089248345,0.023501540945279162,0.05953015522312086,0.0058753852363197905,4.985677083333333,0.4822019830070951,14.95703125,3.42,3.06,3.8,0.23410068837209302,0.21688832965257204,0.2633728446527853,0.058525172093023256,0.05422208241314301,0.06584321116319633,5.0390625,4.47900390625,5.43896484375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.957), 'mean_duration_us': np.float64(4.985666666666667), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.3937286149395573), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(5.439)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.99)}]","{'op_shape': (256, 128, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1152, 9, 3, 1), 'stride_output': (1152, 9, 3, 1)}",True,0.07167597796866881,98.81551655760242 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (512, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,1739,3,11.33,3.776666666666667,0.3121431295629193,0.001179648,4.5,0.25,vector_bf16,0.961506073804064,0.10108157041790036,0.240376518451016,0.02527039260447509,4.945638020833333,0.5446142789205571,14.8369140625,3.91,3.42,4.0,0.9915530900882413,0.8488077660079052,1.0441573653160454,0.24788827252206033,0.2122019415019763,0.26103934132901135,4.7587890625,4.51904296875,5.55908203125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.837000000000002), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.44462218668088177), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.95)}]","{'op_shape': (512, 256, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304, 9, 3, 1), 'stride_output': (2304, 9, 3, 1)}",True,0.07110036127435265,98.88661691887677 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (), (1000, 512))","('c10::BFloat16', 'double', 'c10::BFloat16')","((512, 1), (), (512, 1))","('', '', '')",False,45,3,18.400000000000002,6.133333333333334,3.5500187792930524,0.000512,1.9531326293945312,0.2499990234413147,vector_bf16,0.4226052056017336,0.03357184104754338,0.1056508887016494,0.008392927477012892,4.86572265625,0.36958310688847623,14.59716796875,4.21,3.96,10.23,0.4032224941357431,0.4032224941357431,0.46137062853371463,0.100805229763507,0.100805229763507,0.1153422065779342,5.0791015625,4.43896484375,5.0791015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.597), 'mean_duration_us': np.float64(4.865666666666667), 'median_duration_us': np.float64(5.079), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.87)}]","{'shape_in1': (1000, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (512, 1), 'stride_input2': (), 'stride_output': (512, 1)}",True,0.06995146779098178,98.95656838666775 -aten::fill_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), ())","('c10::BFloat16', 'Scalar')","((1000, 1), ())","('', '0')",False,8,3,33.23,11.076666666666666,0.9347370396712289,,,,,,,,,4.798665364583333,0.4716395854027524,14.39599609375,10.83,10.29,12.11,,,,,,,4.67822265625,4.39892578125,5.31884765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.396), 'mean_duration_us': np.float64(4.798666666666667), 'median_duration_us': np.float64(4.678), 'std_dev_duration_us': np.float64(0.38515826472878506), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.8)}]",,False,0.0689874268232653,99.02555581349102 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (256, 128, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((128, 1, 1, 1), (128, 1, 1, 1), ())","('', '', 'False')",False,1757,3,10.370000000000001,3.456666666666667,0.37072002014098643,3.2768e-05,0.125,0.25,vector_bf16,0.027683243903912667,0.002995977751147662,0.006920810975978167,0.0007489944377869154,4.772298177083333,0.5220458095712031,14.31689453125,3.64,3.03,3.7,0.02777397371960683,0.02464293179105848,0.03063282620107269,0.006943493429901707,0.00616073294776462,0.007658206550268173,4.71923828125,4.27880859375,5.31884765625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.317), 'mean_duration_us': np.float64(4.772333333333333), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.77)}]","{'op_shape': (256, 128, 1, 1), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (128, 1, 1, 1), 'stride_output': (128, 1, 1, 1)}",True,0.06860836217091075,99.09416417566193 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (64, 3, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((147, 49, 7, 1), (147, 49, 7, 1), ())","('', '', 'False')",False,1829,3,12.02,4.006666666666667,1.841312937371954,9.408e-06,0.035888671875,0.25,vector_bf16,0.007982560007111693,0.0009286231010938887,0.001995640001777923,0.00023215577527347219,4.758951822916667,0.5769098932439007,14.27685546875,3.04,2.85,6.13,0.008182432954666101,0.006970275481595369,0.008794971585073606,0.0020456082386665253,0.0017425688703988423,0.0021987428962684016,4.59912109375,4.27880859375,5.39892578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.277000000000001), 'mean_duration_us': np.float64(4.759), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.4710272462041519), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.76)}]","{'op_shape': (64, 3, 7, 7), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (147, 49, 7, 1), 'stride_output': (147, 49, 7, 1)}",True,0.06841648993947202,99.1625806656014 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (128, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,1799,3,9.579,3.193,0.23838414376799483,7.3728e-05,0.28125,0.25,vector_bf16,0.06422163073442737,0.0065021197818901175,0.016055407683606842,0.0016255299454725294,4.625651041666667,0.4971274672189554,13.876953125,3.299,2.92,3.36,0.06765764265710765,0.056722368144252445,0.06828488140192199,0.016914410664276913,0.014180592036063111,0.017071220350480497,4.35888671875,4.31884765625,5.19921875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.876999999999999), 'mean_duration_us': np.float64(4.625666666666667), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.405736641458745), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.199)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.63)}]","{'op_shape': (128, 64, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (576, 9, 3, 1), 'stride_output': (576, 9, 3, 1)}",True,0.0665001075303463,99.22908077313174 -aten::fill_,elementwise,python3,CPU,thread 542 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '1.')",False,6413,3,18.7,6.233333333333333,0.929157324317757,,,,,,,,,4.598958333333333,0.3200683904124541,13.796875,5.8,5.6,7.3,,,,,,,4.59912109375,4.27880859375,4.9189453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.797), 'mean_duration_us': np.float64(4.599), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.2612789058968722), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",,False,0.06611636306746886,99.2951971361992 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (1000,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1650,3,26.75,8.916666666666666,0.4508140784551142,1e-06,0.003814697265625,0.25,vector_bf16,0.0008925166217245666,0.0001022922004128155,0.00022312915543114156,2.557305010320387e-05,4.518880208333333,0.48653430985275825,13.556640625,9.12,8.4,9.23,0.0008405499692181409,0.0008266397578203835,0.001010360138135175,0.0002101374923045352,0.00020665993945509582,0.0002525900345337937,4.7587890625,3.958984375,4.8388671875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.557), 'mean_duration_us': np.float64(4.519), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.39732438468670256), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(4.839)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.52)}]","{'op_shape': (1000,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.06496512967883654,99.36016226587805 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (), (1000,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,33,3,26.64,8.88,2.9559431658947712,1e-06,0.00382232666015625,0.249500998003992,vector_bf16,0.0009143118490488159,8.813688365013132e-05,0.00022812171882455478,2.1990240431669502e-05,4.412272135416667,0.44599523130071334,13.23681640625,7.72,6.68,12.24,0.000945557424259878,0.000814808814770697,0.0009825693081158726,0.0002359175210229236,0.0002032956124677387,0.0002451520229830021,4.23876953125,4.0791015625,4.9189453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.236999999999998), 'mean_duration_us': np.float64(4.412333333333333), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(0.3641733408999376), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}]","{'shape_in1': (1000,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.06343249173258823,99.42359475761063 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (128, 64, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1, 1, 1), (64, 1, 1, 1), ())","('', '', 'False')",False,1787,3,11.7,3.9,0.38105117766515306,8.192e-06,0.03125,0.25,vector_bf16,0.00752253942153772,0.0005527228779897269,0.00188063485538443,0.00013818071949743172,4.372395833333333,0.3352246668890176,13.1171875,4.12,3.46,4.12,0.007803356279069767,0.006885785347835009,0.007878476637708383,0.0019508390697674418,0.0017214463369587523,0.001969619159427096,4.19921875,4.1591796875,4.7587890625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.116999999999999), 'mean_duration_us': np.float64(4.372333333333333), 'median_duration_us': np.float64(4.199), 'std_dev_duration_us': np.float64(0.27390184778898874), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]","{'op_shape': (128, 64, 1, 1), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (64, 1, 1, 1), 'stride_output': (64, 1, 1, 1)}",True,0.06285921494353353,99.48645397255416 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (512, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1, 1, 1), (256, 1, 1, 1), ())","('', '', 'False')",False,1727,3,11.82,3.94,0.6444377394287207,0.000131072,0.5,0.25,vector_bf16,0.1199220893378171,0.0012758765824936278,0.029980522334454276,0.00031896914562340694,4.372233072916667,0.046233127024950436,13.11669921875,3.7,3.45,4.67,0.11918546164946166,0.11918546164946166,0.12139534471452797,0.029796365412365414,0.029796365412365414,0.03034883617863199,4.39892578125,4.31884765625,4.39892578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.117), 'mean_duration_us': np.float64(4.372333333333334), 'median_duration_us': np.float64(4.399), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]","{'op_shape': (512, 256, 1, 1), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (256, 1, 1, 1), 'stride_output': (256, 1, 1, 1)}",True,0.06285687503827207,99.54931084759244 -aten::cat,other,python3,CPU,thread 542 (python3),"((), ())","('TensorList', 'Scalar')","((), ())","('', '0')",False,5534,3,64.599,21.533,0.9481492498546847,,,,,,,,,4.065592447916667,0.18031158429403077,12.19677734375,21.29,20.73,22.579,,,,,,,4.0791015625,3.87890625,4.23876953125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.197), 'mean_duration_us': np.float64(4.065666666666666), 'median_duration_us': np.float64(4.079), 'std_dev_duration_us': np.float64(0.14727148022916342), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.239)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.07)}]",,False,0.058448493525704436,99.60775934111814 -aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (1000, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1), (512, 1), ())","('', '', 'False')",False,1652,3,13.67,4.556666666666667,0.3212994449626912,0.000512,1.953125,0.25,vector_bf16,0.5402953724150212,0.09578083415618481,0.13507384310375528,0.023945208539046175,3.86572265625,0.6377912043259547,11.59716796875,4.44,4.31,4.92,0.5070483558994198,0.4655682095682096,0.6482695517774344,0.12676208897485491,0.11639205239205239,0.16206738794435854,4.0390625,3.1591796875,4.39892578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.597), 'mean_duration_us': np.float64(3.8656666666666664), 'median_duration_us': np.float64(4.039), 'std_dev_duration_us': np.float64(0.5208539995899897), 'min_duration_us': np.float64(3.159), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]","{'op_shape': (1000, 512), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (512, 1), 'stride_output': (512, 1)}",True,0.05557508986464654,99.66333443098279 -aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,316,3,18.89,6.296666666666667,0.19655363983740748,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.40633830628853135,0.009023223314506893,0.06772305104808855,0.0015038705524178157,3.7057291666666665,0.0830743261395091,11.1171875,6.4,6.07,6.42,0.4091325069674851,0.3962485141388175,0.41363389775929155,0.06818875116124751,0.06604141902313625,0.06893898295988192,3.67919921875,3.63916015625,3.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.06798692684790385), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.05327496299264336,99.71660939397543 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (), (64, 3, 7, 7))","('c10::BFloat16', 'double', 'c10::BFloat16')","((147, 49, 7, 1), (), (147, 49, 7, 1))","('', '', '')",False,1640,3,13.02,4.34,0.6022457969965419,9.408e-06,0.03589630126953125,0.2499468650371945,vector_bf16,0.010469517217205479,0.00042669772018276105,0.0026168230068934414,0.00010665175747819901,3.59912109375,0.1443628928652574,10.79736328125,4.4,3.71,4.91,0.010343045753387896,0.010120351844558225,0.010945154053670312,0.002585211860995572,0.0025295502166207172,0.0027357069430640354,3.63916015625,3.43896484375,3.71923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.796999999999999), 'mean_duration_us': np.float64(3.5989999999999998), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.11775681155103787), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","{'shape_in1': (64, 3, 7, 7), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (147, 49, 7, 1), 'stride_input2': (), 'stride_output': (147, 49, 7, 1)}",True,0.05174232504639506,99.76835171902182 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (), (256, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,860,3,15.12,5.04,0.6274551776820395,0.000294912,1.1250076293945312,0.2499983045904908,vector_bf16,0.33069730299007677,0.014599473837398664,0.08267376508016704,0.003649843707262895,3.5719401041666665,0.16181668128245583,10.7158203125,4.81,4.56,5.75,0.3390786649824561,0.31383937230449466,0.3391738716832795,0.08476909136842105,0.0784593109898675,0.08479289288221255,3.47900390625,3.47802734375,3.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.716000000000001), 'mean_duration_us': np.float64(3.5720000000000005), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(0.13222959830033), 'min_duration_us': np.float64(3.478), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.57)}]","{'shape_in1': (256, 128, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1152, 9, 3, 1), 'stride_input2': (), 'stride_output': (1152, 9, 3, 1)}",True,0.05135156086773328,99.81970327988955 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (), (512, 256, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((2304, 9, 3, 1), (), (2304, 9, 3, 1))","('', '', '')",False,460,3,17.27,5.756666666666667,2.121658156568426,0.001179648,4.500007629394531,0.24999957614546686,vector_bf16,1.5653958412452047,0.5370752244514754,0.39134829681117766,0.1342685784711003,3.2257486979166665,0.9245327069892811,9.67724609375,4.69,4.38,8.2,1.2687006432978865,1.2421198971722365,2.185366983265491,0.31717462307995276,0.31052944781491004,0.5463408195386703,3.71923828125,2.1591796875,3.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.677), 'mean_duration_us': np.float64(3.2256666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.7549540089009102), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.23)}]","{'shape_in1': (512, 256, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (2304, 9, 3, 1), 'stride_input2': (), 'stride_output': (2304, 9, 3, 1)}",True,0.04637458237663382,99.86607786226618 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (), (128, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,1260,3,13.48,4.493333333333333,0.17925772879665008,7.3728e-05,0.28125762939453125,0.2499932184999322,vector_bf16,0.12092366157503864,0.06343112956112114,0.03023009534994049,0.015857352232070868,2.8390299479166665,1.1447188535008865,8.51708984375,4.4,4.38,4.7,0.08575836433338066,0.0828640636575662,0.19414855673416906,0.021439009512991623,0.020715453971738233,0.048535822565091605,3.43896484375,1.51904296875,3.55908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.517), 'mean_duration_us': np.float64(2.839), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.9346657156438339), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(3.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","{'shape_in1': (128, 64, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (576, 9, 3, 1), 'stride_input2': (), 'stride_output': (576, 9, 3, 1)}",True,0.04081496747543386,99.90689282974161 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (), (512, 256, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((256, 1, 1, 1), (), (256, 1, 1, 1))","('', '', '')",False,371,3,17.96,5.986666666666667,0.4619884558442263,0.000131072,0.5000076293945312,0.24999618536094115,vector_bf16,0.3123481897924305,0.00744979172641545,0.07808585595250288,0.0018624195133373658,1.67919921875,0.0400390625,5.03759765625,5.73,5.71,6.52,0.31222977842396044,0.30495830957114456,0.3198564813821865,0.078056253562082,0.07623841408690712,0.07996290020851951,1.67919921875,1.63916015625,1.71923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(5.037), 'mean_duration_us': np.float64(1.679), 'median_duration_us': np.float64(1.679), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.639), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.68)}]","{'shape_in1': (512, 256, 1, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (256, 1, 1, 1), 'stride_input2': (), 'stride_output': (256, 1, 1, 1)}",True,0.024140802582356884,99.93103363232396 -aten::cat,other,python3,CPU,thread 542 (python3),"(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('', '0')",False,5559,3,31.38,10.459999999999999,0.43863424398922585,,,,,,,,,1.6658528645833333,0.09246625404990101,4.99755859375,10.36,10.08,10.94,,,,,,,1.71923828125,1.55908203125,1.71923828125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<8u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.997), 'mean_duration_us': np.float64(1.6656666666666666), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(1.67)}]",,False,0.023948930350918166,99.95498256267487 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (), (128, 64, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((64, 1, 1, 1), (), (64, 1, 1, 1))","('', '', '')",False,1171,3,14.07,4.69,0.2707397274136176,8.192e-06,0.03125762939453125,0.2499389797412741,vector_bf16,0.020273373841058095,0.0017990846225563672,0.005067106373747496,0.0004496613750299535,1.6256510416666667,0.15130600872189426,4.876953125,4.81,4.38,4.88,0.021022626996554966,0.018220751357220413,0.021576743169398907,0.005254373943000313,0.004554076004343105,0.005392869173899068,1.55908203125,1.51904296875,1.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.877), 'mean_duration_us': np.float64(1.6256666666666666), 'median_duration_us': np.float64(1.559), 'std_dev_duration_us': np.float64(0.12364824660660939), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(1.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.63)}]","{'shape_in1': (128, 64, 1, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (64, 1, 1, 1), 'stride_input2': (), 'stride_output': (64, 1, 1, 1)}",True,0.023370973751340562,99.97835353642621 -aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (), (256, 128, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((128, 1, 1, 1), (), (128, 1, 1, 1))","('', '', '')",False,771,3,14.879999999999999,4.96,0.19672315572905966,3.2768e-05,0.12500762939453125,0.24998474214220323,vector_bf16,0.08710984937303184,0.0026281576561250322,0.02177613323356353,0.0006569993139754716,1.5056966145833333,0.046233127024950485,4.51708984375,4.99,4.75,5.14,0.08862721690326841,0.08407511431255872,0.08862721690326841,0.022155451964344666,0.021017495772001252,0.022155451964344666,1.47900390625,1.47900390625,1.55908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.51)}]","{'shape_in1': (256, 128, 1, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (128, 1, 1, 1), 'stride_input2': (), 'stride_output': (128, 1, 1, 1)}",True,0.021646463573653536,99.99999999999987 +aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), (64,), (64,), (64,), (64,), (64,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,1604,3,42.5,14.166666666666666,3.357295538574661,0.07225344,45.93798828125,1.4999840562919187,vector_bf16,0.12067939344638634,0.0017619546798114713,0.18101716609255902,0.0026429039276261376,399.2096354166667,5.878125137364244,1197.62890625,12.81,11.7,17.99,0.12169049708883495,0.11864487584337362,0.12170280740695048,0.18253380543549058,0.17796542212579466,0.18255227071639177,395.8359375,395.7958984375,405.9970703125,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: NativeBatchNormBackward0', 'NativeBatchNormBackward0', 'aten::native_batch_norm_backward'], 'count': 3, 'total_duration_us': np.float64(1197.6290000000001), 'mean_duration_us': np.float64(399.2096666666667), 'median_duration_us': np.float64(395.836), 'std_dev_duration_us': np.float64(4.799397207520504), 'min_duration_us': np.float64(395.796), 'max_duration_us': np.float64(405.997)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: NativeBatchNormBackward0', 'NativeBatchNormBackward0', 'aten::native_batch_norm_backward'], 'count': 12, 'total_duration_us': np.float64(1023.8620000000001), 'mean_duration_us': np.float64(85.32183333333334), 'median_duration_us': np.float64(85.6585), 'std_dev_duration_us': np.float64(1.298095709962182), 'min_duration_us': np.float64(82.959), 'max_duration_us': np.float64(87.318)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 12, 'total_duration_us': np.float64(54.266999999999996), 'mean_duration_us': np.float64(4.52225), 'median_duration_us': np.float64(4.379), 'std_dev_duration_us': np.float64(0.443226263699855), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 12, 'total_duration_us': np.float64(114.46700000000001), 'mean_duration_us': np.float64(9.538916666666667), 'median_duration_us': np.float64(10.098500000000001), 'std_dev_duration_us': np.float64(1.8621197803548752), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(11.959)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 12, 'total_duration_us': np.float64(510.306), 'mean_duration_us': np.float64(42.5255), 'median_duration_us': np.float64(42.358999999999995), 'std_dev_duration_us': np.float64(0.5800901510397625), 'min_duration_us': np.float64(41.879), 'max_duration_us': np.float64(43.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 12, 'total_duration_us': np.float64(41.908), 'mean_duration_us': np.float64(3.4923333333333333), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.1349897115421105), 'min_duration_us': np.float64(3.319), 'max_duration_us': np.float64(3.719)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 12, 'total_duration_us': np.float64(89.46799999999999), 'mean_duration_us': np.float64(7.455666666666666), 'median_duration_us': np.float64(7.879), 'std_dev_duration_us': np.float64(1.3939352766737614), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(9.239)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 12, 'total_duration_us': np.float64(484.784), 'mean_duration_us': np.float64(40.398666666666664), 'median_duration_us': np.float64(40.438), 'std_dev_duration_us': np.float64(0.5938183410961831), 'min_duration_us': np.float64(39.278), 'max_duration_us': np.float64(41.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 3, 'total_duration_us': np.float64(13.596), 'mean_duration_us': np.float64(4.532), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.31426846272998266), 'min_duration_us': np.float64(4.118), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 3, 'total_duration_us': np.float64(50.236000000000004), 'mean_duration_us': np.float64(16.745333333333335), 'median_duration_us': np.float64(16.718), 'std_dev_duration_us': np.float64(0.35977801798084186), 'min_duration_us': np.float64(16.319), 'max_duration_us': np.float64(17.199)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 3, 'total_duration_us': np.float64(420.196), 'mean_duration_us': np.float64(140.06533333333334), 'median_duration_us': np.float64(140.119), 'std_dev_duration_us': np.float64(0.5243410679658405), 'min_duration_us': np.float64(139.398), 'max_duration_us': np.float64(140.679)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.53)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(67.345), 'mean_duration_us': np.float64(4.4896666666666665), 'median_duration_us': np.float64(4.319), 'std_dev_duration_us': np.float64(0.4713592637845952), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(5.599)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(132.905), 'mean_duration_us': np.float64(8.860333333333333), 'median_duration_us': np.float64(8.319), 'std_dev_duration_us': np.float64(2.959742931780093), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(13.119)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(244.38300000000004), 'mean_duration_us': np.float64(16.2922), 'median_duration_us': np.float64(16.559), 'std_dev_duration_us': np.float64(0.5976949277571851), 'min_duration_us': np.float64(15.519), 'max_duration_us': np.float64(17.039)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: NativeBatchNormBackward0', 'NativeBatchNormBackward0', 'aten::native_batch_norm_backward'], 'count': 15, 'total_duration_us': np.float64(441.06500000000005), 'mean_duration_us': np.float64(29.404333333333337), 'median_duration_us': np.float64(28.199), 'std_dev_duration_us': np.float64(3.0918341194543766), 'min_duration_us': np.float64(25.879), 'max_duration_us': np.float64(35.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(52.824), 'mean_duration_us': np.float64(3.5216), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.10481081369146336), 'min_duration_us': np.float64(3.359), 'max_duration_us': np.float64(3.679)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(59.665000000000006), 'mean_duration_us': np.float64(3.977666666666667), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.49657314555751886), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(4.879)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(186.50400000000002), 'mean_duration_us': np.float64(12.433600000000002), 'median_duration_us': np.float64(12.359), 'std_dev_duration_us': np.float64(0.2567130174598344), 'min_duration_us': np.float64(12.119), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.52)}, {'name': 'void at::native::batch_norm_transform_input_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(71.185), 'mean_duration_us': np.float64(4.745666666666667), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.546438976973235), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(5.919)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(100.18299999999999), 'mean_duration_us': np.float64(6.678866666666666), 'median_duration_us': np.float64(6.038), 'std_dev_duration_us': np.float64(1.4788284041391984), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(9.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(116.905), 'mean_duration_us': np.float64(7.793666666666667), 'median_duration_us': np.float64(7.799), 'std_dev_duration_us': np.float64(0.3799976608115135), 'min_duration_us': np.float64(6.799), 'max_duration_us': np.float64(8.399)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.75)}, {'name': 'void at::native::batch_norm_transform_input_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'aten::add_'], 'count': 60, 'total_duration_us': np.float64(274.618), 'mean_duration_us': np.float64(4.576966666666666), 'median_duration_us': np.float64(4.459), 'std_dev_duration_us': np.float64(0.515218949142552), 'min_duration_us': np.float64(3.919), 'max_duration_us': np.float64(6.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}]","{'shape_in1': (), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (), 'stride_input2': (), 'stride_output': None}",True,1.2956519904172907,63.96148477439185 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((100352, 784, 28, 1), (200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,1248,3,212.887,70.96233333333333,2.7528591197758936,2.31211008,11.765625,187.41035856573706,matrix_bf16,0.1349630457335169,0.0022382409041266167,25.293472794042373,0.4194695303988689,91.42822265625,1.5276087070124051,274.28466796875,71.759,67.899,73.229,0.1357099972929423,0.13244684508326912,0.13673229482433924,25.433459253625525,24.821910727956094,25.62504840054549,90.908203125,90.228515625,93.14794921875,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(5.117), 'mean_duration_us': np.float64(1.7056666666666667), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(1.719)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(5.6370000000000005), 'mean_duration_us': np.float64(1.8790000000000002), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.919)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(8.597000000000001), 'mean_duration_us': np.float64(2.8656666666666673), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.0714890988194368), 'min_duration_us': np.float64(1.359), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(10.757), 'mean_duration_us': np.float64(3.5856666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.08219218670625292), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.04988876515698593), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.759)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3409789827345178), 'min_duration_us': np.float64(4.639), 'max_duration_us': np.float64(5.399)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(23.037), 'mean_duration_us': np.float64(7.678999999999999), 'median_duration_us': np.float64(8.079), 'std_dev_duration_us': np.float64(0.7118052168020874), 'min_duration_us': np.float64(6.679), 'max_duration_us': np.float64(8.279)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(29.156), 'mean_duration_us': np.float64(9.718666666666666), 'median_duration_us': np.float64(9.359), 'std_dev_duration_us': np.float64(0.5378973466708636), 'min_duration_us': np.float64(9.318), 'max_duration_us': np.float64(10.479)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1x1_ta1x8x1x1_1x4x1x32_tb1x8x1x2_1x4x1x32_mh', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(40.277), 'mean_duration_us': np.float64(13.425666666666666), 'median_duration_us': np.float64(13.439), 'std_dev_duration_us': np.float64(0.018856180831641704), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(13.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(40.997), 'mean_duration_us': np.float64(13.665666666666667), 'median_duration_us': np.float64(13.639), 'std_dev_duration_us': np.float64(0.06798692684790397), 'min_duration_us': np.float64(13.599), 'max_duration_us': np.float64(13.759)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr1x2_ta1x4x1x4_1x8x1x32_tb1x4x1x2_1x8x1x32_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(84.235), 'mean_duration_us': np.float64(28.078333333333333), 'median_duration_us': np.float64(28.078), 'std_dev_duration_us': np.float64(0.5229661132000395), 'min_duration_us': np.float64(27.438), 'max_duration_us': np.float64(28.719)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(1.71)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(1.88)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.87)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(7.68)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(9.72)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x64x32_wt16x64x4_ws1x1_wr1...', 'stream': 0, 'mean_duration_us': np.float64(13.43)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(13.67)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt128x64x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(28.08)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (576, 9, 3, 1), 'bias': [], 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,1.2940762506904229,65.25556102508227 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((50176, 196, 14, 1), (100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,848,3,244.599,81.533,4.039056449221771,2.31211008,6.8671875,321.09215017064844,matrix_bf16,0.08223832731986833,0.0017988898280057205,26.40608134557411,0.5776094027944655,87.58805338541667,1.9403670437970018,262.76416015625,79.44,78.97,86.189,0.08323835491736657,0.08016161975995825,0.08331500728228015,26.727182357084803,25.73926684988694,26.751794829750576,86.5078125,86.42822265625,89.828125,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(6.476999999999999), 'mean_duration_us': np.float64(2.159), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.159)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(6.5569999999999995), 'mean_duration_us': np.float64(2.1856666666666666), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(6.997), 'mean_duration_us': np.float64(2.332333333333333), 'median_duration_us': np.float64(2.359), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'Memset (Device)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(10.957), 'mean_duration_us': np.float64(3.6523333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1359738536958075), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.839)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.477), 'mean_duration_us': np.float64(3.8256666666666668), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.12364824660660949), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(3.999)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.637), 'mean_duration_us': np.float64(3.879), 'median_duration_us': np.float64(3.879), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.799), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(14.997), 'mean_duration_us': np.float64(4.999), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(1.4580352076224588), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(7.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(21.997), 'mean_duration_us': np.float64(7.332333333333334), 'median_duration_us': np.float64(7.279), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.239), 'max_duration_us': np.float64(7.479)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(36.357), 'mean_duration_us': np.float64(12.119), 'median_duration_us': np.float64(12.079), 'std_dev_duration_us': np.float64(0.44181444068749043), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.679)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr1x1_ta1x4x1x1_1x8x1x32_tb1x4x1x4_1x8x1x32_mh_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(59.357), 'mean_duration_us': np.float64(19.785666666666668), 'median_duration_us': np.float64(19.679), 'std_dev_duration_us': np.float64(0.24073960113690362), 'min_duration_us': np.float64(19.559), 'max_duration_us': np.float64(20.119)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_weightINS_47GridwiseGemm_bk0mk1_bk0nk1_mn_xdlops_bwd_weightILi64EttftLNS_25InMemoryDataOperationEnumE1ENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINS6_IJiiEEENS6_IJiNS_17integral_constantIiLi1EEEEEELb0EEENS_8RightPadIiiLb0EEENS_11PassThroughIiEENS_7UnMergeINS6_IJiiiEEELb0EEESG_SG_SG_SE_SG_EEENS6_IJNS_8SequenceIJLi0EEEENSL_IJLi1EEEENSL_IJLi2EEEENSL_IJLi3EEEENSL_IJLi4EEEENSL_IJLi5EEEENSL_IJLi6EEEENSL_IJLi8EEEENSL_IJLi7EEEEEEENS6_IJNSL_IJLi1ELi2EEEESP_SQ_NSL_IJLi5ELi6ELi7EEEEST_NSL_IJLi9EEEENSL_IJLi10EEEENSL_IJLi11EEEENSL_IJLi12EEEEEEENSL_IJLi9ELi10ELi11ELi12EEEElEENS5_INS6_IJNS7_INS6_IJiiiiEEES15_Lb0EEESG_NS_3PadIiiiLb0EEES18_SG_SG_NS7_IS8_S8_Lb0EEES19_SG_NS_23Merge_v2_magic_divisionISI_EES1B_SE_SG_SJ_SG_SG_SG_SE_SG_EEENS6_IJSM_SN_SO_SP_SQ_SR_SS_SU_ST_NSL_IJLi10ELi12ELi14EEEENSL_IJLi9ELi11ELi13EEEENSL_IJLi16EEEENSL_IJLi15EEEENSL_IJLi17EEEENSL_IJLi18EEEENSL_IJLi19EEEENSL_IJLi20EEEENSL_IJLi22EEEENSL_IJLi21EEEEEEENS6_IJNSL_IJLi1ELi2ELi3ELi4EEEESR_SS_SU_ST_SY_NSL_IJLi10ELi11EEEENSL_IJLi12ELi13EEEENSL_IJLi14EEEES1G_S1F_S1H_S1I_NSL_IJLi19ELi20ELi21EEEES1L_NSL_IJLi23EEEENSL_IJLi24EEEENSL_IJLi25EEEENSL_IJLi26EEEEEEENSL_IJLi23ELi24ELi25ELi26EEEElEENS5_INS6_IJSC_SE_SE_EEENS6_IJSM_SN_SO_EEENS6_IJSW_SP_SQ_EEENSL_IJLi3ELi4EEEElEENS0_12element_wise11PassThroughES26_S26_Li64ELi32ELi4ELi32ELi32ELi8ELi2ELi1ENSL_IJLi1ELi4ELi8ELi2EEEENSL_IJLi0ELi3ELi1ELi2EEEENSL_IJLi0ELi2ELi1ELi3EEEELi2ELi8ELi4ELb0ELb1ELi8ELi8ELi4ENSL_IJLi1ELi4ELi4ELi4EEEES28_S29_Li2ELi8ELi2ELb0ELb1ELi8ELi4ELi4ELi1ELi1ELi8ENSL_IJLi1ELi16ELi1ELi4EEEELb1ELb1ELi1ELNS_15PipelineVersionE0EttEEtttS26_S26_S26_S14_S1Z_NS5_INS6_IJSC_SE_SE_NSH_INS6_IJiNS9_IiLi64EEEEEELb0EEENSH_INS6_IJiNS9_IiLi32EEEEEELb0EEEEEENS6_IJSM_SN_SO_SP_SQ_EEENS6_IJSW_SP_SQ_NSL_IJLi5ELi6EEEENSL_IJLi7ELi8EEEEEEENSL_IJLi5ELi6ELi7ELi8EEEElEENS_38BlockToCTileMap_KSplit_M00_N00_M01_N01ILi64ELi32ES24_Lb0EEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1EEEvPKT0_PKT1_PT2_T3_T4_T5_iT6_T7_T8_T9_T10_', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(64.437), 'mean_duration_us': np.float64(21.479), 'median_duration_us': np.float64(21.439), 'std_dev_duration_us': np.float64(0.18184242262647862), 'min_duration_us': np.float64(21.279), 'max_duration_us': np.float64(21.719)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.16)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.19)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.33)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.83)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.88)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.0)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(7.33)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(12.12)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt32x128x32_wt16x64x4_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(19.79)}, {'name': '_ZN2ck16tensor_operation6device37kernel_batched_gemm_xdlops_bwd_...', 'stream': 0, 'mean_duration_us': np.float64(21.48)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': [], 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,1.2397224449656774,66.49528347004795 +aten::batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (512,), (512,), (512,), (512,), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((25088, 49, 7, 1), (1,), (1,), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",True,76,15,827.038,55.135866666666665,14.266122122340175,0.001257472,0.962890625,1.2454361054766734,vector_bf16,0.06025762574731561,0.003969722940015474,0.07504702273600766,0.0049440362782342895,16.820930989583335,1.0621585372054239,252.31396484375,48.78,43.67,98.52,0.059121997769835594,0.05476143728813559,0.06916848543234654,0.07363267065046461,0.06820187118644067,0.0861449291185817,17.07763671875,14.59716796875,18.4375,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(78.545), 'mean_duration_us': np.float64(5.2363333333333335), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.685618617665017), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.279)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(86.344), 'mean_duration_us': np.float64(5.756266666666666), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.5323087408220493), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.439)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(87.423), 'mean_duration_us': np.float64(5.8282), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.6891894949866836), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.119)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(5.24)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(72.70400000000001), 'mean_duration_us': np.float64(4.846933333333334), 'median_duration_us': np.float64(4.799), 'std_dev_duration_us': np.float64(0.5992004079512038), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(6.159)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(86.624), 'mean_duration_us': np.float64(5.774933333333333), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.4027929934290759), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.519)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(90.385), 'mean_duration_us': np.float64(6.025666666666667), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.6557506301094104), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: MaxPool2DWithIndicesBackward0', 'MaxPool2DWithIndicesBackward0', 'aten::max_pool2d_with_indices_backward', 'aten::zero_', 'aten::fill_'], 'count': 3, 'total_duration_us': np.float64(89.917), 'mean_duration_us': np.float64(29.972333333333335), 'median_duration_us': np.float64(30.359), 'std_dev_duration_us': np.float64(1.510967313419527), 'min_duration_us': np.float64(27.959), 'max_duration_us': np.float64(31.599)}, {'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw(c10::BFloat16 const*, long const*, int, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: MaxPool2DWithIndicesBackward0', 'MaxPool2DWithIndicesBackward0', 'aten::max_pool2d_with_indices_backward'], 'count': 3, 'total_duration_us': np.float64(156.236), 'mean_duration_us': np.float64(52.07866666666666), 'median_duration_us': np.float64(52.319), 'std_dev_duration_us': np.float64(0.3678045978807537), 'min_duration_us': np.float64(51.559), 'max_duration_us': np.float64(52.358)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(29.97)}, {'name': 'void at::native::(anonymous namespace)::max_pool_backward_nchw Device)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::copy_'], 'count': 60, 'total_duration_us': np.float64(238.17999999999998), 'mean_duration_us': np.float64(3.9696666666666665), 'median_duration_us': np.float64(4.539), 'std_dev_duration_us': np.float64(1.3463009404372495), 'min_duration_us': np.float64(1.439), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.97)}]","{'op_shape': (), 'dtype_in_out': ('long int', None), 'stride_input': (), 'stride_output': None}",True,1.12375813740561,71.1489612189259 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((50176, 196, 14, 1), (100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,760,3,220.12900000000002,73.37633333333333,3.947623377848164,0.25690112,5.8671875,41.75765645805592,matrix_bf16,0.08194129870898983,0.0005017494598043458,3.4216766012169386,0.020951881570525563,75.08235677083333,0.45986563848762135,225.2470703125,71.74,70.51,77.879,0.08195399545989684,0.08143332137224994,0.08243657929482272,3.422206787779447,3.400464658100876,3.4423583577704933,75.06884765625,74.62939453125,75.548828125,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(6.5169999999999995), 'mean_duration_us': np.float64(2.172333333333333), 'median_duration_us': np.float64(2.159), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(2.199)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.1319932658214888), 'min_duration_us': np.float64(3.479), 'max_duration_us': np.float64(3.799)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.517), 'mean_duration_us': np.float64(3.839), 'median_duration_us': np.float64(3.799), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(3.759), 'max_duration_us': np.float64(3.959)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.717), 'mean_duration_us': np.float64(3.905666666666667), 'median_duration_us': np.float64(3.839), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.839), 'max_duration_us': np.float64(4.039)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.997), 'mean_duration_us': np.float64(3.999), 'median_duration_us': np.float64(3.919), 'std_dev_duration_us': np.float64(0.1423610433604174), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(21.597), 'mean_duration_us': np.float64(7.199000000000001), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.08640987597877155), 'min_duration_us': np.float64(7.079), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x1x2_1x4x1x64_mh_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(21.636), 'mean_duration_us': np.float64(7.212), 'median_duration_us': np.float64(7.239), 'std_dev_duration_us': np.float64(0.06844462481938694), 'min_duration_us': np.float64(7.118), 'max_duration_us': np.float64(7.279)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(59.677), 'mean_duration_us': np.float64(19.892333333333333), 'median_duration_us': np.float64(19.799), 'std_dev_duration_us': np.float64(0.9005677221743096), 'min_duration_us': np.float64(18.839), 'max_duration_us': np.float64(21.039)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(65.196), 'mean_duration_us': np.float64(21.732), 'median_duration_us': np.float64(21.799), 'std_dev_duration_us': np.float64(0.2171128738697909), 'min_duration_us': np.float64(21.439), 'max_duration_us': np.float64(21.958)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.51)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(2.17)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.84)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.2)}, {'name': 'igemm_bwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(7.21)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(19.89)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(21.73)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (128, 1, 1, 1), 'bias': [], 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,1.0627166526938792,72.21167787161978 +aten::batch_norm,NORM_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (256,), (256,), (256,), (256,), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((50176, 196, 14, 1), (1,), (1,), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",True,479,15,1203.203,80.21353333333333,45.292811649574254,0.002510336,1.9169921875,1.2488537952114112,vector_bf16,0.1497916781274734,0.0017232861501095906,0.18706790572058132,0.0021521324487996265,13.421061197916666,0.15624974568664163,201.31591796875,58.989,44.7,180.009,0.15004225593177095,0.14527169793210531,0.15185766262126968,0.18738084076247405,0.18142311129931543,0.18964801829650668,13.39697265625,13.23681640625,13.8369140625,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(float, float, c10::BFloat16, c10::BFloat16)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(52.385000000000005), 'mean_duration_us': np.float64(3.4923333333333337), 'median_duration_us': np.float64(3.519), 'std_dev_duration_us': np.float64(0.09870269612438269), 'min_duration_us': np.float64(3.279), 'max_duration_us': np.float64(3.639)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor::type, 1ul, at::RestrictPtrTraits, int>, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(54.545), 'mean_duration_us': np.float64(3.6363333333333334), 'median_duration_us': np.float64(3.599), 'std_dev_duration_us': np.float64(0.0660773956979405), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(at::GenericPackedTensorAccessor, float, float, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'torch/nn/functional.py(2791): batch_norm', 'aten::batch_norm', 'aten::_batch_norm_impl_index', 'aten::native_batch_norm'], 'count': 15, 'total_duration_us': np.float64(94.38500000000002), 'mean_duration_us': np.float64(6.2923333333333344), 'median_duration_us': np.float64(6.239), 'std_dev_duration_us': np.float64(0.10599790354320963), 'min_duration_us': np.float64(6.159), 'max_duration_us': np.float64(6.479)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.49)}, {'name': 'void at::native::batch_norm_transform_input_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: NativeBatchNormBackward0', 'NativeBatchNormBackward0', 'aten::native_batch_norm_backward'], 'count': 15, 'total_duration_us': np.float64(174.86399999999998), 'mean_duration_us': np.float64(11.657599999999999), 'median_duration_us': np.float64(11.159), 'std_dev_duration_us': np.float64(1.1193715975194891), 'min_duration_us': np.float64(10.679), 'max_duration_us': np.float64(14.119)}]","[{'name': 'void at::native::batch_norm_backward_kernel, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: BatchNorm2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/batchnorm.py(159): forward', 'aten::add_'], 'count': 57, 'total_duration_us': np.float64(171.62300000000002), 'mean_duration_us': np.float64(3.010929824561404), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(1.5473071555679883), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.01)}]","{'shape_in1': (), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (), 'stride_input2': (), 'stride_output': None}",True,0.8097344040008676,77.34648378748118 +aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",True,869,3,219.039,73.01299999999999,3.4858753563488203,1.15605504,5.8828125,187.41035856573706,matrix_bf16,0.11636516154285974,0.0037364627143583943,21.808036649307258,0.7002518170654148,53.047200520833336,1.7144715434542532,159.1416015625,71.77,70.319,76.95,0.1168414088399323,0.11241340826822802,0.11984066752041891,21.897290326017593,21.067437151145203,22.45938247075899,52.79443359375,51.47314453125,54.8740234375,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.15434449203720302), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.919)}, {'name': 'Memset (Device)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(11.277), 'mean_duration_us': np.float64(3.759), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(0.09797958971132721), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(22.477), 'mean_duration_us': np.float64(7.492333333333334), 'median_duration_us': np.float64(7.439), 'std_dev_duration_us': np.float64(0.1049867716534909), 'min_duration_us': np.float64(7.399), 'max_duration_us': np.float64(7.639)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(29.357), 'mean_duration_us': np.float64(9.785666666666666), 'median_duration_us': np.float64(9.679), 'std_dev_duration_us': np.float64(0.20997354330698184), 'min_duration_us': np.float64(9.599), 'max_duration_us': np.float64(10.079)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(39.837), 'mean_duration_us': np.float64(13.279000000000002), 'median_duration_us': np.float64(13.359), 'std_dev_duration_us': np.float64(0.2993325909419156), 'min_duration_us': np.float64(12.879), 'max_duration_us': np.float64(13.599)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(45.076), 'mean_duration_us': np.float64(15.025333333333334), 'median_duration_us': np.float64(15.719), 'std_dev_duration_us': np.float64(1.7995185158505285), 'min_duration_us': np.float64(12.558), 'max_duration_us': np.float64(16.799)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.71)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(3.76)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.49)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(9.79)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.28)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.03)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (576, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.7508307650004433,78.09731455248162 +aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",True,469,3,232.279,77.42633333333333,1.6352340301416541,1.15605504,3.43359375,321.09215017064844,matrix_bf16,0.0745927716124512,0.015942201878728298,23.95115342423007,5.118915879695417,49.980143229166664,12.039248815535107,149.9404296875,77.76,75.65,78.869,0.0810293127616787,0.056438571061172005,0.08631043101450292,26.01787626149738,18.12198213459066,27.71360187660217,44.43310546875,41.71435546875,63.79296875,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(8.997), 'mean_duration_us': np.float64(2.999), 'median_duration_us': np.float64(3.039), 'std_dev_duration_us': np.float64(0.768027777275449), 'min_duration_us': np.float64(2.039), 'max_duration_us': np.float64(3.919)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.879)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(14.917), 'mean_duration_us': np.float64(4.972333333333333), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.21746008573733433), 'min_duration_us': np.float64(4.679), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(21.917), 'mean_duration_us': np.float64(7.305666666666667), 'median_duration_us': np.float64(3.759), 'std_dev_duration_us': np.float64(5.044054806293136), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(14.439)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(44.917), 'mean_duration_us': np.float64(14.972333333333333), 'median_duration_us': np.float64(12.399), 'std_dev_duration_us': np.float64(3.724417926185096), 'min_duration_us': np.float64(12.279), 'max_duration_us': np.float64(20.239)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(47.955), 'mean_duration_us': np.float64(15.985), 'median_duration_us': np.float64(17.158), 'std_dev_duration_us': np.float64(2.1576386784322046), 'min_duration_us': np.float64(12.959), 'max_duration_us': np.float64(17.838)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.0)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(7.31)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.97)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(15.98)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.7074195962678373,78.80473414874946 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((128,), (128,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5735,30,122.208,4.0736,0.36744566569954146,1.28e-07,0.00048828125,0.25,vector_bf16,0.00010629745268836305,1.1739641893917567e-05,2.6574363172090762e-05,2.9349104734793917e-06,4.879085286458333,0.5906942348665651,146.37255859375,4.1145,3.38,4.78,0.00010942043201502661,7.902449317959153e-05,0.00012676208897485493,2.7355108003756652e-05,1.9756123294897883e-05,3.169052224371373e-05,4.67919921875,4.0390625,6.47900390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(146.37), 'mean_duration_us': np.float64(4.8790000000000004), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.5807581252122092), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(6.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.88)}]","{'op_shape': (128,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6905863650043503,79.49532051375381 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5745,30,117.27,3.909,0.4530992888068147,2.56e-07,0.0009765625,0.25,vector_bf16,0.0002189128231331666,1.908323453978501e-05,5.472820578329165e-05,4.770808634946253e-06,4.712369791666666,0.412890788540921,141.37109375,3.83,3.22,4.9,0.00021884086403005322,0.0001910844646924829,0.0002485955429113324,5.4710216007513305e-05,4.7771116173120725e-05,6.21488857278331e-05,4.67919921875,4.119140625,5.35888671875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(141.37), 'mean_duration_us': np.float64(4.7123333333333335), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4059666105591554), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.359)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.71)}]","{'op_shape': (256,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6669894322231955,80.162309945977 +aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (576, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",False,6006,3,213.297,71.099,13.028994588992655,1.15605504,5.8828125,187.41035856573706,matrix_bf16,0.13182544425605489,0.0027346069259115715,24.705453776114833,0.5124936645214361,46.806803385416664,0.9608392846176006,140.42041015625,65.239,62.029,86.029,0.13070855903654346,0.12982605563719696,0.13494171809442426,24.496137916649424,24.330747638142412,25.289475773552663,47.193359375,45.712890625,47.51416015625,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.396999999999998), 'mean_duration_us': np.float64(4.4656666666666665), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.16759740119968727), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.639)}, {'name': 'Memset (Device)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(15.556), 'mean_duration_us': np.float64(5.185333333333333), 'median_duration_us': np.float64(5.278), 'std_dev_duration_us': np.float64(0.16091474623400923), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(5.319)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.997), 'mean_duration_us': np.float64(5.999), 'median_duration_us': np.float64(6.439), 'std_dev_duration_us': np.float64(0.738286303995047), 'min_duration_us': np.float64(4.959), 'max_duration_us': np.float64(6.599)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(20.717), 'mean_duration_us': np.float64(6.905666666666666), 'median_duration_us': np.float64(7.359), 'std_dev_duration_us': np.float64(0.6411101482758033), 'min_duration_us': np.float64(5.999), 'max_duration_us': np.float64(7.359)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(31.476999999999997), 'mean_duration_us': np.float64(10.492333333333333), 'median_duration_us': np.float64(10.359), 'std_dev_duration_us': np.float64(0.5309948733797298), 'min_duration_us': np.float64(9.919), 'max_duration_us': np.float64(11.199)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_conv_fwd_xdl_cshuffle_v3INS_28GridwiseGemm_xdl_cshuffle_v3INS_13tensor_layout4gemm8RowMajorENS6_11ColumnMajorES7_ttfttNS0_12element_wise11PassThroughESA_SA_LNS1_18GemmSpecializationE7ELi128ELi16ELi32ELi64ELi8ELi8ELi16ELi16ELi1ELi1ENS_8SequenceIJLi8ELi16ELi1EEEENSC_IJLi1ELi0ELi2EEEESE_Li2ELi8ELi8ELb0ELi0ESD_SE_SE_Li2ELi8ELi8ELb0ELi0ELi1ELi1ENSC_IJLi1ELi16ELi1ELi8EEEELi4ELNS_26BlockGemmPipelineSchedulerE1ELNS_24BlockGemmPipelineVersionE0EttLb0ELb0EEENS_16TensorDescriptorINS_5TupleIJNS_5EmbedINSK_IJiiiiEEESM_Lb0EEENS_11PassThroughIiEENS_3PadIiiiLb0EEESR_SP_SP_NSL_INSK_IJiiEEESS_Lb0EEEST_SP_NS_23Merge_v2_magic_divisionINSK_IJiiiEEEEESW_NS_8RightPadIiiLb0EEESY_NS_7UnMergeISS_Lb0EEESP_EEENSK_IJNSC_IJLi0EEEENSC_IJLi1EEEENSC_IJLi2EEEENSC_IJLi3EEEENSC_IJLi4EEEENSC_IJLi5EEEENSC_IJLi6EEEENSC_IJLi7EEEENSC_IJLi8EEEENSC_IJLi9ELi11ELi13EEEENSC_IJLi10ELi12ELi14EEEENSC_IJLi15EEEENSC_IJLi16EEEENSC_IJLi18EEEENSC_IJLi17EEEEEEENSK_IJNSC_IJLi1ELi2ELi3ELi4EEEES17_S18_S19_S1A_NSC_IJLi9EEEENSC_IJLi10ELi11EEEENSC_IJLi12ELi13EEEENSC_IJLi14EEEES1D_S1E_S1G_S1F_NSC_IJLi19ELi20EEEENSC_IJLi21EEEEEEENSC_IJLi19ELi21ELi20EEEElEENSJ_INSK_IJS10_SY_SY_S10_SP_EEENSK_IJS12_S13_S14_S16_S15_EEENSK_IJNSC_IJLi1ELi2EEEES15_S16_NSC_IJLi5ELi6EEEES19_EEENSC_IJLi5ELi7ELi6EEEElEENSJ_INSK_IJST_SY_SY_NSZ_INSK_IJiNS_17integral_constantIiLi16EEEEEELb0EEENSZ_INSK_IJiNS1Z_IiLi32EEEEEELb0EEEEEENSK_IJS12_S13_S14_S15_S16_EEENSK_IJS1U_S15_S16_S1V_NSC_IJLi7ELi8EEEEEEENSC_IJLi5ELi6ELi7ELi8EEEElEENS1_30ComputePtrOffsetOfStridedBatchILi1ELi1ELi0EvEELb1ELNS_25InMemoryDataOperationEnumE0ELi2ELNS_10TailNumberE10EEEvNT_8ArgumentET0_T1_T2_T3_S2L_i', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(41.277), 'mean_duration_us': np.float64(13.759), 'median_duration_us': np.float64(13.479), 'std_dev_duration_us': np.float64(0.4537253207246281), 'min_duration_us': np.float64(13.399), 'max_duration_us': np.float64(14.399)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.47)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(5.19)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.0)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(6.91)}, {'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(10.49)}, {'name': '_ZN2ck16tensor_operation6device12_GLOBAL__N_139kernel_grouped_co...', 'stream': 0, 'mean_duration_us': np.float64(13.76)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (576, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.6625041029129437,80.82481404888995 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5755,30,108.37,3.6123333333333334,0.3327905350665568,5.12e-07,0.001953125,0.25,vector_bf16,0.0004498108283717333,4.445849585013526e-05,0.00011245270709293332,1.1114623962533814e-05,4.597688802083334,0.4726140319865054,137.9306640625,3.665,2.96,4.42,0.00044150568910255607,0.00033912548512289776,0.0005506503872915846,0.00011037642227563902,8.478137128072444e-05,0.00013766259682289616,4.638671875,3.71923828125,6.0390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(137.92800000000003), 'mean_duration_us': np.float64(4.597600000000001), 'median_duration_us': np.float64(4.6385000000000005), 'std_dev_duration_us': np.float64(0.46466702056418846), 'min_duration_us': np.float64(3.719), 'max_duration_us': np.float64(6.039)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]","{'op_shape': (512,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6507574700660134,81.47557151895596 +aten::copy_,elementwise,python3,CPU,thread 542 (python3),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'True')",False,5725,30,150.389,5.012966666666667,2.305494314313816,6.4e-08,0.000244140625,0.25,vector_bf16,6.115328106105659e-05,2.7096609139717043e-05,1.5288320265264148e-05,6.774152284929261e-06,4.593570963541667,1.0373284068708915,137.80712890625,4.17,3.26,11.97,5.4954425818261364e-05,4.0513716096128585e-05,0.00016419918571875978,1.3738606454565341e-05,1.0128429024032146e-05,4.1049796429689945e-05,4.6591796875,1.55908203125,6.31884765625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(137.808), 'mean_duration_us': np.float64(4.5935999999999995), 'median_duration_us': np.float64(4.659000000000001), 'std_dev_duration_us': np.float64(1.0199425996920939), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(6.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.59)}]","{'op_shape': (64,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6501746306641162,82.12574614962007 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (128,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1771,30,108.77,3.6256666666666666,1.2631833987393024,1.28e-07,0.00048828125,0.25,vector_bf16,0.00011460971326258692,1.081865846681428e-05,2.865242831564673e-05,2.70466461670357e-06,4.510904947916667,0.4786475103410302,135.3271484375,3.3899999999999997,2.82,9.97,0.0001196594773479402,9.015355515432894e-05,0.00012676208897485493,2.991486933698505e-05,2.2538388788582234e-05,3.169052224371373e-05,4.27880859375,4.0390625,5.67919921875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(135.32800000000003), 'mean_duration_us': np.float64(4.510933333333335), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4705758835960702), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.679)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.51)}]","{'op_shape': (128,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6384740720782054,82.76422022169828 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (64,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1801,30,100.31,3.3436666666666666,0.4722468913998077,6.4e-08,0.000244140625,0.25,vector_bf16,5.749474553569203e-05,5.812158598455802e-06,1.4373686383923007e-05,1.4530396496139505e-06,4.502962239583334,0.5168070532058079,135.0888671875,3.36,2.77,4.34,5.98297386739701e-05,4.4453790062743766e-05,6.338104448742746e-05,1.4957434668492525e-05,1.1113447515685942e-05,1.5845261121856866e-05,4.27880859375,4.0390625,5.7587890625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(135.09000000000003), 'mean_duration_us': np.float64(4.503000000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.5081312166491382), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.5)}]","{'op_shape': (64,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6373498601093287,83.4015700818076 +aten::convolution_backward,CONV_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), (), ())","('', '', '', '[0]', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1', '[True, True, False]')",False,360,3,291.309,97.10300000000001,4.874355034258377,0.25690112,3.37109375,72.67670915411355,matrix_bf16,0.07859386145231952,0.0017153538306378634,5.711943210068921,0.12466627144566311,44.990397135416664,0.9803749232086446,134.97119140625,94.399,94.18,102.73,0.07849766551006246,0.07692862976462463,0.08035528908227145,5.7049520055517,5.5909196510281065,5.839957973626959,45.03125,43.990234375,45.94970703125,"[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(5.5969999999999995), 'mean_duration_us': np.float64(1.8656666666666666), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(1.839), 'max_duration_us': np.float64(1.879)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(6.957), 'mean_duration_us': np.float64(2.319), 'median_duration_us': np.float64(2.319), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(2.279), 'max_duration_us': np.float64(2.359)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(10.757000000000001), 'mean_duration_us': np.float64(3.585666666666667), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.06798692684790367), 'min_duration_us': np.float64(3.519), 'max_duration_us': np.float64(3.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(10.876999999999999), 'mean_duration_us': np.float64(3.625666666666666), 'median_duration_us': np.float64(3.559), 'std_dev_duration_us': np.float64(0.09428090415820621), 'min_duration_us': np.float64(3.559), 'max_duration_us': np.float64(3.759)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(11.237), 'mean_duration_us': np.float64(3.7456666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.13199326582148882), 'min_duration_us': np.float64(3.599), 'max_duration_us': np.float64(3.919)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(13.556000000000001), 'mean_duration_us': np.float64(4.518666666666667), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.08594701209983321), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(4.638)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(14.556999999999999), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.06798692684790346), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT3128_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR1_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVW2_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA256_LBSPPB256_LPA32_LPB16_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS16_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR3_PKA0_SIA3_SLW1_SS1_SU0_SUM0_SUS0_SCIUI1_SPO0_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_16_TLDS0_UMLDSA0_UMLDSB0_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB1_VFLRP1_WSGRA1_WSGRB0_WS64_WG16_8_2_WGM16', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(16.916), 'mean_duration_us': np.float64(5.6386666666666665), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.06572839738060139), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(5.719)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_wr2x2_ta1x4x1x4_1x4x1x64_tb1x4x1x2_1x4x1x64_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'ConvolutionBackward0', 'aten::convolution_backward'], 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(15.079), 'std_dev_duration_us': np.float64(0.4877157642179166), 'min_duration_us': np.float64(14.159), 'max_duration_us': np.float64(15.279)}]","[{'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(1.87)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(2.32)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(3.59)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(3.63)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(3.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.52)}, {'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'Cijk_Ailk_Bjlk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.64)}, {'name': 'igemm_wrw_gtcx3_nhwc_bf16_bx0_ex1_bt256x128x16_wt32x32x8_ws2x1_w...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (256, 1, 1, 1), 'bias': [], 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.6367946652640433,84.03836474707165 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (256,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1741,30,111.66,3.722,1.4776551788513472,2.56e-07,0.0009765625,0.25,vector_bf16,0.0002332602622228708,1.961438154685428e-05,5.83150655557177e-05,4.90359538671357e-06,4.424300130208334,0.4238580059237626,132.72900390625,3.48,2.85,11.31,0.0002393189546958804,0.0001868952856251671,0.00025352417794970985,5.98297386739701e-05,4.672382140629177e-05,6.338104448742746e-05,4.27880859375,4.0390625,5.47900390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(132.729), 'mean_duration_us': np.float64(4.424300000000001), 'median_duration_us': np.float64(4.279), 'std_dev_duration_us': np.float64(0.4167844486862084), 'min_duration_us': np.float64(4.039), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.42)}]","{'op_shape': (256,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.6262160149339581,84.66458076200561 +aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",False,6264,3,367.707,122.569,86.42108134014525,1.15605504,3.685546875,299.14149443561206,matrix_bf16,0.09291021412141652,0.001986041389297363,27.793300300613243,0.594107389205396,41.607259114583336,0.8786485534396721,124.82177734375,72.939,72.409,222.359,0.09185246843919367,0.0916769175740166,0.09520125635103927,27.476884676500287,27.42437012834175,28.478646096997693,42.07373046875,40.59375,42.154296875,"[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.277), 'mean_duration_us': np.float64(4.425666666666666), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.18571184369578841), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.679)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.437000000000001), 'mean_duration_us': np.float64(4.479), 'median_duration_us': np.float64(4.519), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.639)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(14.517), 'mean_duration_us': np.float64(4.8389999999999995), 'median_duration_us': np.float64(4.959), 'std_dev_duration_us': np.float64(0.2902872140943631), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.119)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.1496662954709578), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(5.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.757), 'mean_duration_us': np.float64(5.5856666666666674), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.1643843734125062), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(5.799)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(51.477), 'mean_duration_us': np.float64(17.159), 'median_duration_us': np.float64(17.159), 'std_dev_duration_us': np.float64(0.4898979485566353), 'min_duration_us': np.float64(16.559), 'max_duration_us': np.float64(17.759)}]","[{'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.43)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.48)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(4.84)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.59)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(17.16)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5889096857864407,85.25349044779206 +aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (2304, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",True,66,3,449.947,149.98233333333334,77.67991782522259,1.15605504,3.685546875,299.14149443561206,matrix_bf16,0.09326654481051204,0.003432223314842696,27.899893595462554,1.0267204116387927,41.473795572916664,1.5480063825290074,124.42138671875,111.059,99.459,239.429,0.09418167985149223,0.08946950835386946,0.09614844622617444,28.17364845923176,26.764042435395993,28.761989891759907,41.033203125,40.19384765625,43.1943359375,"[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.357), 'mean_duration_us': np.float64(4.452333333333333), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.22939534045447024), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.719)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.916999999999998), 'mean_duration_us': np.float64(4.638999999999999), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.4079215610874227), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.199)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(14.557), 'mean_duration_us': np.float64(4.852333333333333), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(15.357), 'mean_duration_us': np.float64(5.119), 'median_duration_us': np.float64(5.159), 'std_dev_duration_us': np.float64(0.27904599381941786), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.439)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.836), 'mean_duration_us': np.float64(5.611999999999999), 'median_duration_us': np.float64(5.478), 'std_dev_duration_us': np.float64(0.27792924759130083), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(5.999)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_wr2x2_ta1x8x2x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(50.397), 'mean_duration_us': np.float64(16.799), 'median_duration_us': np.float64(16.719), 'std_dev_duration_us': np.float64(0.851038581185758), 'min_duration_us': np.float64(15.799), 'max_duration_us': np.float64(17.879)}]","[{'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.45)}, {'name': 'batched_transpose_32x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.85)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.12)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.61)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt128x128x32_wt32x32x8_ws1x1_w...', 'stream': 0, 'mean_duration_us': np.float64(16.8)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (2304, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5870206410846397,85.8405110888767 +aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 3, 3), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (1152, 9, 3, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[1, 1]', '[1, 1]', 'False', '[0, 0]', '1')",False,6135,3,232.999,77.66633333333333,8.509544073176492,1.15605504,3.43359375,321.09215017064844,matrix_bf16,0.08848329434037287,0.0017454310118086836,28.41129123393269,0.560444196556177,40.700520833333336,0.8011398380941223,122.1015625,73.459,72.08,87.46,0.08834451298763539,0.08681139692481575,0.09029397310866744,28.36672963097863,27.87445809790671,28.99268597291274,40.75390625,39.8740234375,41.4736328125,"[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.917), 'mean_duration_us': np.float64(4.639), 'median_duration_us': np.float64(4.679), 'std_dev_duration_us': np.float64(0.4418144406874905), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(5.159)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.957), 'mean_duration_us': np.float64(4.652333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.30346151137976096), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.079)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(14.837), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.879), 'std_dev_duration_us': np.float64(0.3785351884420904), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.439)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.997), 'mean_duration_us': np.float64(5.665666666666667), 'median_duration_us': np.float64(5.559), 'std_dev_duration_us': np.float64(0.46341725858620714), 'min_duration_us': np.float64(5.159), 'max_duration_us': np.float64(6.279)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.877000000000002), 'mean_duration_us': np.float64(5.9590000000000005), 'median_duration_us': np.float64(5.839), 'std_dev_duration_us': np.float64(0.19866219234335095), 'min_duration_us': np.float64(5.799), 'max_duration_us': np.float64(6.239)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr2x1_ta1x8x1x1_1x4x1x64_tb1x8x2x1_1x4x1x64_gkgs', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(44.517), 'mean_duration_us': np.float64(14.839), 'median_duration_us': np.float64(14.759), 'std_dev_duration_us': np.float64(0.4607240678178929), 'min_duration_us': np.float64(14.319), 'max_duration_us': np.float64(15.439)}]","[{'name': 'batched_transpose_32x16_half', 'stream': 0, 'mean_duration_us': np.float64(4.64)}, {'name': 'SubTensorOpWithCastTensor1d', 'stream': 0, 'mean_duration_us': np.float64(4.65)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(4.95)}, {'name': 'SubTensorOpWithScalar1d', 'stream': 0, 'mean_duration_us': np.float64(5.67)}, {'name': 'batched_transpose_16x32_half', 'stream': 0, 'mean_duration_us': np.float64(5.96)}, {'name': 'igemm_fwd_gtcx3_nhwc_bf16_bx0_ex1_bt64x128x32_wt32x32x8_ws1x1_wr...', 'stream': 0, 'mean_duration_us': np.float64(14.84)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 3, 3), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (1152, 9, 3, 1), 'bias': False, 'stride': (2, 2), 'padding': (1, 1), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.5760757003794492,86.41658678925614 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (512,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1654,30,104.799,3.4933,0.39374918938066533,5.12e-07,0.001953125,0.25,vector_bf16,0.0006993106735288572,0.0005527770176441737,0.0001748276683822143,0.00013819425441104343,3.868310546875,1.3189206115385315,116.04931640625,3.5345,2.77,4.14,0.0004877664910714769,0.0003657716926833522,0.0025637555012224937,0.00012194162276786922,9.144292317083806e-05,0.0006409388753056234,4.19873046875,0.798828125,5.59912109375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 30, 'total_duration_us': np.float64(116.04899999999999), 'mean_duration_us': np.float64(3.8682999999999996), 'median_duration_us': np.float64(4.1985), 'std_dev_duration_us': np.float64(1.296753976923405), 'min_duration_us': np.float64(0.799), 'max_duration_us': np.float64(5.599)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]","{'op_shape': (512,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.5475211771125924,86.96410796636873 +aten::native_batch_norm_backward,NORM_bwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), (512,), (512,), (512,), (512,), (512,), (), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((25088, 49, 7, 1), (25088, 49, 7, 1), (1,), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, True, True]')",False,234,15,233.968,15.597866666666667,1.447699498547692,0.00225792,1.439453125,1.4959294436906376,vector_bf16,0.20269897036383833,0.02635609183228633,0.30322335797304173,0.03942685379253144,7.585579427083333,1.1608900026613005,113.78369140625,15.279,13.29,18.41,0.20623137287344054,0.1413379382744273,0.23296420589343586,0.3085075828941224,0.21143158337524576,0.34849801492199867,7.31884765625,6.47900390625,10.67919921875,"[{'name': 'void at::native::batch_norm_backward_kernel(at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, at::GenericPackedTensorAccessor, bool, float)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: NativeBatchNormBackward0', 'NativeBatchNormBackward0', 'aten::native_batch_norm_backward'], 'count': 15, 'total_duration_us': np.float64(113.78399999999999), 'mean_duration_us': np.float64(7.5855999999999995), 'median_duration_us': np.float64(7.319), 'std_dev_duration_us': np.float64(1.1215021949748174), 'min_duration_us': np.float64(6.479), 'max_duration_us': np.float64(10.679)}]","[{'name': 'void at::native::batch_norm_backward_kernel, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float>(at::native::(anonymous namespace)::TensorListMetadata<2>, at::native::(anonymous namespace)::BinaryOpListAlphaFunctor, std::plus, float)', 'stream': 0, 'call_stack': ['torch/optim/optimizer.py(473): wrapper', 'torch/optim/optimizer.py(72): _use_grad', 'torch/optim/sgd.py(103): step', 'torch/optim/sgd.py(246): sgd', 'torch/optim/sgd.py(356): _multi_tensor_sgd', 'aten::_foreach_add_'], 'count': 3, 'total_duration_us': np.float64(90.756), 'mean_duration_us': np.float64(30.252), 'median_duration_us': np.float64(30.119), 'std_dev_duration_us': np.float64(1.5382992773406174), 'min_duration_us': np.float64(28.438), 'max_duration_us': np.float64(32.199)}]","[{'name': 'void at::native::(anonymous namespace)::multi_tensor_apply_kerne...', 'stream': 0, 'mean_duration_us': np.float64(30.25)}]",,False,0.42818884107199695,87.92912875599679 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), ())","('c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), ())","('', '0')",False,5922,12,56.07,4.6725,1.5946793636111534,0.00200704,7.65625,0.24999999999999997,vector_bf16,1.1135704722370185,0.12752058629825047,0.27839261805925464,0.03188014657456262,7.302205403645833,0.893610122762632,87.62646484375,4.425,3.38,9.54,1.1231365867000933,0.8541571863473427,1.3119750781998085,0.2807841466750233,0.21353929658683568,0.32799376954995213,7.158935546875,6.119140625,9.39892578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(87.62700000000002), 'mean_duration_us': np.float64(7.302250000000002), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.8555424327096035), 'min_duration_us': np.float64(6.119), 'max_duration_us': np.float64(9.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(7.3)}]","{'op_shape': (10, 64, 56, 56), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (200704, 3136, 56, 1), 'stride_output': None}",True,0.413422040415236,88.34255079641203 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512,), (), (512,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,251,30,138.669,4.6223,1.045535703310294,5.12e-07,0.00196075439453125,0.2490272373540856,vector_bf16,0.001403201957640396,0.0011944753466311248,0.0003494355069610325,0.0002974568956591127,2.7550455729166665,1.6544370356456592,82.6513671875,4.32,3.45,7.64,0.0005978543234417151,0.00034272244831515546,0.0032167211611917493,0.00014888201050688627,8.534722448315156e-05,0.0008010511841100076,3.43896484375,0.63916015625,5.9990234375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 30, 'total_duration_us': np.float64(82.649), 'mean_duration_us': np.float64(2.754966666666667), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(1.6267029329973628), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(5.999)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.75)}]","{'shape_in1': (512,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.3899495081388339,88.73250030455087 +aten::max_pool2d_with_indices,other,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), (), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar')","((802816, 12544, 112, 1), (), (), (), (), ())","('', '[3, 3]', '[2, 2]', '[1, 1]', '[1, 1]', 'False')",False,5893,3,33.01,11.003333333333332,1.0217794934981492,,,,,,,,,23.585286458333332,0.7803342920411799,70.755859375,10.49,10.34,12.18,,,,,,,23.23779296875,23.0390625,24.47900390625,"[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw(int, c10::BFloat16 const*, long, long, long, int, int, int, int, int, int, int, int, int, int, c10::BFloat16*, long*)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: MaxPool2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/pooling.py(212): forward', 'torch/_jit_internal.py(614): fn', 'torch/nn/functional.py(807): _max_pool2d', 'aten::max_pool2d', 'aten::max_pool2d_with_indices'], 'count': 3, 'total_duration_us': np.float64(70.756), 'mean_duration_us': np.float64(23.585333333333335), 'median_duration_us': np.float64(23.238), 'std_dev_duration_us': np.float64(0.6371186877044349), 'min_duration_us': np.float64(23.039), 'max_duration_us': np.float64(24.479)}]","[{'name': 'void at::native::(anonymous namespace)::max_pool_forward_nchw >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(67.46600000000001), 'mean_duration_us': np.float64(5.622166666666668), 'median_duration_us': np.float64(5.7989999999999995), 'std_dev_duration_us': np.float64(0.5222931541662104), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.62)}]","{'op_shape': (10, 64, 56, 56), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (200704, 3136, 56, 1), 'stride_output': None}",True,0.31830633596650804,89.38463309130832 +aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",True,929,3,214.709,71.56966666666666,1.479810911344199,0.12845056,5.7578125,21.275440976933513,matrix_bf16,0.27151903387499976,0.0017704911132208805,5.776687179321569,0.03766797917951613,22.236653645833332,0.14463376370416037,66.7099609375,71.7,70.029,72.98,0.27102137500821954,0.27005062991678863,0.27348509669999116,5.766099267474739,5.745446237578351,5.8185160329116155,22.27685546875,22.076171875,22.35693359375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(14.596), 'mean_duration_us': np.float64(4.865333333333333), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.037950259843935186), 'min_duration_us': np.float64(4.838), 'max_duration_us': np.float64(4.919)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(21.277), 'mean_duration_us': np.float64(7.092333333333333), 'median_duration_us': np.float64(7.119), 'std_dev_duration_us': np.float64(0.09977753031397187), 'min_duration_us': np.float64(6.959), 'max_duration_us': np.float64(7.199)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(30.837), 'mean_duration_us': np.float64(10.279), 'median_duration_us': np.float64(10.319), 'std_dev_duration_us': np.float64(0.18184242262647798), 'min_duration_us': np.float64(10.039), 'max_duration_us': np.float64(10.479)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.87)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(7.09)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(10.28)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (64, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.31473788445054507,89.69937097575887 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",False,6029,12,59.17,4.930833333333333,0.9774964155557002,0.00100352,3.828125,0.24999999999999997,vector_bf16,0.7276497399843521,0.06460940177098536,0.18191243499608803,0.01615235044274634,5.5555419921875,0.48117926954934276,66.66650390625,4.615,3.76,6.51,0.7018557022112183,0.6312551516547646,0.8295495297679111,0.17546392555280457,0.15781378791369116,0.20738738244197777,5.71923828125,4.8388671875,6.35888671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(66.66699999999999), 'mean_duration_us': np.float64(5.555583333333332), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.46067531196663397), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.56)}]","{'op_shape': (10, 128, 28, 28), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (100352, 784, 28, 1), 'stride_output': None}",True,0.31453285398900815,90.01390382974787 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",False,6158,12,61.31,5.109166666666667,0.740177599490743,0.00050176,1.9140625,0.24999999999999997,vector_bf16,0.3690627712191356,0.023393149398912485,0.0922656928047839,0.005848287349728121,5.459025065104167,0.3592526349408488,65.50830078125,4.895,4.15,6.51,0.3731781436255698,0.3237569250157529,0.4080224260472503,0.09329453590639245,0.08093923125393823,0.10200560651181258,5.37890625,4.9189453125,6.19921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(65.508), 'mean_duration_us': np.float64(5.459), 'median_duration_us': np.float64(5.379), 'std_dev_duration_us': np.float64(0.3438992100407715), 'min_duration_us': np.float64(4.919), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.46)}]","{'op_shape': (10, 256, 14, 14), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (50176, 196, 14, 1), 'stride_output': None}",True,0.3090684466320913,90.32297227637997 +aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",True,94,12,56.76,4.7299999999999995,1.1467265664411102,0.00025088,0.95703125,0.24999999999999997,vector_bf16,0.1903412584785916,0.018326339750038282,0.0475853146196479,0.0045815849375095705,5.318806966145833,0.5309911273970868,63.82568359375,4.390000000000001,3.35,6.5,0.1901381946114128,0.15982649972781707,0.22016164542046063,0.0475345486528532,0.03995662493195427,0.05504041135511516,5.279052734375,4.55810546875,6.27880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(63.826), 'mean_duration_us': np.float64(5.318833333333333), 'median_duration_us': np.float64(5.279), 'std_dev_duration_us': np.float64(0.5084422014567852), 'min_duration_us': np.float64(4.558), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.32)}]","{'op_shape': (10, 512, 7, 7), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (25088, 49, 7, 1), 'stride_output': None}",True,0.30112985145842547,90.6241021278384 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256,), (), (256,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,654,30,143.568,4.7856000000000005,1.1527475603665505,2.56e-07,0.00098419189453125,0.24806201550387597,vector_bf16,0.0009225621914914683,0.0006401909615510164,0.0002288526366490464,0.00015880706022970952,2.08974609375,1.4501653361546871,62.6923828125,4.4350000000000005,3.78,8.809,0.0009133405171805666,0.00028049581950895816,0.001614618792971734,0.0002265650895331638,6.958035832780358e-05,0.0004005255920550038,2.01904296875,0.63916015625,3.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 30, 'total_duration_us': np.float64(62.68900000000001), 'mean_duration_us': np.float64(2.0896333333333335), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.425860780565745), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","{'shape_in1': (256,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.29578293346710843,90.91988506130551 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128,), (), (128,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,1054,30,127.369,4.245633333333333,1.0058190857869687,1.28e-07,0.00049591064453125,0.24615384615384617,vector_bf16,0.0004665090466028926,0.0003241785608034115,0.00011483299608686586,7.979779958237824e-05,2.087109375,1.4501753944792757,62.61328125,4.0,3.12,7.35,0.00045929849481825974,0.00014133510285335103,0.0008135676088617264,0.00011305809103218701,3.479017916390179e-05,0.0002002627960275019,2.0390625,0.63916015625,3.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.039), 'std_dev_duration_us': np.float64(1.425871429454049), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","{'shape_in1': (128,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.2954097319528502,91.21529479325835 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64,), (), (64,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,1426,30,124.159,4.138633333333334,0.8446355052811889,6.4e-08,0.00025177001953125,0.24242424242424243,vector_bf16,0.0002376293523446567,0.00016544210163953982,5.7607115719916775e-05,4.010717615503995e-05,2.087109375,1.4530668185492028,62.61328125,3.91,3.179,6.58,0.0002336452485810752,7.175474452554745e-05,0.0004130420168067227,5.664127238329095e-05,1.7395089581950895e-05,0.00010013139801375095,2.01904296875,0.63916015625,3.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 30, 'total_duration_us': np.float64(62.61000000000001), 'mean_duration_us': np.float64(2.087), 'median_duration_us': np.float64(2.019), 'std_dev_duration_us': np.float64(1.4287113074375803), 'min_duration_us': np.float64(0.639), 'max_duration_us': np.float64(3.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.09)}]","{'shape_in1': (64,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.2954097319528502,91.5107045252112 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '0')",False,1402,12,68.569,5.714083333333334,1.4651323525900517,0.00200704,11.484375,0.16666666666666666,vector_bf16,3.165084549111451,1.3915160070258372,0.5275140915185751,0.23191933450430616,5.1123046875,3.398747629905021,61.34765625,5.1395,4.06,8.25,3.6130421691504555,1.0988463518089469,4.428534300592566,0.6021736948584092,0.18314105863482444,0.7380890500987609,3.458984375,2.71923828125,10.958984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'aten::threshold_backward'], 'count': 12, 'total_duration_us': np.float64(61.348), 'mean_duration_us': np.float64(5.112333333333333), 'median_duration_us': np.float64(3.4589999999999996), 'std_dev_duration_us': np.float64(3.254036809188789), 'min_duration_us': np.float64(2.719), 'max_duration_us': np.float64(10.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(5.11)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.28943850772471846,91.80014303293592 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), ())","('c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), ())","('', '0')",False,6287,12,58.11,4.8425,1.4555544085892622,0.00025088,0.95703125,0.24999999999999997,vector_bf16,0.1988810296057187,0.012983218725457043,0.04972025740142968,0.0032458046813642607,5.065714518229167,0.33309153344527864,60.78857421875,4.51,3.55,8.88,0.19994568134825264,0.1767009681024847,0.22011448645175108,0.04998642033706316,0.044175242025621175,0.05502862161293777,5.01904296875,4.55908203125,5.67919921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(60.788000000000004), 'mean_duration_us': np.float64(5.065666666666667), 'median_duration_us': np.float64(5.019), 'std_dev_duration_us': np.float64(0.3188869531493706), 'min_duration_us': np.float64(4.559), 'max_duration_us': np.float64(5.679)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(5.07)}]","{'op_shape': (10, 512, 7, 7), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (25088, 49, 7, 1), 'stride_output': None}",True,0.2868007562813501,92.08694378921727 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (64, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,1805,12,39.639,3.3032500000000002,0.40490787392150895,3.6864e-05,0.140625,0.25,vector_bf16,0.03143695960242978,0.0032985443652827815,0.007859239900607445,0.0008246360913206954,4.738972981770833,0.5046606226144523,56.86767578125,3.1950000000000003,2.82,4.009,0.031953819823427855,0.02671767566132885,0.03579775817923186,0.007988454955856964,0.006679418915332212,0.008949439544807964,4.618896484375,4.119140625,5.51904296875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 12, 'total_duration_us': np.float64(56.868), 'mean_duration_us': np.float64(4.739), 'median_duration_us': np.float64(4.619), 'std_dev_duration_us': np.float64(0.4831838849409888), 'min_duration_us': np.float64(4.119), 'max_duration_us': np.float64(5.519)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.74)}]","{'op_shape': (64, 64, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (576, 9, 3, 1), 'stride_output': (576, 9, 3, 1)}",True,0.26830194048200684,92.35524572969928 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,1254,9,44.76,4.973333333333333,0.30765240125830323,0.00200704,11.484375,0.16666666666666666,vector_bf16,1.933778612946109,0.16589069439747692,0.32229643549101816,0.027648449066246143,6.270073784722222,0.5623815435318228,56.4306640625,5.05,4.38,5.33,1.9940578525226391,1.6453737754353193,2.150737552978111,0.3323429754204398,0.2742289625725532,0.3584562588296852,6.0390625,5.59912109375,7.31884765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'aten::add_'], 'count': 9, 'total_duration_us': np.float64(56.431), 'mean_duration_us': np.float64(6.2701111111111105), 'median_duration_us': np.float64(6.039), 'std_dev_duration_us': np.float64(0.5302503485135729), 'min_duration_us': np.float64(5.599), 'max_duration_us': np.float64(7.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.27)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.26624011730138264,92.62148584700066 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '0')",False,1030,12,73.18,6.098333333333334,1.257145636557337,0.00100352,5.7421875,0.16666666666666666,vector_bf16,1.6190023371009568,0.727229851991352,0.26983372285015944,0.12120497533189199,4.608968098958333,2.3743423923450107,55.3076171875,5.64,4.98,8.26,1.5603676650007188,0.7067836166676219,2.7378449733570163,0.26006127750011976,0.11779726944460364,0.4563074955595026,3.85888671875,2.19921875,8.51904296875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'aten::threshold_backward'], 'count': 12, 'total_duration_us': np.float64(55.308), 'mean_duration_us': np.float64(4.609), 'median_duration_us': np.float64(3.859), 'std_dev_duration_us': np.float64(2.273213584333861), 'min_duration_us': np.float64(2.199), 'max_duration_us': np.float64(8.519)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.61)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.26094157728413614,92.8824274242848 +aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (128, 64, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((200704, 3136, 56, 1), (64, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",False,6053,3,220.558,73.51933333333334,11.818136500029654,0.12845056,5.7578125,21.275440976933513,matrix_bf16,0.32907099921474836,0.02371037608768371,7.001130621013913,0.5044487069944104,18.410481770833332,1.3202682878965732,55.2314453125,67.449,65.97,87.139,0.32746651638020075,0.30620361536366114,0.3535428659003832,6.966994541168992,6.514616945593224,7.521780376279522,18.43701171875,17.0771484375,19.71728515625,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.477), 'mean_duration_us': np.float64(5.825666666666667), 'median_duration_us': np.float64(6.119), 'std_dev_duration_us': np.float64(0.716534871602368), 'min_duration_us': np.float64(4.839), 'max_duration_us': np.float64(6.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(18.157), 'mean_duration_us': np.float64(6.052333333333333), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.4847909056719425), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.559)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS3_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR4_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB256_LPA32_LPB4_LDL1_LRVW4_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR1_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS512_SCIUI1_SPO1_SRVW0_SSO4_SVW2_SNLL0_TSGRA0_TSGRB0_TT2_32_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW2_VWB2_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.639), 'std_dev_duration_us': np.float64(0.3670906639449654), 'min_duration_us': np.float64(6.039), 'max_duration_us': np.float64(6.919)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.83)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(6.05)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT64x64x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]","{'convNd': 'conv2d', 'input_shape': (10, 64, 56, 56), 'filter_shape': (128, 64, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (200704, 3136, 56, 1), 'weight_stride': (64, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.2605821980481837,93.14300962233298 +aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), ())","('c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), ())","('', '0')",True,897,12,59.75,4.979166666666667,1.0226032584743818,0.00100352,3.828125,0.24999999999999997,vector_bf16,0.9298180230887522,0.1745056838628018,0.23245450577218804,0.04362642096570045,4.4456787109375,0.7578874066557242,53.34814453125,4.885,3.64,7.28,0.8805258591489127,0.7490511015945329,1.3036530034887408,0.22013146478722817,0.18726277539863323,0.3259132508721852,4.55908203125,3.0791015625,5.35888671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(53.348), 'mean_duration_us': np.float64(4.445666666666667), 'median_duration_us': np.float64(4.559), 'std_dev_duration_us': np.float64(0.725687413575723), 'min_duration_us': np.float64(3.079), 'max_duration_us': np.float64(5.359)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]","{'op_shape': (10, 128, 28, 28), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (100352, 784, 28, 1), 'stride_output': None}",True,0.25169677681056646,93.39470639914354 +aten::clamp_min_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 112, 112), ())","('c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), ())","('', '0')",False,5891,3,18.05,6.016666666666667,0.20744477176668816,0.00802816,30.625,0.24999999999999997,vector_bf16,1.8607984413183,0.04921750919684054,0.465199610329575,0.012304377299210136,17.265625,0.4635000603108948,51.796875,5.98,5.83,6.24,1.884648289775332,1.804199679578624,1.8935473546009443,0.471162072443833,0.451049919894656,0.47338683865023606,17.0390625,16.958984375,17.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 3, 'total_duration_us': np.float64(51.797), 'mean_duration_us': np.float64(17.265666666666664), 'median_duration_us': np.float64(17.039), 'std_dev_duration_us': np.float64(0.37853518844208994), 'min_duration_us': np.float64(16.959), 'max_duration_us': np.float64(17.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(17.27)}]","{'op_shape': (10, 64, 112, 112), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (802816, 12544, 112, 1), 'stride_output': None}",True,0.2443778804476133,93.63908427959116 +aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",True,126,3,206.999,68.99966666666667,3.083175365322795,0.12845056,1.685546875,72.67670915411355,matrix_bf16,0.10341179087164896,0.007890012410202976,7.515628648284847,0.5734201371586678,17.1572265625,1.3007552227360448,51.4716796875,70.729,65.44,70.83,0.10277354775695627,0.0958602847457627,0.11160154011222792,7.46924323906871,6.966810033898304,8.110832671887525,17.197265625,15.8369140625,18.4375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.677), 'mean_duration_us': np.float64(5.559), 'median_duration_us': np.float64(5.359), 'std_dev_duration_us': np.float64(0.40133111848779757), 'min_duration_us': np.float64(5.199), 'max_duration_us': np.float64(6.119)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.719), 'std_dev_duration_us': np.float64(0.29454296045832684), 'min_duration_us': np.float64(5.399), 'max_duration_us': np.float64(6.119)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.557000000000002), 'mean_duration_us': np.float64(5.852333333333334), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.547803695577977), 'min_duration_us': np.float64(5.079), 'max_duration_us': np.float64(6.279)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.56)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.75)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.85)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (256, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.24284360755566278,93.88192788714682 +aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (512, 256, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((50176, 196, 14, 1), (256, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",False,6311,3,194.428,64.80933333333333,7.873588148571995,0.12845056,1.685546875,72.67670915411355,matrix_bf16,0.10396356789862353,0.007640169010598823,7.555729986792198,0.5552623410715624,17.063802083333332,1.2943239361047492,51.19140625,60.379,60.149,73.9,0.10623321550788015,0.09544574285412931,0.1102117453338611,7.720680505972471,6.936682493407868,8.009826960996255,16.63720703125,16.03662109375,18.517578125,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.877), 'mean_duration_us': np.float64(5.625666666666667), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.37853518844209033), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(6.159)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR8_EMLL0_FSSC10_FL0_GLVWA2_GLVWB8_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS1_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV0_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC0_NTD0_NEPBS0_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR1_PLR5_PKA0_SIA3_SLW1_SS0_SU64_SUM0_SUS128_SCIUI1_SPO0_SRVW0_SSO0_SVW4_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGM16', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.076999999999998), 'mean_duration_us': np.float64(5.692333333333333), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.3612324582438417), 'min_duration_us': np.float64(5.279), 'max_duration_us': np.float64(6.159)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.237000000000002), 'mean_duration_us': np.float64(5.745666666666668), 'median_duration_us': np.float64(5.679), 'std_dev_duration_us': np.float64(0.3461534662865911), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.199)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.63)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.69)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.75)}]","{'convNd': 'conv2d', 'input_shape': (10, 256, 14, 14), 'filter_shape': (512, 256, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (50176, 196, 14, 1), 'weight_stride': (256, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.24152127626440212,94.12344916341122 +aten::convolution,CONV_fwd,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",False,6182,3,190.139,63.37966666666667,9.018666216982055,0.12845056,2.93359375,41.75765645805592,matrix_bf16,0.18804717997750622,0.009065025309499552,7.852409539406916,0.3785342126576635,16.383951822916668,0.8043624567112516,49.15185546875,58.639,57.72,73.78,0.19038514983378663,0.17804218313361972,0.1957142069651123,7.950037681474765,7.43462431833597,8.172566618410015,16.1572265625,15.71728515625,17.27734375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(15.877), 'mean_duration_us': np.float64(5.292333333333334), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(0.7052816616233701), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(6.199)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.117), 'mean_duration_us': np.float64(5.372333333333334), 'median_duration_us': np.float64(5.519), 'std_dev_duration_us': np.float64(0.2659991645768003), 'min_duration_us': np.float64(4.999), 'max_duration_us': np.float64(5.599)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(17.157), 'mean_duration_us': np.float64(5.719), 'median_duration_us': np.float64(5.639), 'std_dev_duration_us': np.float64(0.26733250207684545), 'min_duration_us': np.float64(5.439), 'max_duration_us': np.float64(6.079)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.29)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.37)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(5.72)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (128, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.23189866685047222,94.35534783026169 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '0')",False,630,12,84.658,7.054833333333334,3.44171180541241,0.00050176,2.87109375,0.16666666666666666,vector_bf16,0.959759619857854,0.5073463271319937,0.15995993664297567,0.0845577211886656,3.9957682291666665,1.984446512224859,47.94921875,5.625,5.229,17.3,0.8318693393547332,0.4181787086272382,1.7928545740040709,0.13864488989245552,0.06969645143787302,0.2988090956673451,3.619140625,1.67919921875,7.19921875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'aten::threshold_backward'], 'count': 12, 'total_duration_us': np.float64(47.94800000000001), 'mean_duration_us': np.float64(3.995666666666667), 'median_duration_us': np.float64(3.6189999999999998), 'std_dev_duration_us': np.float64(1.8999268991785507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(7.199)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(4.0)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.22622462160591653,94.58157245186761 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (512, 512, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((4608, 9, 3, 1), (4608, 9, 3, 1), ())","('', '', 'False')",False,1658,9,33.04,3.671111111111111,0.403312671647087,0.002359296,9.0,0.25,vector_bf16,1.8616538552030524,0.2435625724804497,0.4654134638007631,0.06089064312011243,5.150119357638889,0.6976119225404901,46.35107421875,3.82,3.09,4.08,1.9502878740665992,1.503021450501594,2.165044565027445,0.4875719685166498,0.3757553626253985,0.5412611412568612,4.8388671875,4.35888671875,6.27880859375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 9, 'total_duration_us': np.float64(46.35100000000001), 'mean_duration_us': np.float64(5.150111111111112), 'median_duration_us': np.float64(4.839), 'std_dev_duration_us': np.float64(0.6577477470622245), 'min_duration_us': np.float64(4.359), 'max_duration_us': np.float64(6.279)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(5.15)}]","{'op_shape': (512, 512, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (4608, 9, 3, 1), 'stride_output': (4608, 9, 3, 1)}",True,0.21868456879006962,94.80025702065768 +aten::clamp_min_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), ())","('c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), ())","('', '0')",True,497,12,79.19,6.599166666666666,4.488936821551267,0.00050176,1.9140625,0.24999999999999997,vector_bf16,0.5587514956047688,0.10057935081336584,0.1396878739011922,0.02514483770334146,3.7023111979166665,0.6702554335583752,44.427734375,5.164999999999999,4.56,20.71,0.5570036566177266,0.43639642424885866,0.6782867854785478,0.13925091415443164,0.10909910606221467,0.16957169636963695,3.638916015625,2.958984375,4.59912109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array >(int, at::native::(anonymous namespace)::launch_clamp_scalar(at::TensorIteratorBase&, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::{lambda()#1}::operator()() const::{lambda()#9}::operator()() const::{lambda(c10::BFloat16)#1}, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: ReLU', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/activation.py(132): forward', 'torch/nn/functional.py(1693): relu', 'aten::relu_', 'aten::clamp_min_'], 'count': 12, 'total_duration_us': np.float64(44.428000000000004), 'mean_duration_us': np.float64(3.7023333333333337), 'median_duration_us': np.float64(3.6390000000000002), 'std_dev_duration_us': np.float64(0.6417597335105681), 'min_duration_us': np.float64(2.959), 'max_duration_us': np.float64(4.599)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::(a...', 'stream': 0, 'mean_duration_us': np.float64(3.7)}]","{'op_shape': (10, 256, 14, 14), 'dtype_in_out': ('c10::BFloat16', None), 'stride_input': (50176, 196, 14, 1), 'stride_output': None}",True,0.20961024308227225,95.00986726373995 +aten::convolution,CONV_fwd,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (256, 128, 1, 1), (), (), (), (), (), (), ())","('c10::BFloat16', 'c10::BFloat16', '', 'ScalarList', 'ScalarList', 'ScalarList', 'Scalar', 'ScalarList', 'Scalar')","((100352, 784, 28, 1), (128, 1, 1, 1), (), (), (), (), (), (), ())","('', '', '', '[2, 2]', '[0, 0]', '[1, 1]', 'False', '[0, 0]', '1')",True,529,3,306.349,102.11633333333333,57.856441130900315,0.12845056,2.93359375,41.75765645805592,matrix_bf16,0.21017238725879214,0.0017248514918915291,8.776306344122132,0.07202575603957062,14.63671875,0.1201171875,43.91015625,71.07,66.41,168.869,0.21016295062716842,0.2084522734431871,0.21190193770602087,8.775912292500667,8.70447842234134,8.848528317524385,14.63671875,14.5166015625,14.7568359375,"[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(13.477), 'mean_duration_us': np.float64(4.492333333333334), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.018856180831641284), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(4.519)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(14.397), 'mean_duration_us': np.float64(4.799), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.05656854249492343), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(4.879)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV0_ACED0_AF0EM1_AF1EM1_AMAS0_ASE_ASGT_ASLT_ASM_ASAE01_ASCE01_ASEM1_AAC0_BL1_BS1_CLR0_DTLA0_DTLB0_DTVA0_DTVB0_DVO0_ETSP_EPS1_ELFLR0_EMLL0_FSSC10_FL0_GLVWA2_GLVWB2_GRCGA1_GRCGB1_GRPM1_GRVWn1_GSU1_GSUASB_GLS0_ISA942_IU1_K1_KLA_LBSPPA512_LBSPPB128_LPA16_LPB16_LDL1_LRVW8_LWPMn1_LDW0_FMA_MIAV1_MDA2_MO40_MMFSC_MKFGSU256_NTA0_NTB0_NTC2_NTD2_NEPBS8_NLCA1_NLCB1_ONLL1_OPLV0_PK0_PAP0_PGR2_PLR5_PKA0_SIA3_SLW1_SS1_SU64_SUM0_SUS128_SCIUI1_SPO1_SRVW0_SSO1_SVW1_SNLL0_TSGRA0_TSGRB0_TT1_16_TLDS1_UMLDSA0_UMLDSB1_U64SL1_USFGROn1_VAW1_VSn1_VW1_VWB1_VFLRP1_WSGRA0_WSGRB0_WS64_WG32_8_1_WGMn16', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: Conv2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/conv.py(553): forward', 'torch/nn/modules/conv.py(536): _conv_forward', 'aten::conv2d', 'aten::convolution', 'aten::_convolution', 'aten::miopen_convolution'], 'count': 3, 'total_duration_us': np.float64(16.037), 'mean_duration_us': np.float64(5.345666666666666), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(5.239), 'max_duration_us': np.float64(5.399)}]","[{'name': 'transpose_NCHW2CNHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.49)}, {'name': 'transpose_CNHW2NCHW_V2_2D_WG_off64', 'stream': 0, 'mean_duration_us': np.float64(4.8)}, {'name': 'Cijk_Ailk_Bljk_BBS_BH_MT32x32x64_MI16x16x16x1_SN_1LDSB0_APM1_ABV...', 'stream': 0, 'mean_duration_us': np.float64(5.35)}]","{'convNd': 'conv2d', 'input_shape': (10, 128, 28, 28), 'filter_shape': (256, 128, 1, 1), 'dtype_input_weight': ('c10::BFloat16', 'c10::BFloat16'), 'input_stride': (100352, 784, 28, 1), 'weight_stride': (128, 1, 1, 1), 'bias': False, 'stride': (2, 2), 'padding': (0, 0), 'dilation': (1, 1), 'transposed_conv': False, 'output_padding': (0, 0), 'groups': 1}",True,0.20716830724823687,95.21703557098819 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (128, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,1775,9,31.8,3.533333333333333,0.30442568879777554,0.000147456,0.5625,0.25,vector_bf16,0.12328301444114621,0.011430523082899711,0.030820753610286553,0.0028576307707249278,4.821180555555555,0.44821790427644176,43.390625,3.54,3.09,4.09,0.12394413626103017,0.10765168452009624,0.13914981591982492,0.03098603406525754,0.02691292113002406,0.03478745397995623,4.7587890625,4.23876953125,5.47900390625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 9, 'total_duration_us': np.float64(43.391), 'mean_duration_us': np.float64(4.821222222222222), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.4225262063608935), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(5.479)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.82)}]","{'op_shape': (128, 128, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1152, 9, 3, 1), 'stride_output': (1152, 9, 3, 1)}",True,0.20471715656199763,95.42175272755019 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 256, 3, 3), (256, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,1745,9,30.699,3.411,0.3342401831019125,0.000589824,2.25,0.25,vector_bf16,0.5064330496442352,0.04900106631659805,0.1266082624110588,0.012250266579149512,4.701171875,0.4952850959970768,42.310546875,3.36,2.92,3.889,0.5267456893055706,0.41837719352324876,0.5462790512153759,0.13168642232639266,0.10459429838081219,0.13656976280384397,4.47900390625,4.31884765625,5.63916015625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 9, 'total_duration_us': np.float64(42.311), 'mean_duration_us': np.float64(4.701222222222222), 'median_duration_us': np.float64(4.479), 'std_dev_duration_us': np.float64(0.46689941285933856), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.639)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.7)}]","{'op_shape': (256, 256, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304, 9, 3, 1), 'stride_output': (2304, 9, 3, 1)}",True,0.19962134329323705,95.62137407084342 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",False,5945,6,44.419,7.4031666666666665,3.0211554357011603,0.00200704,11.484375,0.16666666666666666,vector_bf16,1.7350461490021605,0.17963276476169893,0.28917435816702675,0.029938794126949837,7.012451171875,0.8351389698492557,42.07470703125,6.6645,5.21,13.33,1.7922031480270328,1.3939132719154468,1.8702136589064988,0.29870052467117214,0.23231887865257445,0.31170227648441645,6.71923828125,6.43896484375,8.63916015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(42.074), 'mean_duration_us': np.float64(7.012333333333333), 'median_duration_us': np.float64(6.719), 'std_dev_duration_us': np.float64(0.7623355924758827), 'min_duration_us': np.float64(6.439), 'max_duration_us': np.float64(8.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(7.01)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.19850864988961528,95.81988272073303 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '0')",False,227,12,88.21,7.350833333333333,1.7181303704017834,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.5506234561117808,0.20692332879085323,0.0917705760186301,0.0344872214651422,3.1856282552083335,1.3758855731737367,38.2275390625,7.665,5.24,10.24,0.5445946389992844,0.23973974959172564,0.7844309007633588,0.09076577316654738,0.03995662493195427,0.13073848346055977,2.959228515625,1.9189453125,6.27880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'aten::threshold_backward'], 'count': 12, 'total_duration_us': np.float64(38.228), 'mean_duration_us': np.float64(3.1856666666666666), 'median_duration_us': np.float64(2.9589999999999996), 'std_dev_duration_us': np.float64(1.3174048563579668), 'min_duration_us': np.float64(1.919), 'max_duration_us': np.float64(6.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(3.19)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.1803576947609695,96.000240415494 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 56, 56), (10, 64, 56, 56), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((200704, 3136, 56, 1), (200704, 3136, 56, 1), ())","('', '', '1')",True,1328,6,33.39,5.565,0.5423190942609342,0.00200704,11.484375,0.16666666666666666,vector_bf16,1.9331527244233129,0.14419505308634836,0.32219212073721876,0.02403250884772472,6.258951822916667,0.47782093094713657,37.5537109375,5.744999999999999,4.77,6.22,1.9119961156014238,1.7107732741398447,2.105567106633655,0.31866601926690397,0.2851288790233074,0.35092785110560915,6.298828125,5.71923828125,7.0390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(37.554), 'mean_duration_us': np.float64(6.259), 'median_duration_us': np.float64(6.2989999999999995), 'std_dev_duration_us': np.float64(0.4361956747454822), 'min_duration_us': np.float64(5.719), 'max_duration_us': np.float64(7.039)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(6.26)}]","{'shape_in1': (10, 64, 56, 56), 'shape_in2': (10, 64, 56, 56), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (200704, 3136, 56, 1), 'stride_input2': (200704, 3136, 56, 1), 'stride_output': None}",True,0.17717857075062157,96.17741898624463 +aten::threshold_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 64, 112, 112), (10, 64, 112, 112), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((802816, 12544, 112, 1), (802816, 12544, 112, 1), ())","('', '', '0')",False,1600,3,14.969999999999999,4.989999999999999,0.2535744466621197,0.00802816,45.9375,0.16666666666666666,vector_bf16,3.961416641468842,0.22266977934034973,0.6602361069114736,0.037111629890058284,12.185709635416666,0.698889002841252,36.55712890625,4.88,4.81,5.28,4.014406693253032,3.71703203014318,4.152811201010314,0.6690677822088386,0.6195053383571966,0.6921352001683856,11.9990234375,11.59912109375,12.958984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array >(int, at::native::BinaryFunctor(at::TensorIteratorBase&, c10::BFloat16, c10::BFloat16)::{lambda(c10::BFloat16, c10::BFloat16)#1}>, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'aten::threshold_backward'], 'count': 3, 'total_duration_us': np.float64(36.557), 'mean_duration_us': np.float64(12.185666666666668), 'median_duration_us': np.float64(11.999), 'std_dev_duration_us': np.float64(0.5706915882408716), 'min_duration_us': np.float64(11.599), 'max_duration_us': np.float64(12.959)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Bi...', 'stream': 0, 'mean_duration_us': np.float64(12.19)}]","{'shape_in1': (10, 64, 112, 112), 'shape_in2': (10, 64, 112, 112), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (802816, 12544, 112, 1), 'stride_input2': (802816, 12544, 112, 1), 'stride_output': None}",True,0.17247669241357805,96.34989567865821 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 512, 3, 3), (), (512, 512, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((4608, 9, 3, 1), (), (4608, 9, 3, 1))","('', '', '')",False,272,9,47.149,5.238777777777778,0.5600678034349453,0.002359296,9.000007629394531,0.2499997880725538,vector_bf16,2.6787217353571995,0.6836274955838052,0.6696798661446434,0.17090672901652196,3.710177951388889,0.8288603382936338,33.3916015625,5.13,4.55,6.26,2.359874141147741,2.03424578633828,3.630916628968627,0.5899680351648352,0.5085610154720555,0.9077283877512681,3.9990234375,2.59912109375,4.63916015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 9, 'total_duration_us': np.float64(33.391), 'mean_duration_us': np.float64(3.710111111111111), 'median_duration_us': np.float64(3.999), 'std_dev_duration_us': np.float64(0.7815148316562939), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(4.639)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]","{'shape_in1': (512, 512, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (4608, 9, 3, 1), 'stride_input2': (), 'stride_output': (4608, 9, 3, 1)}",True,0.15754172070409578,96.50743739936232 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,6074,6,38.81,6.468333333333334,1.0910255114646337,0.00100352,5.7421875,0.16666666666666666,vector_bf16,1.1219694653014638,0.15654971643840035,0.18699491088357725,0.026091619406400056,5.445638020833333,0.6823692762967902,32.673828125,6.8100000000000005,4.89,7.75,1.0494735953428131,0.9904621493975905,1.3941496619559073,0.17491226589046885,0.16507702489959838,0.23235827699265119,5.739013671875,4.31884765625,6.0791015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(32.674), 'mean_duration_us': np.float64(5.445666666666667), 'median_duration_us': np.float64(5.739000000000001), 'std_dev_duration_us': np.float64(0.6228607834464742), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(6.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.45)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.15415526251915998,96.66159266188147 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,6332,6,36.2,6.033333333333334,1.155225807652628,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.2886959041489444,0.05652407689825793,0.04811598402482407,0.00942067948304299,5.399007161458333,1.1462242511559813,32.39404296875,6.16,4.54,7.72,0.2924459792266926,0.20680307506540552,0.3517988634029442,0.04874099653778209,0.034467179177567586,0.058633143900490695,5.19921875,4.27880859375,7.27880859375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(32.394000000000005), 'mean_duration_us': np.float64(5.399000000000001), 'median_duration_us': np.float64(5.199), 'std_dev_duration_us': np.float64(1.0463906217724492), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(7.279)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.4)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.1528352349409503,96.81442789682242 +aten::add_,elementwise,python3,CPU,thread 542 (python3),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,6203,6,43.78,7.296666666666667,1.2449524756659052,0.00050176,2.87109375,0.16666666666666666,vector_bf16,0.5606019905108158,0.040274347844888564,0.09343366508513595,0.006712391307481421,5.392252604166667,0.3687834988480689,32.353515625,7.21,5.66,9.12,0.5577447396569328,0.5156068640240843,0.6326315288323415,0.0929574566094888,0.08593447733734738,0.10543858813872357,5.39892578125,4.7587890625,5.8388671875,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: CheckpointWrapper', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/distributed/algorithms/_checkpoint/checkpoint_wrapper.py(144): forward', 'torch/_compile.py(22): inner', 'torch/_dynamo/eval_frame.py(738): _fn', 'torch/utils/checkpoint.py(343): checkpoint', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(32.354), 'mean_duration_us': np.float64(5.392333333333333), 'median_duration_us': np.float64(5.399), 'std_dev_duration_us': np.float64(0.33658414830304906), 'min_duration_us': np.float64(4.759), 'max_duration_us': np.float64(5.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.39)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.15264402675771924,96.96707192358014 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",True,153,6,38.639,6.4398333333333335,1.2328763793124864,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.29522556932188054,0.047309360287814316,0.049204261553646746,0.007884893381302379,5.212483723958333,0.8603393923316893,31.27490234375,6.574999999999999,5.07,7.75,0.29888887434996225,0.2294955289213132,0.36191752054472887,0.049814812391660364,0.03824925482021886,0.0603195867574548,5.05908203125,4.1591796875,6.55908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(31.274), 'mean_duration_us': np.float64(5.2123333333333335), 'median_duration_us': np.float64(5.059), 'std_dev_duration_us': np.float64(0.7854227453345676), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(6.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(5.21)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.1475551246281116,97.11462704820825 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 64, 3, 3), (), (64, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,1447,12,53.01,4.4174999999999995,0.37675950853658224,3.6864e-05,0.14063262939453125,0.24998643736776432,vector_bf16,0.06668872402117339,0.026107861124065823,0.016671276530655182,0.006526611189697569,2.5723876953125,1.0093065844733184,30.86865234375,4.38,3.78,5.08,0.06586034554800356,0.03923178383995843,0.09458386219855935,0.016464193147355307,0.009807413873733437,0.023644682743501406,2.51904296875,1.55908203125,3.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 12, 'total_duration_us': np.float64(30.868), 'mean_duration_us': np.float64(2.5723333333333334), 'median_duration_us': np.float64(2.519), 'std_dev_duration_us': np.float64(0.9664137600197731), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.57)}]","{'shape_in1': (64, 64, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (576, 9, 3, 1), 'stride_input2': (), 'stride_output': (576, 9, 3, 1)}",True,0.14563843536969895,97.26026548357795 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",True,956,6,37.06,6.176666666666667,0.7811956647771842,0.00100352,5.7421875,0.16666666666666666,vector_bf16,1.22715017000074,0.09870807605136768,0.20452502833345665,0.016451346008561282,4.932210286458333,0.38339940966681924,29.59326171875,6.494999999999999,4.92,6.84,1.229089972137329,1.1152440770552592,1.3941496619559073,0.20484832868955477,0.18587401284254315,0.23235827699265119,4.89892578125,4.31884765625,5.39892578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(29.593999999999998), 'mean_duration_us': np.float64(4.932333333333333), 'median_duration_us': np.float64(4.898999999999999), 'std_dev_duration_us': np.float64(0.3499841266241783), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.399)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.93)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.1396211368805477,97.3998866204585 +aten::mm,GEMM,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (1000, 512))","('c10::BFloat16', 'c10::BFloat16')","((1000, 1), (512, 1))","('', '')",False,16,3,438.926,146.30866666666665,166.77260011864462,0.01024,1.005401611328125,9.713158294126574,matrix_bf16,0.11936650538560463,0.009195732100480506,1.15942576182709,0.08931960152234825,8.86572265625,0.6575774436567361,26.59716796875,58.159,42.109,338.658,0.11560738487898907,0.11264587676736057,0.12984625451046428,1.1229128292996358,1.0941472322220482,1.2612172239595862,9.119140625,8.119140625,9.35888671875,"[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMBSK_GLS0_ISA942_IU1_K1_LBSPPA256_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD0_NTM0_NEPBS0_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: AddmmBackward0', 'AddmmBackward0', 'aten::mm'], 'count': 3, 'total_duration_us': np.float64(26.597), 'mean_duration_us': np.float64(8.865666666666668), 'median_duration_us': np.float64(9.119), 'std_dev_duration_us': np.float64(0.5369874817493938), 'min_duration_us': np.float64(8.119), 'max_duration_us': np.float64(9.359)}]","[{'name': 'Cijk_Ailk_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(8.87)}]","{'M': 10, 'N': 512, 'K': 1000, 'bias': False, 'stride_A': (1000, 1), 'stride_B': (512, 1), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (False, False)}",True,0.12548555359975436,97.52537217405826 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",True,556,6,45.619,7.603166666666667,2.697739825607108,0.00050176,2.87109375,0.16666666666666666,vector_bf16,0.6952010846285724,0.01428130609525998,0.11586684743809539,0.0023802176825433335,4.33203125,0.09015475637167203,25.9921875,6.495,5.29,12.43,0.7004151067592712,0.6721494472909626,0.710243852090773,0.11673585112654519,0.11202490788182709,0.11837397534846215,4.29833984375,4.23876953125,4.47900390625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ReluBackward0', 'ReluBackward0', 'torch/utils/checkpoint.py(1111): unpack_hook', 'torch/utils/checkpoint.py(1500): recompute_fn', 'nn.Module: Sequential', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/container.py(248): forward', 'nn.Module: BasicBlock', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(89): forward', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(25.993), 'mean_duration_us': np.float64(4.332166666666667), 'median_duration_us': np.float64(4.2985), 'std_dev_duration_us': np.float64(0.08222006378548305), 'min_duration_us': np.float64(4.239), 'max_duration_us': np.float64(4.479)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.33)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.12263125312959418,97.64800342718786 +aten::sum,reduce,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '')","((1000, 1), (), (), ())","('', '[0]', 'True', '')",False,26,3,39.019999999999996,13.006666666666666,3.703138308696197,1e-05,0.019075393676757812,0.49995000499950004,vector_bf16,0.0025081292560820063,0.00011280745184699644,0.0012539392341175916,5.639808611488654e-05,7.985677083333333,0.36060498707123123,23.95703125,11.16,10.59,17.27,0.0025131347239263804,0.0023929023891582453,0.0026183506551613936,0.0012564417177914112,0.0011963315614229805,0.001309044423138383,7.958984375,7.63916015625,8.35888671875,"[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, c10::BFloat16, 4, 8>)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: AddmmBackward0', 'aten::sum'], 'count': 3, 'total_duration_us': np.float64(23.956999999999997), 'mean_duration_us': np.float64(7.985666666666666), 'median_duration_us': np.float64(7.959), 'std_dev_duration_us': np.float64(0.2945429604583269), 'min_duration_us': np.float64(7.639), 'max_duration_us': np.float64(8.359)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: AdaptiveAvgPool2d', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/pooling.py(1454): forward', 'torch/nn/functional.py(1370): adaptive_avg_pool2d', 'aten::adaptive_avg_pool2d', 'aten::mean'], 'count': 3, 'total_duration_us': np.float64(22.076999999999998), 'mean_duration_us': np.float64(7.358999999999999), 'median_duration_us': np.float64(7.159), 'std_dev_duration_us': np.float64(0.31155523854794487), 'min_duration_us': np.float64(7.119), 'max_duration_us': np.float64(7.799)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 9, 'total_duration_us': np.float64(21.991), 'mean_duration_us': np.float64(2.4434444444444443), 'median_duration_us': np.float64(1.839), 'std_dev_duration_us': np.float64(0.895111552465962), 'min_duration_us': np.float64(1.719), 'max_duration_us': np.float64(3.839)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.44)}]","{'shape_in1': (256, 256, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (2304, 9, 3, 1), 'stride_input2': (), 'stride_output': (2304, 9, 3, 1)}",True,0.10375232467683974,97.96894521088467 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 128, 3, 3), (), (128, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,1075,9,45.0,5.0,0.5905929224093363,0.000147456,0.5625076293945312,0.24999660920397673,vector_bf16,0.2733472121251077,0.0840759242798106,0.06833587616663707,0.02101869598564295,2.4078776041666665,0.9181949417968699,21.6708984375,4.63,4.39,5.86,0.3139230602910603,0.15692075032475966,0.35125790520500144,0.07847970062370062,0.03922965549493375,0.08781328525734224,1.87890625,1.67919921875,3.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 9, 'total_duration_us': np.float64(21.670999999999996), 'mean_duration_us': np.float64(2.4078888888888885), 'median_duration_us': np.float64(1.879), 'std_dev_duration_us': np.float64(0.8656974637628507), 'min_duration_us': np.float64(1.679), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.41)}]","{'shape_in1': (128, 128, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1152, 9, 3, 1), 'stride_input2': (), 'stride_output': (1152, 9, 3, 1)}",True,0.10224339262844998,98.07118860351312 +aten::mse_loss_backward,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((), (10, 1000), (10, 1000), (), (10, 1000))","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'c10::BFloat16')","((), (1000, 1), (1000, 1), (), (1000, 1))","('', '', '', '1', '')",False,9,3,26.05,8.683333333333334,2.602428353160435,,,,,,,,,7.118977864583333,0.7664773569099081,21.35693359375,7.67,6.74,11.64,,,,,,,7.47900390625,6.23876953125,7.63916015625,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16, c10::BFloat16)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: MseLossBackward0', 'MseLossBackward0', 'aten::mse_loss_backward', 'aten::mse_loss_backward'], 'count': 3, 'total_duration_us': np.float64(21.357), 'mean_duration_us': np.float64(7.119), 'median_duration_us': np.float64(7.479), 'std_dev_duration_us': np.float64(0.625672971021337), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(7.639)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(7.12)}]",,False,0.10076210513667193,98.17195070864979 +"aten::mse_loss->void at::native::vectorized_elementwise_kernel<8, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array) (Synthetic Op)",elementwise,python3,CPU,thread 542 (python3),"((10, 1000), (10, 1000), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1000, 1), (1000, 1), ())","('', '', '1')",False,56451,3,78.18,26.060000000000002,2.977263844539146,,,,,,,,,6.5322265625,0.26638550439867287,19.5966796875,27.11,22.7,28.37,,,,,,,6.59912109375,6.23876953125,6.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#4}::operator()() const::{lambda(c10::BFloat16, c10::BFloat16)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.597), 'mean_duration_us': np.float64(6.532333333333334), 'median_duration_us': np.float64(6.599), 'std_dev_duration_us': np.float64(0.21746008573733472), 'min_duration_us': np.float64(6.239), 'max_duration_us': np.float64(6.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(6.53)}]",,False,0.09245721958790075,98.26440792823769 +aten::mean,reduce,python3,CPU,thread 542 (python3),"((10, 1000), (), (), (), ())","('c10::BFloat16', 'ScalarList', 'Scalar', '', 'c10::BFloat16')","((1000, 1), (), (), (), ())","('', '[]', 'False', '', '')",False,6408,3,25.23,8.41,0.9355212450821205,1e-05,0.019075393676757812,0.49995000499950004,vector_bf16,0.0033239192399606584,0.000369630530044365,0.0016617934406362655,0.00018479678534364817,6.065755208333333,0.6504878218749942,18.197265625,7.89,7.85,9.49,0.003226535601764335,0.003012730455247481,0.003732491662870159,0.0016131064902331442,0.0015062146061631243,0.0018660592255125283,6.19921875,5.35888671875,6.63916015625,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4> >(at::native::ReduceOp, unsigned int, c10::BFloat16, 4, 4>)', 'stream': 0, 'call_stack': ['torch/nn/functional.py(3835): mse_loss', 'aten::mse_loss', 'aten::mean'], 'count': 3, 'total_duration_us': np.float64(18.197000000000003), 'mean_duration_us': np.float64(6.065666666666668), 'median_duration_us': np.float64(6.199), 'std_dev_duration_us': np.float64(0.5309948733797302), 'min_duration_us': np.float64(5.359), 'max_duration_us': np.float64(6.639)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast > >(at::TensorIteratorBase&, at::native::BUnaryFunctor > const&)::{lambda(int, bool)#1})', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: MeanBackward1', 'MeanBackward1', 'aten::div', 'aten::div'], 'count': 3, 'total_duration_us': np.float64(17.716), 'mean_duration_us': np.float64(5.905333333333334), 'median_duration_us': np.float64(5.959), 'std_dev_duration_us': np.float64(0.2644243222969896), 'min_duration_us': np.float64(5.558), 'max_duration_us': np.float64(6.199)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 8, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.91)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'Scalar', None), 'stride_input1': (512, 1, 0, 0), 'stride_input2': (), 'stride_output': None}",True,0.0835856206285893,98.51819417278548 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 256, 14, 14), (10, 256, 14, 14), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((50176, 196, 14, 1), (50176, 196, 14, 1), ())","('', '', '1')",False,454,6,35.81,5.968333333333334,0.6816866337743955,0.00050176,2.87109375,0.16666666666666666,vector_bf16,1.0752666573810312,0.25450396443104517,0.17921110956350517,0.042417327405174204,2.9457194010416665,0.7493654374675626,17.67431640625,5.744999999999999,5.21,7.2,1.141777709153922,0.7761363141993959,1.4206513548387096,0.19029628485898697,0.12935605236656594,0.23677522580645158,2.63916015625,2.119140625,3.87890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.6390000000000002), 'std_dev_duration_us': np.float64(0.6841702192355998), 'min_duration_us': np.float64(2.119), 'max_duration_us': np.float64(3.879)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]","{'shape_in1': (10, 256, 14, 14), 'shape_in2': (10, 256, 14, 14), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (50176, 196, 14, 1), 'stride_input2': (50176, 196, 14, 1), 'stride_output': None}",True,0.0833875013062053,98.60158167409169 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 128, 28, 28), (10, 128, 28, 28), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((100352, 784, 28, 1), (100352, 784, 28, 1), ())","('', '', '1')",False,854,6,39.33,6.555,2.9827017953526624,0.00100352,5.7421875,0.16666666666666666,vector_bf16,2.058135814442255,0.18207552315729217,0.34302263574037584,0.030345920526215354,2.9456380208333335,0.27438967631487227,17.673828125,5.355,5.02,12.61,2.0627724590163936,1.7508524435609827,2.316598489573549,0.34379540983606555,0.2918087405934971,0.3860997482622581,2.9189453125,2.59912109375,3.43896484375,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'aten::add_'], 'count': 6, 'total_duration_us': np.float64(17.674), 'mean_duration_us': np.float64(2.9456666666666664), 'median_duration_us': np.float64(2.919), 'std_dev_duration_us': np.float64(0.25051058970741247), 'min_duration_us': np.float64(2.599), 'max_duration_us': np.float64(3.439)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.95)}]","{'shape_in1': (10, 128, 28, 28), 'shape_in2': (10, 128, 28, 28), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (100352, 784, 28, 1), 'stride_input2': (100352, 784, 28, 1), 'stride_output': None}",True,0.08338519759315433,98.68496687168485 +aten::addmm,GEMM,python3,CPU,thread 542 (python3),"((1000,), (10, 512), (512, 1000), (), ())","('c10::BFloat16', 'c10::BFloat16', 'c10::BFloat16', 'Scalar', 'Scalar')","((1,), (512, 1), (1, 512), (), ())","('', '', '', '1', '1')",False,6400,3,131.53,43.843333333333334,8.790109972766741,0.01025,1.0073089599609375,9.704233886237976,matrix_bf16,0.19147347243378673,0.012316432308777972,1.8581033595076064,0.1195215397683994,5.5322265625,0.36958310688847623,16.5966796875,39.78,37.82,53.93,0.1985843679427155,0.1772516814159292,0.1985843679427155,1.9271091526668502,1.7200917731891183,1.9271091526668502,5.31884765625,5.31884765625,5.958984375,"[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x1_SN_LDSB1_AFC1_AFEM1_AFEM1_ASEM1_CLR1_CADS0_DTVA0_DTVB0_EPS0_FDSI0_GRPM1_GRVWA8_GRVWB8_GSUAMB_GLS0_ISA942_IU1_K1_LBSPPA512_LBSPPB512_LBSPPM0_LPA16_LPB16_LPM0_LRVW8_LWPMn1_MIAV0_MIWT1_1_MO40_NTn1_NTA4_NTB0_NTC0_NTD4_NTM0_NEPBS16_NLCA1_NLCB1_ONLL1_PGR2_PLR1_PKA1_SIA3_SS1_SPO0_SRVW0_SSO0_SVW1_SK0_SKXCCM0_TLDS1_ULSGRO0_USL1_UIOFGRO0_USFGROn1_VSn1_VWA1_VWB1_WSGRA0_WSGRB0_WS64_WG16_4_4', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1454): _run_ddp_forward', 'nn.Module: ResNet', 'torch/nn/modules/module.py(1743): _call_impl', 'torchvision/models/resnet.py(284): forward', 'torchvision/models/resnet.py(266): _forward_impl', 'nn.Module: Linear', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/modules/linear.py(124): forward', 'aten::linear', 'aten::addmm'], 'count': 3, 'total_duration_us': np.float64(16.597), 'mean_duration_us': np.float64(5.532333333333334), 'median_duration_us': np.float64(5.319), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(5.319), 'max_duration_us': np.float64(5.959)}]","[{'name': 'Cijk_Alik_Bljk_BBS_BH_Bias_HAS_SAV_UserArgs_MT16x16x256_MI16x16x...', 'stream': 0, 'mean_duration_us': np.float64(5.53)}]","{'M': 10, 'N': 1000, 'K': 512, 'bias': True, 'stride_A': (512, 1), 'stride_B': (1, 512), 'dtype_A_B': ('c10::BFloat16', 'c10::BFloat16'), 'B': 1, 'transpose': (True, False)}",True,0.07830320660269961,98.76327007828755 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (256, 128, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1152, 9, 3, 1), (1152, 9, 3, 1), ())","('', '', 'False')",False,1769,3,10.28,3.4266666666666663,0.37004504230341106,0.000294912,1.125,0.25,vector_bf16,0.23812062089248345,0.023501540945279162,0.05953015522312086,0.0058753852363197905,4.985677083333333,0.4822019830070951,14.95703125,3.42,3.06,3.8,0.23410068837209302,0.21688832965257204,0.2633728446527853,0.058525172093023256,0.05422208241314301,0.06584321116319633,5.0390625,4.47900390625,5.43896484375,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(14.957), 'mean_duration_us': np.float64(4.985666666666667), 'median_duration_us': np.float64(5.039), 'std_dev_duration_us': np.float64(0.3937286149395573), 'min_duration_us': np.float64(4.479), 'max_duration_us': np.float64(5.439)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.99)}]","{'op_shape': (256, 128, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1152, 9, 3, 1), 'stride_output': (1152, 9, 3, 1)}",True,0.0705673381775197,98.83383741646507 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (512, 256, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((2304, 9, 3, 1), (2304, 9, 3, 1), ())","('', '', 'False')",False,1739,3,11.33,3.776666666666667,0.3121431295629193,0.001179648,4.5,0.25,vector_bf16,0.961506073804064,0.10108157041790036,0.240376518451016,0.02527039260447509,4.945638020833333,0.5446142789205571,14.8369140625,3.91,3.42,4.0,0.9915530900882413,0.8488077660079052,1.0441573653160454,0.24788827252206033,0.2122019415019763,0.26103934132901135,4.7587890625,4.51904296875,5.55908203125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(14.837000000000002), 'mean_duration_us': np.float64(4.945666666666667), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.44462218668088177), 'min_duration_us': np.float64(4.519), 'max_duration_us': np.float64(5.559)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.95)}]","{'op_shape': (512, 256, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (2304, 9, 3, 1), 'stride_output': (2304, 9, 3, 1)}",True,0.07000062476697942,98.90383804123205 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (), (1000, 512))","('c10::BFloat16', 'double', 'c10::BFloat16')","((512, 1), (), (512, 1))","('', '', '')",False,45,3,18.400000000000002,6.133333333333334,3.5500187792930524,0.000512,1.9531326293945312,0.2499990234413147,vector_bf16,0.4226052056017336,0.03357184104754338,0.1056508887016494,0.008392927477012892,4.86572265625,0.36958310688847623,14.59716796875,4.21,3.96,10.23,0.4032224941357431,0.4032224941357431,0.46137062853371463,0.100805229763507,0.100805229763507,0.1153422065779342,5.0791015625,4.43896484375,5.0791015625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(14.597), 'mean_duration_us': np.float64(4.865666666666667), 'median_duration_us': np.float64(5.079), 'std_dev_duration_us': np.float64(0.3016988933062601), 'min_duration_us': np.float64(4.439), 'max_duration_us': np.float64(5.079)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.87)}]","{'shape_in1': (1000, 512), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (512, 1), 'stride_input2': (), 'stride_output': (512, 1)}",True,0.06886950165894984,98.972707542891 +aten::fill_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 1000), ())","('c10::BFloat16', 'Scalar')","((1000, 1), ())","('', '0')",False,8,3,33.23,11.076666666666666,0.9347370396712289,,,,,,,,,4.798665364583333,0.4716395854027524,14.39599609375,10.83,10.29,12.11,,,,,,,4.67822265625,4.39892578125,5.31884765625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: MseLossBackward0', 'MseLossBackward0', 'aten::mse_loss_backward', 'aten::zeros_like', 'aten::zero_', 'aten::fill_'], 'count': 3, 'total_duration_us': np.float64(14.396), 'mean_duration_us': np.float64(4.798666666666667), 'median_duration_us': np.float64(4.678), 'std_dev_duration_us': np.float64(0.38515826472878506), 'min_duration_us': np.float64(4.399), 'max_duration_us': np.float64(5.319)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.8)}]",,False,0.06792037188194741,99.04062791477295 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (256, 128, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((128, 1, 1, 1), (128, 1, 1, 1), ())","('', '', 'False')",False,1757,3,10.370000000000001,3.456666666666667,0.37072002014098643,3.2768e-05,0.125,0.25,vector_bf16,0.027683243903912667,0.002995977751147662,0.006920810975978167,0.0007489944377869154,4.772298177083333,0.5220458095712031,14.31689453125,3.64,3.03,3.7,0.02777397371960683,0.02464293179105848,0.03063282620107269,0.006943493429901707,0.00616073294776462,0.007658206550268173,4.71923828125,4.27880859375,5.31884765625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(14.317), 'mean_duration_us': np.float64(4.772333333333333), 'median_duration_us': np.float64(4.719), 'std_dev_duration_us': np.float64(0.42624979635055416), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.319)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.77)}]","{'op_shape': (256, 128, 1, 1), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (128, 1, 1, 1), 'stride_output': (128, 1, 1, 1)}",True,0.06754717036768919,99.10817508514064 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (64, 3, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((147, 49, 7, 1), (147, 49, 7, 1), ())","('', '', 'False')",False,1829,3,12.02,4.006666666666667,1.841312937371954,9.408e-06,0.035888671875,0.25,vector_bf16,0.007982560007111693,0.0009286231010938887,0.001995640001777923,0.00023215577527347219,4.758951822916667,0.5769098932439007,14.27685546875,3.04,2.85,6.13,0.008182432954666101,0.006970275481595369,0.008794971585073606,0.0020456082386665253,0.0017425688703988423,0.0021987428962684016,4.59912109375,4.27880859375,5.39892578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(14.277000000000001), 'mean_duration_us': np.float64(4.759), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.4710272462041519), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(5.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.76)}]","{'op_shape': (64, 3, 7, 7), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (147, 49, 7, 1), 'stride_output': (147, 49, 7, 1)}",True,0.0673582658975091,99.17553335103815 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (128, 64, 3, 3), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((576, 9, 3, 1), (576, 9, 3, 1), ())","('', '', 'False')",False,1799,3,9.579,3.193,0.23838414376799483,7.3728e-05,0.28125,0.25,vector_bf16,0.06422163073442737,0.0065021197818901175,0.016055407683606842,0.0016255299454725294,4.625651041666667,0.4971274672189554,13.876953125,3.299,2.92,3.36,0.06765764265710765,0.056722368144252445,0.06828488140192199,0.016914410664276913,0.014180592036063111,0.017071220350480497,4.35888671875,4.31884765625,5.19921875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(13.876999999999999), 'mean_duration_us': np.float64(4.625666666666667), 'median_duration_us': np.float64(4.359), 'std_dev_duration_us': np.float64(0.405736641458745), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(5.199)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.63)}]","{'op_shape': (128, 64, 3, 3), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (576, 9, 3, 1), 'stride_output': (576, 9, 3, 1)}",True,0.06547152490875914,99.24100487594691 +aten::fill_,elementwise,python3,CPU,thread 542 (python3),"((), ())","('c10::BFloat16', 'Scalar')","((), ())","('', '1.')",False,6413,3,18.7,6.233333333333333,0.929157324317757,,,,,,,,,4.598958333333333,0.3200683904124541,13.796875,5.8,5.6,7.3,,,,,,,4.59912109375,4.27880859375,4.9189453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'call_stack': ['torch/_tensor.py(570): backward', 'torch/autograd/__init__.py(242): backward', 'torch/autograd/__init__.py(88): _make_grads', 'aten::ones_like', 'aten::fill_'], 'count': 3, 'total_duration_us': np.float64(13.797), 'mean_duration_us': np.float64(4.599), 'median_duration_us': np.float64(4.599), 'std_dev_duration_us': np.float64(0.2612789058968722), 'min_duration_us': np.float64(4.279), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(4.6)}]",,False,0.06509371596839895,99.30609859191532 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (1000,), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((1,), (1,), ())","('', '', 'False')",False,1650,3,26.75,8.916666666666666,0.4508140784551142,1e-06,0.003814697265625,0.25,vector_bf16,0.0008925166217245666,0.0001022922004128155,0.00022312915543114156,2.557305010320387e-05,4.518880208333333,0.48653430985275825,13.556640625,9.12,8.4,9.23,0.0008405499692181409,0.0008266397578203835,0.001010360138135175,0.0002101374923045352,0.00020665993945509582,0.0002525900345337937,4.7587890625,3.958984375,4.8388671875,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(13.557), 'mean_duration_us': np.float64(4.519), 'median_duration_us': np.float64(4.759), 'std_dev_duration_us': np.float64(0.39732438468670256), 'min_duration_us': np.float64(3.959), 'max_duration_us': np.float64(4.839)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.52)}]","{'op_shape': (1000,), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (1,), 'stride_output': (1,)}",True,0.0639602891473184,99.37005888106263 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000,), (), (1000,))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1,), (), (1,))","('', '', '')",False,33,3,26.64,8.88,2.9559431658947712,1e-06,0.00382232666015625,0.249500998003992,vector_bf16,0.0009143118490488159,8.813688365013132e-05,0.00022812171882455478,2.1990240431669502e-05,4.412272135416667,0.44599523130071334,13.23681640625,7.72,6.68,12.24,0.000945557424259878,0.000814808814770697,0.0009825693081158726,0.0002359175210229236,0.0002032956124677387,0.0002451520229830021,4.23876953125,4.0791015625,4.9189453125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(13.236999999999998), 'mean_duration_us': np.float64(4.412333333333333), 'median_duration_us': np.float64(4.239), 'std_dev_duration_us': np.float64(0.3641733408999376), 'min_duration_us': np.float64(4.079), 'max_duration_us': np.float64(4.919)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}]","{'shape_in1': (1000,), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1,), 'stride_input2': (), 'stride_output': (1,)}",True,0.06245135709892863,99.43251023816156 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (128, 64, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((64, 1, 1, 1), (64, 1, 1, 1), ())","('', '', 'False')",False,1787,3,11.7,3.9,0.38105117766515306,8.192e-06,0.03125,0.25,vector_bf16,0.00752253942153772,0.0005527228779897269,0.00188063485538443,0.00013818071949743172,4.372395833333333,0.3352246668890176,13.1171875,4.12,3.46,4.12,0.007803356279069767,0.006885785347835009,0.007878476637708383,0.0019508390697674418,0.0017214463369587523,0.001969619159427096,4.19921875,4.1591796875,4.7587890625,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(13.116999999999999), 'mean_duration_us': np.float64(4.372333333333333), 'median_duration_us': np.float64(4.199), 'std_dev_duration_us': np.float64(0.27390184778898874), 'min_duration_us': np.float64(4.159), 'max_duration_us': np.float64(4.759)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]","{'op_shape': (128, 64, 1, 1), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (64, 1, 1, 1), 'stride_output': (64, 1, 1, 1)}",True,0.061886947401439324,99.49439718556299 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (512, 256, 1, 1), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((256, 1, 1, 1), (256, 1, 1, 1), ())","('', '', 'False')",False,1727,3,11.82,3.94,0.6444377394287207,0.000131072,0.5,0.25,vector_bf16,0.1199220893378171,0.0012758765824936278,0.029980522334454276,0.00031896914562340694,4.372233072916667,0.046233127024950436,13.11669921875,3.7,3.45,4.67,0.11918546164946166,0.11918546164946166,0.12139534471452797,0.029796365412365414,0.029796365412365414,0.03034883617863199,4.39892578125,4.31884765625,4.39892578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(13.117), 'mean_duration_us': np.float64(4.372333333333334), 'median_duration_us': np.float64(4.399), 'std_dev_duration_us': np.float64(0.03771236166328257), 'min_duration_us': np.float64(4.319), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(4.37)}]","{'op_shape': (512, 256, 1, 1), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (256, 1, 1, 1), 'stride_output': (256, 1, 1, 1)}",True,0.06188464368838835,99.55628182925138 +aten::cat,other,python3,CPU,thread 542 (python3),"((), ())","('TensorList', 'Scalar')","((), ())","('', '0')",False,5534,3,64.599,21.533,0.9481492498546847,,,,,,,,,4.065592447916667,0.18031158429403077,12.19677734375,21.29,20.73,22.579,,,,,,,4.0791015625,3.87890625,4.23876953125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<2u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::flatten_dense_tensors', 'aten::cat'], 'count': 3, 'total_duration_us': np.float64(12.197), 'mean_duration_us': np.float64(4.065666666666666), 'median_duration_us': np.float64(4.079), 'std_dev_duration_us': np.float64(0.14727148022916342), 'min_duration_us': np.float64(3.879), 'max_duration_us': np.float64(4.239)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(4.07)}]",,False,0.057544448300348154,99.61382627755172 +aten::copy_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((1000, 512), (1000, 512), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((512, 1), (512, 1), ())","('', '', 'False')",False,1652,3,13.67,4.556666666666667,0.3212994449626912,0.000512,1.953125,0.25,vector_bf16,0.5402953724150212,0.09578083415618481,0.13507384310375528,0.023945208539046175,3.86572265625,0.6377912043259547,11.59716796875,4.44,4.31,4.92,0.5070483558994198,0.4655682095682096,0.6482695517774344,0.12676208897485491,0.11639205239205239,0.16206738794435854,4.0390625,3.1591796875,4.39892578125,"[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'call_stack': ['torch.distributed.ddp.reducer::copy_bucket_to_grad', 'aten::copy_'], 'count': 3, 'total_duration_us': np.float64(11.597), 'mean_duration_us': np.float64(3.8656666666666664), 'median_duration_us': np.float64(4.039), 'std_dev_duration_us': np.float64(0.5208539995899897), 'min_duration_us': np.float64(3.159), 'max_duration_us': np.float64(4.399)}]","[{'name': 'Memcpy DtoD (Device -> Device)', 'stream': 0, 'mean_duration_us': np.float64(3.87)}]","{'op_shape': (1000, 512), 'dtype_in_out': ('c10::BFloat16', 'c10::BFloat16'), 'stride_input': (512, 1), 'stride_output': (512, 1)}",True,0.054715488673748716,99.66854176622547 +aten::add_,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((10, 512, 7, 7), (10, 512, 7, 7), ())","('c10::BFloat16', 'c10::BFloat16', 'Scalar')","((25088, 49, 7, 1), (25088, 49, 7, 1), ())","('', '', '1')",False,316,3,18.89,6.296666666666667,0.19655363983740748,0.00025088,1.435546875,0.16666666666666666,vector_bf16,0.40633830628853135,0.009023223314506893,0.06772305104808855,0.0015038705524178157,3.7057291666666665,0.0830743261395091,11.1171875,6.4,6.07,6.42,0.4091325069674851,0.3962485141388175,0.41363389775929155,0.06818875116124751,0.06604141902313625,0.06893898295988192,3.67919921875,3.63916015625,3.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: ConvolutionBackward0', 'aten::add_'], 'count': 3, 'total_duration_us': np.float64(11.116999999999999), 'mean_duration_us': np.float64(3.705666666666666), 'median_duration_us': np.float64(3.679), 'std_dev_duration_us': np.float64(0.06798692684790385), 'min_duration_us': np.float64(3.639), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.71)}]","{'shape_in1': (10, 512, 7, 7), 'shape_in2': (10, 512, 7, 7), 'dtype_in1_in2_out': ('c10::BFloat16', 'c10::BFloat16', None), 'stride_input1': (25088, 49, 7, 1), 'stride_input2': (25088, 49, 7, 1), 'stride_output': None}",True,0.05245093874463857,99.72099270497012 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((64, 3, 7, 7), (), (64, 3, 7, 7))","('c10::BFloat16', 'double', 'c10::BFloat16')","((147, 49, 7, 1), (), (147, 49, 7, 1))","('', '', '')",False,1640,3,13.02,4.34,0.6022457969965419,9.408e-06,0.03589630126953125,0.2499468650371945,vector_bf16,0.010469517217205479,0.00042669772018276105,0.0026168230068934414,0.00010665175747819901,3.59912109375,0.1443628928652574,10.79736328125,4.4,3.71,4.91,0.010343045753387896,0.010120351844558225,0.010945154053670312,0.002585211860995572,0.0025295502166207172,0.0027357069430640354,3.63916015625,3.43896484375,3.71923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(10.796999999999999), 'mean_duration_us': np.float64(3.5989999999999998), 'median_duration_us': np.float64(3.639), 'std_dev_duration_us': np.float64(0.11775681155103787), 'min_duration_us': np.float64(3.439), 'max_duration_us': np.float64(3.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.6)}]","{'shape_in1': (64, 3, 7, 7), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (147, 49, 7, 1), 'stride_input2': (), 'stride_output': (147, 49, 7, 1)}",True,0.0509420066962488,99.77193471166636 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 3, 3), (), (256, 128, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((1152, 9, 3, 1), (), (1152, 9, 3, 1))","('', '', '')",False,860,3,15.12,5.04,0.6274551776820395,0.000294912,1.1250076293945312,0.2499983045904908,vector_bf16,0.33069730299007677,0.014599473837398664,0.08267376508016704,0.003649843707262895,3.5719401041666665,0.16181668128245583,10.7158203125,4.81,4.56,5.75,0.3390786649824561,0.31383937230449466,0.3391738716832795,0.08476909136842105,0.0784593109898675,0.08479289288221255,3.47900390625,3.47802734375,3.7587890625,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(10.716000000000001), 'mean_duration_us': np.float64(3.5720000000000005), 'median_duration_us': np.float64(3.479), 'std_dev_duration_us': np.float64(0.13222959830033), 'min_duration_us': np.float64(3.478), 'max_duration_us': np.float64(3.759)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.57)}]","{'shape_in1': (256, 128, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (1152, 9, 3, 1), 'stride_input2': (), 'stride_output': (1152, 9, 3, 1)}",True,0.05055728661673568,99.8224919982831 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 3, 3), (), (512, 256, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((2304, 9, 3, 1), (), (2304, 9, 3, 1))","('', '', '')",False,460,3,17.27,5.756666666666667,2.121658156568426,0.001179648,4.500007629394531,0.24999957614546686,vector_bf16,1.5653958412452047,0.5370752244514754,0.39134829681117766,0.1342685784711003,3.2257486979166665,0.9245327069892811,9.67724609375,4.69,4.38,8.2,1.2687006432978865,1.2421198971722365,2.185366983265491,0.31717462307995276,0.31052944781491004,0.5463408195386703,3.71923828125,2.1591796875,3.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(9.677), 'mean_duration_us': np.float64(3.2256666666666667), 'median_duration_us': np.float64(3.719), 'std_dev_duration_us': np.float64(0.7549540089009102), 'min_duration_us': np.float64(2.159), 'max_duration_us': np.float64(3.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(3.23)}]","{'shape_in1': (512, 256, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (2304, 9, 3, 1), 'stride_input2': (), 'stride_output': (2304, 9, 3, 1)}",True,0.04565728895730814,99.86814928724041 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 3, 3), (), (128, 64, 3, 3))","('c10::BFloat16', 'double', 'c10::BFloat16')","((576, 9, 3, 1), (), (576, 9, 3, 1))","('', '', '')",False,1260,3,13.48,4.493333333333333,0.17925772879665008,7.3728e-05,0.28125762939453125,0.2499932184999322,vector_bf16,0.12092366157503864,0.06343112956112114,0.03023009534994049,0.015857352232070868,2.8390299479166665,1.1447188535008865,8.51708984375,4.4,4.38,4.7,0.08575836433338066,0.0828640636575662,0.19414855673416906,0.021439009512991623,0.020715453971738233,0.048535822565091605,3.43896484375,1.51904296875,3.55908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(8.517), 'mean_duration_us': np.float64(2.839), 'median_duration_us': np.float64(3.439), 'std_dev_duration_us': np.float64(0.9346657156438339), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(3.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(2.84)}]","{'shape_in1': (128, 64, 3, 3), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (576, 9, 3, 1), 'stride_input2': (), 'stride_output': (576, 9, 3, 1)}",True,0.040183666748187394,99.9083329539886 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((512, 256, 1, 1), (), (512, 256, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((256, 1, 1, 1), (), (256, 1, 1, 1))","('', '', '')",False,371,3,17.96,5.986666666666667,0.4619884558442263,0.000131072,0.5000076293945312,0.24999618536094115,vector_bf16,0.3123481897924305,0.00744979172641545,0.07808585595250288,0.0018624195133373658,1.67919921875,0.0400390625,5.03759765625,5.73,5.71,6.52,0.31222977842396044,0.30495830957114456,0.3198564813821865,0.078056253562082,0.07623841408690712,0.07996290020851951,1.67919921875,1.63916015625,1.71923828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(5.037), 'mean_duration_us': np.float64(1.679), 'median_duration_us': np.float64(1.679), 'std_dev_duration_us': np.float64(0.03265986323710907), 'min_duration_us': np.float64(1.639), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.68)}]","{'shape_in1': (512, 256, 1, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (256, 1, 1, 1), 'stride_input2': (), 'stride_output': (256, 1, 1, 1)}",True,0.023767407546927095,99.93210036153553 +aten::cat,other,python3,CPU,thread 542 (python3),"(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('TensorList', 'Scalar')","(((1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,), (1,)), ())","('', '0')",False,5559,3,31.38,10.459999999999999,0.43863424398922585,,,,,,,,,1.6658528645833333,0.09246625404990101,4.99755859375,10.36,10.08,10.94,,,,,,,1.71923828125,1.55908203125,1.71923828125,"[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_contig, unsigned int, 1, 128, 1>(at::native::(anonymous namespace)::OpaqueType<8u>*, at::native::(anonymous namespace)::CatArrInputTensorMetadata, unsigned int, 128, 1>, at::native::(anonymous namespace)::TensorSizeStride, int, unsigned int)', 'stream': 0, 'call_stack': ['nn.Module: DistributedDataParallel', 'torch/nn/modules/module.py(1743): _call_impl', 'torch/nn/parallel/distributed.py(1637): forward', 'torch/nn/parallel/distributed.py(1493): _pre_forward', 'torch/nn/parallel/distributed.py(2155): _sync_buffers', 'torch/nn/parallel/distributed.py(2174): _sync_module_buffers', 'torch/nn/parallel/distributed.py(2184): _default_broadcast_coalesced', 'torch/nn/parallel/distributed.py(2110): _distributed_broadcast_coalesced', 'aten::flatten_dense_tensors', 'aten::cat'], 'count': 3, 'total_duration_us': np.float64(4.997), 'mean_duration_us': np.float64(1.6656666666666666), 'median_duration_us': np.float64(1.719), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(1.559), 'max_duration_us': np.float64(1.719)}]","[{'name': 'void at::native::(anonymous namespace)::CatArrayBatchedCopy_cont...', 'stream': 0, 'mean_duration_us': np.float64(1.67)}]",,False,0.023578503076747002,99.95567886461228 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((128, 64, 1, 1), (), (128, 64, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((64, 1, 1, 1), (), (64, 1, 1, 1))","('', '', '')",False,1171,3,14.07,4.69,0.2707397274136176,8.192e-06,0.03125762939453125,0.2499389797412741,vector_bf16,0.020273373841058095,0.0017990846225563672,0.005067106373747496,0.0004496613750299535,1.6256510416666667,0.15130600872189426,4.876953125,4.81,4.38,4.88,0.021022626996554966,0.018220751357220413,0.021576743169398907,0.005254373943000313,0.004554076004343105,0.005392869173899068,1.55908203125,1.51904296875,1.798828125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(4.877), 'mean_duration_us': np.float64(1.6256666666666666), 'median_duration_us': np.float64(1.559), 'std_dev_duration_us': np.float64(0.12364824660660939), 'min_duration_us': np.float64(1.519), 'max_duration_us': np.float64(1.799)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.63)}]","{'shape_in1': (128, 64, 1, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (64, 1, 1, 1), 'stride_input2': (), 'stride_output': (64, 1, 1, 1)}",True,0.02300948595315575,99.97868835056543 +aten::mul,elementwise,python3,CPU,thread 639 (pt_autograd_0),"((256, 128, 1, 1), (), (256, 128, 1, 1))","('c10::BFloat16', 'double', 'c10::BFloat16')","((128, 1, 1, 1), (), (128, 1, 1, 1))","('', '', '')",False,771,3,14.879999999999999,4.96,0.19672315572905966,3.2768e-05,0.12500762939453125,0.24998474214220323,vector_bf16,0.08710984937303184,0.0026281576561250322,0.02177613323356353,0.0006569993139754716,1.5056966145833333,0.046233127024950485,4.51708984375,4.99,4.75,5.14,0.08862721690326841,0.08407511431255872,0.08862721690326841,0.022155451964344666,0.021017495772001252,0.022155451964344666,1.47900390625,1.47900390625,1.55908203125,"[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AUnaryFunctor >, std::array >(int, at::native::AUnaryFunctor >, std::array)', 'stream': 0, 'call_stack': ['autograd::engine::evaluate_function: torch::autograd::AccumulateGrad', 'torch::distributed::reducer::mul_out', 'aten::mul'], 'count': 3, 'total_duration_us': np.float64(4.517), 'mean_duration_us': np.float64(1.5056666666666667), 'median_duration_us': np.float64(1.479), 'std_dev_duration_us': np.float64(0.037712361663282463), 'min_duration_us': np.float64(1.479), 'max_duration_us': np.float64(1.559)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<8, at::native::AU...', 'stream': 0, 'mean_duration_us': np.float64(1.51)}]","{'shape_in1': (256, 128, 1, 1), 'shape_in2': (), 'dtype_in1_in2_out': ('c10::BFloat16', 'double', 'c10::BFloat16'), 'stride_input1': (128, 1, 1, 1), 'stride_input2': (), 'stride_output': (128, 1, 1, 1)}",True,0.021311649434585883,100.00000000000001 diff --git a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/BinaryElementwise.csv b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/BinaryElementwise.csv index caaccb905..c790aa9e3 100644 --- a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/BinaryElementwise.csv +++ b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/BinaryElementwise.csv @@ -1,7 +1,7 @@ name,param: shape_in1,param: shape_in2,param: dtype_in1_in2_out,param: stride_input1,param: stride_input2,param: stride_output,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::add_,"(16,)","(16,)","('float', 'float', None)","(1,)","(1,)",,1.6e-08,0.00018310546875,0.08333333333333333,0.00010201639512774651,0.00010099062554990768,4.268934582028177e-06,9.786361373817821e-05,0.00010901469365123373,8.501366260645541e-06,8.415885462492306e-06,3.557445485023487e-07,8.155301144848183e-06,9.084557804269476e-06,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.621), 'mean_duration_us': np.float64(1.8850833333333332), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.07396447157626122), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.962)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]","[[16], [16], []]","['float', 'float', 'Scalar']","[[1], [1], []]","['', '', '1']",1.885009765625,1.9013671875,0.07718424959046567,1.76123046875,1.9619140625,22.6201171875,12,286 -aten::add_,(),(),"('long int', 'long int', None)",(),(),,1e-09,2.288818359375e-05,0.041666666666666664,8.159373148075394e-06,6.712597892214445e-06,3.2424184530722574e-06,5.211748489025555e-06,1.275350285417748e-05,3.3997388116980807e-07,2.7969157884226854e-07,1.3510076887801073e-07,2.1715618704273142e-07,5.313959522573949e-07,python,CPU,thread 2300490 (python),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(19.823999999999998), 'mean_duration_us': np.float64(3.304), 'median_duration_us': np.float64(3.5845000000000002), 'std_dev_duration_us': np.float64(1.0166421854975984), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.3)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', '1']",3.303955078125,3.58447265625,1.1137280126556983,1.8818359375,4.60498046875,19.82373046875,6,799 -aten::add_,"(16, 32, 32)","(16, 32, 32)","('float', 'float', None)","(1024, 32, 1)","(1024, 32, 1)",,1.6384e-05,0.1875,0.08333333333333333,0.047958026130510166,0.0480332236803435,0.0033861364668778225,0.044635094113734626,0.05113056304761905,0.0039965021775425135,0.004002768640028624,0.00028217803890648525,0.0037195911761445516,0.004260880253968253,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.459999999999997), 'mean_duration_us': np.float64(4.114999999999999), 'median_duration_us': np.float64(4.105), 'std_dev_duration_us': np.float64(0.2519920633670832), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(4.405)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]","[[16, 32, 32], [16, 32, 32], []]","['float', 'float', 'Scalar']","[[1024, 32, 1], [1024, 32, 1], []]","['', '', '1']",4.114990234375,4.10498046875,0.29094638896929526,3.84521484375,4.40478515625,16.4599609375,4,333 -aten::add_,"(32, 32)","(32, 32)","('float', 'float', None)","(32, 1)","(32, 1)",,1.024e-06,0.01171875,0.08333333333333333,0.005466037708706859,0.005466037708706859,0.0006164429592976079,0.005030146711972817,0.0059019287054409,0.0004555031423922382,0.0004555031423922382,5.1370246608134065e-05,0.00041917889266440136,0.000491827392120075,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.525), 'mean_duration_us': np.float64(2.2625), 'median_duration_us': np.float64(2.2625), 'std_dev_duration_us': np.float64(0.18050000000000008), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.26)}]","[[32, 32], [32, 32], []]","['float', 'float', 'Scalar']","[[32, 1], [32, 1], []]","['', '', '1']",2.262451171875,2.262451171875,0.25515230043791925,2.08203125,2.44287109375,4.52490234375,2,258 -aten::add,"(1,)",(),"('long int', 'Scalar', None)","(1,)",(),,1e-09,1.9073486328125e-05,0.05,,,,,,,,,,,python,CPU,thread 2300490 (python),,[],,"[[1], [], []]","['long int', 'Scalar', 'Scalar']","[[1], [], []]","['', '1', '1']",0.0,0.0,0.0,0.0,0.0,0.0,6,849 -aten::add,"(1,)",(),"('long int', 'long int', None)","(1,)",(),,1e-09,2.288818359375e-05,0.041666666666666664,,,,,,,,,,,python,CPU,thread 2300490 (python),,[],,"[[1], [], []]","['long int', 'long int', 'Scalar']","[[1], [], []]","['', '', '1']",0.0,0.0,0.0,0.0,0.0,0.0,6,850 +aten::add_,"(16,)","(16,)","('float', 'float', None)","(1,)","(1,)",None,1.6e-08,0.00018310546875,0.08333333333333333,0.00010201639512774651,0.00010099062554990768,4.268934582028177e-06,9.786361373817821e-05,0.00010901469365123373,8.501366260645541e-06,8.415885462492306e-06,3.557445485023487e-07,8.155301144848183e-06,9.084557804269476e-06,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.621), 'mean_duration_us': np.float64(1.8850833333333332), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.07396447157626122), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.962)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]","[[16], [16], []]","['float', 'float', 'Scalar']","[[1], [1], []]","['', '', '1']",1.885009765625,1.9013671875,0.07718424959046567,1.76123046875,1.9619140625,22.6201171875,12,286 +aten::add_,(),(),"('long int', 'long int', None)",(),(),None,1e-09,2.288818359375e-05,0.041666666666666664,8.159373148075394e-06,6.712597892214445e-06,3.2424184530722574e-06,5.211748489025555e-06,1.275350285417748e-05,3.3997388116980807e-07,2.7969157884226854e-07,1.3510076887801073e-07,2.1715618704273142e-07,5.313959522573949e-07,python,CPU,thread 2300490 (python),,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(19.823999999999998), 'mean_duration_us': np.float64(3.304), 'median_duration_us': np.float64(3.5845000000000002), 'std_dev_duration_us': np.float64(1.0166421854975984), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.3)}]","[[], [], []]","['long int', 'long int', 'Scalar']","[[], [], []]","['', '', '1']",3.303955078125,3.58447265625,1.1137280126556983,1.8818359375,4.60498046875,19.82373046875,6,799 +aten::add_,"(16, 32, 32)","(16, 32, 32)","('float', 'float', None)","(1024, 32, 1)","(1024, 32, 1)",None,1.6384e-05,0.1875,0.08333333333333333,0.047958026130510166,0.0480332236803435,0.0033861364668778225,0.044635094113734626,0.05113056304761905,0.0039965021775425135,0.004002768640028624,0.00028217803890648525,0.0037195911761445516,0.004260880253968253,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.459999999999997), 'mean_duration_us': np.float64(4.114999999999999), 'median_duration_us': np.float64(4.105), 'std_dev_duration_us': np.float64(0.2519920633670832), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(4.405)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]","[[16, 32, 32], [16, 32, 32], []]","['float', 'float', 'Scalar']","[[1024, 32, 1], [1024, 32, 1], []]","['', '', '1']",4.114990234375,4.10498046875,0.29094638896929526,3.84521484375,4.40478515625,16.4599609375,4,333 +aten::add_,"(32, 32)","(32, 32)","('float', 'float', None)","(32, 1)","(32, 1)",None,1.024e-06,0.01171875,0.08333333333333333,0.005466037708706859,0.005466037708706859,0.0006164429592976079,0.005030146711972817,0.0059019287054409,0.0004555031423922382,0.0004555031423922382,5.1370246608134065e-05,0.00041917889266440136,0.000491827392120075,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.525), 'mean_duration_us': np.float64(2.2625), 'median_duration_us': np.float64(2.2625), 'std_dev_duration_us': np.float64(0.18050000000000008), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.26)}]","[[32, 32], [32, 32], []]","['float', 'float', 'Scalar']","[[32, 1], [32, 1], []]","['', '', '1']",2.262451171875,2.262451171875,0.25515230043791925,2.08203125,2.44287109375,4.52490234375,2,258 +aten::add,"(1,)",(),"('long int', 'Scalar', None)","(1,)",(),None,1e-09,1.9073486328125e-05,0.05,,,,,,,,,,,python,CPU,thread 2300490 (python),,[],,"[[1], [], []]","['long int', 'Scalar', 'Scalar']","[[1], [], []]","['', '1', '1']",0.0,0.0,0.0,0.0,0.0,0.0,6,849 +aten::add,"(1,)",(),"('long int', 'long int', None)","(1,)",(),None,1e-09,2.288818359375e-05,0.041666666666666664,,,,,,,,,,,python,CPU,thread 2300490 (python),,[],,"[[1], [], []]","['long int', 'long int', 'Scalar']","[[1], [], []]","['', '', '1']",0.0,0.0,0.0,0.0,0.0,0.0,6,850 diff --git a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Normalization.csv b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Normalization.csv index 094d37d07..7e40d9eba 100644 --- a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Normalization.csv +++ b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Normalization.csv @@ -1,23 +1,23 @@ name,param: op_shape,param: dtype_in_out,param: stride_input,param: stride_output,param: num_channels,param: has_bias,param: is_affine,param: is_training,param: output_mask,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::batch_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,,0.000655456,1.0003662109375,0.624862721171446,0.06029117081479473,0.06186871052394456,0.01901091404536839,0.027308055117709867,0.08236284476478933,0.0376737050579451,0.038659450813360474,0.011879211482345359,0.01706378563075202,0.051465471303147645,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(23.229000000000003), 'mean_duration_us': np.float64(3.8715000000000006), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.6369447254929844), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.269999999999996), 'mean_duration_us': np.float64(4.211666666666666), 'median_duration_us': np.float64(4.3055), 'std_dev_duration_us': np.float64(1.2830641276084198), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(6.128)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(70.05699999999999), 'mean_duration_us': np.float64(11.676166666666665), 'median_duration_us': np.float64(10.774999999999999), 'std_dev_duration_us': np.float64(8.576367051704093), 'min_duration_us': np.float64(3.685), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(3.87)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(4.21)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(11.68)}]","[[8, 16, 32, 32], [16], [16], [16], [16], [], [], [], []]","['float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [1], [1], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True']",19.759195963541668,16.98193359375,9.429794512765431,12.73583984375,38.412109375,118.55517578125,6,800 -aten::native_layer_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16384.0,True,True,True,"[True, True, True]",0.001179648,1.75,0.6428571428571429,0.05628963269412802,0.05683579419860258,0.001008475034056347,0.05512587657870418,0.0569072273050773,0.03618619244622515,0.03653729627053023,0.0006483053790362222,0.035438063514881255,0.03658321755326398,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleCUDAKernel(long, long, float const*, float const*, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.936999999999998), 'mean_duration_us': np.float64(4.312333333333332), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.16157626338323602), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.446)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.883), 'mean_duration_us': np.float64(28.29433333333333), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4143543840187468), 'min_duration_us': np.float64(27.84), 'max_duration_us': np.float64(28.842)}]","[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleC...', 'stream': 0, 'mean_duration_us': np.float64(4.31)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(28.29)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [], [8, 1, 1, 1], [8, 1, 1, 1], [16, 32, 32], [16, 32, 32], []]","['float', 'float', 'ScalarList', 'float', 'float', 'float', 'float', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [], [1, 1, 1, 1], [1, 1, 1, 1], [1024, 32, 1], [1024, 32, 1], []]","['', '', '[16, 32, 32]', '', '', '', '', '[True, True, True]']",32.6064453125,32.2861328125,0.5902431727220115,32.24560546875,33.28759765625,97.8193359375,3,152 -aten::instance_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,,0.000655456,1.0003662109375,0.624862721171446,0.07847361405809597,0.07186558594633613,0.02181711774215055,0.05680999814888272,0.11338911010239627,0.04903523602049969,0.04490612559300802,0.013632703560478026,0.03549845003305566,0.07085262788979203,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(24.952), 'mean_duration_us': np.float64(4.158666666666667), 'median_duration_us': np.float64(4.005), 'std_dev_duration_us': np.float64(0.37268470439352464), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.967)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(27.955000000000005), 'mean_duration_us': np.float64(4.659166666666668), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(1.7152123694231634), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.162), 'mean_duration_us': np.float64(5.360333333333333), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(1.6696030133604283), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(7.971)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.16)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.66)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.36)}]","[[8, 16, 32, 32], [16], [16], [], [], [], [], [], []]","['float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [], [], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True']",14.177978515625,14.718505859375,3.559129140800897,9.2509765625,18.46435546875,85.06787109375,6,833 -aten::layer_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16384.0,True,True,True,,0.000753664,1.375,0.5227272727272727,0.10577106830319778,0.10833763183487723,0.013194414901568887,0.082553959293223,0.1176222919056724,0.05528942206758067,0.05663103482277673,0.006897080516729191,0.04315320599418475,0.0614843798597833,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.0), 'mean_duration_us': np.float64(13.833333333333334), 'median_duration_us': np.float64(13.339), 'std_dev_duration_us': np.float64(1.7844332122242315), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(13.83)}]","[[8, 16, 32, 32], [], [16, 32, 32], [16, 32, 32], [], []]","['float', 'ScalarList', 'float', 'float', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [], [1024, 32, 1], [1024, 32, 1], [], []]","['', '[16, 32, 32]', '', '', '1.0000000000000001e-05', 'True']",13.833333333333334,13.339111328125,1.9547023334545126,12.2578125,17.46484375,83.0,6,811 -aten::native_layer_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16384.0,True,True,True,,0.000753664,1.375,0.5227272727272727,0.10577106830319778,0.10833763183487723,0.013194414901568887,0.082553959293223,0.1176222919056724,0.05528942206758067,0.05663103482277673,0.006897080516729191,0.04315320599418475,0.0614843798597833,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.0), 'mean_duration_us': np.float64(13.833333333333334), 'median_duration_us': np.float64(13.339), 'std_dev_duration_us': np.float64(1.7844332122242315), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(13.83)}]","[[8, 16, 32, 32], [], [16, 32, 32], [16, 32, 32], []]","['float', 'ScalarList', 'float', 'float', 'Scalar']","[[16384, 1024, 32, 1], [], [1024, 32, 1], [1024, 32, 1], []]","['', '[16, 32, 32]', '', '', '1.0000000000000001e-05']",13.833333333333334,13.339111328125,1.9547023334545126,12.2578125,17.46484375,83.0,6,812 -aten::group_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,,0.000655456,1.0003662109375,0.624862721171446,0.08244925142955863,0.08380426443270807,0.021253721865758506,0.05768561746462232,0.11588467364332723,0.051519463606822746,0.052366160719193394,0.01328065848005892,0.03604559190139899,0.0724120125148344,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","[[8, 16, 32, 32], [], [16], [16], [], []]","['float', 'Scalar', 'float', 'float', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [], [1], [1], [], []]","['', '4', '', '', '1.0000000000000001e-05', 'True']",13.451334635416666,12.517578125,3.476054549810176,9.0517578125,18.18408203125,80.7080078125,6,820 -aten::native_group_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,,0.000655456,1.0003662109375,0.624862721171446,0.08244925142955863,0.08380426443270807,0.021253721865758506,0.05768561746462232,0.11588467364332723,0.051519463606822746,0.052366160719193394,0.01328065848005892,0.03604559190139899,0.0724120125148344,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","[[8, 16, 32, 32], [16], [16], [], [], [], [], []]","['float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [], [], [], [], []]","['', '', '', '8', '16', '1024', '4', '1.0000000000000001e-05']",13.451334635416666,12.517578125,3.476054549810176,9.0517578125,18.18408203125,80.7080078125,6,821 -aten::native_layer_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16384.0,False,False,True,"[True, False, False]",0.001179648,1.5625,0.72,0.06680599771272798,0.06661193893554086,0.00219379562352543,0.06471567821944493,0.06909037598319813,0.04810031835316414,0.04796059603358942,0.001579532848938307,0.04659528831800035,0.04974507070790265,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(73.62700000000001), 'mean_duration_us': np.float64(24.542333333333335), 'median_duration_us': np.float64(24.596), 'std_dev_duration_us': np.float64(0.6555213362067043), 'min_duration_us': np.float64(23.714), 'max_duration_us': np.float64(25.317)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(24.54)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [], [8, 1, 1, 1], [8, 1, 1, 1], [], [], []]","['float', 'float', 'ScalarList', 'float', 'float', '', '', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [], [1, 1, 1, 1], [1, 1, 1, 1], [], [], []]","['', '', '[16, 32, 32]', '', '', '', '', '[True, False, False]']",24.542317708333332,24.59619140625,0.8028704426605566,23.7138671875,25.31689453125,73.626953125,3,55 -aten::miopen_batch_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,,0.000655456,1.0003662109375,0.624862721171446,0.061149659349069435,0.0737780781647091,0.029620350894417908,0.027308055117709867,0.08236284476478933,0.03821014253956648,0.046101170684799776,0.018508653061939044,0.01706378563075202,0.051465471303147645,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(4.178333333333334), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.74), 'mean_duration_us': np.float64(5.246666666666667), 'median_duration_us': np.float64(4.926), 'std_dev_duration_us': np.float64(0.6308519812303217), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(6.128)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.091), 'mean_duration_us': np.float64(12.363666666666667), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(12.076039232942046), 'min_duration_us': np.float64(3.685), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.18)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(5.25)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(12.36)}]","[[8, 16, 32, 32], [16], [16], [16], [16], [], [], []]","['float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [1], [1], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05']",21.78857421875,14.2177734375,14.41545950056331,12.73583984375,38.412109375,65.36572265625,3,803 -aten::batch_norm,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",,128.0,True,True,True,,0.000656128,1.0029296875,0.623904576436222,0.15285529675585438,0.13860793410654032,0.1016204193338914,0.056955575935475344,0.2679491296342374,0.09536711917849433,0.0864781244194408,0.06340144468178278,0.03553484447970382,0.1671746882309032,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]","[[1, 128, 32, 32], [128], [128], [], [], [], [], [], []]","['float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[131072, 1024, 32, 1], [1], [1], [], [], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True']",10.73388671875,10.513671875,7.042280180198284,3.9248046875,18.46435546875,64.4033203125,6,898 -aten::native_group_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,4.0,True,True,True,"[True, True, True]",0.001179648,1.50006103515625,0.749969483663588,0.08158110778877121,0.07823573877352762,0.008789629375982646,0.07495536086744072,0.0915522237253453,0.06118334128504826,0.05867441661202185,0.006591953804700008,0.05621423328757242,0.0686613739555505,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.327), 'mean_duration_us': np.float64(2.109), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.24552936009094037), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.403)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.370999999999999), 'mean_duration_us': np.float64(3.1236666666666664), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.624051992135983), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(4.005)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKernel1(long, long, long, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.415), 'mean_duration_us': np.float64(4.138333333333333), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.1359738536958077), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(4.325)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.216000000000001), 'mean_duration_us': np.float64(4.405333333333334), 'median_duration_us': np.float64(4.405), 'std_dev_duration_us': np.float64(0.1963675691712412), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.646)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.942), 'mean_duration_us': np.float64(5.647333333333333), 'median_duration_us': np.float64(4.726), 'std_dev_duration_us': np.float64(1.4759235150312575), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(7.73)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(3.12)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKer...', 'stream': 0, 'mean_duration_us': np.float64(4.14)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [8, 4], [8, 4], [16], [], [], [], [], []]","['float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [4, 1], [4, 1], [1], [], [], [], [], []]","['', '', '', '', '', '8', '16', '1024', '4', '[True, True, True]']",19.423502604166668,20.10498046875,1.9915551671802427,17.1806640625,20.98486328125,58.2705078125,3,123 -aten::native_batch_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,,0.000655456,1.0003662109375,0.624862721171446,0.05943268228052002,0.05938713108862719,0.004894991042083343,0.05456062579367095,0.06435028995926192,0.03713726757632372,0.037108804334604964,0.0030586974226660484,0.03409290110225022,0.040210097292115984,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.530000000000001), 'mean_duration_us': np.float64(3.176666666666667), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.8672271264720037), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(3.925)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.693999999999999), 'mean_duration_us': np.float64(3.564666666666666), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.7857575255057304), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.966), 'mean_duration_us': np.float64(10.988666666666667), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.5762877367735286), 'min_duration_us': np.float64(10.174), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.18)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.895), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.045)}, {'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.865000000000002), 'mean_duration_us': np.float64(6.288333333333334), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.17297462883967188), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.587), 'mean_duration_us': np.float64(6.862333333333333), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.8121807406948011), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.971)}]","[{'name': 'void at::native::batch_norm_transform_input_kernel(float const*, float const*, int, long, long, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.695), 'mean_duration_us': np.float64(3.8983333333333334), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.04988876515698577), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.965)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.782999999999998), 'mean_duration_us': np.float64(5.594333333333332), 'median_duration_us': np.float64(5.528), 'std_dev_duration_us': np.float64(0.2178077643754286), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::(anonymous namespace)::cuComputePartGradGammaBeta(float const*, float const*, long, long, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.707), 'mean_duration_us': np.float64(6.902333333333334), 'median_duration_us': np.float64(6.889), 'std_dev_duration_us': np.float64(0.5071320231348923), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::(anonymous namespace)::cuComputeGradGammaBeta(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.617), 'mean_duration_us': np.float64(4.539000000000001), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(1.026369329237775), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(5.968)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.738), 'mean_duration_us': np.float64(4.5793333333333335), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.6704099906441994), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.658999999999999), 'mean_duration_us': np.float64(4.886333333333333), 'median_duration_us': np.float64(4.446), 'std_dev_duration_us': np.float64(0.9517430792440201), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.208)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [8, 4], [8, 4], [], [], [], [], [], []]","['float', 'float', 'float', 'float', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [4, 1], [4, 1], [], [], [], [], [], []]","['', '', '', '', '', '8', '16', '1024', '4', '[True, False, False]']",14.004557291666666,13.056640625,3.2111962330970787,11.3740234375,17.5830078125,42.013671875,3,39 -aten::native_batch_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,True,[True],0.001179648,1.500244140625,0.7498779495524817,0.13861462663243995,0.13828439179328697,0.001021216688976221,0.13779939093242086,0.139760097171612,0.10394405199711688,0.10369641617306206,0.0007657878767782663,0.1033327247219846,0.104803015096304,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(34.048), 'mean_duration_us': np.float64(11.349333333333334), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.06798692684790375), 'min_duration_us': np.float64(11.256), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::batch_norm_backward_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(27.236000000000004), 'mean_duration_us': np.float64(4.539333333333334), 'median_duration_us': np.float64(4.2455), 'std_dev_duration_us': np.float64(0.5087467171611253), 'min_duration_us': np.float64(4.126), 'max_duration_us': np.float64(5.528)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}]","[[8, 16, 32, 32], [], [32, 32], []]","['float', 'ScalarList', 'float', '']","[[16384, 1024, 32, 1], [], [32, 1], []]","['', '[32, 32]', '', '']",4.539388020833333,4.24560546875,0.5572450517309505,4.1259765625,5.52783203125,27.236328125,6,912 -aten::native_batch_norm_backward,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",,128.0,True,True,True,[True],0.001179648,1.501953125,0.7490247074122237,0.24182137684950603,0.24883658200894926,0.029782389314002698,0.2091576276506063,0.2674699208889626,0.1811301860407223,0.186384748032711,0.022307745441957804,0.1566642308540302,0.2003415792354258,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.747), 'mean_duration_us': np.float64(6.582333333333334), 'median_duration_us': np.float64(6.329), 'std_dev_duration_us': np.float64(0.6938656610292484), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::batch_norm_backward_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.583), 'mean_duration_us': np.float64(5.861), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.705458716013914), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(6.849)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(5.86)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [], [8, 16, 1, 1], [], []]","['float', 'float', 'ScalarList', 'float', '', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [], [16, 1, 1, 1], [], []]","['', '', '[32, 32]', '', '', '[True, False]']",5.861002604166667,5.48681640625,0.864090943974899,5.2470703125,6.84912109375,17.5830078125,3,13 -aten::miopen_batch_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",,16.0,True,True,False,[True],0.000524336,1.00006103515625,0.5000152578577968,0.2067490101745708,0.20944165398868736,0.01852446773236728,0.18702557868152922,0.22377979785349592,0.10337765963428229,0.10472402262531696,0.00926251650987806,0.0935156429504485,0.1118933133270814,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.3), 'mean_duration_us': np.float64(5.1000000000000005), 'median_duration_us': np.float64(5.007), 'std_dev_duration_us': np.float64(0.38170407385827065), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.607)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.1)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [16], [16], [16], [16], [16], []]","['float', 'float', 'float', 'float', 'float', 'float', 'float', 'Scalar']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [1], [1], [1], [1], [1], []]","['', '', '', '', '', '', '', '1.0000000000000001e-05']",5.099934895833333,5.0068359375,0.4674548588682645,4.68603515625,5.60693359375,15.2998046875,3,167 -aten::miopen_batch_norm_backward,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",,128.0,True,True,False,[True],0.000524672,1.00048828125,0.5001220107369448,0.23711254933163992,0.2447632973342447,0.02942084384243977,0.20462211657142854,0.2619522340892465,0.11858520494270279,0.12241151241740716,0.014714011580058634,0.10233602438095238,0.13100807802974884,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.418), 'mean_duration_us': np.float64(4.472666666666666), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.4766930062652715), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.127)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.47)}]","[[1, 128, 32, 32], [1, 128, 32, 32], [128], [], [], [128], [128], []]","['float', 'float', 'float', '', '', 'float', 'float', 'Scalar']","[[131072, 1024, 32, 1], [131072, 1024, 32, 1], [1], [], [], [1], [1], []]","['', '', '', '', '', '', '', '1.0000000000000001e-05']",4.47265625,4.2861328125,0.5838267646323473,4.0048828125,5.126953125,13.41796875,3,88 -aten::miopen_batch_norm,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",,128.0,True,True,True,,0.000656128,1.0029296875,0.623904576436222,0.24405964575323438,0.25249415052754987,0.029040390437094794,0.21173565709791586,0.2679491296342374,0.15226992990884605,0.15753225603751467,0.018118432495198136,0.13210284545812032,0.1671746882309032,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]","[[1, 128, 32, 32], [128], [128], [], [], [], [], []]","['float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar']","[[131072, 1024, 32, 1], [1], [1], [], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05']",4.352213541666667,4.1650390625,0.5456305012929936,3.9248046875,4.966796875,13.056640625,3,901 +aten::batch_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,nan,0.000655456,1.0003662109375,0.624862721171446,0.05930285522681405,0.06186871052394456,0.021107107920548884,0.021378161589825754,0.08236284476478933,0.03705614349026334,0.038659450813360474,0.013189044891293557,0.013358416224661405,0.051465471303147645,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.285), 'mean_duration_us': np.float64(4.285), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.285), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.655), 'mean_duration_us': np.float64(10.655), 'median_duration_us': np.float64(10.655), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.655), 'max_duration_us': np.float64(10.655)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(29.441), 'mean_duration_us': np.float64(29.441), 'median_duration_us': np.float64(29.441), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(29.441), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.28)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(4.69)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(10.66)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(29.44)}]","[[8, 16, 32, 32], [16], [16], [16], [16], [], [], [], []]","['float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [1], [1], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True']",21.534993489583332,16.98193359375,13.687179389810174,12.73583984375,49.06689453125,129.2099609375,6,800 +aten::native_layer_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16384.0,True,True,True,"[True, True, True]",0.001179648,1.75,0.6428571428571429,0.05628963269412802,0.05683579419860258,0.001008475034056347,0.05512587657870418,0.0569072273050773,0.03618619244622515,0.03653729627053023,0.0006483053790362222,0.035438063514881255,0.03658321755326398,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleCUDAKernel(long, long, float const*, float const*, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.936999999999998), 'mean_duration_us': np.float64(4.312333333333332), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.16157626338323602), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.446)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.883), 'mean_duration_us': np.float64(28.29433333333333), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4143543840187468), 'min_duration_us': np.float64(27.84), 'max_duration_us': np.float64(28.842)}]","[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleC...', 'stream': 0, 'mean_duration_us': np.float64(4.31)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(28.29)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [], [8, 1, 1, 1], [8, 1, 1, 1], [16, 32, 32], [16, 32, 32], []]","['float', 'float', 'ScalarList', 'float', 'float', 'float', 'float', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [], [1, 1, 1, 1], [1, 1, 1, 1], [1024, 32, 1], [1024, 32, 1], []]","['', '', '[16, 32, 32]', '', '', '', '', '[True, True, True]']",32.6064453125,32.2861328125,0.5902431727220115,32.24560546875,33.28759765625,97.8193359375,3,152 +aten::instance_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,nan,0.000655456,1.0003662109375,0.624862721171446,0.07847361405809597,0.07186558594633613,0.02181711774215055,0.05680999814888272,0.11338911010239627,0.04903523602049969,0.04490612559300802,0.013632703560478026,0.03549845003305566,0.07085262788979203,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(24.952), 'mean_duration_us': np.float64(4.158666666666667), 'median_duration_us': np.float64(4.005), 'std_dev_duration_us': np.float64(0.37268470439352464), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.967)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(27.955000000000005), 'mean_duration_us': np.float64(4.659166666666668), 'median_duration_us': np.float64(4.966), 'std_dev_duration_us': np.float64(1.7152123694231634), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(32.162), 'mean_duration_us': np.float64(5.360333333333333), 'median_duration_us': np.float64(5.287), 'std_dev_duration_us': np.float64(1.6696030133604283), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(7.971)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.16)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.66)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.36)}]","[[8, 16, 32, 32], [16], [16], [], [], [], [], [], []]","['float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [], [], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True']",14.177978515625,14.718505859375,3.559129140800897,9.2509765625,18.46435546875,85.06787109375,6,833 +aten::layer_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16384.0,True,True,True,nan,0.000753664,1.375,0.5227272727272727,0.10577106830319778,0.10833763183487723,0.013194414901568887,0.082553959293223,0.1176222919056724,0.05528942206758067,0.05663103482277673,0.006897080516729191,0.04315320599418475,0.0614843798597833,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.0), 'mean_duration_us': np.float64(13.833333333333334), 'median_duration_us': np.float64(13.339), 'std_dev_duration_us': np.float64(1.7844332122242315), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(13.83)}]","[[8, 16, 32, 32], [], [16, 32, 32], [16, 32, 32], [], []]","['float', 'ScalarList', 'float', 'float', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [], [1024, 32, 1], [1024, 32, 1], [], []]","['', '[16, 32, 32]', '', '', '1.0000000000000001e-05', 'True']",13.833333333333334,13.339111328125,1.9547023334545126,12.2578125,17.46484375,83.0,6,811 +aten::native_layer_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16384.0,True,True,True,nan,0.000753664,1.375,0.5227272727272727,0.10577106830319778,0.10833763183487723,0.013194414901568887,0.082553959293223,0.1176222919056724,0.05528942206758067,0.05663103482277673,0.006897080516729191,0.04315320599418475,0.0614843798597833,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(83.0), 'mean_duration_us': np.float64(13.833333333333334), 'median_duration_us': np.float64(13.339), 'std_dev_duration_us': np.float64(1.7844332122242315), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(13.83)}]","[[8, 16, 32, 32], [], [16, 32, 32], [16, 32, 32], []]","['float', 'ScalarList', 'float', 'float', 'Scalar']","[[16384, 1024, 32, 1], [], [1024, 32, 1], [1024, 32, 1], []]","['', '[16, 32, 32]', '', '', '1.0000000000000001e-05']",13.833333333333334,13.339111328125,1.9547023334545126,12.2578125,17.46484375,83.0,6,812 +aten::group_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,nan,0.000655456,1.0003662109375,0.624862721171446,0.08244925142955863,0.08380426443270807,0.021253721865758506,0.05768561746462232,0.11588467364332723,0.051519463606822746,0.052366160719193394,0.01328065848005892,0.03604559190139899,0.0724120125148344,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","[[8, 16, 32, 32], [], [16], [16], [], []]","['float', 'Scalar', 'float', 'float', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [], [1], [1], [], []]","['', '4', '', '', '1.0000000000000001e-05', 'True']",13.451334635416666,12.517578125,3.476054549810176,9.0517578125,18.18408203125,80.7080078125,6,820 +aten::native_group_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,nan,0.000655456,1.0003662109375,0.624862721171446,0.08244925142955863,0.08380426443270807,0.021253721865758506,0.05768561746462232,0.11588467364332723,0.051519463606822746,0.052366160719193394,0.01328065848005892,0.03604559190139899,0.0724120125148344,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","[[8, 16, 32, 32], [16], [16], [], [], [], [], []]","['float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [], [], [], [], []]","['', '', '', '8', '16', '1024', '4', '1.0000000000000001e-05']",13.451334635416666,12.517578125,3.476054549810176,9.0517578125,18.18408203125,80.7080078125,6,821 +aten::miopen_batch_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,nan,0.000655456,1.0003662109375,0.624862721171446,0.059173028173108065,0.0737780781647091,0.03301156629774701,0.021378161589825754,0.08236284476478933,0.03697501940420294,0.046101170684799776,0.02062769714694179,0.013358416224661405,0.051465471303147645,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.285), 'mean_duration_us': np.float64(4.285), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.285), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.655), 'mean_duration_us': np.float64(10.655), 'median_duration_us': np.float64(10.655), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.655), 'max_duration_us': np.float64(10.655)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(29.441), 'mean_duration_us': np.float64(29.441), 'median_duration_us': np.float64(29.441), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(29.441), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.28)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(4.69)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(10.66)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(29.44)}]","[[8, 16, 32, 32], [16], [16], [16], [16], [], [], []]","['float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar']","[[16384, 1024, 32, 1], [1], [1], [1], [1], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05']",25.340169270833332,14.2177734375,20.56130225646085,12.73583984375,49.06689453125,76.0205078125,3,803 +aten::native_layer_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16384.0,False,False,True,"[True, False, False]",0.001179648,1.5625,0.72,0.06680599771272798,0.06661193893554086,0.00219379562352543,0.06471567821944493,0.06909037598319813,0.04810031835316414,0.04796059603358942,0.001579532848938307,0.04659528831800035,0.04974507070790265,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(73.62700000000001), 'mean_duration_us': np.float64(24.542333333333335), 'median_duration_us': np.float64(24.596), 'std_dev_duration_us': np.float64(0.6555213362067043), 'min_duration_us': np.float64(23.714), 'max_duration_us': np.float64(25.317)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(24.54)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [], [8, 1, 1, 1], [8, 1, 1, 1], [], [], []]","['float', 'float', 'ScalarList', 'float', 'float', '', '', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [], [1, 1, 1, 1], [1, 1, 1, 1], [], [], []]","['', '', '[16, 32, 32]', '', '', '', '', '[True, False, False]']",24.542317708333332,24.59619140625,0.8028704426605566,23.7138671875,25.31689453125,73.626953125,3,55 +aten::batch_norm,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",None,128.0,True,True,True,nan,0.000656128,1.0029296875,0.623904576436222,0.15285529675585438,0.13860793410654032,0.1016204193338914,0.056955575935475344,0.2679491296342374,0.09536711917849433,0.0864781244194408,0.06340144468178278,0.03553484447970382,0.1671746882309032,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]","[[1, 128, 32, 32], [128], [128], [], [], [], [], [], []]","['float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar']","[[131072, 1024, 32, 1], [1], [1], [], [], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True']",10.73388671875,10.513671875,7.042280180198284,3.9248046875,18.46435546875,64.4033203125,6,898 +aten::native_group_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,4.0,True,True,True,"[True, True, True]",0.001179648,1.50006103515625,0.749969483663588,0.08158110778877121,0.07823573877352762,0.008789629375982646,0.07495536086744072,0.0915522237253453,0.06118334128504826,0.05867441661202185,0.006591953804700008,0.05621423328757242,0.0686613739555505,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.327), 'mean_duration_us': np.float64(2.109), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.24552936009094037), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.403)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.370999999999999), 'mean_duration_us': np.float64(3.1236666666666664), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.624051992135983), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(4.005)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKernel1(long, long, long, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.415), 'mean_duration_us': np.float64(4.138333333333333), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.1359738536958077), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(4.325)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.216000000000001), 'mean_duration_us': np.float64(4.405333333333334), 'median_duration_us': np.float64(4.405), 'std_dev_duration_us': np.float64(0.1963675691712412), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.646)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.942), 'mean_duration_us': np.float64(5.647333333333333), 'median_duration_us': np.float64(4.726), 'std_dev_duration_us': np.float64(1.4759235150312575), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(7.73)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(3.12)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKer...', 'stream': 0, 'mean_duration_us': np.float64(4.14)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [8, 4], [8, 4], [16], [], [], [], [], []]","['float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [4, 1], [4, 1], [1], [], [], [], [], []]","['', '', '', '', '', '8', '16', '1024', '4', '[True, True, True]']",19.423502604166668,20.10498046875,1.9915551671802427,17.1806640625,20.98486328125,58.2705078125,3,123 +aten::native_batch_norm,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,nan,0.000655456,1.0003662109375,0.624862721171446,0.05943268228052002,0.05938713108862719,0.004894991042083343,0.05456062579367095,0.06435028995926192,0.03713726757632372,0.037108804334604964,0.0030586974226660484,0.03409290110225022,0.040210097292115984,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.530000000000001), 'mean_duration_us': np.float64(3.176666666666667), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.8672271264720037), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(3.925)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.693999999999999), 'mean_duration_us': np.float64(3.564666666666666), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.7857575255057304), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.966), 'mean_duration_us': np.float64(10.988666666666667), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.5762877367735286), 'min_duration_us': np.float64(10.174), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.18)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.895), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.045)}, {'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.865000000000002), 'mean_duration_us': np.float64(6.288333333333334), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.17297462883967188), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.587), 'mean_duration_us': np.float64(6.862333333333333), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.8121807406948011), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.971)}]","[{'name': 'void at::native::batch_norm_transform_input_kernel(float const*, float const*, int, long, long, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.695), 'mean_duration_us': np.float64(3.8983333333333334), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.04988876515698577), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.965)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.782999999999998), 'mean_duration_us': np.float64(5.594333333333332), 'median_duration_us': np.float64(5.528), 'std_dev_duration_us': np.float64(0.2178077643754286), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::(anonymous namespace)::cuComputePartGradGammaBeta(float const*, float const*, long, long, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.707), 'mean_duration_us': np.float64(6.902333333333334), 'median_duration_us': np.float64(6.889), 'std_dev_duration_us': np.float64(0.5071320231348923), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::(anonymous namespace)::cuComputeGradGammaBeta(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.617), 'mean_duration_us': np.float64(4.539000000000001), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(1.026369329237775), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(5.968)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.738), 'mean_duration_us': np.float64(4.5793333333333335), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.6704099906441994), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.658999999999999), 'mean_duration_us': np.float64(4.886333333333333), 'median_duration_us': np.float64(4.446), 'std_dev_duration_us': np.float64(0.9517430792440201), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.208)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [8, 4], [8, 4], [], [], [], [], [], []]","['float', 'float', 'float', 'float', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [4, 1], [4, 1], [], [], [], [], [], []]","['', '', '', '', '', '8', '16', '1024', '4', '[True, False, False]']",14.004557291666666,13.056640625,3.2111962330970787,11.3740234375,17.5830078125,42.013671875,3,39 +aten::native_batch_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,True,[True],0.001179648,1.500244140625,0.7498779495524817,0.13861462663243995,0.13828439179328697,0.001021216688976221,0.13779939093242086,0.139760097171612,0.10394405199711688,0.10369641617306206,0.0007657878767782663,0.1033327247219846,0.104803015096304,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(34.048), 'mean_duration_us': np.float64(11.349333333333334), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.06798692684790375), 'min_duration_us': np.float64(11.256), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::batch_norm_backward_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(27.236000000000004), 'mean_duration_us': np.float64(4.539333333333334), 'median_duration_us': np.float64(4.2455), 'std_dev_duration_us': np.float64(0.5087467171611253), 'min_duration_us': np.float64(4.126), 'max_duration_us': np.float64(5.528)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}]","[[8, 16, 32, 32], [], [32, 32], []]","['float', 'ScalarList', 'float', '']","[[16384, 1024, 32, 1], [], [32, 1], []]","['', '[32, 32]', '', '']",4.539388020833333,4.24560546875,0.5572450517309505,4.1259765625,5.52783203125,27.236328125,6,912 +aten::miopen_batch_norm_backward,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",None,128.0,True,True,False,[True],0.000524672,1.00048828125,0.5001220107369448,0.19342844135154588,0.2447632973342447,0.10415582864872205,0.07356979263114641,0.2619522340892465,0.09673782102244834,0.12241151241740716,0.052090622453771565,0.036793872620189016,0.13100807802974884,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(9.13)}]","[[1, 128, 32, 32], [1, 128, 32, 32], [128], [], [], [128], [128], []]","['float', 'float', 'float', '', '', 'float', 'float', 'Scalar']","[[131072, 1024, 32, 1], [131072, 1024, 32, 1], [1], [], [], [1], [1], []]","['', '', '', '', '', '', '', '1.0000000000000001e-05']",7.516927083333333,4.2861328125,5.841162477612149,4.0048828125,14.259765625,22.55078125,3,88 +aten::native_batch_norm_backward,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",None,128.0,True,True,True,[True],0.001179648,1.501953125,0.7490247074122237,0.24182137684950603,0.24883658200894926,0.029782389314002698,0.2091576276506063,0.2674699208889626,0.1811301860407223,0.186384748032711,0.022307745441957804,0.1566642308540302,0.2003415792354258,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.747), 'mean_duration_us': np.float64(6.582333333333334), 'median_duration_us': np.float64(6.329), 'std_dev_duration_us': np.float64(0.6938656610292484), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::batch_norm_backward_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.583), 'mean_duration_us': np.float64(5.861), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.705458716013914), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(6.849)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(5.86)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [], [8, 16, 1, 1], [], []]","['float', 'float', 'ScalarList', 'float', '', 'ScalarList']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [], [16, 1, 1, 1], [], []]","['', '', '[32, 32]', '', '', '[True, False]']",5.861002604166667,5.48681640625,0.864090943974899,5.2470703125,6.84912109375,17.5830078125,3,13 +aten::miopen_batch_norm_backward,"(8, 16, 32, 32)","('float', None)","(16384, 1024, 32, 1)",None,16.0,True,True,False,[True],0.000524336,1.00006103515625,0.5000152578577968,0.2067490101745708,0.20944165398868736,0.01852446773236728,0.18702557868152922,0.22377979785349592,0.10337765963428229,0.10472402262531696,0.00926251650987806,0.0935156429504485,0.1118933133270814,python,CPU,thread 2300680 (pt_autograd_0),vector_fp32,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.3), 'mean_duration_us': np.float64(5.1000000000000005), 'median_duration_us': np.float64(5.007), 'std_dev_duration_us': np.float64(0.38170407385827065), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.607)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.1)}]","[[8, 16, 32, 32], [8, 16, 32, 32], [16], [16], [16], [16], [16], []]","['float', 'float', 'float', 'float', 'float', 'float', 'float', 'Scalar']","[[16384, 1024, 32, 1], [16384, 1024, 32, 1], [1], [1], [1], [1], [1], []]","['', '', '', '', '', '', '', '1.0000000000000001e-05']",5.099934895833333,5.0068359375,0.4674548588682645,4.68603515625,5.60693359375,15.2998046875,3,167 +aten::miopen_batch_norm,"(1, 128, 32, 32)","('float', None)","(131072, 1024, 32, 1)",None,128.0,True,True,True,nan,0.000656128,1.0029296875,0.623904576436222,0.24405964575323438,0.25249415052754987,0.029040390437094794,0.21173565709791586,0.2679491296342374,0.15226992990884605,0.15753225603751467,0.018118432495198136,0.13210284545812032,0.1671746882309032,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]","[[1, 128, 32, 32], [128], [128], [], [], [], [], []]","['float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar']","[[131072, 1024, 32, 1], [1], [1], [], [], [], [], []]","['', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05']",4.352213541666667,4.1650390625,0.5456305012929936,3.9248046875,4.966796875,13.056640625,3,901 diff --git a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Reduce_fwd.csv b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Reduce_fwd.csv index f9fbb53ff..e9327d1c8 100644 --- a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Reduce_fwd.csv +++ b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/Reduce_fwd.csv @@ -1,3 +1,3 @@ name,param: num_input_elems,param: num_output_elems,param: dtype_in_out,param: reduce_type,GFLOPS_first,Data Moved (MB)_first,FLOPS/Byte_first,TB/s_mean,TB/s_median,TB/s_std,TB/s_min,TB/s_max,TFLOPS/s_mean,TFLOPS/s_median,TFLOPS/s_std,TFLOPS/s_min,TFLOPS/s_max,process_name_first,process_label_first,thread_name_first,Compute Spec,kernel_details__summarize_kernel_stats,trunc_kernel_details,Input Dims_first,Input type_first,Input Strides_first,Concrete Inputs_first,Kernel Time (µs)_mean,Kernel Time (µs)_median,Kernel Time (µs)_std,Kernel Time (µs)_min,Kernel Time (µs)_max,Kernel Time (µs)_sum,name_count,UID_first -aten::mean,131072,1,"('float', None)",mean,0.000131072,0.5000038146972656,0.249998092665919,0.050730715927089075,0.0493973416754842,0.006368456045274941,0.04513451097099622,0.057660295134786814,0.012682582221348828,0.01234924120163776,0.0015921018645454767,0.01128354165615805,0.014414963806250672,python,CPU,thread 2300490 (python),vector_fp32,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.323), 'mean_duration_us': np.float64(10.441), 'median_duration_us': np.float64(10.614), 'std_dev_duration_us': np.float64(1.0372492468061858), 'min_duration_us': np.float64(9.093), 'max_duration_us': np.float64(11.616)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.323), 'mean_duration_us': np.float64(10.441), 'median_duration_us': np.float64(10.614), 'std_dev_duration_us': np.float64(1.0372492468061858), 'min_duration_us': np.float64(9.093), 'max_duration_us': np.float64(11.616)}]","[{'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(2.28)}, {'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.992), 'mean_duration_us': np.float64(4.332), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.99894327499947), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp(long, long, float const*, float const*, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.936999999999998), 'mean_duration_us': np.float64(4.312333333333332), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.16157626338323602), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.446)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.883), 'mean_duration_us': np.float64(28.29433333333333), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4143543840187468), 'min_duration_us': np.float64(27.84), 'max_duration_us': np.float64(28.842)}]","[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleC...', 'stream': 0, 'mean_duration_us': np.float64(4.31)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(28.29)}]",9.860907522058989,9.860907522058989 -aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (), (), ())","('float', 'float', 'ScalarList', 'float', 'float', '', '', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (), (), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, False, False]')",3,24.542317708333332,24.542317708333332,24.59619140625,24.59619140625,0.8028704426605566,0.8028704426605566,23.7138671875,23.7138671875,25.31689453125,25.31689453125,73.626953125,73.626953125,55,"[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(73.62700000000001), 'mean_duration_us': np.float64(24.542333333333335), 'median_duration_us': np.float64(24.596), 'std_dev_duration_us': np.float64(0.6555213362067043), 'min_duration_us': np.float64(23.714), 'max_duration_us': np.float64(25.317)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(24.54)}]",7.422137647310147,17.283045169369135 -aten::miopen_batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (16,), (16,), (16,), (16,), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",3,21.78857421875,21.78857421875,14.2177734375,14.2177734375,14.41545950056331,14.41545950056331,12.73583984375,12.73583984375,38.412109375,38.412109375,65.36572265625,65.36572265625,803,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(4.178333333333334), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.74), 'mean_duration_us': np.float64(5.246666666666667), 'median_duration_us': np.float64(4.926), 'std_dev_duration_us': np.float64(0.6308519812303217), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(6.128)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.091), 'mean_duration_us': np.float64(12.363666666666667), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(12.076039232942046), 'min_duration_us': np.float64(3.685), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.18)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(5.25)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(12.36)}]",6.589344939303937,23.872390108673073 -aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (16,), (), (), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (1,), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, True, True]')",3,19.423502604166668,19.423502604166668,20.10498046875,20.10498046875,1.9915551671802427,1.9915551671802427,17.1806640625,17.1806640625,20.98486328125,20.98486328125,58.2705078125,58.2705078125,123,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.327), 'mean_duration_us': np.float64(2.109), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.24552936009094037), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.403)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.370999999999999), 'mean_duration_us': np.float64(3.1236666666666664), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.624051992135983), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(4.005)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKernel1(long, long, long, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.415), 'mean_duration_us': np.float64(4.138333333333333), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.1359738536958077), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(4.325)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.216000000000001), 'mean_duration_us': np.float64(4.405333333333334), 'median_duration_us': np.float64(4.405), 'std_dev_duration_us': np.float64(0.1963675691712412), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.646)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.942), 'mean_duration_us': np.float64(5.647333333333333), 'median_duration_us': np.float64(4.726), 'std_dev_duration_us': np.float64(1.4759235150312575), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(7.73)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(3.12)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKer...', 'stream': 0, 'mean_duration_us': np.float64(4.14)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",5.874095170402806,29.74648527907588 -aten::native_batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (16,), (16,), (), (), ())","('float', '', '', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",3,17.729817708333332,17.729817708333332,17.6630859375,17.6630859375,1.463543802533565,1.463543802533565,16.30078125,16.30078125,19.2255859375,19.2255859375,53.189453125,53.189453125,922,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.530000000000001), 'mean_duration_us': np.float64(3.176666666666667), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.8672271264720037), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(3.925)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.693999999999999), 'mean_duration_us': np.float64(3.564666666666666), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.7857575255057304), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.966), 'mean_duration_us': np.float64(10.988666666666667), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.5762877367735286), 'min_duration_us': np.float64(10.174), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.18)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.895), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.045)}, {'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.865000000000002), 'mean_duration_us': np.float64(6.288333333333334), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.17297462883967188), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.587), 'mean_duration_us': np.float64(6.862333333333333), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.8121807406948011), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.971)}]","[{'name': 'void at::native::batch_norm_transform_input_kernel(float const*, float const*, int, long, long, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.695), 'mean_duration_us': np.float64(3.8983333333333334), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.04988876515698577), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.965)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.782999999999998), 'mean_duration_us': np.float64(5.594333333333332), 'median_duration_us': np.float64(5.528), 'std_dev_duration_us': np.float64(0.2178077643754286), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::(anonymous namespace)::cuComputePartGradGammaBeta(float const*, float const*, long, long, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.707), 'mean_duration_us': np.float64(6.902333333333334), 'median_duration_us': np.float64(6.889), 'std_dev_duration_us': np.float64(0.5071320231348923), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::(anonymous namespace)::cuComputeGradGammaBeta(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]",4.820934062742728,50.0636444808471 -aten::native_layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (16, 32, 32), (16, 32, 32), ())","('float', 'ScalarList', 'float', 'float', 'Scalar')","((16384, 1024, 32, 1), (), (1024, 32, 1), (1024, 32, 1), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05')",3,14.781412760416666,14.781412760416666,14.18115234375,14.18115234375,2.4393353684496706,2.4393353684496706,12.6982421875,12.6982421875,17.46484375,17.46484375,44.34423828125,44.34423828125,812,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.344), 'mean_duration_us': np.float64(14.781333333333334), 'median_duration_us': np.float64(14.181), 'std_dev_duration_us': np.float64(1.99187890082594), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(14.78)}]",4.470224916543529,54.53386939739063 -aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (), (), (), (), (), ())","('float', 'float', 'float', 'float', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, False, False]')",3,14.004557291666666,14.004557291666666,13.056640625,13.056640625,3.2111962330970787,3.2111962330970787,11.3740234375,11.3740234375,17.5830078125,17.5830078125,42.013671875,42.013671875,39,"[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.617), 'mean_duration_us': np.float64(4.539000000000001), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(1.026369329237775), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(5.968)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.738), 'mean_duration_us': np.float64(4.5793333333333335), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.6704099906441994), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.658999999999999), 'mean_duration_us': np.float64(4.886333333333333), 'median_duration_us': np.float64(4.446), 'std_dev_duration_us': np.float64(0.9517430792440201), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.208)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",4.235286705342297,58.76915610273293 -aten::native_layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), ())","('float', 'ScalarList', '', '', 'Scalar')","((16384, 1024, 32, 1), (), (), (), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05')",3,12.88525390625,12.88525390625,12.41796875,12.41796875,0.9514369086207531,0.9514369086207531,12.2578125,12.2578125,13.97998046875,13.97998046875,38.65576171875,38.65576171875,935,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(38.656), 'mean_duration_us': np.float64(12.885333333333334), 'median_duration_us': np.float64(12.418), 'std_dev_duration_us': np.float64(0.7767974138874454), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(13.98)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(12.89)}]",3.8967846985476458,62.66594080128058 -aten::native_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (16,), (16,), (16,), (16,), (), (), ())","('float', 'float', '', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, False, False]')",3,11.349283854166666,11.349283854166666,11.3759765625,11.3759765625,0.0833479550567492,0.0833479550567492,11.255859375,11.255859375,11.416015625,11.416015625,34.0478515625,34.0478515625,60,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(34.048), 'mean_duration_us': np.float64(11.349333333333334), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.06798692684790375), 'min_duration_us': np.float64(11.256), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.736), 'mean_duration_us': np.float64(3.9120000000000004), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.0972787552243353), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(4.767)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.149), 'mean_duration_us': np.float64(7.049666666666667), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.4280197295556465), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.651)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.05)}]",3.315025905715599,69.413240217799 -aten::mean,reduce,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), ())","('float', 'ScalarList', 'Scalar', '', 'float')","((16384, 1024, 32, 1), (), (), (), ())","('', '[]', 'False', '', '')",3,10.44091796875,10.44091796875,10.61376953125,10.61376953125,1.2705677672188844,1.2705677672188844,9.0927734375,9.0927734375,11.6162109375,11.6162109375,31.32275390625,31.32275390625,988,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.323), 'mean_duration_us': np.float64(10.441), 'median_duration_us': np.float64(10.614), 'std_dev_duration_us': np.float64(1.0372492468061858), 'min_duration_us': np.float64(9.093), 'max_duration_us': np.float64(11.616)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.992), 'mean_duration_us': np.float64(4.332), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.99894327499947), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.621), 'mean_duration_us': np.float64(1.8850833333333332), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.07396447157626122), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.962)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]",2.2802739518349595,77.47123200554441 -aten::copy_,elementwise,python,CPU,thread 2300490 (python),"((8, 16), (8, 16), ())","('float', 'float', 'Scalar')","((16, 1), (0, 1), ())","('', '', 'False')",6,3.444091796875,3.444091796875,3.50390625,3.50390625,0.8804555436695012,0.8804555436695012,2.08203125,2.08203125,4.52587890625,4.52587890625,20.66455078125,20.66455078125,844,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(20.665000000000003), 'mean_duration_us': np.float64(3.4441666666666673), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.8038002273920775), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]",2.0831384949187783,79.5543705004632 -aten::add_,elementwise,python,CPU,thread 2300490 (python),"((), (), ())","('long int', 'long int', 'Scalar')","((), (), ())","('', '', '1')",6,3.303955078125,3.303955078125,3.58447265625,3.58447265625,1.1137280126556983,1.1137280126556983,1.8818359375,1.8818359375,4.60498046875,4.60498046875,19.82373046875,19.82373046875,799,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(19.823999999999998), 'mean_duration_us': np.float64(3.304), 'median_duration_us': np.float64(3.5845000000000002), 'std_dev_duration_us': np.float64(1.0166421854975984), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.3)}]",1.9983776317952666,81.55274813225846 -aten::native_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (), (), (), (128,), (128,), (), (), ())","('float', 'float', '', '', '', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (), (), (), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, False, False]')",3,6.582356770833333,6.582356770833333,6.3291015625,6.3291015625,0.849598477465432,0.849598477465432,5.88818359375,5.88818359375,7.52978515625,7.52978515625,19.7470703125,19.7470703125,23,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.747), 'mean_duration_us': np.float64(6.582333333333334), 'median_duration_us': np.float64(6.329), 'std_dev_duration_us': np.float64(0.6938656610292484), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::batch_norm_backward_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.583), 'mean_duration_us': np.float64(5.861), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.705458716013914), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(6.849)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(5.86)}]",1.7724963304748282,85.31589418772809 -aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((16, 32, 32), (16, 32, 32), ())","('float', 'float', 'Scalar')","((1024, 32, 1), (1024, 32, 1), ())","('', '', '1')",4,4.114990234375,4.114990234375,4.10498046875,4.10498046875,0.29094638896929526,0.29094638896929526,3.84521484375,3.84521484375,4.40478515625,4.40478515625,16.4599609375,16.4599609375,333,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.459999999999997), 'mean_duration_us': np.float64(4.114999999999999), 'median_duration_us': np.float64(4.105), 'std_dev_duration_us': np.float64(0.2519920633670832), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(4.405)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]",1.6592849569649113,86.975179144693 -aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (16,), (16,), (16,), (16,), (16,), ())","('float', 'float', 'float', 'float', 'float', 'float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",3,5.099934895833333,5.099934895833333,5.0068359375,5.0068359375,0.4674548588682645,0.4674548588682645,4.68603515625,4.68603515625,5.60693359375,5.60693359375,15.2998046875,15.2998046875,167,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.3), 'mean_duration_us': np.float64(5.1000000000000005), 'median_duration_us': np.float64(5.007), 'std_dev_duration_us': np.float64(0.38170407385827065), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.607)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.1)}]",1.5423326858955364,88.51751183058853 -aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (32, 32), ())","('float', 'ScalarList', 'float', '')","((16384, 1024, 32, 1), (), (32, 1), ())","('', '[32, 32]', '', '')",3,4.61962890625,4.61962890625,4.205078125,4.205078125,0.7875207625785555,0.7875207625785555,4.1259765625,4.1259765625,5.52783203125,5.52783203125,13.85888671875,13.85888671875,912,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.859000000000002), 'mean_duration_us': np.float64(4.619666666666667), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.6430978843760011), 'min_duration_us': np.float64(4.126), 'max_duration_us': np.float64(5.528)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.62)}]",1.3970775714486823,89.91458940203721 -aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (128,), (), (), (128,), (128,), ())","('float', 'float', 'float', '', '', 'float', 'float', 'Scalar')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (1,), (), (), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",3,4.47265625,4.47265625,4.2861328125,4.2861328125,0.5838267646323473,0.5838267646323473,4.0048828125,4.0048828125,5.126953125,5.126953125,13.41796875,13.41796875,88,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.418), 'mean_duration_us': np.float64(4.472666666666666), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.4766930062652715), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.127)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.47)}]",1.3526298017619627,91.26721920379917 -aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'ScalarList', '', '')","((16384, 1024, 32, 1), (), (), ())","('', '[32, 32]', '', '')",3,4.459147135416667,4.459147135416667,4.24609375,4.24609375,0.3698653385043163,0.3698653385043163,4.2451171875,4.2451171875,4.88623046875,4.88623046875,13.37744140625,13.37744140625,975,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.377000000000002), 'mean_duration_us': np.float64(4.4590000000000005), 'median_duration_us': np.float64(4.246), 'std_dev_duration_us': np.float64(0.30193487156449256), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.886)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",1.348544347848344,92.61576355164752 -aten::normal_,elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'Scalar', 'Scalar', '')","((16384, 1024, 32, 1), (), (), ())","('', '0.', '1.', '')",3,4.458821614583333,4.458821614583333,4.365234375,4.365234375,0.3500872140033832,0.3500872140033832,4.1650390625,4.1650390625,4.84619140625,4.84619140625,13.37646484375,13.37646484375,982,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.376000000000001), 'mean_duration_us': np.float64(4.458666666666667), 'median_duration_us': np.float64(4.365), 'std_dev_duration_us': np.float64(0.28579751962223576), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.846)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",1.3484459031757268,93.96420945482325 -aten::mse_loss_backward,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((), (8, 16, 32, 32), (8, 16, 32, 32), (), (8, 16, 32, 32))","('float', 'float', 'float', 'Scalar', 'float')","((), (16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (16384, 1024, 32, 1))","('', '', '', '1', '')",3,4.446451822916667,4.446451822916667,4.2861328125,4.2861328125,0.9320300852322503,0.9320300852322503,3.60498046875,3.60498046875,5.4482421875,5.4482421875,13.33935546875,13.33935546875,9,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.339), 'mean_duration_us': np.float64(4.4463333333333335), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.7608952329693989), 'min_duration_us': np.float64(3.605), 'max_duration_us': np.float64(5.448)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]",1.3447050056162686,95.30891446043951 -aten::miopen_batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((1, 128, 32, 32), (128,), (128,), (), (), (), (), ())","('float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar')","((131072, 1024, 32, 1), (1,), (1,), (), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",3,4.352213541666667,4.352213541666667,4.1650390625,4.1650390625,0.5456305012929936,0.5456305012929936,3.9248046875,3.9248046875,4.966796875,4.966796875,13.056640625,13.056640625,901,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]",1.3162052728935547,96.62511973333307 -aten::mse_loss,elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (8, 16, 32, 32), ())","('float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), ())","('', '', '1')",3,3.77783203125,14.21875,3.48388671875,14.09765625,0.6160871136487144,1.8257682150170187,3.36376953125,12.45654296875,4.48583984375,16.10205078125,11.33349609375,42.65625,984,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.334), 'mean_duration_us': np.float64(3.778), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(0.503022862303494), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(4.486)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]",1.1424996480602956,97.76761938139336 -aten::fill_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), ())","('float', 'Scalar')","((16384, 1024, 32, 1), ())","('', '0')",3,3.150390625,3.150390625,2.9228515625,2.9228515625,0.57578505122717,0.57578505122717,2.72314453125,2.72314453125,3.80517578125,3.80517578125,9.451171875,9.451171875,8,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.451), 'mean_duration_us': np.float64(3.1503333333333337), 'median_duration_us': np.float64(2.923), 'std_dev_duration_us': np.float64(0.4700647709506521), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(3.805)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.15)}]",0.9527475415904131,98.72036692298377 -aten::fill_,elementwise,python,CPU,thread 2300490 (python),"((), ())","('float', 'Scalar')","((), ())","('', '1.')",3,2.7229817708333335,2.7229817708333335,3.04296875,3.04296875,0.772600022376397,0.772600022376397,1.841796875,1.841796875,3.2841796875,3.2841796875,8.1689453125,8.1689453125,993,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.169), 'mean_duration_us': np.float64(2.7230000000000003), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.6306826988800839), 'min_duration_us': np.float64(1.842), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",0.8234896864438732,99.54385660942765 -aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((32, 32), (32, 32), ())","('float', 'float', 'Scalar')","((32, 1), (32, 1), ())","('', '', '1')",2,2.262451171875,2.262451171875,2.262451171875,2.262451171875,0.25515230043791925,0.25515230043791925,2.08203125,2.08203125,2.44287109375,2.44287109375,4.52490234375,4.52490234375,258,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.525), 'mean_duration_us': np.float64(2.2625), 'median_duration_us': np.float64(2.2625), 'std_dev_duration_us': np.float64(0.18050000000000008), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.26)}]",0.4561433905723475,100.0 +aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (16, 32, 32), (16, 32, 32), ())","('float', 'float', 'ScalarList', 'float', 'float', 'float', 'float', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (1024, 32, 1), (1024, 32, 1), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, True, True]')",3,32.6064453125,32.6064453125,32.2861328125,32.2861328125,0.5902431727220115,0.5902431727220115,32.24560546875,32.24560546875,33.28759765625,33.28759765625,97.8193359375,97.8193359375,152,"[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleCUDAKernel(long, long, float const*, float const*, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.936999999999998), 'mean_duration_us': np.float64(4.312333333333332), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.16157626338323602), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.446)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.883), 'mean_duration_us': np.float64(28.29433333333333), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4143543840187468), 'min_duration_us': np.float64(27.84), 'max_duration_us': np.float64(28.842)}]","[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleC...', 'stream': 0, 'mean_duration_us': np.float64(4.31)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(28.29)}]",9.603057884675488,9.603057884675488 +aten::miopen_batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (16,), (16,), (16,), (16,), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",3,25.340169270833332,25.340169270833332,14.2177734375,14.2177734375,20.56130225646085,20.56130225646085,12.73583984375,12.73583984375,49.06689453125,49.06689453125,76.0205078125,76.0205078125,803,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.285), 'mean_duration_us': np.float64(4.285), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.285), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.655), 'mean_duration_us': np.float64(10.655), 'median_duration_us': np.float64(10.655), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.655), 'max_duration_us': np.float64(10.655)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(29.441), 'mean_duration_us': np.float64(29.441), 'median_duration_us': np.float64(29.441), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(29.441), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.28)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(4.69)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(10.66)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(29.44)}]",7.463037138304665,17.066095022980154 +aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (), (), ())","('float', 'float', 'ScalarList', 'float', 'float', '', '', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (), (), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, False, False]')",3,24.542317708333332,24.542317708333332,24.59619140625,24.59619140625,0.8028704426605566,0.8028704426605566,23.7138671875,23.7138671875,25.31689453125,25.31689453125,73.626953125,73.626953125,55,"[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(73.62700000000001), 'mean_duration_us': np.float64(24.542333333333335), 'median_duration_us': np.float64(24.596), 'std_dev_duration_us': np.float64(0.6555213362067043), 'min_duration_us': np.float64(23.714), 'max_duration_us': np.float64(25.317)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(24.54)}]",7.228058603704052,24.294153626684206 +aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (16,), (), (), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (1,), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, True, True]')",3,19.423502604166668,19.423502604166668,20.10498046875,20.10498046875,1.9915551671802427,1.9915551671802427,17.1806640625,17.1806640625,20.98486328125,20.98486328125,58.2705078125,58.2705078125,123,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.327), 'mean_duration_us': np.float64(2.109), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.24552936009094037), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.403)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.370999999999999), 'mean_duration_us': np.float64(3.1236666666666664), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.624051992135983), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(4.005)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKernel1(long, long, long, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.415), 'mean_duration_us': np.float64(4.138333333333333), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.1359738536958077), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(4.325)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.216000000000001), 'mean_duration_us': np.float64(4.405333333333334), 'median_duration_us': np.float64(4.405), 'std_dev_duration_us': np.float64(0.1963675691712412), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.646)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.942), 'mean_duration_us': np.float64(5.647333333333333), 'median_duration_us': np.float64(4.726), 'std_dev_duration_us': np.float64(1.4759235150312575), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(7.73)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(3.12)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKer...', 'stream': 0, 'mean_duration_us': np.float64(4.14)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]",5.720495381919212,30.01464900860342 +aten::native_batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (16,), (16,), (), (), ())","('float', '', '', 'float', 'float', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (1,), (1,), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",3,17.729817708333332,17.729817708333332,17.6630859375,17.6630859375,1.463543802533565,1.463543802533565,16.30078125,16.30078125,19.2255859375,19.2255859375,53.189453125,53.189453125,922,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.530000000000001), 'mean_duration_us': np.float64(3.176666666666667), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.8672271264720037), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(3.925)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.693999999999999), 'mean_duration_us': np.float64(3.564666666666666), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.7857575255057304), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.966), 'mean_duration_us': np.float64(10.988666666666667), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.5762877367735286), 'min_duration_us': np.float64(10.174), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.18)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.895), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.045)}, {'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.865000000000002), 'mean_duration_us': np.float64(6.288333333333334), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.17297462883967188), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.587), 'mean_duration_us': np.float64(6.862333333333333), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.8121807406948011), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.971)}]","[{'name': 'void at::native::batch_norm_transform_input_kernel(float const*, float const*, int, long, long, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.695), 'mean_duration_us': np.float64(3.8983333333333334), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.04988876515698577), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.965)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.782999999999998), 'mean_duration_us': np.float64(5.594333333333332), 'median_duration_us': np.float64(5.528), 'std_dev_duration_us': np.float64(0.2178077643754286), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::(anonymous namespace)::cuComputePartGradGammaBeta(float const*, float const*, long, long, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.707), 'mean_duration_us': np.float64(6.902333333333334), 'median_duration_us': np.float64(6.889), 'std_dev_duration_us': np.float64(0.5071320231348923), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::(anonymous namespace)::cuComputeGradGammaBeta(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]",4.694873038729754,49.80054147644368 +aten::native_layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (16, 32, 32), (16, 32, 32), ())","('float', 'ScalarList', 'float', 'float', 'Scalar')","((16384, 1024, 32, 1), (), (1024, 32, 1), (1024, 32, 1), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05')",3,14.781412760416666,14.781412760416666,14.18115234375,14.18115234375,2.4393353684496706,2.4393353684496706,12.6982421875,12.6982421875,17.46484375,17.46484375,44.34423828125,44.34423828125,812,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.344), 'mean_duration_us': np.float64(14.781333333333334), 'median_duration_us': np.float64(14.181), 'std_dev_duration_us': np.float64(1.99187890082594), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(14.78)}]",4.353334470996304,54.15387594743998 +aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (), (), (), (), (), ())","('float', 'float', 'float', 'float', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, False, False]')",3,14.004557291666666,14.004557291666666,13.056640625,13.056640625,3.2111962330970787,3.2111962330970787,11.3740234375,11.3740234375,17.5830078125,17.5830078125,42.013671875,42.013671875,39,"[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.617), 'mean_duration_us': np.float64(4.539000000000001), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(1.026369329237775), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(5.968)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.738), 'mean_duration_us': np.float64(4.5793333333333335), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.6704099906441994), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.658999999999999), 'mean_duration_us': np.float64(4.886333333333333), 'median_duration_us': np.float64(4.446), 'std_dev_duration_us': np.float64(0.9517430792440201), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.208)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]",4.124539582043076,58.278415529483055 +aten::native_layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), ())","('float', 'ScalarList', '', '', 'Scalar')","((16384, 1024, 32, 1), (), (), (), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05')",3,12.88525390625,12.88525390625,12.41796875,12.41796875,0.9514369086207531,0.9514369086207531,12.2578125,12.2578125,13.97998046875,13.97998046875,38.65576171875,38.65576171875,935,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(38.656), 'mean_duration_us': np.float64(12.885333333333334), 'median_duration_us': np.float64(12.418), 'std_dev_duration_us': np.float64(0.7767974138874454), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(13.98)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(12.89)}]",3.7948889532286296,62.073304482711684 +aten::mean,reduce,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), ())","('float', 'ScalarList', 'Scalar', '', 'float')","((16384, 1024, 32, 1), (), (), (), ())","('', '[]', 'False', '', '')",3,12.7236328125,12.7236328125,12.45556640625,12.45556640625,2.05587415187946,2.05587415187946,10.81494140625,10.81494140625,14.900390625,14.900390625,38.1708984375,38.1708984375,988,"[{'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.847999999999999), 'mean_duration_us': np.float64(2.282666666666666), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.7097423632715057), 'min_duration_us': np.float64(1.722), 'max_duration_us': np.float64(3.284)}, {'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.323), 'mean_duration_us': np.float64(10.441), 'median_duration_us': np.float64(10.614), 'std_dev_duration_us': np.float64(1.0372492468061858), 'min_duration_us': np.float64(9.093), 'max_duration_us': np.float64(11.616)}]","[{'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(2.28)}, {'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(34.048), 'mean_duration_us': np.float64(11.349333333333334), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.06798692684790375), 'min_duration_us': np.float64(11.256), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.736), 'mean_duration_us': np.float64(3.9120000000000004), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.0972787552243353), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(4.767)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.149), 'mean_duration_us': np.float64(7.049666666666667), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.4280197295556465), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.651)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.05)}]",3.2283423803105054,72.39146024155527 +aten::sum,reduce,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((16, 1), (), (), ())","('', '[0]', 'False', '')",6,4.331949869791667,4.331949869791667,4.205078125,4.205078125,1.0942127847261514,1.0942127847261514,3.1630859375,3.1630859375,6.0078125,6.0078125,25.99169921875,25.99169921875,103,"[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.992), 'mean_duration_us': np.float64(4.332), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.99894327499947), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.621), 'mean_duration_us': np.float64(1.8850833333333332), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.07396447157626122), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.962)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]",2.2206478159747056,77.16374868897127 +aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (128,), (), (), (128,), (128,), ())","('float', 'float', 'float', '', '', 'float', 'float', 'Scalar')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (1,), (), (), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",3,7.516927083333333,7.516927083333333,4.2861328125,4.2861328125,5.841162477612149,5.841162477612149,4.0048828125,4.0048828125,14.259765625,14.259765625,22.55078125,22.55078125,88,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(9.13)}]",2.213841012238825,79.3775897012101 +aten::copy_,elementwise,python,CPU,thread 2300490 (python),"((8, 16), (8, 16), ())","('float', 'float', 'Scalar')","((16, 1), (0, 1), ())","('', '', 'False')",6,3.444091796875,3.444091796875,3.50390625,3.50390625,0.8804555436695012,0.8804555436695012,2.08203125,2.08203125,4.52587890625,4.52587890625,20.66455078125,20.66455078125,844,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(20.665000000000003), 'mean_duration_us': np.float64(3.4441666666666673), 'median_duration_us': np.float64(3.504), 'std_dev_duration_us': np.float64(0.8038002273920775), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(4.526)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.44)}]",2.0286671894803243,81.40625689069043 +aten::add_,elementwise,python,CPU,thread 2300490 (python),"((), (), ())","('long int', 'long int', 'Scalar')","((), (), ())","('', '', '1')",6,3.303955078125,3.303955078125,3.58447265625,3.58447265625,1.1137280126556983,1.1137280126556983,1.8818359375,1.8818359375,4.60498046875,4.60498046875,19.82373046875,19.82373046875,799,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(19.823999999999998), 'mean_duration_us': np.float64(3.304), 'median_duration_us': np.float64(3.5845000000000002), 'std_dev_duration_us': np.float64(1.0166421854975984), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.3)}]",1.9461227103733774,83.3523796010638 +aten::native_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (), (), (), (128,), (128,), (), (), ())","('float', 'float', '', '', '', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (), (), (), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, False, False]')",3,6.582356770833333,6.582356770833333,6.3291015625,6.3291015625,0.849598477465432,0.849598477465432,5.88818359375,5.88818359375,7.52978515625,7.52978515625,19.7470703125,19.7470703125,23,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.747), 'mean_duration_us': np.float64(6.582333333333334), 'median_duration_us': np.float64(6.329), 'std_dev_duration_us': np.float64(0.6938656610292484), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::batch_norm_backward_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.583), 'mean_duration_us': np.float64(5.861), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.705458716013914), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(6.849)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(5.86)}]",1.7261479051342474,87.0171243842719 +aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((16, 32, 32), (16, 32, 32), ())","('float', 'float', 'Scalar')","((1024, 32, 1), (1024, 32, 1), ())","('', '', '1')",4,4.114990234375,4.114990234375,4.10498046875,4.10498046875,0.29094638896929526,0.29094638896929526,3.84521484375,3.84521484375,4.40478515625,4.40478515625,16.4599609375,16.4599609375,333,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.459999999999997), 'mean_duration_us': np.float64(4.114999999999999), 'median_duration_us': np.float64(4.105), 'std_dev_duration_us': np.float64(0.2519920633670832), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(4.405)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]",1.6158968587080114,88.63302124297991 +aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (16,), (16,), (16,), (16,), (16,), ())","('float', 'float', 'float', 'float', 'float', 'float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",3,5.099934895833333,5.099934895833333,5.0068359375,5.0068359375,0.4674548588682645,0.4674548588682645,4.68603515625,4.68603515625,5.60693359375,5.60693359375,15.2998046875,15.2998046875,167,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.3), 'mean_duration_us': np.float64(5.1000000000000005), 'median_duration_us': np.float64(5.007), 'std_dev_duration_us': np.float64(0.38170407385827065), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.607)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.1)}]",1.5020027342259514,90.13502397720586 +aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (32, 32), ())","('float', 'ScalarList', 'float', '')","((16384, 1024, 32, 1), (), (32, 1), ())","('', '[32, 32]', '', '')",3,4.61962890625,4.61962890625,4.205078125,4.205078125,0.7875207625785555,0.7875207625785555,4.1259765625,4.1259765625,5.52783203125,5.52783203125,13.85888671875,13.85888671875,912,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.859000000000002), 'mean_duration_us': np.float64(4.619666666666667), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.6430978843760011), 'min_duration_us': np.float64(4.126), 'max_duration_us': np.float64(5.528)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.62)}]",1.3605458481373325,91.4955698253432 +aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'ScalarList', '', '')","((16384, 1024, 32, 1), (), (), ())","('', '[32, 32]', '', '')",3,4.459147135416667,4.459147135416667,4.24609375,4.24609375,0.3698653385043163,0.3698653385043163,4.2451171875,4.2451171875,4.88623046875,4.88623046875,13.37744140625,13.37744140625,975,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.377000000000002), 'mean_duration_us': np.float64(4.4590000000000005), 'median_duration_us': np.float64(4.246), 'std_dev_duration_us': np.float64(0.30193487156449256), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.886)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",1.3132817038867808,92.80885152922998 +aten::normal_,elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'Scalar', 'Scalar', '')","((16384, 1024, 32, 1), (), (), ())","('', '0.', '1.', '')",3,4.458821614583333,4.458821614583333,4.365234375,4.365234375,0.3500872140033832,0.3500872140033832,4.1650390625,4.1650390625,4.84619140625,4.84619140625,13.37646484375,13.37646484375,982,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.376000000000001), 'mean_duration_us': np.float64(4.458666666666667), 'median_duration_us': np.float64(4.365), 'std_dev_duration_us': np.float64(0.28579751962223576), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.846)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",1.3131858334116275,94.1220373626416 +aten::mse_loss_backward,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((), (8, 16, 32, 32), (8, 16, 32, 32), (), (8, 16, 32, 32))","('float', 'float', 'float', 'Scalar', 'float')","((), (16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (16384, 1024, 32, 1))","('', '', '', '1', '')",3,4.446451822916667,4.446451822916667,4.2861328125,4.2861328125,0.9320300852322503,0.9320300852322503,3.60498046875,3.60498046875,5.4482421875,5.4482421875,13.33935546875,13.33935546875,9,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.339), 'mean_duration_us': np.float64(4.4463333333333335), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.7608952329693989), 'min_duration_us': np.float64(3.605), 'max_duration_us': np.float64(5.448)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]",1.3095427553558041,95.43158011799741 +aten::miopen_batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((1, 128, 32, 32), (128,), (128,), (), (), (), (), ())","('float', 'float', 'float', '', '', 'Scalar', 'Scalar', 'Scalar')","((131072, 1024, 32, 1), (1,), (1,), (), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05')",3,4.352213541666667,4.352213541666667,4.1650390625,4.1650390625,0.5456305012929936,0.5456305012929936,3.9248046875,3.9248046875,4.966796875,4.966796875,13.056640625,13.056640625,901,"[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]",1.2817882527989386,96.71336837079635 +aten::mse_loss,elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (8, 16, 32, 32), ())","('float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), ())","('', '', '1')",3,3.77783203125,16.50146484375,3.48388671875,15.939453125,0.6160871136487144,2.648859716198048,3.36376953125,14.1787109375,4.48583984375,19.38623046875,11.33349609375,49.50439453125,984,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.334), 'mean_duration_us': np.float64(3.778), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(0.503022862303494), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(4.486)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]",1.1126247993910308,97.82599317018737 +aten::fill_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), ())","('float', 'Scalar')","((16384, 1024, 32, 1), ())","('', '0')",3,3.150390625,3.150390625,2.9228515625,2.9228515625,0.57578505122717,0.57578505122717,2.72314453125,2.72314453125,3.80517578125,3.80517578125,9.451171875,9.451171875,8,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.451), 'mean_duration_us': np.float64(3.1503333333333337), 'median_duration_us': np.float64(2.923), 'std_dev_duration_us': np.float64(0.4700647709506521), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(3.805)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.15)}]",0.9278344585331434,98.75382762872052 +aten::fill_,elementwise,python,CPU,thread 2300490 (python),"((), ())","('float', 'Scalar')","((), ())","('', '1.')",3,2.7229817708333335,2.7229817708333335,3.04296875,3.04296875,0.772600022376397,0.772600022376397,1.841796875,1.841796875,3.2841796875,3.2841796875,8.1689453125,8.1689453125,993,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.169), 'mean_duration_us': np.float64(2.7230000000000003), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.6306826988800839), 'min_duration_us': np.float64(1.842), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",0.8019565246569275,99.55578415337745 +aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((32, 32), (32, 32), ())","('float', 'float', 'Scalar')","((32, 1), (32, 1), ())","('', '', '1')",2,2.262451171875,2.262451171875,2.262451171875,2.262451171875,0.25515230043791925,0.25515230043791925,2.08203125,2.08203125,2.44287109375,2.44287109375,4.52490234375,4.52490234375,258,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.525), 'mean_duration_us': np.float64(2.2625), 'median_duration_us': np.float64(2.2625), 'std_dev_duration_us': np.float64(0.18050000000000008), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.26)}]",0.44421584662257907,100.00000000000003 diff --git a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/unified_perf_summary.csv b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/unified_perf_summary.csv index 7dabc5067..691d4b7dd 100644 --- a/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/unified_perf_summary.csv +++ b/tests/traces/perf_model/normalization/normalization_layer_test_perf_report_csvs/unified_perf_summary.csv @@ -1,32 +1,32 @@ name,op category,process_name,process_label,thread_name,Input Dims,Input type,Input Strides,Concrete Inputs,ex_UID,operation_count,total_duration_us,mean_duration_us,std_duration_us,GFLOPS,Data Moved (MB),FLOPS/Byte,Compute Spec,TB/s_mean,TB/s_std,TFLOPS/s_mean,TFLOPS/s_std,Kernel Time (µs)_mean,Kernel Time (µs)_std,Kernel Time (µs)_sum,duration_us_median,duration_us_min,duration_us_max,TB/s_median,TB/s_min,TB/s_max,TFLOPS/s_median,TFLOPS/s_min,TFLOPS/s_max,Kernel Time (µs)_median,Kernel Time (µs)_min,Kernel Time (µs)_max,kernel_details_summary,trunc_kernel_details,perf_params,has_perf_model,Percentage (%),Cumulative Percentage (%) -aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (16, 32, 32), (16, 32, 32), ())","('float', 'float', 'ScalarList', 'float', 'float', 'float', 'float', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (1024, 32, 1), (1024, 32, 1), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, True, True]')",152,3,58.578,19.526,5.161390607191052,0.001179648,1.75,0.6428571428571429,vector_fp32,0.05628963269412802,0.001008475034056347,0.03618619244622515,0.0006483053790362222,32.6064453125,0.5902431727220115,97.8193359375,16.815,16.285,25.478,0.05683579419860258,0.05512587657870418,0.0569072273050773,0.03653729627053023,0.035438063514881255,0.03658321755326398,32.2861328125,32.24560546875,33.28759765625,"[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleCUDAKernel(long, long, float const*, float const*, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.936999999999998), 'mean_duration_us': np.float64(4.312333333333332), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.16157626338323602), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.446)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.883), 'mean_duration_us': np.float64(28.29433333333333), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4143543840187468), 'min_duration_us': np.float64(27.84), 'max_duration_us': np.float64(28.842)}]","[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleC...', 'stream': 0, 'mean_duration_us': np.float64(4.31)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(28.29)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': True, 'is_affine': True, 'is_training': True, 'output_mask': [True, True, True]}",True,9.860907522058989,9.860907522058989 -aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (), (), ())","('float', 'float', 'ScalarList', 'float', 'float', '', '', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (), (), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, False, False]')",55,3,904.339,301.44633333333337,505.77193739602967,0.001179648,1.5625,0.72,vector_fp32,0.06680599771272798,0.00219379562352543,0.04810031835316414,0.001579532848938307,24.542317708333332,0.8028704426605566,73.626953125,10.075,8.803,885.461,0.06661193893554086,0.06471567821944493,0.06909037598319813,0.04796059603358942,0.04659528831800035,0.04974507070790265,24.59619140625,23.7138671875,25.31689453125,"[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(73.62700000000001), 'mean_duration_us': np.float64(24.542333333333335), 'median_duration_us': np.float64(24.596), 'std_dev_duration_us': np.float64(0.6555213362067043), 'min_duration_us': np.float64(23.714), 'max_duration_us': np.float64(25.317)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(24.54)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': False, 'is_affine': False, 'is_training': True, 'output_mask': [True, False, False]}",True,7.422137647310147,17.283045169369135 -aten::batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (16,), (16,), (16,), (16,), (), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",800,3,15966.217999999999,5322.072666666666,8954.225689402816,0.000655456,1.0003662109375,0.624862721171446,vector_fp32,0.061149659349069435,0.029620350894417908,0.03821014253956648,0.018508653061939044,21.78857421875,14.41545950056331,65.36572265625,230.304,74.782,15661.132,0.0737780781647091,0.027308055117709867,0.08236284476478933,0.046101170684799776,0.01706378563075202,0.051465471303147645,14.2177734375,12.73583984375,38.412109375,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.535), 'mean_duration_us': np.float64(4.178333333333334), 'median_duration_us': np.float64(4.125), 'std_dev_duration_us': np.float64(0.07542472332656514), 'min_duration_us': np.float64(4.125), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.74), 'mean_duration_us': np.float64(5.246666666666667), 'median_duration_us': np.float64(4.926), 'std_dev_duration_us': np.float64(0.6308519812303217), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(6.128)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(37.091), 'mean_duration_us': np.float64(12.363666666666667), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(12.076039232942046), 'min_duration_us': np.float64(3.685), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.18)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(5.25)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(12.36)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,6.589344939303937,23.872390108673073 -aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (16,), (), (), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (1,), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, True, True]')",123,3,263.062,87.68733333333334,27.195307211600554,0.001179648,1.50006103515625,0.749969483663588,vector_fp32,0.08158110778877121,0.008789629375982646,0.06118334128504826,0.006591953804700008,19.423502604166668,1.9915551671802427,58.2705078125,96.314,57.225,109.523,0.07823573877352762,0.07495536086744072,0.0915522237253453,0.05867441661202185,0.05621423328757242,0.0686613739555505,20.10498046875,17.1806640625,20.98486328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.327), 'mean_duration_us': np.float64(2.109), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.24552936009094037), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.403)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.370999999999999), 'mean_duration_us': np.float64(3.1236666666666664), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.624051992135983), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(4.005)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKernel1(long, long, long, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.415), 'mean_duration_us': np.float64(4.138333333333333), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.1359738536958077), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(4.325)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.216000000000001), 'mean_duration_us': np.float64(4.405333333333334), 'median_duration_us': np.float64(4.405), 'std_dev_duration_us': np.float64(0.1963675691712412), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.646)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.942), 'mean_duration_us': np.float64(5.647333333333333), 'median_duration_us': np.float64(4.726), 'std_dev_duration_us': np.float64(1.4759235150312575), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(7.73)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(3.12)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKer...', 'stream': 0, 'mean_duration_us': np.float64(4.14)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 4.0, 'has_bias': True, 'is_affine': True, 'is_training': True, 'output_mask': [True, True, True]}",True,5.874095170402806,29.74648527907588 -aten::batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (16,), (16,), (), (), (), ())","('float', '', '', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",919,3,332033.53599999996,110677.84533333332,191592.16417494096,0.000655456,1.0003662109375,0.624862721171446,vector_fp32,0.05943268228052002,0.004894991042083343,0.03713726757632372,0.0030586974226660484,17.729817708333332,1.463543802533565,53.189453125,74.351,49.765,331909.42,0.05938713108862719,0.05456062579367095,0.06435028995926192,0.037108804334604964,0.03409290110225022,0.040210097292115984,17.6630859375,16.30078125,19.2255859375,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.530000000000001), 'mean_duration_us': np.float64(3.176666666666667), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.8672271264720037), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(3.925)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.693999999999999), 'mean_duration_us': np.float64(3.564666666666666), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.7857575255057304), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.966), 'mean_duration_us': np.float64(10.988666666666667), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.5762877367735286), 'min_duration_us': np.float64(10.174), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.18)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.895), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.045)}, {'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.865000000000002), 'mean_duration_us': np.float64(6.288333333333334), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.17297462883967188), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.587), 'mean_duration_us': np.float64(6.862333333333333), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.8121807406948011), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.971)}]","[{'name': 'void at::native::batch_norm_transform_input_kernel(float const*, float const*, int, long, long, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.695), 'mean_duration_us': np.float64(3.8983333333333334), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.04988876515698577), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.965)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.782999999999998), 'mean_duration_us': np.float64(5.594333333333332), 'median_duration_us': np.float64(5.528), 'std_dev_duration_us': np.float64(0.2178077643754286), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::(anonymous namespace)::cuComputePartGradGammaBeta(float const*, float const*, long, long, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.707), 'mean_duration_us': np.float64(6.902333333333334), 'median_duration_us': np.float64(6.889), 'std_dev_duration_us': np.float64(0.5071320231348923), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::(anonymous namespace)::cuComputeGradGammaBeta(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,4.820934062742728,50.0636444808471 -aten::layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (16, 32, 32), (16, 32, 32), (), ())","('float', 'ScalarList', 'float', 'float', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (1024, 32, 1), (1024, 32, 1), (), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05', 'True')",811,3,8812.761,2937.587,5021.909728746127,0.000753664,1.375,0.5227272727272727,vector_fp32,0.09925539927538994,0.015634765952425182,0.0518835041666811,0.008172718566040437,14.781412760416666,2.4393353684496706,44.34423828125,48.352,28.032,8736.377,0.10166959391247461,0.082553959293223,0.1135426446204722,0.053145469545157184,0.04315320599418475,0.05935183696070138,14.18115234375,12.6982421875,17.46484375,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.344), 'mean_duration_us': np.float64(14.781333333333334), 'median_duration_us': np.float64(14.181), 'std_dev_duration_us': np.float64(1.99187890082594), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(14.78)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,4.470224916543529,54.53386939739063 -aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (), (), (), (), (), ())","('float', 'float', 'float', 'float', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, False, False]')",39,3,533.636,177.87866666666665,235.44524314653998,0.001179648,1.50006103515625,0.749969483663588,vector_fp32,0.11607270439465735,0.02471211817896858,0.08705098618229744,0.018533334510914632,14.004557291666666,3.2111962330970787,42.013671875,43.565,40.33,449.741,0.12046957905759162,0.08945727697861705,0.13829125714776339,0.09034850800299177,0.06709022782560399,0.10371422271829656,13.056640625,11.3740234375,17.5830078125,"[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.617), 'mean_duration_us': np.float64(4.539000000000001), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(1.026369329237775), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(5.968)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.738), 'mean_duration_us': np.float64(4.5793333333333335), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.6704099906441994), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.658999999999999), 'mean_duration_us': np.float64(4.886333333333333), 'median_duration_us': np.float64(4.446), 'std_dev_duration_us': np.float64(0.9517430792440201), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.208)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 4.0, 'has_bias': True, 'is_affine': True, 'is_training': True, 'output_mask': [True, False, False]}",True,4.235286705342297,58.76915610273293 -aten::layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), (), ())","('float', 'ScalarList', '', '', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (), (), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05', 'True')",934,3,266.067,88.68900000000001,95.66646824776171,0.000753664,1.375,0.5227272727272727,vector_fp32,0.11228673733100565,0.007963901459708054,0.058695339968480226,0.004162948490301934,12.88525390625,0.9514369086207531,38.65576171875,43.966,23.575,198.526,0.1161053010380623,0.10313261904928225,0.1176222919056724,0.06069140736080529,0.05391023268485209,0.0614843798597833,12.41796875,12.2578125,13.97998046875,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(38.656), 'mean_duration_us': np.float64(12.885333333333334), 'median_duration_us': np.float64(12.418), 'std_dev_duration_us': np.float64(0.7767974138874454), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(13.98)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(12.89)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,3.8967846985476458,62.66594080128058 -aten::native_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (16,), (16,), (16,), (16,), (), (), ())","('float', 'float', '', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1,), (1,), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, False, False]')",60,3,44.557,14.852333333333334,2.2663694167838853,0.001179648,1.500244140625,0.7498779495524817,vector_fp32,0.13861462663243995,0.001021216688976221,0.10394405199711688,0.0007657878767782663,11.349283854166666,0.0833479550567492,34.0478515625,14.071,13.08,17.406,0.13828439179328697,0.13779939093242086,0.139760097171612,0.10369641617306206,0.1033327247219846,0.104803015096304,11.3759765625,11.255859375,11.416015625,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(34.048), 'mean_duration_us': np.float64(11.349333333333334), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.06798692684790375), 'min_duration_us': np.float64(11.256), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.09), 'mean_duration_us': np.float64(3.03), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.7386600481051259), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(3.884)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.575), 'mean_duration_us': np.float64(3.858333333333333), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.6352187724625972), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(4.526)}, {'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.03)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.86)}, {'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,3.399343767812333,69.49755807989573 -aten::group_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), (), ())","('float', 'Scalar', '', '', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (), (), ())","('', '4', '', '', '1.0000000000000001e-05', 'True')",943,3,153.189,51.062999999999995,18.599813654980522,0.000655456,1.0003662109375,0.624862721171446,vector_fp32,0.09741620804511049,0.0164189966356011,0.06087175684527146,0.010259618916626514,10.961588541666666,1.7283104611351434,32.884765625,40.931,39.729,72.529,0.09189280862349217,0.08447114186851211,0.11588467364332723,0.05742039045256224,0.05278286756841774,0.0724120125148344,11.4150390625,9.0517578125,12.41796875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.736), 'mean_duration_us': np.float64(3.9120000000000004), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.0972787552243353), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(4.767)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.149), 'mean_duration_us': np.float64(7.049666666666667), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.4280197295556465), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.651)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.05)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,3.315025905715599,72.81258398561133 -aten::mean,reduce,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), ())","('float', 'ScalarList', 'Scalar', '', 'float')","((16384, 1024, 32, 1), (), (), (), ())","('', '[]', 'False', '', '')",988,3,21550.049,7183.349666666666,12390.810850716807,0.000131072,0.5000038146972656,0.249998092665919,vector_fp32,0.050730715927089075,0.006368456045274941,0.012682582221348828,0.0015921018645454767,10.44091796875,1.2705677672188844,31.32275390625,39.479,19.549,21491.021,0.0493973416754842,0.04513451097099622,0.057660295134786814,0.01234924120163776,0.01128354165615805,0.014414963806250672,10.61376953125,9.0927734375,11.6162109375,"[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.323), 'mean_duration_us': np.float64(10.441), 'median_duration_us': np.float64(10.614), 'std_dev_duration_us': np.float64(1.0372492468061858), 'min_duration_us': np.float64(9.093), 'max_duration_us': np.float64(11.616)}]","[{'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.992), 'mean_duration_us': np.float64(4.332), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.99894327499947), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.621), 'mean_duration_us': np.float64(1.8850833333333332), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.07396447157626122), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.962)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]","{'shape_in1': (16,), 'shape_in2': (16,), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (1,), 'stride_input2': (1,), 'stride_output': None}",True,2.2802739518349595,80.87057577335673 -aten::add_,elementwise,python,CPU,thread 2300490 (python),"((), (), ())","('long int', 'long int', 'Scalar')","((), (), ())","('', '', '1')",799,6,111702.897,18617.1495,45500.52519478777,1e-09,2.288818359375e-05,0.041666666666666664,,8.159373148075394e-06,3.2424184530722574e-06,3.3997388116980807e-07,1.3510076887801073e-07,3.303955078125,1.1137280126556983,19.82373046875,27.9765,13.23,111494.667,6.712597892214445e-06,5.211748489025555e-06,1.275350285417748e-05,2.7969157884226854e-07,2.1715618704273142e-07,5.313959522573949e-07,3.58447265625,1.8818359375,4.60498046875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(19.823999999999998), 'mean_duration_us': np.float64(3.304), 'median_duration_us': np.float64(3.5845000000000002), 'std_dev_duration_us': np.float64(1.0166421854975984), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.3)}]","{'shape_in1': (), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (), 'stride_input2': (), 'stride_output': None}",True,1.9983776317952666,82.868953405152 -aten::native_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (), (), (), (128,), (128,), (), (), ())","('float', 'float', '', '', '', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (), (), (), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, False, False]')",23,3,662.188,220.72933333333333,346.017647147271,0.001179648,1.501953125,0.7490247074122237,vector_fp32,0.24182137684950603,0.029782389314002698,0.1811301860407223,0.022307745441957804,6.582356770833333,0.849598477465432,19.7470703125,25.878,16.074,620.236,0.24883658200894926,0.2091576276506063,0.2674699208889626,0.186384748032711,0.1566642308540302,0.2003415792354258,6.3291015625,5.88818359375,7.52978515625,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.747), 'mean_duration_us': np.float64(6.582333333333334), 'median_duration_us': np.float64(6.329), 'std_dev_duration_us': np.float64(0.6938656610292484), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::batch_norm_backward_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.583), 'mean_duration_us': np.float64(5.861), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.705458716013914), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(6.849)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(5.86)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 1024, 'has_bias': False, 'is_affine': True, 'is_training': False, 'output_mask': [True, False]}",True,1.7724963304748282,86.63209946062163 -aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((16, 32, 32), (16, 32, 32), ())","('float', 'float', 'Scalar')","((1024, 32, 1), (1024, 32, 1), ())","('', '', '1')",333,4,21.01,5.2525,0.46811002980068667,1.6384e-05,0.1875,0.08333333333333333,vector_fp32,0.047958026130510166,0.0033861364668778225,0.0039965021775425135,0.00028217803890648525,4.114990234375,0.29094638896929526,16.4599609375,5.3675,4.597,5.678,0.0480332236803435,0.044635094113734626,0.05113056304761905,0.004002768640028624,0.0037195911761445516,0.004260880253968253,4.10498046875,3.84521484375,4.40478515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.459999999999997), 'mean_duration_us': np.float64(4.114999999999999), 'median_duration_us': np.float64(4.105), 'std_dev_duration_us': np.float64(0.2519920633670832), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(4.405)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]","{'shape_in1': (16, 32, 32), 'shape_in2': (16, 32, 32), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (1024, 32, 1), 'stride_input2': (1024, 32, 1), 'stride_output': None}",True,1.6592849569649113,88.29138441758654 -aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (16,), (16,), (16,), (16,), (16,), ())","('float', 'float', 'float', 'float', 'float', 'float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",167,3,1179.8,393.26666666666665,630.3512836445511,0.000524336,1.00006103515625,0.5000152578577968,vector_fp32,0.2067490101745708,0.01852446773236728,0.10337765963428229,0.00926251650987806,5.099934895833333,0.4674548588682645,15.2998046875,30.165,28.502,1121.133,0.20944165398868736,0.18702557868152922,0.22377979785349592,0.10472402262531696,0.0935156429504485,0.1118933133270814,5.0068359375,4.68603515625,5.60693359375,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.3), 'mean_duration_us': np.float64(5.1000000000000005), 'median_duration_us': np.float64(5.007), 'std_dev_duration_us': np.float64(0.38170407385827065), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.607)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.1)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': False, 'output_mask': [True]}",True,1.5423326858955364,89.83371710348207 -aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (32, 32), ())","('float', 'ScalarList', 'float', '')","((16384, 1024, 32, 1), (), (32, 1), ())","('', '[32, 32]', '', '')",912,3,151.726,50.57533333333333,40.63064339059047,0.000524544,1.00390625,0.4982976653696498,vector_fp32,0.23196586194858182,0.03604997760607121,0.11558804745443681,0.017963619677733432,4.61962890625,0.7875207625785555,13.85888671875,29.314,24.987,97.425,0.25033351788202507,0.1904312566027736,0.2551328113609468,0.1247406075243846,0.09489145057857082,0.12713208426035505,4.205078125,4.1259765625,5.52783203125,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.859000000000002), 'mean_duration_us': np.float64(4.619666666666667), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.6430978843760011), 'min_duration_us': np.float64(4.126), 'max_duration_us': np.float64(5.528)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.62)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 1024, 'has_bias': False, 'is_affine': True, 'is_training': False}",True,1.3970775714486823,91.23079467493075 -aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (128,), (), (), (128,), (128,), ())","('float', 'float', 'float', '', '', 'float', 'float', 'Scalar')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (1,), (), (), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",88,3,1945.033,648.3443333333333,1062.809495321402,0.000524672,1.00048828125,0.5001220107369448,vector_fp32,0.23711254933163992,0.02942084384243977,0.11858520494270279,0.014714011580058634,4.47265625,0.5838267646323473,13.41796875,36.665,32.799,1875.569,0.2447632973342447,0.20462211657142854,0.2619522340892465,0.12241151241740716,0.10233602438095238,0.13100807802974884,4.2861328125,4.0048828125,5.126953125,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.418), 'mean_duration_us': np.float64(4.472666666666666), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.4766930062652715), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(5.127)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.47)}]","{'op_shape': (1, 128, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (131072, 1024, 32, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': False, 'output_mask': [True]}",True,1.3526298017619627,92.58342447669271 -aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'ScalarList', '', '')","((16384, 1024, 32, 1), (), (), ())","('', '[32, 32]', '', '')",975,3,70.705,23.56833333333333,4.88347748365172,0.000524544,1.00390625,0.4982976653696498,vector_fp32,0.23710807904360365,0.01876822884498544,0.1181504022277101,0.00935216461657956,4.459147135416667,0.3698653385043163,13.37744140625,21.452,20.1,29.153,0.247915392824287,0.21543642010592584,0.2479724242005981,0.12353566145354186,0.10735146517437795,0.1235640800552105,4.24609375,4.2451171875,4.88623046875,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.377000000000002), 'mean_duration_us': np.float64(4.4590000000000005), 'median_duration_us': np.float64(4.246), 'std_dev_duration_us': np.float64(0.30193487156449256), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.886)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 1024, 'has_bias': False, 'is_affine': True, 'is_training': False}",True,1.348544347848344,93.93196882454106 -aten::normal_,elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'Scalar', 'Scalar', '')","((16384, 1024, 32, 1), (), (), ())","('', '0.', '1.', '')",982,3,66.521,22.173666666666666,8.761302433618722,,,,,,,,,4.458821614583333,0.3500872140033832,13.37646484375,25.078,12.329,29.114,,,,,,,4.365234375,4.1650390625,4.84619140625,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.376000000000001), 'mean_duration_us': np.float64(4.458666666666667), 'median_duration_us': np.float64(4.365), 'std_dev_duration_us': np.float64(0.28579751962223576), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.846)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",,False,1.3484459031757268,95.28041472771679 -aten::mse_loss_backward,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((), (8, 16, 32, 32), (8, 16, 32, 32), (), (8, 16, 32, 32))","('float', 'float', 'float', 'Scalar', 'float')","((), (16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (16384, 1024, 32, 1))","('', '', '', '1', '')",9,3,137599.16400000002,45866.388000000006,79423.6600692322,,,,,,,,,4.446451822916667,0.9320300852322503,13.33935546875,13.52,8.713,137576.931,,,,,,,4.2861328125,3.60498046875,5.4482421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.339), 'mean_duration_us': np.float64(4.4463333333333335), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.7608952329693989), 'min_duration_us': np.float64(3.605), 'max_duration_us': np.float64(5.448)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]",,False,1.3447050056162686,96.62511973333305 -"aten::mse_loss->void at::native::vectorized_elementwise_kernel<4, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array) (Synthetic Op)",elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (8, 16, 32, 32), ())","('float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), ())","('', '', '1')",8500,3,152058.83200000002,50686.27733333334,87692.50918748582,,,,,,,,,3.77783203125,0.6160871136487144,11.33349609375,73.99,39.979,151944.863,,,,,,,3.48388671875,3.36376953125,4.48583984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.334), 'mean_duration_us': np.float64(3.778), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(0.503022862303494), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(4.486)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]",,False,1.1424996480602956,97.76761938139335 -aten::fill_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), ())","('float', 'Scalar')","((16384, 1024, 32, 1), ())","('', '0')",8,3,108.982,36.327333333333335,32.981532079837244,,,,,,,,,3.150390625,0.57578505122717,9.451171875,26.069,9.694,73.219,,,,,,,2.9228515625,2.72314453125,3.80517578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.451), 'mean_duration_us': np.float64(3.1503333333333337), 'median_duration_us': np.float64(2.923), 'std_dev_duration_us': np.float64(0.4700647709506521), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(3.805)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.15)}]",,False,0.9527475415904131,98.72036692298376 -aten::fill_,elementwise,python,CPU,thread 2300490 (python),"((), ())","('float', 'Scalar')","((), ())","('', '1.')",993,3,62.082,20.694,14.578219129921186,,,,,,,,,2.7229817708333335,0.772600022376397,8.1689453125,17.315,8.102,36.665,,,,,,,3.04296875,1.841796875,3.2841796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.169), 'mean_duration_us': np.float64(2.7230000000000003), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.6306826988800839), 'min_duration_us': np.float64(1.842), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",,False,0.8234896864438732,99.54385660942764 -aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((32, 32), (32, 32), ())","('float', 'float', 'Scalar')","((32, 1), (32, 1), ())","('', '', '1')",258,2,32.438,16.219,10.715496162100942,1.024e-06,0.01171875,0.08333333333333333,vector_fp32,0.005466037708706859,0.0006164429592976079,0.0004555031423922382,5.1370246608134065e-05,2.262451171875,0.25515230043791925,4.52490234375,16.219,8.642,23.796,0.005466037708706859,0.005030146711972817,0.0059019287054409,0.0004555031423922382,0.00041917889266440136,0.000491827392120075,2.262451171875,2.08203125,2.44287109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.525), 'mean_duration_us': np.float64(2.2625), 'median_duration_us': np.float64(2.2625), 'std_dev_duration_us': np.float64(0.18050000000000008), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.26)}]","{'shape_in1': (32, 32), 'shape_in2': (32, 32), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (32, 1), 'stride_input2': (32, 1), 'stride_output': None}",True,0.4561433905723475,99.99999999999999 +aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (16, 32, 32), (16, 32, 32), ())","('float', 'float', 'ScalarList', 'float', 'float', 'float', 'float', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (1024, 32, 1), (1024, 32, 1), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, True, True]')",152,3,58.578,19.526,5.161390607191052,0.001179648,1.75,0.6428571428571429,vector_fp32,0.05628963269412802,0.001008475034056347,0.03618619244622515,0.0006483053790362222,32.6064453125,0.5902431727220115,97.8193359375,16.815,16.285,25.478,0.05683579419860258,0.05512587657870418,0.0569072273050773,0.03653729627053023,0.035438063514881255,0.03658321755326398,32.2861328125,32.24560546875,33.28759765625,"[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleCUDAKernel(long, long, float const*, float const*, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.936999999999998), 'mean_duration_us': np.float64(4.312333333333332), 'median_duration_us': np.float64(4.406), 'std_dev_duration_us': np.float64(0.16157626338323602), 'min_duration_us': np.float64(4.085), 'max_duration_us': np.float64(4.446)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(84.883), 'mean_duration_us': np.float64(28.29433333333333), 'median_duration_us': np.float64(28.201), 'std_dev_duration_us': np.float64(0.4143543840187468), 'min_duration_us': np.float64(27.84), 'max_duration_us': np.float64(28.842)}]","[{'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardSimpleC...', 'stream': 0, 'mean_duration_us': np.float64(4.31)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(28.29)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': True, 'is_affine': True, 'is_training': True, 'output_mask': [True, True, True]}",True,9.603057884675488,9.603057884675488 +aten::batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (16,), (16,), (16,), (16,), (), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",800,3,15966.217999999999,5322.072666666666,8954.225689402816,0.000655456,1.0003662109375,0.624862721171446,vector_fp32,0.059173028173108065,0.03301156629774701,0.03697501940420294,0.02062769714694179,25.340169270833332,20.56130225646085,76.0205078125,230.304,74.782,15661.132,0.0737780781647091,0.021378161589825754,0.08236284476478933,0.046101170684799776,0.013358416224661405,0.051465471303147645,14.2177734375,12.73583984375,49.06689453125,"[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.285), 'mean_duration_us': np.float64(4.285), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.285), 'max_duration_us': np.float64(4.285)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(4.686), 'mean_duration_us': np.float64(4.686), 'median_duration_us': np.float64(4.686), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(4.686)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(10.655), 'mean_duration_us': np.float64(10.655), 'median_duration_us': np.float64(10.655), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(10.655), 'max_duration_us': np.float64(10.655)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(29.441), 'mean_duration_us': np.float64(29.441), 'median_duration_us': np.float64(29.441), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(29.441), 'max_duration_us': np.float64(29.441)}]","[{'name': 'MIOpenBatchNormFwdTrainSpatialNorm', 'stream': 0, 'mean_duration_us': np.float64(4.28)}, {'name': 'MIOpenBatchNormFwdTrainSpatialFinalMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(4.69)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(10.66)}, {'name': 'MIOpenBatchNormFwdTrainSpatialMeanVariance', 'stream': 0, 'mean_duration_us': np.float64(29.44)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,7.463037138304665,17.066095022980154 +aten::native_layer_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (), (8, 1, 1, 1), (8, 1, 1, 1), (), (), ())","('float', 'float', 'ScalarList', 'float', 'float', '', '', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (1, 1, 1, 1), (1, 1, 1, 1), (), (), ())","('', '', '[16, 32, 32]', '', '', '', '', '[True, False, False]')",55,3,904.339,301.44633333333337,505.77193739602967,0.001179648,1.5625,0.72,vector_fp32,0.06680599771272798,0.00219379562352543,0.04810031835316414,0.001579532848938307,24.542317708333332,0.8028704426605566,73.626953125,10.075,8.803,885.461,0.06661193893554086,0.06471567821944493,0.06909037598319813,0.04796059603358942,0.04659528831800035,0.04974507070790265,24.59619140625,23.7138671875,25.31689453125,"[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(73.62700000000001), 'mean_duration_us': np.float64(24.542333333333335), 'median_duration_us': np.float64(24.596), 'std_dev_duration_us': np.float64(0.6555213362067043), 'min_duration_us': np.float64(23.714), 'max_duration_us': np.float64(25.317)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(24.54)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': False, 'is_affine': False, 'is_training': True, 'output_mask': [True, False, False]}",True,7.228058603704052,24.294153626684206 +aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (16,), (), (), (), (), ())","('float', 'float', 'float', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (1,), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, True, True]')",123,3,263.062,87.68733333333334,27.195307211600554,0.001179648,1.50006103515625,0.749969483663588,vector_fp32,0.08158110778877121,0.008789629375982646,0.06118334128504826,0.006591953804700008,19.423502604166668,1.9915551671802427,58.2705078125,96.314,57.225,109.523,0.07823573877352762,0.07495536086744072,0.0915522237253453,0.05867441661202185,0.05621423328757242,0.0686613739555505,20.10498046875,17.1806640625,20.98486328125,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.327), 'mean_duration_us': np.float64(2.109), 'median_duration_us': np.float64(2.122), 'std_dev_duration_us': np.float64(0.24552936009094037), 'min_duration_us': np.float64(1.802), 'max_duration_us': np.float64(2.403)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.370999999999999), 'mean_duration_us': np.float64(3.1236666666666664), 'median_duration_us': np.float64(2.723), 'std_dev_duration_us': np.float64(0.624051992135983), 'min_duration_us': np.float64(2.643), 'max_duration_us': np.float64(4.005)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKernel1(long, long, long, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.415), 'mean_duration_us': np.float64(4.138333333333333), 'median_duration_us': np.float64(4.085), 'std_dev_duration_us': np.float64(0.1359738536958077), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(4.325)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.216000000000001), 'mean_duration_us': np.float64(4.405333333333334), 'median_duration_us': np.float64(4.405), 'std_dev_duration_us': np.float64(0.1963675691712412), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.646)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.942), 'mean_duration_us': np.float64(5.647333333333333), 'median_duration_us': np.float64(4.726), 'std_dev_duration_us': np.float64(1.4759235150312575), 'min_duration_us': np.float64(4.486), 'max_duration_us': np.float64(7.73)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(2.11)}, {'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(3.12)}, {'name': 'void at::native::(anonymous namespace)::GammaBetaBackwardCUDAKer...', 'stream': 0, 'mean_duration_us': np.float64(4.14)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.41)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(5.65)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 4.0, 'has_bias': True, 'is_affine': True, 'is_training': True, 'output_mask': [True, True, True]}",True,5.720495381919212,30.01464900860342 +aten::batch_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (16,), (16,), (), (), (), ())","('float', '', '', 'float', 'float', 'Scalar', 'Scalar', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (1,), (1,), (), (), (), ())","('', '', '', '', '', 'True', '0.10000000000000001', '1.0000000000000001e-05', 'True')",919,3,332033.53599999996,110677.84533333332,191592.16417494096,0.000655456,1.0003662109375,0.624862721171446,vector_fp32,0.05943268228052002,0.004894991042083343,0.03713726757632372,0.0030586974226660484,17.729817708333332,1.463543802533565,53.189453125,74.351,49.765,331909.42,0.05938713108862719,0.05456062579367095,0.06435028995926192,0.037108804334604964,0.03409290110225022,0.040210097292115984,17.6630859375,16.30078125,19.2255859375,"[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_kernel_for_multi_outputs<3, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int> >(int, at::native::(anonymous namespace)::batch_norm_update_stats_and_invert(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, double, double, long)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float, float)#1}, std::array, TrivialOffsetCalculator<4, unsigned int>, TrivialOffsetCalculator<3, unsigned int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.530000000000001), 'mean_duration_us': np.float64(3.176666666666667), 'median_duration_us': np.float64(3.644), 'std_dev_duration_us': np.float64(0.8672271264720037), 'min_duration_us': np.float64(1.961), 'max_duration_us': np.float64(3.925)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(10.693999999999999), 'mean_duration_us': np.float64(3.564666666666666), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.7857575255057304), 'min_duration_us': np.float64(2.483), 'max_duration_us': np.float64(4.326)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(32.966), 'mean_duration_us': np.float64(10.988666666666667), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.5762877367735286), 'min_duration_us': np.float64(10.174), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::(anonymous namespace)::unrolled_elementwise_ker...', 'stream': 0, 'mean_duration_us': np.float64(3.18)}, {'name': 'void at::native::batch_norm_transform_input_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, std::conditional::type, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, std::conditional::type, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::RestrictPtrTraits, int>, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.895), 'mean_duration_us': np.float64(3.965), 'median_duration_us': np.float64(3.965), 'std_dev_duration_us': np.float64(0.06531972647421815), 'min_duration_us': np.float64(3.885), 'max_duration_us': np.float64(4.045)}, {'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array >(int, at::native::(anonymous namespace)::batch_norm_calc_invstd(at::Tensor const&, at::Tensor const&, double)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(18.865000000000002), 'mean_duration_us': np.float64(6.288333333333334), 'median_duration_us': np.float64(6.369), 'std_dev_duration_us': np.float64(0.17297462883967188), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(6.448)}, {'name': 'void at::native::batch_norm_collect_statistics_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::RestrictPtrTraits, int>, float, float, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::RestrictPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::RestrictPtrTraits, int>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.587), 'mean_duration_us': np.float64(6.862333333333333), 'median_duration_us': np.float64(6.568), 'std_dev_duration_us': np.float64(0.8121807406948011), 'min_duration_us': np.float64(6.048), 'max_duration_us': np.float64(7.971)}]","[{'name': 'void at::native::batch_norm_transform_input_kernel(float const*, float const*, int, long, long, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.695), 'mean_duration_us': np.float64(3.8983333333333334), 'median_duration_us': np.float64(3.885), 'std_dev_duration_us': np.float64(0.04988876515698577), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(3.965)}, {'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(16.782999999999998), 'mean_duration_us': np.float64(5.594333333333332), 'median_duration_us': np.float64(5.528), 'std_dev_duration_us': np.float64(0.2178077643754286), 'min_duration_us': np.float64(5.367), 'max_duration_us': np.float64(5.888)}, {'name': 'void at::native::(anonymous namespace)::cuComputePartGradGammaBeta(float const*, float const*, long, long, float const*, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(20.707), 'mean_duration_us': np.float64(6.902333333333334), 'median_duration_us': np.float64(6.889), 'std_dev_duration_us': np.float64(0.5071320231348923), 'min_duration_us': np.float64(6.288), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::(anonymous namespace)::cuComputeGradGammaBeta(long, long, long, float const*, float const*, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(12.296), 'mean_duration_us': np.float64(4.0986666666666665), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.4510511898467109), 'min_duration_us': np.float64(2.123), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.657), 'mean_duration_us': np.float64(4.552333333333333), 'median_duration_us': np.float64(4.285), 'std_dev_duration_us': np.float64(0.7437568300339985), 'min_duration_us': np.float64(3.805), 'max_duration_us': np.float64(5.567)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.869999999999997), 'mean_duration_us': np.float64(7.289999999999999), 'median_duration_us': np.float64(7.17), 'std_dev_duration_us': np.float64(0.5463338417732021), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(8.011)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeFusedParamsCUDAKe...', 'stream': 0, 'mean_duration_us': np.float64(4.1)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.55)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.29)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,4.694873038729754,49.80054147644368 +aten::layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (16, 32, 32), (16, 32, 32), (), ())","('float', 'ScalarList', 'float', 'float', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (1024, 32, 1), (1024, 32, 1), (), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05', 'True')",811,3,8812.761,2937.587,5021.909728746127,0.000753664,1.375,0.5227272727272727,vector_fp32,0.09925539927538994,0.015634765952425182,0.0518835041666811,0.008172718566040437,14.781412760416666,2.4393353684496706,44.34423828125,48.352,28.032,8736.377,0.10166959391247461,0.082553959293223,0.1135426446204722,0.053145469545157184,0.04315320599418475,0.05935183696070138,14.18115234375,12.6982421875,17.46484375,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(44.344), 'mean_duration_us': np.float64(14.781333333333334), 'median_duration_us': np.float64(14.181), 'std_dev_duration_us': np.float64(1.99187890082594), 'min_duration_us': np.float64(12.698), 'max_duration_us': np.float64(17.465)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(14.78)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,4.353334470996304,54.15387594743998 +aten::native_group_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (8, 4), (8, 4), (), (), (), (), (), ())","('float', 'float', 'float', 'float', '', 'Scalar', 'Scalar', 'Scalar', 'Scalar', 'ScalarList')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (4, 1), (4, 1), (), (), (), (), (), ())","('', '', '', '', '', '8', '16', '1024', '4', '[True, False, False]')",39,3,533.636,177.87866666666665,235.44524314653998,0.001179648,1.50006103515625,0.749969483663588,vector_fp32,0.11607270439465735,0.02471211817896858,0.08705098618229744,0.018533334510914632,14.004557291666666,3.2111962330970787,42.013671875,43.565,40.33,449.741,0.12046957905759162,0.08945727697861705,0.13829125714776339,0.09034850800299177,0.06709022782560399,0.10371422271829656,13.056640625,11.3740234375,17.5830078125,"[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedParamsCUDAKernel(long, long, long, float const*, float const*, float const*, at::AccumulateType::type const*, at::AccumulateType::type const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.617), 'mean_duration_us': np.float64(4.539000000000001), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(1.026369329237775), 'min_duration_us': np.float64(3.604), 'max_duration_us': np.float64(5.968)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormBackwardKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float, float, float)#2} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.738), 'mean_duration_us': np.float64(4.5793333333333335), 'median_duration_us': np.float64(4.566), 'std_dev_duration_us': np.float64(0.6704099906441994), 'min_duration_us': np.float64(3.765), 'max_duration_us': np.float64(5.407)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradientsCUDAKernel(long, float const*, float const*, at::AccumulateType::type*, at::AccumulateType::type*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(14.658999999999999), 'mean_duration_us': np.float64(4.886333333333333), 'median_duration_us': np.float64(4.446), 'std_dev_duration_us': np.float64(0.9517430792440201), 'min_duration_us': np.float64(4.005), 'max_duration_us': np.float64(6.208)}]","[{'name': 'void at::native::(anonymous namespace)::ComputeBackwardFusedPara...', 'stream': 0, 'mean_duration_us': np.float64(4.54)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.58)}, {'name': 'void at::native::(anonymous namespace)::ComputeInternalGradients...', 'stream': 0, 'mean_duration_us': np.float64(4.89)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 4.0, 'has_bias': True, 'is_affine': True, 'is_training': True, 'output_mask': [True, False, False]}",True,4.124539582043076,58.278415529483055 +aten::layer_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), (), ())","('float', 'ScalarList', '', '', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (), (), ())","('', '[16, 32, 32]', '', '', '1.0000000000000001e-05', 'True')",934,3,266.067,88.68900000000001,95.66646824776171,0.000753664,1.375,0.5227272727272727,vector_fp32,0.11228673733100565,0.007963901459708054,0.058695339968480226,0.004162948490301934,12.88525390625,0.9514369086207531,38.65576171875,43.966,23.575,198.526,0.1161053010380623,0.10313261904928225,0.1176222919056724,0.06069140736080529,0.05391023268485209,0.0614843798597833,12.41796875,12.2578125,13.97998046875,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(38.656), 'mean_duration_us': np.float64(12.885333333333334), 'median_duration_us': np.float64(12.418), 'std_dev_duration_us': np.float64(0.7767974138874454), 'min_duration_us': np.float64(12.258), 'max_duration_us': np.float64(13.98)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(12.89)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16384, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,3.7948889532286296,62.073304482711684 +aten::mean,reduce,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), ())","('float', 'ScalarList', 'Scalar', '', 'float')","((16384, 1024, 32, 1), (), (), (), ())","('', '[]', 'False', '', '')",988,3,21550.049,7183.349666666666,12390.810850716807,0.000131072,0.5000038146972656,0.249998092665919,vector_fp32,0.0419193116128298,0.006647715364113619,0.010479747949075758,0.0016619161616143296,12.7236328125,2.05587415187946,38.1708984375,39.479,19.549,21491.021,0.04209298741620605,0.035186460086511995,0.04847848733577137,0.01052316656866204,0.008796547909293484,0.01211952936927175,12.45556640625,10.81494140625,14.900390625,"[{'name': 'Memset (Device)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(6.847999999999999), 'mean_duration_us': np.float64(2.282666666666666), 'median_duration_us': np.float64(1.842), 'std_dev_duration_us': np.float64(0.7097423632715057), 'min_duration_us': np.float64(1.722), 'max_duration_us': np.float64(3.284)}, {'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp, unsigned int, float, 4, 4> >(at::native::ReduceOp, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(31.323), 'mean_duration_us': np.float64(10.441), 'median_duration_us': np.float64(10.614), 'std_dev_duration_us': np.float64(1.0372492468061858), 'min_duration_us': np.float64(9.093), 'max_duration_us': np.float64(11.616)}]","[{'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(2.28)}, {'name': 'void at::native::reduce_kernel<512, 1, at::native::ReduceOp(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(34.048), 'mean_duration_us': np.float64(11.349333333333334), 'median_duration_us': np.float64(11.376), 'std_dev_duration_us': np.float64(0.06798692684790375), 'min_duration_us': np.float64(11.256), 'max_duration_us': np.float64(11.416)}]","[{'name': 'void at::native::batch_norm_backward_kernel(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.09), 'mean_duration_us': np.float64(3.03), 'median_duration_us': np.float64(3.124), 'std_dev_duration_us': np.float64(0.7386600481051259), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(3.884)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::direct_copy_kernel_cuda(at::TensorIteratorBase&)::{lambda()#3}::operator()() const::{lambda()#7}::operator()() const::{lambda(float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.575), 'mean_duration_us': np.float64(3.858333333333333), 'median_duration_us': np.float64(4.045), 'std_dev_duration_us': np.float64(0.6352187724625972), 'min_duration_us': np.float64(3.004), 'max_duration_us': np.float64(4.526)}, {'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.056999999999999), 'mean_duration_us': np.float64(4.352333333333333), 'median_duration_us': np.float64(4.165), 'std_dev_duration_us': np.float64(0.4455418673430763), 'min_duration_us': np.float64(3.925), 'max_duration_us': np.float64(4.967)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.03)}, {'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.86)}, {'name': 'MIOpenBatchNormFwdTrainSpatial', 'stream': 0, 'mean_duration_us': np.float64(4.35)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,3.3104554422792627,72.47357330352402 +aten::group_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), (), (), ())","('float', 'Scalar', '', '', 'Scalar', 'Scalar')","((16384, 1024, 32, 1), (), (), (), (), ())","('', '4', '', '', '1.0000000000000001e-05', 'True')",943,3,153.189,51.062999999999995,18.599813654980522,0.000655456,1.0003662109375,0.624862721171446,vector_fp32,0.09741620804511049,0.0164189966356011,0.06087175684527146,0.010259618916626514,10.961588541666666,1.7283104611351434,32.884765625,40.931,39.729,72.529,0.09189280862349217,0.08447114186851211,0.11588467364332723,0.05742039045256224,0.05278286756841774,0.0724120125148344,11.4150390625,9.0517578125,12.41796875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1}>(at::TensorIteratorBase&, at::native::(anonymous namespace)::GroupNormKernelImplInternal(at::Tensor const&, at::Tensor const&, at::Tensor const&, long, long, long, long, float, at::Tensor&, at::Tensor&, at::Tensor&)::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.736), 'mean_duration_us': np.float64(3.9120000000000004), 'median_duration_us': np.float64(4.606), 'std_dev_duration_us': np.float64(1.0972787552243353), 'min_duration_us': np.float64(2.363), 'max_duration_us': np.float64(4.767)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel(long, float, float const*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(21.149), 'mean_duration_us': np.float64(7.049666666666667), 'median_duration_us': np.float64(6.809), 'std_dev_duration_us': np.float64(0.4280197295556465), 'min_duration_us': np.float64(6.689), 'max_duration_us': np.float64(7.651)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(3.91)}, {'name': 'void at::native::(anonymous namespace)::RowwiseMomentsCUDAKernel...', 'stream': 0, 'mean_duration_us': np.float64(7.05)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': True}",True,3.2283423803105054,75.70191568383453 +aten::sum,reduce,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16), (), (), ())","('float', 'ScalarList', 'Scalar', '')","((16, 1), (), (), ())","('', '[0]', 'False', '')",103,6,27520.59,4586.765,11195.928190434395,1.28e-07,0.000492095947265625,0.24806201550387597,vector_fp32,0.00012539076366954036,3.0255241485078625e-05,3.110468556143637e-05,7.50517618234509e-06,4.331949869791667,1.0942127847261514,25.99169921875,14.607,8.453,27440.35,0.00012433529636920676,8.588816644993497e-05,0.00016313183081197898,3.084286421561718e-05,2.130559167750325e-05,4.0466810744056805e-05,4.205078125,3.1630859375,6.0078125,"[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4> >(at::native::ReduceOp::operator()(at::TensorIterator&)::{lambda(float, float)#1}>, unsigned int, float, 4, 4>)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(25.992), 'mean_duration_us': np.float64(4.332), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.99894327499947), 'min_duration_us': np.float64(3.163), 'max_duration_us': np.float64(6.008)}]","[{'name': 'void at::native::reduce_kernel<128, 4, at::native::ReduceOp, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 12, 'total_duration_us': np.float64(22.621), 'mean_duration_us': np.float64(1.8850833333333332), 'median_duration_us': np.float64(1.9015), 'std_dev_duration_us': np.float64(0.07396447157626122), 'min_duration_us': np.float64(1.761), 'max_duration_us': np.float64(1.962)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(1.89)}]","{'shape_in1': (16,), 'shape_in2': (16,), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (1,), 'stride_input2': (1,), 'stride_output': None}",True,2.2206478159747056,80.47420413125053 +aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (128,), (), (), (128,), (128,), ())","('float', 'float', 'float', '', '', 'float', 'float', 'Scalar')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (1,), (), (), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",88,3,1945.033,648.3443333333333,1062.809495321402,0.000524672,1.00048828125,0.5001220107369448,vector_fp32,0.19342844135154588,0.10415582864872205,0.09673782102244834,0.052090622453771565,7.516927083333333,5.841162477612149,22.55078125,36.665,32.799,1875.569,0.2447632973342447,0.07356979263114641,0.2619522340892465,0.12241151241740716,0.036793872620189016,0.13100807802974884,4.2861328125,4.0048828125,14.259765625,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(5.127), 'mean_duration_us': np.float64(5.127), 'median_duration_us': np.float64(5.127), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(5.127), 'max_duration_us': np.float64(5.127)}, {'name': 'Memset (Device)', 'stream': 0, 'count': 1, 'total_duration_us': np.float64(9.133), 'mean_duration_us': np.float64(9.133), 'median_duration_us': np.float64(9.133), 'std_dev_duration_us': np.float64(0.0), 'min_duration_us': np.float64(9.133), 'max_duration_us': np.float64(9.133)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.13)}, {'name': 'Memset (Device)', 'stream': 0, 'mean_duration_us': np.float64(9.13)}]","{'op_shape': (1, 128, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (131072, 1024, 32, 1), 'stride_output': None, 'num_channels': 128, 'has_bias': True, 'is_affine': True, 'is_training': False, 'output_mask': [True]}",True,2.213841012238825,82.68804514348936 +aten::add_,elementwise,python,CPU,thread 2300490 (python),"((), (), ())","('long int', 'long int', 'Scalar')","((), (), ())","('', '', '1')",799,6,111702.897,18617.1495,45500.52519478777,1e-09,2.288818359375e-05,0.041666666666666664,,8.159373148075394e-06,3.2424184530722574e-06,3.3997388116980807e-07,1.3510076887801073e-07,3.303955078125,1.1137280126556983,19.82373046875,27.9765,13.23,111494.667,6.712597892214445e-06,5.211748489025555e-06,1.275350285417748e-05,2.7969157884226854e-07,2.1715618704273142e-07,5.313959522573949e-07,3.58447265625,1.8818359375,4.60498046875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctorOnSelf_add, std::array >(int, at::native::CUDAFunctorOnSelf_add, std::array)', 'stream': 0, 'count': 6, 'total_duration_us': np.float64(19.823999999999998), 'mean_duration_us': np.float64(3.304), 'median_duration_us': np.float64(3.5845000000000002), 'std_dev_duration_us': np.float64(1.0166421854975984), 'min_duration_us': np.float64(1.882), 'max_duration_us': np.float64(4.605)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(3.3)}]","{'shape_in1': (), 'shape_in2': (), 'dtype_in1_in2_out': ('long int', 'long int', None), 'stride_input1': (), 'stride_input2': (), 'stride_output': None}",True,1.9461227103733774,84.63416785386273 +aten::native_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((1, 128, 32, 32), (1, 128, 32, 32), (), (), (), (128,), (128,), (), (), ())","('float', 'float', '', '', '', 'float', 'float', 'Scalar', 'Scalar', 'ScalarList')","((131072, 1024, 32, 1), (131072, 1024, 32, 1), (), (), (), (1,), (1,), (), (), ())","('', '', '', '', '', '', '', 'True', '1.0000000000000001e-05', '[True, False, False]')",23,3,662.188,220.72933333333333,346.017647147271,0.001179648,1.501953125,0.7490247074122237,vector_fp32,0.24182137684950603,0.029782389314002698,0.1811301860407223,0.022307745441957804,6.582356770833333,0.849598477465432,19.7470703125,25.878,16.074,620.236,0.24883658200894926,0.2091576276506063,0.2674699208889626,0.186384748032711,0.1566642308540302,0.2003415792354258,6.3291015625,5.88818359375,7.52978515625,"[{'name': 'void at::native::batch_norm_backward_kernel(torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float const, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 2ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<3ul, int>, float, 3ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, torch::headeronly::detail::GenericPackedTensorAccessor, float const, 0ul, torch::headeronly::DefaultPtrTraits, int>, at::detail::IndexBoundsCheck<1ul, int>, float const, 1ul, torch::headeronly::DefaultPtrTraits, int>, bool, float)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(19.747), 'mean_duration_us': np.float64(6.582333333333334), 'median_duration_us': np.float64(6.329), 'std_dev_duration_us': np.float64(0.6938656610292484), 'min_duration_us': np.float64(5.888), 'max_duration_us': np.float64(7.53)}]","[{'name': 'void at::native::batch_norm_backward_kernel(float const*, float const*, float const*, float const*, float const*, float*, int)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(17.583), 'mean_duration_us': np.float64(5.861), 'median_duration_us': np.float64(5.487), 'std_dev_duration_us': np.float64(0.705458716013914), 'min_duration_us': np.float64(5.247), 'max_duration_us': np.float64(6.849)}]","[{'name': 'void at::native::(anonymous namespace)::layer_norm_grad_input_ke...', 'stream': 0, 'mean_duration_us': np.float64(5.86)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 1024, 'has_bias': False, 'is_affine': True, 'is_training': False, 'output_mask': [True, False]}",True,1.7261479051342474,88.29891263707083 +aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((16, 32, 32), (16, 32, 32), ())","('float', 'float', 'Scalar')","((1024, 32, 1), (1024, 32, 1), ())","('', '', '1')",333,4,21.01,5.2525,0.46811002980068667,1.6384e-05,0.1875,0.08333333333333333,vector_fp32,0.047958026130510166,0.0033861364668778225,0.0039965021775425135,0.00028217803890648525,4.114990234375,0.29094638896929526,16.4599609375,5.3675,4.597,5.678,0.0480332236803435,0.044635094113734626,0.05113056304761905,0.004002768640028624,0.0037195911761445516,0.004260880253968253,4.10498046875,3.84521484375,4.40478515625,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 4, 'total_duration_us': np.float64(16.459999999999997), 'mean_duration_us': np.float64(4.114999999999999), 'median_duration_us': np.float64(4.105), 'std_dev_duration_us': np.float64(0.2519920633670832), 'min_duration_us': np.float64(3.845), 'max_duration_us': np.float64(4.405)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(4.11)}]","{'shape_in1': (16, 32, 32), 'shape_in2': (16, 32, 32), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (1024, 32, 1), 'stride_input2': (1024, 32, 1), 'stride_output': None}",True,1.6158968587080114,89.91480949577884 +aten::miopen_batch_norm_backward,NORM_bwd,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), (8, 16, 32, 32), (16,), (16,), (16,), (16,), (16,), ())","('float', 'float', 'float', 'float', 'float', 'float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), (1,), (1,), (1,), (1,), (1,), ())","('', '', '', '', '', '', '', '1.0000000000000001e-05')",167,3,1179.8,393.26666666666665,630.3512836445511,0.000524336,1.00006103515625,0.5000152578577968,vector_fp32,0.2067490101745708,0.01852446773236728,0.10337765963428229,0.00926251650987806,5.099934895833333,0.4674548588682645,15.2998046875,30.165,28.502,1121.133,0.20944165398868736,0.18702557868152922,0.22377979785349592,0.10472402262531696,0.0935156429504485,0.1118933133270814,5.0068359375,4.68603515625,5.60693359375,"[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(15.3), 'mean_duration_us': np.float64(5.1000000000000005), 'median_duration_us': np.float64(5.007), 'std_dev_duration_us': np.float64(0.38170407385827065), 'min_duration_us': np.float64(4.686), 'max_duration_us': np.float64(5.607)}]","[{'name': 'MIOpenBatchNormBwdSpatial', 'stream': 0, 'mean_duration_us': np.float64(5.1)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 16, 'has_bias': True, 'is_affine': True, 'is_training': False, 'output_mask': [True]}",True,1.5020027342259514,91.4168122300048 +aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (32, 32), ())","('float', 'ScalarList', 'float', '')","((16384, 1024, 32, 1), (), (32, 1), ())","('', '[32, 32]', '', '')",912,3,151.726,50.57533333333333,40.63064339059047,0.000524544,1.00390625,0.4982976653696498,vector_fp32,0.23196586194858182,0.03604997760607121,0.11558804745443681,0.017963619677733432,4.61962890625,0.7875207625785555,13.85888671875,29.314,24.987,97.425,0.25033351788202507,0.1904312566027736,0.2551328113609468,0.1247406075243846,0.09489145057857082,0.12713208426035505,4.205078125,4.1259765625,5.52783203125,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.859000000000002), 'mean_duration_us': np.float64(4.619666666666667), 'median_duration_us': np.float64(4.205), 'std_dev_duration_us': np.float64(0.6430978843760011), 'min_duration_us': np.float64(4.126), 'max_duration_us': np.float64(5.528)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.62)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 1024, 'has_bias': False, 'is_affine': True, 'is_training': False}",True,1.3605458481373325,92.77735807814213 +aten::_fused_rms_norm,NORM_fwd,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'ScalarList', '', '')","((16384, 1024, 32, 1), (), (), ())","('', '[32, 32]', '', '')",975,3,70.705,23.56833333333333,4.88347748365172,0.000524544,1.00390625,0.4982976653696498,vector_fp32,0.23710807904360365,0.01876822884498544,0.1181504022277101,0.00935216461657956,4.459147135416667,0.3698653385043163,13.37744140625,21.452,20.1,29.153,0.247915392824287,0.21543642010592584,0.2479724242005981,0.12353566145354186,0.10735146517437795,0.1235640800552105,4.24609375,4.2451171875,4.88623046875,"[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_kernel(int, float, float const*, float const*, float const*, float*, float*, float*)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.377000000000002), 'mean_duration_us': np.float64(4.4590000000000005), 'median_duration_us': np.float64(4.246), 'std_dev_duration_us': np.float64(0.30193487156449256), 'min_duration_us': np.float64(4.245), 'max_duration_us': np.float64(4.886)}]","[{'name': 'void at::native::(anonymous namespace)::vectorized_layer_norm_ke...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]","{'op_shape': (8, 16, 32, 32), 'dtype_in_out': ('float', None), 'stride_input': (16384, 1024, 32, 1), 'stride_output': None, 'num_channels': 1024, 'has_bias': False, 'is_affine': True, 'is_training': False}",True,1.3132817038867808,94.09063978202892 +aten::normal_,elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (), (), ())","('float', 'Scalar', 'Scalar', '')","((16384, 1024, 32, 1), (), (), ())","('', '0.', '1.', '')",982,3,66.521,22.173666666666666,8.761302433618722,,,,,,,,,4.458821614583333,0.3500872140033832,13.37646484375,25.078,12.329,29.114,,,,,,,4.365234375,4.1650390625,4.84619140625,"[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise_grid_stride_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1}>(long, at::PhiloxCudaState, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::(anonymous namespace)::distribution_nullary_kernel, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2}, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_and_transform(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1}>(at::TensorIteratorBase&, at::CUDAGeneratorImpl*, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(hiprandStatePhilox4_32_10*)#2} const&, at::native::templates::cuda::normal_kernel(at::TensorBase const&, double, double, at::CUDAGeneratorImpl*)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float)#1})::{lambda(int, float)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.376000000000001), 'mean_duration_us': np.float64(4.458666666666667), 'median_duration_us': np.float64(4.365), 'std_dev_duration_us': np.float64(0.28579751962223576), 'min_duration_us': np.float64(4.165), 'max_duration_us': np.float64(4.846)}]","[{'name': 'void at::native::(anonymous namespace)::distribution_elementwise...', 'stream': 0, 'mean_duration_us': np.float64(4.46)}]",,False,1.3131858334116275,95.40382561544054 +aten::mse_loss_backward,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((), (8, 16, 32, 32), (8, 16, 32, 32), (), (8, 16, 32, 32))","('float', 'float', 'float', 'Scalar', 'float')","((), (16384, 1024, 32, 1), (16384, 1024, 32, 1), (), (16384, 1024, 32, 1))","('', '', '', '1', '')",9,3,137599.16400000002,45866.388000000006,79423.6600692322,,,,,,,,,4.446451822916667,0.9320300852322503,13.33935546875,13.52,8.713,137576.931,,,,,,,4.2861328125,3.60498046875,5.4482421875,"[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1}>(int, at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase&, at::native::mse_backward_cuda_kernel(at::TensorIterator&, c10::Scalar const&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float, float)#1} const&)::{lambda(int, bool)#1})', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(13.339), 'mean_duration_us': np.float64(4.4463333333333335), 'median_duration_us': np.float64(4.286), 'std_dev_duration_us': np.float64(0.7608952329693989), 'min_duration_us': np.float64(3.605), 'max_duration_us': np.float64(5.448)}]","[{'name': 'void at::native::elementwise_kernel_manual_unroll<128, 4, at::na...', 'stream': 0, 'mean_duration_us': np.float64(4.45)}]",,False,1.3095427553558041,96.71336837079635 +"aten::mse_loss->void at::native::vectorized_elementwise_kernel<4, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array) (Synthetic Op)",elementwise,python,CPU,thread 2300490 (python),"((8, 16, 32, 32), (8, 16, 32, 32), ())","('float', 'float', 'Scalar')","((16384, 1024, 32, 1), (16384, 1024, 32, 1), ())","('', '', '1')",8500,3,152058.83200000002,50686.27733333334,87692.50918748582,,,,,,,,,3.77783203125,0.6160871136487144,11.33349609375,73.99,39.979,151944.863,,,,,,,3.48388671875,3.36376953125,4.48583984375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array >(int, at::native::mse_kernel_cuda(at::TensorIteratorBase&)::{lambda()#1}::operator()() const::{lambda()#2}::operator()() const::{lambda(float, float)#1}, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(11.334), 'mean_duration_us': np.float64(3.778), 'median_duration_us': np.float64(3.484), 'std_dev_duration_us': np.float64(0.503022862303494), 'min_duration_us': np.float64(3.364), 'max_duration_us': np.float64(4.486)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::ms...', 'stream': 0, 'mean_duration_us': np.float64(3.78)}]",,False,1.1126247993910308,97.82599317018737 +aten::fill_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((8, 16, 32, 32), ())","('float', 'Scalar')","((16384, 1024, 32, 1), ())","('', '0')",8,3,108.982,36.327333333333335,32.981532079837244,,,,,,,,,3.150390625,0.57578505122717,9.451171875,26.069,9.694,73.219,,,,,,,2.9228515625,2.72314453125,3.80517578125,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(9.451), 'mean_duration_us': np.float64(3.1503333333333337), 'median_duration_us': np.float64(2.923), 'std_dev_duration_us': np.float64(0.4700647709506521), 'min_duration_us': np.float64(2.723), 'max_duration_us': np.float64(3.805)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(3.15)}]",,False,0.9278344585331434,98.75382762872052 +aten::fill_,elementwise,python,CPU,thread 2300490 (python),"((), ())","('float', 'Scalar')","((), ())","('', '1.')",993,3,62.082,20.694,14.578219129921186,,,,,,,,,2.7229817708333335,0.772600022376397,8.1689453125,17.315,8.102,36.665,,,,,,,3.04296875,1.841796875,3.2841796875,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::FillFunctor, std::array >(int, at::native::FillFunctor, std::array)', 'stream': 0, 'count': 3, 'total_duration_us': np.float64(8.169), 'mean_duration_us': np.float64(2.7230000000000003), 'median_duration_us': np.float64(3.043), 'std_dev_duration_us': np.float64(0.6306826988800839), 'min_duration_us': np.float64(1.842), 'max_duration_us': np.float64(3.284)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::Fi...', 'stream': 0, 'mean_duration_us': np.float64(2.72)}]",,False,0.8019565246569275,99.55578415337745 +aten::add_,elementwise,python,CPU,thread 2300680 (pt_autograd_0),"((32, 32), (32, 32), ())","('float', 'float', 'Scalar')","((32, 1), (32, 1), ())","('', '', '1')",258,2,32.438,16.219,10.715496162100942,1.024e-06,0.01171875,0.08333333333333333,vector_fp32,0.005466037708706859,0.0006164429592976079,0.0004555031423922382,5.1370246608134065e-05,2.262451171875,0.25515230043791925,4.52490234375,16.219,8.642,23.796,0.005466037708706859,0.005030146711972817,0.0059019287054409,0.0004555031423922382,0.00041917889266440136,0.000491827392120075,2.262451171875,2.08203125,2.44287109375,"[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CUDAFunctor_add, std::array >(int, at::native::CUDAFunctor_add, std::array)', 'stream': 0, 'count': 2, 'total_duration_us': np.float64(4.525), 'mean_duration_us': np.float64(2.2625), 'median_duration_us': np.float64(2.2625), 'std_dev_duration_us': np.float64(0.18050000000000008), 'min_duration_us': np.float64(2.082), 'max_duration_us': np.float64(2.443)}]","[{'name': 'void at::native::vectorized_elementwise_kernel<4, at::native::CU...', 'stream': 0, 'mean_duration_us': np.float64(2.26)}]","{'shape_in1': (32, 32), 'shape_in2': (32, 32), 'dtype_in1_in2_out': ('float', 'float', None), 'stride_input1': (32, 1), 'stride_input2': (32, 1), 'stride_output': None}",True,0.44421584662257907,100.00000000000003