diff --git a/docs/lab/Lab3.5-AscendC-Op/index.md b/docs/lab/Lab3.5-AscendC-Op/index.md index 1960ffd0..e5c920e0 100644 --- a/docs/lab/Lab3.5-AscendC-Op/index.md +++ b/docs/lab/Lab3.5-AscendC-Op/index.md @@ -209,7 +209,7 @@ Simulator 在 CPU 上模拟指定 SoC 的指令执行,适合检查指令发射 python3 checker/test_op.py 2 ``` - 由于是 CPU 侧模拟算子在 NPU 上的行为,所以我们需要显示指定 -soc-version 为 Ascend 910B4。 + 由于是 CPU 侧模拟算子在 NPU 上的行为,所以我们需要显式指定 -soc-version 为 Ascend 910B4。 !!! warning "不要尝试模拟真实数据规模" @@ -295,7 +295,7 @@ Vector 侧的元素级与逐元素运算包括 `Cast`(类型转换,可指定 ### 让搬运与计算形成流水 -AIV 的 MTE2、Vector 和 MTE3 可以分别执行搬入、计算和搬出。由于这三个单元本身是相互独立的,因此如果在同一时间重叠不同单元的执行将能够大幅掩盖时间,获得加速。Ascend C 的编程模型中倡导把一个 tile 的处理拆成 `CopyIn → Compute → CopyOut` 三段式,明确生命生产者和消费者关系,并用 `TQue` 在阶段间传递 LocalTensor 的所有权与同步事件。这样的编写范式能够更好的让编译器识别依赖关系,并且**自动**开启流水。 +AIV 的 MTE2、Vector 和 MTE3 可以分别执行搬入、计算和搬出。由于这三个单元本身是相互独立的,因此如果在同一时间重叠不同单元的执行将能够大幅掩盖时间,获得加速。Ascend C 的编程模型中倡导把一个 tile 的处理拆成 `CopyIn → Compute → CopyOut` 三段式,明确声明生产者和消费者关系,并用 `TQue` 在阶段间传递 LocalTensor 的所有权与同步事件。这样的编写范式能够更好的让编译器识别依赖关系,并且**自动**开启流水。
diff --git a/docs/lab/Lab4-AMSS-NCKU/index.md b/docs/lab/Lab4-AMSS-NCKU/index.md index c414c382..824d1c7d 100644 --- a/docs/lab/Lab4-AMSS-NCKU/index.md +++ b/docs/lab/Lab4-AMSS-NCKU/index.md @@ -76,7 +76,7 @@ AMSS-NCKU 也被用作 [ASC26 世界大学生超级计算机竞赛](https://www. !!! note "关于黑洞演化时间" - 本实验的优化任务设计 CPU 和 GPU 两个平台。由于 CPU 单步演化的时间可能远大于 GPU 演化,因此在硬件资源有限的情况下我们无法支撑你在 CPU 平台上完整模拟整个引力波事件。目前演化时间的选择逻辑如下: + 本实验的优化任务涉及 CPU 和 GPU 两个平台。由于 CPU 单步演化的时间可能远大于 GPU 演化,因此在硬件资源有限的情况下我们无法支撑你在 CPU 平台上完整模拟整个引力波事件。目前演化时间的选择逻辑如下: ```python Final_Evolution_Time = 100.0 if GPU_Calculation == "yes" else 40.0 ## final evolution time t1 diff --git a/docs/lab/Lab5-Gemma4/index.md b/docs/lab/Lab5-Gemma4/index.md index 65edebc7..839da2dc 100644 --- a/docs/lab/Lab5-Gemma4/index.md +++ b/docs/lab/Lab5-Gemma4/index.md @@ -596,7 +596,7 @@ Prefill 通常处理多个 token,计算量明显大于单步 decode。如果 - 你需要使用优化后的推理框架在 1/7 张 H800 上进行推理,推理框架启动入口为 `scripts/run_generation_queue.py`。 -- 我们会给出一份公开的性能测试数据集 `performance_public.jsonl`,在测试时我们采用无限并发模式,即在开始推理之间将所有请求压入等待队列,推理过程中不再有新的请求到达。 +- 我们会给出一份公开的性能测试数据集 `performance_public.jsonl`,在测试时我们采用无限并发模式,即在开始推理之前将所有请求压入等待队列,推理过程中不再有新的请求到达。 - 允许修改代码框架的推理逻辑、算子实现、KV Cache 管理和请求调度策略,但不得修改模型结构,修改计时区间或跳过必要步骤。 @@ -713,7 +713,7 @@ Prefill 通常处理多个 token,计算量明显大于单步 decode。如果 ├── src/ │ └── ... ├── config.yaml -├── datasets/ # optimal +├── datasets/ # optional │ └── calibration.jsonl ├── report.pdf └── results/