Skip to content
Closed
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
4 changes: 2 additions & 2 deletions docs/lab/Lab3.5-AscendC-Op/index.md
Original file line number Diff line number Diff line change
Expand Up @@ -209,7 +209,7 @@ Simulator 在 CPU 上模拟指定 SoC 的指令执行,适合检查指令发射
python3 checker/test_op.py 2
```

由于是 CPU 侧模拟算子在 NPU 上的行为,所以我们需要显示指定 -soc-version 为 Ascend 910B4。
由于是 CPU 侧模拟算子在 NPU 上的行为,所以我们需要显式指定 -soc-version 为 Ascend 910B4。

!!! warning "不要尝试模拟真实数据规模"

Expand Down Expand Up @@ -295,7 +295,7 @@ Vector 侧的元素级与逐元素运算包括 `Cast`(类型转换,可指定

### 让搬运与计算形成流水

AIV 的 MTE2、Vector 和 MTE3 可以分别执行搬入、计算和搬出。由于这三个单元本身是相互独立的,因此如果在同一时间重叠不同单元的执行将能够大幅掩盖时间,获得加速。Ascend C 的编程模型中倡导把一个 tile 的处理拆成 `CopyIn → Compute → CopyOut` 三段式,明确生命生产者和消费者关系,并用 `TQue` 在阶段间传递 LocalTensor 的所有权与同步事件。这样的编写范式能够更好的让编译器识别依赖关系,并且**自动**开启流水。
AIV 的 MTE2、Vector 和 MTE3 可以分别执行搬入、计算和搬出。由于这三个单元本身是相互独立的,因此如果在同一时间重叠不同单元的执行将能够大幅掩盖时间,获得加速。Ascend C 的编程模型中倡导把一个 tile 的处理拆成 `CopyIn → Compute → CopyOut` 三段式,明确声明生产者和消费者关系,并用 `TQue` 在阶段间传递 LocalTensor 的所有权与同步事件。这样的编写范式能够更好的让编译器识别依赖关系,并且**自动**开启流水。

<figure markdown="span">
<div markdown="span" style="background: #ffffff; padding: 8px;">
Expand Down
2 changes: 1 addition & 1 deletion docs/lab/Lab4-AMSS-NCKU/index.md
Original file line number Diff line number Diff line change
Expand Up @@ -76,7 +76,7 @@ AMSS-NCKU 也被用作 [ASC26 世界大学生超级计算机竞赛](https://www.

!!! note "关于黑洞演化时间"

本实验的优化任务设计 CPU 和 GPU 两个平台。由于 CPU 单步演化的时间可能远大于 GPU 演化,因此在硬件资源有限的情况下我们无法支撑你在 CPU 平台上完整模拟整个引力波事件。目前演化时间的选择逻辑如下:
本实验的优化任务涉及 CPU 和 GPU 两个平台。由于 CPU 单步演化的时间可能远大于 GPU 演化,因此在硬件资源有限的情况下我们无法支撑你在 CPU 平台上完整模拟整个引力波事件。目前演化时间的选择逻辑如下:

```python
Final_Evolution_Time = 100.0 if GPU_Calculation == "yes" else 40.0 ## final evolution time t1
Expand Down
4 changes: 2 additions & 2 deletions docs/lab/Lab5-Gemma4/index.md
Original file line number Diff line number Diff line change
Expand Up @@ -596,7 +596,7 @@ Prefill 通常处理多个 token,计算量明显大于单步 decode。如果

- 你需要使用优化后的推理框架在 1/7 张 H800 上进行推理,推理框架启动入口为 `scripts/run_generation_queue.py`。

- 我们会给出一份公开的性能测试数据集 `performance_public.jsonl`,在测试时我们采用无限并发模式,即在开始推理之间将所有请求压入等待队列,推理过程中不再有新的请求到达。
- 我们会给出一份公开的性能测试数据集 `performance_public.jsonl`,在测试时我们采用无限并发模式,即在开始推理之前将所有请求压入等待队列,推理过程中不再有新的请求到达。

- 允许修改代码框架的推理逻辑、算子实现、KV Cache 管理和请求调度策略,但不得修改模型结构,修改计时区间或跳过必要步骤。

Expand Down Expand Up @@ -713,7 +713,7 @@ Prefill 通常处理多个 token,计算量明显大于单步 decode。如果
├── src/
│ └── ...
├── config.yaml
├── datasets/ # optimal
├── datasets/ # optional
│ └── calibration.jsonl
├── report.pdf
└── results/
Expand Down