From 51dfe5016d802ca06932c87299ca8eb395c153ea Mon Sep 17 00:00:00 2001 From: Bao Jie <65008983+Bjorntday@users.noreply.github.com> Date: Wed, 2 Jul 2025 17:20:17 +0800 Subject: [PATCH] Update kernel_wrapper.cpp fix bug for flash-attn v2.6.2 --- src/ksana_llm/kernels/nvidia/kernel_wrapper.cpp | 1 + 1 file changed, 1 insertion(+) diff --git a/src/ksana_llm/kernels/nvidia/kernel_wrapper.cpp b/src/ksana_llm/kernels/nvidia/kernel_wrapper.cpp index 6cec6a53..fa4706f9 100644 --- a/src/ksana_llm/kernels/nvidia/kernel_wrapper.cpp +++ b/src/ksana_llm/kernels/nvidia/kernel_wrapper.cpp @@ -1245,6 +1245,7 @@ void InvokePagedAttention(void* output_ptr, void* query_ptr, void** key_cache_pt const_null_tensor, // rotary_cos_: seqlen_ro x (rotary_dim / 2) const_null_tensor, // rotary_sin_: seqlen_ro x (rotary_dim / 2) const_null_tensor, // cache_batch_idx_: indices to index into the KV cache + const_null_tensor, // indices that the KV cache starts. [batch_size,], nullptr, default 0 block_table_tensor, // batch_size x max_num_blocks_per_seq alibi_slopes_tensor, // num_heads or batch_size x num_heads out_tensor, // batch_size x seqlen_q x num_heads x head_size