hai 5 meses · 9b8f3c6c77
--- a/ggml/src/ggml-cuda/fattn-mma-f16.cuh
+++ b/ggml/src/ggml-cuda/fattn-mma-f16.cuh
@@ -1330,14 +1330,16 @@ static __global__ void flash_attn_ext_f16(
 
				          ne01, ne02, stride_Q1, stride_Q2, stride_K, stride_V, stride_mask, jt, kb0_start_kernel, kb0_stop_kernel);
			
 
				 #else
			
 
				     GGML_UNUSED(Q); GGML_UNUSED(K); GGML_UNUSED(V); GGML_UNUSED(mask);
			
 
				-    GGML_UNUSED(dst); GGML_UNUSED(dst_meta); GGML_UNUSED(scale);
			
 
				-    GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				-    GGML_UNUSED(n_head_log2); GGML_UNUSED(logit_softcap); GGML_UNUSED(ne00);
			
 
				-    GGML_UNUSED(ne01); GGML_UNUSED(ne02); GGML_UNUSED(ne03); GGML_UNUSED(ne10);
			
 
				-    GGML_UNUSED(ne11); GGML_UNUSED(ne12); GGML_UNUSED(ne13); GGML_UNUSED(ne31); GGML_UNUSED(ne32);
			
 
				-    GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb01); GGML_UNUSED(nb02); GGML_UNUSED(nb03);
			
 
				-    GGML_UNUSED(nb11); GGML_UNUSED(nb12); GGML_UNUSED(nb13); GGML_UNUSED(nb21);
			
 
				-    GGML_UNUSED(nb22); GGML_UNUSED(nb23);
			
 
				+    GGML_UNUSED(dst); GGML_UNUSED(dst_meta);
			
 
				+    GGML_UNUSED(scale); GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				+    GGML_UNUSED(n_head_log2); GGML_UNUSED(logit_softcap);
			
 
				+    GGML_UNUSED(ne00); GGML_UNUSED(ne01); GGML_UNUSED(ne02); GGML_UNUSED(ne03);
			
 
				+    GGML_UNUSED(nb01); GGML_UNUSED(nb02); GGML_UNUSED(nb03);
			
 
				+    GGML_UNUSED(ne10); GGML_UNUSED(ne11); GGML_UNUSED(ne12); GGML_UNUSED(ne13);
			
 
				+    GGML_UNUSED(nb11); GGML_UNUSED(nb12); GGML_UNUSED(nb13);
			
 
				+    GGML_UNUSED(nb21); GGML_UNUSED(nb22); GGML_UNUSED(nb23);
			
 
				+    GGML_UNUSED(ne31); GGML_UNUSED(ne32); GGML_UNUSED(ne33);
			
 
				+    GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb33);
			
 
				     NO_DEVICE_CODE;
			
 
				 #endif // defined(FLASH_ATTN_AVAILABLE) && defined(NEW_MMA_AVAILABLE)
			
 
				 }
			
--- a/ggml/src/ggml-cuda/fattn-tile-f32.cu
+++ b/ggml/src/ggml-cuda/fattn-tile-f32.cu
@@ -37,16 +37,16 @@ static __global__ void flash_attn_tile_ext_f32(
 
				 #endif // FP16_MMA_AVAILABLE
			
 
				     if (use_logit_softcap && !(D == 128 || D == 256)) {
			
 
				         GGML_UNUSED(Q); GGML_UNUSED(K); GGML_UNUSED(V); GGML_UNUSED(mask);
			
 
				-        GGML_UNUSED(dst); GGML_UNUSED(dst_meta); GGML_UNUSED(scale);
			
 
				-        GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				+        GGML_UNUSED(dst); GGML_UNUSED(dst_meta);
			
 
				+        GGML_UNUSED(scale); GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				         GGML_UNUSED(n_head_log2); GGML_UNUSED(logit_softcap);
			
 
				-        GGML_UNUSED(ne00); GGML_UNUSED(ne01); GGML_UNUSED(ne02);
			
 
				-        GGML_UNUSED(ne03); GGML_UNUSED(ne10); GGML_UNUSED(ne11);
			
 
				-        GGML_UNUSED(ne12); GGML_UNUSED(ne13); GGML_UNUSED(ne31); GGML_UNUSED(ne32);
			
 
				-        GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb01); GGML_UNUSED(nb02);
			
 
				-        GGML_UNUSED(nb03); GGML_UNUSED(nb11); GGML_UNUSED(nb12);
			
 
				-        GGML_UNUSED(nb13); GGML_UNUSED(nb21); GGML_UNUSED(nb22);
			
 
				-        GGML_UNUSED(nb23);
			
 
				+        GGML_UNUSED(ne00); GGML_UNUSED(ne01); GGML_UNUSED(ne02); GGML_UNUSED(ne03);
			
 
				+        GGML_UNUSED(nb01); GGML_UNUSED(nb02); GGML_UNUSED(nb03);
			
 
				+        GGML_UNUSED(ne10); GGML_UNUSED(ne11); GGML_UNUSED(ne12); GGML_UNUSED(ne13);
			
 
				+        GGML_UNUSED(nb11); GGML_UNUSED(nb12); GGML_UNUSED(nb13);
			
 
				+        GGML_UNUSED(nb21); GGML_UNUSED(nb22); GGML_UNUSED(nb23);
			
 
				+        GGML_UNUSED(ne31); GGML_UNUSED(ne32); GGML_UNUSED(ne33);
			
 
				+        GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb33);
			
 
				         NO_DEVICE_CODE;
			
 
				         return;
			
 
				     }
			
@@ -282,16 +282,16 @@ static __global__ void flash_attn_tile_ext_f32(
 
				     }
			
 
				 #else
			
 
				     GGML_UNUSED(Q); GGML_UNUSED(K); GGML_UNUSED(V); GGML_UNUSED(mask);
			
 
				-    GGML_UNUSED(dst); GGML_UNUSED(dst_meta); GGML_UNUSED(scale);
			
 
				-    GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				+    GGML_UNUSED(dst); GGML_UNUSED(dst_meta);
			
 
				+    GGML_UNUSED(scale); GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				     GGML_UNUSED(n_head_log2); GGML_UNUSED(logit_softcap);
			
 
				     GGML_UNUSED(ne00); GGML_UNUSED(ne01); GGML_UNUSED(ne02); GGML_UNUSED(ne03);
			
 
				-    GGML_UNUSED(ne10); GGML_UNUSED(ne11); GGML_UNUSED(ne12); GGML_UNUSED(ne13);
			
 
				-    GGML_UNUSED(ne31); GGML_UNUSED(ne32);
			
 
				-    GGML_UNUSED(nb31); GGML_UNUSED(nb32);
			
 
				     GGML_UNUSED(nb01); GGML_UNUSED(nb02); GGML_UNUSED(nb03);
			
 
				+    GGML_UNUSED(ne10); GGML_UNUSED(ne11); GGML_UNUSED(ne12); GGML_UNUSED(ne13);
			
 
				     GGML_UNUSED(nb11); GGML_UNUSED(nb12); GGML_UNUSED(nb13);
			
 
				     GGML_UNUSED(nb21); GGML_UNUSED(nb22); GGML_UNUSED(nb23);
			
 
				+    GGML_UNUSED(ne31); GGML_UNUSED(ne32); GGML_UNUSED(ne33);
			
 
				+    GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb33);
			
 
				     NO_DEVICE_CODE;
			
 
				 #endif // FLASH_ATTN_AVAILABLE
			
 
				 }
			
--- a/ggml/src/ggml-cuda/fattn-vec-f16.cuh
+++ b/ggml/src/ggml-cuda/fattn-vec-f16.cuh
@@ -329,16 +329,16 @@ static __global__ void flash_attn_vec_ext_f16(
 
				     }
			
 
				 #else
			
 
				     GGML_UNUSED(Q); GGML_UNUSED(K); GGML_UNUSED(V); GGML_UNUSED(mask);
			
 
				-    GGML_UNUSED(dst); GGML_UNUSED(dst_meta); GGML_UNUSED(scale);
			
 
				-    GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				+    GGML_UNUSED(dst); GGML_UNUSED(dst_meta);
			
 
				+    GGML_UNUSED(scale); GGML_UNUSED(max_bias); GGML_UNUSED(m0); GGML_UNUSED(m1);
			
 
				     GGML_UNUSED(n_head_log2); GGML_UNUSED(logit_softcap);
			
 
				-    GGML_UNUSED(ne00); GGML_UNUSED(ne01); GGML_UNUSED(ne02);
			
 
				-    GGML_UNUSED(ne03); GGML_UNUSED(ne10); GGML_UNUSED(ne11);
			
 
				-    GGML_UNUSED(ne12); GGML_UNUSED(ne13); GGML_UNUSED(ne31); GGML_UNUSED(ne32); GGML_UNUSED(ne32);
			
 
				-    GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb33); GGML_UNUSED(nb01); GGML_UNUSED(nb02);
			
 
				-    GGML_UNUSED(nb03); GGML_UNUSED(nb11); GGML_UNUSED(nb12);
			
 
				-    GGML_UNUSED(nb13); GGML_UNUSED(nb21); GGML_UNUSED(nb22);
			
 
				-    GGML_UNUSED(nb23);
			
 
				+    GGML_UNUSED(ne00); GGML_UNUSED(ne01); GGML_UNUSED(ne02); GGML_UNUSED(ne03);
			
 
				+    GGML_UNUSED(nb01); GGML_UNUSED(nb02); GGML_UNUSED(nb03);
			
 
				+    GGML_UNUSED(ne10); GGML_UNUSED(ne11); GGML_UNUSED(ne12); GGML_UNUSED(ne13);
			
 
				+    GGML_UNUSED(nb11); GGML_UNUSED(nb12); GGML_UNUSED(nb13);
			
 
				+    GGML_UNUSED(nb21); GGML_UNUSED(nb22); GGML_UNUSED(nb23);
			
 
				+    GGML_UNUSED(ne31); GGML_UNUSED(ne32); GGML_UNUSED(ne33);
			
 
				+    GGML_UNUSED(nb31); GGML_UNUSED(nb32); GGML_UNUSED(nb33);
			
 
				     NO_DEVICE_CODE;
			
 
				 #endif // defined(FLASH_ATTN_AVAILABLE) && defined(FP16_AVAILABLE)
			
 
				 }
			
--- a/ggml/src/ggml-cuda/set-rows.cu
+++ b/ggml/src/ggml-cuda/set-rows.cu
@@ -44,6 +44,9 @@ static __global__ void k_set_rows_quant(
 
				     block_type * dst_block = dst_row_ptr + i00 / qk;
			
 
				 
			
 
				     quantize_func(src_block, dst_block);
			
 
				+
			
 
				+    GGML_UNUSED(ne10);
			
 
				+    GGML_UNUSED(ne13);
			
 
				 }
			
 
				 
			
 
				 // Template dispatch function for quantized set_rows