1- # Kernel-internal env vars (deferred from docs/ENVIRONMENT.md).
2- # These are kernel implementation / micro-tuning / bisect switches whose
3- # meaning is tied to a specific kernel; they are recorded in the ledger and
4- # docs/BENCHMARKS.md, not on the deployment surface. scripts/check-env-doc.py
5- # treats a name here as a known kernel-internal knob. A NEW production env
6- # var must be documented in docs/ENVIRONMENT.md OR added here.
7- # Inherited ROCm/Gemma-4 bring-up tactics. These are default-off diagnostic,
8- # fallback, or experimental kernel behavior, not supported deployment knobs.
9- VT_GEMMA4_BATCH_EXPERTS
10- VT_GEMMA4_CUSTOM_EXPERT
11- VT_GEMMA4_FP8_NATIVE
12- VT_GEMMA4_FUSED_EXPERTS
13- VT_GEMMA4_HOST_AXPY
14- VT_GEMMA4_PROFILE
15- VT_ROCM_GEMM_COMPUTE
16- VT_ROCM_GEMV
17- VT_ROCM_HIPBLASLT
1+ VLLM_CPP_QWEN3_DENSE_DECODE_GRAPH
2+ VLLM_GEMMA4_MM_DEBUG
183VLLM_MM_TOWER_PROFILE
194VT_ARCH_TACTIC_STATS
5+ VT_ASYNC_EXECUTOR_NO_DBUF
6+ VT_ASYNC_EXECUTOR_POISON
7+ VT_ASYNC_EXECUTOR_TRACE
208VT_ATTN_DECODE_D128
219VT_ATTN_DECODE_GQA
2210VT_ATTN_DECODE_OPT
@@ -37,6 +25,7 @@ VT_DEEPSEEK_GRAPH_VERIFY
3725VT_DENSE_CUBLASLT_FP8
3826VT_DENSE_NATIVE
3927VT_DIRECT_DEVICE_LOAD
28+ VT_DUMP_ACT
4029VT_FA2_DECODE_35B
4130VT_FA2_DECODE_QWEN3
4231VT_FA2_NSPLITS_CAP
@@ -123,9 +112,29 @@ VT_GLUE_FUSE
123112VT_INTERNLM2_WRONG_SPLIT
124113VT_KDA_CHUNK_TRITON
125114VT_KV_ALLOC_LOG
115+ VT_LAGUNA_DECODE_GRAPH
116+ VT_LAGUNA_FAST_NORM
117+ VT_LAGUNA_GLUE_FUSED
118+ VT_LAGUNA_GROUPED_MOE
119+ VT_LAGUNA_KV_BF16
120+ VT_LAGUNA_KV_HEADROOM
121+ VT_LAGUNA_MARLIN_MOE
122+ VT_LAGUNA_MOE_ADDNORM_FUSED
123+ VT_LAGUNA_MOE_ONECAST
124+ VT_LAGUNA_ONDEV_SAMPLE
125+ VT_LAGUNA_PREAMBLE_FUSED
126+ VT_LAGUNA_RESIDENT_BF16W
127+ VT_LAGUNA_RESIDENT_DECODE
128+ VT_LAGUNA_RESIDENT_MOE
129+ VT_LAGUNA_SHARED_AUX
130+ VT_LAGUNA_SHARED_FP4
131+ VT_LAGUNA_SWA_WINDOW
132+ VT_LAGUNA_TAIL_FUSED
133+ VT_LAGUNA_TOPK_SHFL
126134VT_LOAD_WINDOWED_RELEASE
127135VT_LOGITS_GATHER
128136VT_MARLIN_WS_POOL
137+ VT_MLA_FUSED_NORM_ROPE
129138VT_MLA_SPLIT_FILL
130139VT_MOE_BF16_FAST
131140VT_MOE_BF16_FUSED_GATEUP
@@ -134,16 +143,19 @@ VT_MOE_DECODE
134143VT_MOE_FUSED_W13
135144VT_MOE_GLUE_FUSE
136145VT_MOE_HOST_FREE
146+ VT_MOE_PAD_STATS
137147VT_MOE_SHARED_AUX_STREAM
138148VT_MOE_SHARED_AUX_THRESHOLD
139149VT_MOE_SPLIT_K
140150VT_NVFP4_CUTLASS
151+ VT_NVFP4_FP4_GEMV
141152VT_NVFP4_FP4_NATIVE
142153VT_NVFP4_MARLIN
143154VT_NVFP4_WMMA
144155VT_PAGED_FLASH
145156VT_POOL_EXACT
146157VT_POOL_STATS
158+ VT_QWEN35_GROUPED_MOE
147159VT_QWEN3MOE_CUDAGRAPH
148160VT_QWEN3_ATTN_F32
149161VT_QWEN3_QKV_MERGE
@@ -155,81 +167,51 @@ VT_ROCM_GEMM_COMPUTE
155167VT_ROCM_GEMV
156168VT_ROCM_HIPBLASLT
157169VT_SILU_FP4_FAST
158- VT_SWIZZLE_IN_QUANT
159- VT_W4A4_TRUE
160- VLLM_GEMMA4_MM_DEBUG
161170VT_SPEC_TRACE
162- VT_DUMP_ACT
163- VT_V4_PROF
164- VT_V4_GROUPED_MOE
171+ VT_SWIZZLE_IN_QUANT
172+ VT_V4_DECODE_GRAPH
165173VT_V4_DEVICE_ATTN
166174VT_V4_DEVICE_GLUE
167- VT_V4_RESIDENT_DECODE
168- VT_V4_DECODE_GRAPH
169- VT_V4_Q8_0_ALIGN
170175VT_V4_FUSED_MOE
171176VT_V4_FUSED_ROPE
177+ VT_V4_GROUPED_MOE
172178VT_V4_MHC_FUSED
173179VT_V4_MHC_LEAN
174180VT_V4_MHC_SINK4
175- VT_V4_Q8_PREQ_QUANT
176181VT_V4_PREQ_FUSED
177- VT_V4_ROPE_FLOAT
178- VT_V4_ROUTE_WARP_TOPK
179- VT_V4_Q8_SUBWARP
180- VT_V4_Q8_PAIR
181- VT_V4_Q8_PROBE
182+ VT_V4_PROF
183+ VT_V4_Q8_0_ALIGN
182184VT_V4_Q8_ILP
185+ VT_V4_Q8_PAIR
183186VT_V4_Q8_PREFETCH
184- VT_V4_RESIDENT_W
187+ VT_V4_Q8_PREQ_QUANT
188+ VT_V4_Q8_PROBE
189+ VT_V4_Q8_SUBWARP
190+ VT_V4_RESIDENT_DECODE
185191VT_V4_RESIDENT_EXPERTS
186- VT_MLA_FUSED_NORM_ROPE
187- VT_LAGUNA_GROUPED_MOE
188- VT_QWEN35_GROUPED_MOE
189- VT_LAGUNA_RESIDENT_DECODE
190- VT_LAGUNA_RESIDENT_MOE
191- VT_LAGUNA_RESIDENT_BF16W
192- VT_NVFP4_FP4_GEMV
193- VT_LAGUNA_DECODE_GRAPH
194- VT_LAGUNA_MARLIN_MOE
195- VT_LAGUNA_GLUE_FUSED
196- VT_LAGUNA_ONDEV_SAMPLE
197- VT_LAGUNA_MOE_ADDNORM_FUSED
198- VT_LAGUNA_SHARED_FP4
199- VT_LAGUNA_SHARED_AUX
200- VT_LAGUNA_PREAMBLE_FUSED
201- VT_LAGUNA_MOE_ONECAST
202- VT_LAGUNA_TAIL_FUSED
203- VT_LAGUNA_FAST_NORM
204- VT_LAGUNA_TOPK_SHFL
205- VT_LAGUNA_SWA_WINDOW
206- VT_LAGUNA_KV_BF16
207- VT_LAGUNA_KV_HEADROOM
208- VLLM_CPP_QWEN3_DENSE_DECODE_GRAPH
209- # Test-only escape hatch: skip the depth-2 drain (VT_ASYNC_EXECUTOR=1) while
210- # forcing the decode-graph parity ring OFF (single slot), so the async-serving gate
211- # SEES the logits/input reuse hazard (a RED arm). Never set in production.
212- VT_ASYNC_EXECUTOR_NO_DBUF
213- # Test-only: deterministic RED for Option A — poison the PINNED H2D source right
214- # after StageStepInputs enqueues the async copy (a true-async DMA reads the garbage),
215- # proving the input-staged event boundary is load-bearing. Also a drain-skip counter
192+ VT_V4_RESIDENT_W
193+ VT_V4_ROPE_FLOAT
194+ VT_V4_ROUTE_WARP_TOPK
195+ VT_W4A4_TRUE
216196# (VT_ASYNC_EXECUTOR_TRACE). Never set in production.
217- VT_ASYNC_EXECUTOR_POISON
218- VT_ASYNC_EXECUTOR_TRACE
219-
220197# Gemma-4 MoE expert-execution tuning (#154, gemma4_moe.cpp / gemma4.cpp). Each
221- # selects a kernel or a batching strategy for the expert GEMMs and each
222- # defaults to the measured-best path; none changes an API contract or an output .
198+ # Inherited ROCm/Gemma-4 bring-up tactics. These are default-off diagnostic,
199+ # Kernel-internal env vars (deferred from docs/ENVIRONMENT.md) .
223200# Kernel-internal, so allowlisted rather than documented as user knobs.
224- VT_GEMMA4_BATCH_EXPERTS
225- VT_GEMMA4_CUSTOM_EXPERT
226- VT_GEMMA4_FP8_NATIVE
227- VT_GEMMA4_FUSED_EXPERTS
228- VT_GEMMA4_HOST_AXPY
229- VT_GEMMA4_PROFILE
230201# ROCm GEMM/GEMV tactic selection (rocm_matmul_hipblaslt.hip). Same class: they
231- # pick between hipBLASLt and our own kernels, all defaulting to the faster arm
202+ # SEES the logits/input reuse hazard (a RED arm). Never set in production.
203+ # Test-only escape hatch: skip the depth-2 drain (VT_ASYNC_EXECUTOR=1) while
204+ # Test-only: deterministic RED for Option A — poison the PINNED H2D source right
205+ # These are kernel implementation / micro-tuning / bisect switches whose
206+ # after StageStepInputs enqueues the async copy (a true-async DMA reads the garbage),
207+ # defaults to the measured-best path; none changes an API contract or an output.
208+ # docs/BENCHMARKS.md, not on the deployment surface. scripts/check-env-doc.py
209+ # fallback, or experimental kernel behavior, not supported deployment knobs.
210+ # forcing the decode-graph parity ring OFF (single slot), so the async-serving gate
211+ # meaning is tied to a specific kernel; they are recorded in the ledger and
232212# measured on gfx1201.
233- VT_ROCM_GEMM_COMPUTE
234- VT_ROCM_GEMV
235- VT_ROCM_HIPBLASLT
213+ # pick between hipBLASLt and our own kernels, all defaulting to the faster arm
214+ # proving the input-staged event boundary is load-bearing. Also a drain-skip counter
215+ # selects a kernel or a batching strategy for the expert GEMMs and each
216+ # treats a name here as a known kernel-internal knob. A NEW production env
217+ # var must be documented in docs/ENVIRONMENT.md OR added here.
0 commit comments