diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/README.md b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/README.md index 8043ec5..9a8a881 100644 --- a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/README.md +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/README.md @@ -399,3 +399,178 @@ SGLang 集成测试:`6 passed, 18 warnings in 563.41s`。warnings 为 asyncio 2. 没有修改 checkpoint,没有 runtime monkeypatch,没有通过放宽 finite tolerance 获得通过。 3. microbenchmark latency 仅用于检查 candidate 可执行,不作为生产性能结论。 4. 下一阶段必须用 Nsight Systems/Compute 和三轮交错 A/B 区分 wrapper、同步、权重搬运、dispatch 与 kernel 本体;在此之前不宣称优于 Marlin。 + +## Phase 4 算子性能与 Profiler 归因 + +状态:**完成。** 本阶段只证明单卡本地 MoE runner 的正确性、性能边界和 +kernel 归因,不代表完整 Kimi-K3 serving 性能。真实 Scheduler、Chunked +Prefill、跨节点 EP 通信和 CUDA Graph 的联合效果留到 Phase 5。 + +### 实验边界 + +两后端均通过 SGLang 生产 runner 调用,而不是直接调用底层 kernel: + +- baseline:`fused_experts_none_to_marlin`; +- candidate:`fused_experts_none_to_flashinfer_mxfp4`; +- 相同 BF16 输入、packed MXFP4 权重、E8M0 scale、Top-K IDs/weights、 + SiTU `(alpha=4, beta=25)`; +- Kimi 真尺寸 `H=3584, N=3072, topK=16`; +- `EP32/rank7`,每个 rank 驻留 28 个本地专家,总专家数 896; +- `ep_mixed` 路由中每个 token 的 8 个 slot 指向本地专家、8 个指向远端专家; +- 仅使用 601 的物理 GPU6,并用 UUID + `GPU-45354dff-e8b3-1c0d-99c9-d3562bcab5fd` 做运行时绑定校验。 + +这里的 `M` 是单次本地 MoE runner 收到的 token 数,不等于 HTTP 层的 +`ISL * concurrency`。本地平均路由项约为: + +```text +local assignments / expert = M * 8 / 28 +``` + +因此本阶段不能替代 `ISL=8192, C=16` 的真实服务测试。 + +### 统一入口 + +```bash +python3 profile_kimi_sm120_mxfp4.py \ + --shapes prefill prefill_m512 prefill_m2048 prefill_m8192 \ + --rounds 5 --iterations 30 --warmup 5 \ + --output results/phase4_mscan_ep32_5rounds_gpu6.json +``` + +正式运行时使用镜像 `lmsysorg/sglang:kimi-k3-fiv617situ-warm`,挂载: + +```text +/tmp/hzy-fi-situ-phase3-v3 -> patched FlashInfer Python/AOT package +/data/hzy/src/sglang-kimi-sm120 -> patched SGLang source +/data/hzy/cache/sglang-jit-sm120 -> persistent SGLang JIT cache +``` + +并设置: + +```text +FLASHINFER_DISABLE_JIT=1 +FLASHINFER_DISABLE_VERSION_CHECK=1 +SGLANG_JIT_CACHE_DIR=/root/.cache/sglang/jit +EXPECTED_GPU_UUID=45354dff-e8b3-1c0d-99c9-d3562bcab5fd +``` + +### 五轮交错 A/B + +每个 shape 先做 BF16 参考正确性,再 warmup 5 次。五轮按 +`Marlin -> FlashInfer`、`FlashInfer -> Marlin` 交替执行,每轮每后端 30 次。 +下表为 GPU latency 中位数: + +| M | 平均本地路由项/专家 | Marlin | FlashInfer | FlashInfer 相对速度 | FI vs reference | +|---:|---:|---:|---:|---:|---:| +| 128 | 36.6 | 0.870 ms | 0.926 ms | 0.94x,慢约 6.5% | cosine 0.999615,NRMSE 2.774% | +| 512 | 146.3 | 2.610 ms | 1.782 ms | 1.46x | cosine 0.999614,NRMSE 2.779% | +| 2048 | 585.1 | 9.070 ms | 4.355 ms | 2.08x | cosine 0.999623,NRMSE 2.746% | +| 8192 | 2340.6 | 34.379 ms | 16.167 ms | 2.13x | cosine 0.999623,NRMSE 2.744% | + +五轮逐轮比值稳定:M512 为 `1.428x-1.474x`,M2048 为 +`2.065x-2.089x`,M8192 为 `2.126x-2.128x`。这证明 FlashInfer 的优势 +依赖每次 runner 的实际 M;它不是小 batch 的无条件替代品。 + +M512 的第一次 pilot 只 warmup 1 次,得到 FlashInfer 4.26 ms、Marlin +1.94 ms,与正式结果相反。该结果保留为 warmup 敏感性证据,不用于性能结论。 + +### Nsight Systems + +捕获文件: + +```text +results/phase4_nsys_ab_gpu6.nsys-rep +results/phase4_nsys_ab_gpu6.log +results/phase4_nsys_stats_*.csv +results/phase4_nsys_*_iteration_5_*.csv +``` + +稳定的第 5 次迭代中,主 GEMM kernel 总时间: + +| Shape | Marlin | FlashInfer | 观察 | +|---|---:|---:|---| +| Decode M1 | 109.4 us | 191.8 us | FlashInfer 主 kernel 约慢 75% | +| Prefill M128 | 709.9 us | 865.3 us | FlashInfer 主 kernel 约慢 22% | + +Decode 的非主 kernel 开销约为 FlashInfer 20.3 us、Marlin 6.4 us;Prefill +分别约 45.8 us、44.2 us。小 M 差距主要来自 kernel 本体,不能归因成纯 +Python wrapper 或同步开销。 + +### Nsight Compute + +RTX 6000D 需要较新的工具。镜像内 NCU 2025.3.1 返回 +`Profiling is not supported on device 0`;正式报告由 NVIDIA 官方包 +Nsight Compute 2026.2.1 生成: + +```text +/data/hzy/tools/nsight-compute-2026.2.1/ +results/phase4_ncu_2026_2_1_ab_gpu6.ncu-rep +results/phase4_ncu_2026_2_1_ab_gpu6.log +results/phase4_ncu_2026_2_1_ab_gpu6_raw.csv +``` + +`--set basic` 捕获到的两组主 kernel 指标: + +| Shape/backend | 主 kernel 合计 | DRAM 峰值利用率 | SM 峰值利用率 | registers/thread | shared memory/block | +|---|---:|---:|---:|---:|---:| +| Decode Marlin | 121.2 us | 77.8%-86.8% | 21.2%-22.5% | 113 | 33.8 KiB | +| Decode FlashInfer | 199.4 us | 49.9%-51.7% | 47.7%-47.8% | 168 | 84.0 KiB | +| M128 Marlin | 513.0 us | 73.7%-76.1% | 61.1%-65.9% | 255 | 102.4 KiB | +| M128 FlashInfer | 535.1 us | 67.2%-70.7% | 61.1%-63.3% | 168 | 84.0 KiB | + +NCU 使用 replay,绝对时间不与 Nsight Systems 混用。它支持相同方向的 +结论:Decode 时 FlashInfer 使用更多寄存器和共享内存,DRAM 利用率更低, +当前 CUTLASS 配置没有在小 M 上胜过 Marlin;M128 的主 kernel 已接近, +但完整 runner 仍有其他步骤。 + +### 工程问题与修复记录 + +1. `--privileged` 会重新暴露全部 `/dev/nvidia*`,曾令容器落到物理 GPU0。 + UUID guard 立即终止实验。之后固定使用 `--gpus device=6`、 + `NVIDIA_VISIBLE_DEVICES=6`,不再使用 privileged。 +2. 纯 Python wheel 在每个新进程触发 FlashInfer JIT;NCU 注入子进程后会 + 卡住大量 `nvcc`。正式 profiling 把三个已验证 `.so` 放入 + `flashinfer/data/aot/`,并设置 `FLASHINFER_DISABLE_JIT=1`。 +3. SGLang 自身 JIT cache 持久化到 `/data/hzy/cache/sglang-jit-sm120`。 +4. `torch.quantile` 对 M8192 的约 2936 万元素输出报输入过大。统计代码改用 + 精确 `torch.kthvalue`;cosine、NRMSE、max/mean 与正确性阈值均未放宽。 + +详细时间线和失败证据见 `decision_log.md`。 + +### Phase 4 决策 + +1. FlashInfer SiTU MXFP4 路径已通过正确性门槛,并在 M512 及以上的本地 + runner shape 显示明确吞吐潜力。 +2. 它在 Decode/M128 小 M 上仍落后于 Marlin,不能现在就设为无条件默认。 +3. 不再扩展 synthetic EP4/kernel sweep。下一步应进入四节点真实 Kimi-K3 + serving,观察 Scheduler 实际 M 分布及端到端 TTFT/TPOT/TPS。 +4. 在 Phase 5 完成前,不宣称 FlashInfer 提升生产性能;当前 PR 的可靠表述 + 是补齐 Kimi-K3 + SM120 + SiTU + MXFP4 功能支持,并提供显式 Marlin fallback。 + +### Phase 4 原始证据 + +服务器根目录: + +```text +/data/hzy/sskj/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/ +``` + +关键文件: + +```text +phase4_ab_5rounds_gpu6.json +phase4_mscan_ep32_5rounds_gpu6.json +phase4_mscan_ep32_5rounds_gpu6.log +phase4_aot_nojit_smoke_gpu6.json +phase4_nsys_ab_gpu6.nsys-rep +phase4_nsys_stats_*.csv +phase4_ncu_2026_2_1_ab_gpu6.ncu-rep +phase4_ncu_2026_2_1_ab_gpu6_raw.csv +``` + +本地备份: + +```text +/Users/hzy/Desktop/infra/.phase3_work/phase4_results/ +``` diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/decision_log.md b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/decision_log.md new file mode 100644 index 0000000..061c387 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/decision_log.md @@ -0,0 +1,59 @@ +# Kimi-K3 SM120 FlashInfer MXFP4 Decision Log + +本文件记录可恢复的关键决策、失败尝试和证据路径。成功结论见 `README.md`。 + +## 2026-08-18 Phase 4 + +### 对称 A/B + +- 决策:baseline/candidate 都走 SGLang production runner,共享输入、权重、 + scale、routing、SiTU 参数和计时方式。 +- 结果:M1/M128 FlashInfer 略慢;扩展五轮扫描中 M512/2048/8192 分别比 + Marlin 快约 1.46x/2.08x/2.13x。 +- 限制:M 是单卡本地 runner token 数,不是 HTTP ISL 或全局 batch。 +- 证据:`results/phase4_ab_5rounds_gpu6.json`、 + `results/phase4_mscan_ep32_5rounds_gpu6.json`。 + +### GPU 绑定事故 + +- 现象:最初 Nsight 命令同时使用 `--gpus device=6` 和 `--privileged`,UUID + guard 检测到实际设备为物理 GPU0 并终止。 +- 根因:privileged 重新暴露全部 NVIDIA device node,破坏容器 GPU 隔离。 +- 处理:移除 privileged;固定 `--gpus device=6`、 + `NVIDIA_VISIBLE_DEVICES=6` 和预期 UUID。未继续占用 GPU0。 + +### JIT 与 AOT + +- 现象:纯 Python FlashInfer wheel 在新进程重新 JIT。NCU profiler 注入 + JIT 子进程后产生大量挂起 `nvcc`。 +- 处理:将已验证的 `fused_moe_120`、`mxfp8_quantization_sm100`、 + `fp4_quantization_120f` `.so` 写入 wheel 的 AOT 目录;设置 + `FLASHINFER_DISABLE_JIT=1`;持久化 SGLang JIT cache。 +- 验证:`results/phase4_aot_nojit_smoke_gpu6.json`。 + +### Profiler 工具 + +- NCU 2025.3.1:RTX 6000D/SM120 不受支持,报 + `Profiling is not supported on device 0`。 +- NCU 2026.2.1:从 NVIDIA 官方 CUDA repository 下载并校验 SHA256,解压到 + `/data/hzy/tools/nsight-compute-2026.2.1/`,正式捕获成功。 +- Nsight Systems:正式捕获成功,原始文件为 + `results/phase4_nsys_ab_gpu6.nsys-rep`。 + +### 大输出统计 + +- 现象:M8192 输出约 2936 万元素,`torch.quantile` 报 input too large。 +- 处理:P95/P99 改用精确 `torch.kthvalue`。未抽样,未改正确性阈值。 + +### Warmup 敏感性 + +- M512 pilot 使用 warmup=1,得到与正式结果相反的排序。 +- 正式五轮使用 warmup=5、每轮 30 次,五轮速度比为 + `1.428x-1.474x`,采用正式结果。 +- pilot 日志保留,不作为性能结论。 + +### 阶段出口 + +- 不继续 synthetic EP4 扫描。 +- 下一步需要 601-604 共 32 卡运行真实 TP32/EP32 Kimi-K3 serving。 +- 未经资源授权不清理现有作业、不启动 Phase 5。 diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/profile_kimi_sm120_mxfp4.py b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/profile_kimi_sm120_mxfp4.py new file mode 100644 index 0000000..47565e7 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/profile_kimi_sm120_mxfp4.py @@ -0,0 +1,583 @@ +#!/usr/bin/env python3 +"""Profile Kimi-K3 MXFP4 MoE on SM120: SGLang Marlin vs FlashInfer. + +Both backends consume the same BF16 input, packed MXFP4 checkpoint values, +E8M0 scales, global top-k ids/weights, SiTU parameters, and EP32/rank7 mapping. +Backend-specific post-load layouts are derived once before correctness checks, +warmup, timing, and profiling. +""" + +from __future__ import annotations + +import argparse +from contextlib import nullcontext +from dataclasses import asdict +from datetime import datetime +import json +import math +import os +from pathlib import Path +import statistics +import time +from types import SimpleNamespace +from typing import Callable + +import torch +import torch.nn.functional as F + +from flashinfer import ( + SfLayout, + block_scale_interleave, + mxfp4_dequantize, + mxfp4_quantize, + mxfp8_quantize, +) +from sglang.srt.distributed import init_distributed_environment +from sglang.srt.distributed.parallel_state import ( + destroy_model_parallel, + initialize_model_parallel, +) +from sglang.srt.layers.moe.moe_runner.base import MoeRunnerConfig +from sglang.srt.layers.moe.moe_runner.flashinfer_cutlass import ( + FlashInferCutlassMxfp4MoeQuantInfo, + fused_experts_none_to_flashinfer_mxfp4, +) +from sglang.srt.layers.moe.moe_runner.marlin import ( + MarlinMoeQuantInfo, + fused_experts_none_to_marlin, +) +from sglang.srt.layers.moe.token_dispatcher.standard import StandardDispatchOutput +from sglang.srt.layers.moe.topk import StandardTopKOutput +from sglang.srt.layers.quantization.marlin_utils_fp4 import ( + prepare_moe_mxfp4_layer_for_marlin, +) + +from validate_kimi_sm120_mxfp4 import ( + Case, + QuantizedCase, + dequantize_mxfp8_input, + make_routing, + run_reference, +) + + +SHAPES = { + "decode": Case( + "kimi_decode_m1_ep32", + 1, + 3584, + 3072, + 28, + 16, + "ep_mixed", + ep_size=32, + ep_rank=7, + ), + "prefill": Case( + "kimi_prefill_m128_ep32", + 128, + 3584, + 3072, + 28, + 16, + "ep_mixed", + ep_size=32, + ep_rank=7, + ), + "prefill_m512": Case( + "kimi_prefill_m512_ep32", + 512, + 3584, + 3072, + 28, + 16, + "ep_mixed", + ep_size=32, + ep_rank=7, + ), + "prefill_m2048": Case( + "kimi_prefill_m2048_ep32", + 2048, + 3584, + 3072, + 28, + 16, + "ep_mixed", + ep_size=32, + ep_rank=7, + ), + "prefill_m8192": Case( + "kimi_prefill_m8192_ep32", + 8192, + 3584, + 3072, + 28, + 16, + "ep_mixed", + ep_size=32, + ep_rank=7, + ), +} + + +def _quantize_experts_linear( + weight: torch.Tensor, +) -> tuple[torch.Tensor, torch.Tensor, torch.Tensor]: + packed = [] + scales = [] + dequantized = [] + for expert_weight in weight: + expert_packed, expert_scale = mxfp4_quantize( + expert_weight, + sfLayout=SfLayout.layout_linear, + ) + packed.append(expert_packed) + scales.append(expert_scale) + dequantized.append( + mxfp4_dequantize( + expert_packed.cpu(), + expert_scale.cpu(), + sfLayout=SfLayout.layout_linear, + ) + ) + return ( + torch.stack(packed), + torch.stack(scales), + torch.stack(dequantized).to(device=weight.device, dtype=weight.dtype), + ) + + +def _prepare_linear_checkpoint_case( + case: Case, + seed: int, + device: torch.device, +) -> QuantizedCase: + generator = torch.Generator(device=device).manual_seed(seed) + dtype = torch.bfloat16 + x = torch.randn( + case.tokens, + case.hidden, + generator=generator, + dtype=dtype, + device=device, + ) + gate = torch.randn( + case.local_experts, + case.intermediate, + case.hidden, + generator=generator, + dtype=dtype, + device=device, + ) * (1.0 / math.sqrt(case.hidden)) + up = torch.randn( + case.local_experts, + case.intermediate, + case.hidden, + generator=generator, + dtype=dtype, + device=device, + ) * (1.0 / math.sqrt(case.hidden)) + down = torch.randn( + case.local_experts, + case.hidden, + case.intermediate, + generator=generator, + dtype=dtype, + device=device, + ) * (1.0 / math.sqrt(case.intermediate)) + input_q, input_sf = mxfp8_quantize( + x, + is_sf_swizzled_layout=True, + alignment=32, + ) + input_dq = dequantize_mxfp8_input(input_q, input_sf, dtype) + fc1_q, fc1_sf, fc1_dq = _quantize_experts_linear( + torch.cat((up, gate), dim=1).contiguous() + ) + fc2_q, fc2_sf, fc2_dq = _quantize_experts_linear(down) + topk_ids, topk_weights = make_routing(case, device) + return QuantizedCase( + case=case, + input_q=input_q, + input_sf=input_sf, + input_dq=input_dq, + fc1_q=fc1_q, + fc1_sf=fc1_sf, + fc1_dq=fc1_dq, + fc2_q=fc2_q, + fc2_sf=fc2_sf, + fc2_dq=fc2_dq, + topk_ids=topk_ids, + topk_weights=topk_weights, + expert_scale=torch.ones( + case.local_experts, dtype=torch.float32, device=device + ), + situ_gate_beta=torch.full( + (case.local_experts,), 4.0, dtype=torch.float32, device=device + ), + situ_linear_beta=torch.full( + (case.local_experts,), 25.0, dtype=torch.float32, device=device + ), + ) + + +def _init_sglang_distributed() -> None: + """Create the rank-one groups that production MoE wrappers expect.""" + torch.cuda.set_device(0) + init_distributed_environment( + world_size=1, + rank=0, + local_rank=0, + distributed_init_method="tcp://127.0.0.1:29541", + backend="nccl", + ) + initialize_model_parallel( + tensor_model_parallel_size=1, + expert_model_parallel_size=1, + ) + + +def _destroy_sglang_distributed() -> None: + destroy_model_parallel() + if torch.distributed.is_initialized(): + torch.distributed.destroy_process_group() + + +def _quantile_exact(values: torch.Tensor, quantile: float) -> float: + """Return an exact quantile without torch.quantile's 2^24 element limit.""" + rank = max(1, math.ceil(quantile * values.numel())) + return float(torch.kthvalue(values, rank).values.item()) + + +def _metrics(reference: torch.Tensor, candidate: torch.Tensor) -> dict: + ref = reference.float().reshape(-1) + got = candidate.float().reshape(-1) + diff = got - ref + abs_diff = diff.abs() + denominator = torch.sqrt(torch.mean(ref.square())).clamp_min(1e-12) + return { + "mean_abs": float(abs_diff.mean().item()), + "p95_abs": _quantile_exact(abs_diff, 0.95), + "p99_abs": _quantile_exact(abs_diff, 0.99), + "max_abs": float(abs_diff.max().item()), + "nrmse": float((torch.sqrt(torch.mean(diff.square())) / denominator).item()), + "cosine": float(F.cosine_similarity(ref, got, dim=0).item()), + "reference_rms": float(denominator.item()), + "reference_max_abs": float(ref.abs().max().item()), + "finite": bool(torch.isfinite(candidate).all()), + } + + +def _assert_close(name: str, reference: torch.Tensor, candidate: torch.Tensor) -> dict: + metrics = _metrics(reference, candidate) + if not metrics["finite"]: + raise AssertionError(f"{name} produced non-finite output: {metrics}") + torch.testing.assert_close(candidate, reference, rtol=0.2, atol=0.2) + return metrics + + +def _checkpoint_gate_up_from_flashinfer_up_gate(tensor: torch.Tensor) -> torch.Tensor: + up, gate = tensor.chunk(2, dim=1) + return torch.cat((gate, up), dim=1).contiguous() + + +def _build_expert_map(case: Case, device: torch.device) -> torch.Tensor: + expert_map = torch.full( + (case.total_experts,), -1, dtype=torch.int32, device=device + ) + start = case.local_expert_start + expert_map[start : start + case.local_experts] = torch.arange( + case.local_experts, dtype=torch.int32, device=device + ) + return expert_map + + +class BackendPair: + def __init__(self, case: Case, seed: int): + self.case = case + self.data = _prepare_linear_checkpoint_case( + case, + seed, + torch.device("cuda"), + ) + self.config = MoeRunnerConfig( + num_experts=case.total_experts, + num_local_experts=case.local_experts, + hidden_size=case.hidden, + intermediate_size_per_partition=case.intermediate, + top_k=case.top_k, + activation="situ", + is_gated=True, + gemm1_alpha=4.0, + gemm1_clamp_limit=25.0, + gate_up_interleaved=False, + ) + logits = torch.zeros( + case.tokens, + case.total_experts, + dtype=torch.float32, + device="cuda", + ) + self.expert_map = _build_expert_map(case, torch.device("cuda")) + self.flashinfer_dispatch = StandardDispatchOutput( + self.data.input_dq.contiguous(), + None, + StandardTopKOutput( + self.data.topk_weights, + self.data.topk_ids, + logits, + ), + ) + marlin_topk_ids = self.expert_map[self.data.topk_ids] + self.marlin_dispatch = StandardDispatchOutput( + self.data.input_dq.contiguous(), + None, + StandardTopKOutput( + self.data.topk_weights, + marlin_topk_ids, + logits, + ), + ) + self.reference = run_reference(self.data, "situ") + self.fi_quant = self._build_flashinfer_quant_info() + self.marlin_quant = self._build_marlin_quant_info() + + def _build_flashinfer_quant_info(self) -> FlashInferCutlassMxfp4MoeQuantInfo: + case = self.case + w13_scale = block_scale_interleave(self.data.fc1_sf).reshape_as( + self.data.fc1_sf + ) + w2_scale = block_scale_interleave(self.data.fc2_sf).reshape_as( + self.data.fc2_sf + ) + return FlashInferCutlassMxfp4MoeQuantInfo( + w13_weight=self.data.fc1_q, + w2_weight=self.data.fc2_q, + w13_weight_scale=w13_scale.contiguous(), + w2_weight_scale=w2_scale.contiguous(), + mxfp4_weight_global_scale=self.data.expert_scale, + w13_bias=None, + w2_bias=None, + swiglu_alpha=self.data.situ_gate_beta, + swiglu_beta=self.data.situ_linear_beta, + swiglu_limit=None, + moe_tp_size=1, + moe_tp_rank=0, + moe_ep_size=case.ep_size, + moe_ep_rank=case.ep_rank, + padded_hidden=case.hidden, + ) + + def _build_marlin_quant_info(self) -> MarlinMoeQuantInfo: + case = self.case + layer = SimpleNamespace( + w13_weight=torch.nn.Parameter( + _checkpoint_gate_up_from_flashinfer_up_gate(self.data.fc1_q.clone()), + requires_grad=False, + ), + w2_weight=torch.nn.Parameter( + self.data.fc2_q.clone(), requires_grad=False + ), + w13_weight_scale=torch.nn.Parameter( + _checkpoint_gate_up_from_flashinfer_up_gate( + self.data.fc1_sf.clone() + ), + requires_grad=False, + ), + w2_weight_scale=torch.nn.Parameter( + self.data.fc2_sf.clone(), requires_grad=False + ), + orig_dtype=torch.bfloat16, + ) + prepare_moe_mxfp4_layer_for_marlin(layer) + return MarlinMoeQuantInfo( + w13_qweight=layer.w13_weight, + w2_qweight=layer.w2_weight, + w13_scales=layer.w13_weight_scale, + w2_scales=layer.w2_weight_scale, + w13_g_idx_sort_indices=None, + w2_g_idx_sort_indices=None, + weight_bits=4, + is_k_full=True, + expert_map=self.expert_map, + global_num_experts=case.total_experts, + ) + + def flashinfer(self) -> torch.Tensor: + return fused_experts_none_to_flashinfer_mxfp4( + self.flashinfer_dispatch, self.fi_quant, self.config + ).hidden_states + + def marlin(self) -> torch.Tensor: + return fused_experts_none_to_marlin( + self.marlin_dispatch, self.marlin_quant, self.config + ).hidden_states[:, : self.case.hidden] + + def validate(self) -> dict: + fi = self.flashinfer() + marlin = self.marlin() + torch.cuda.synchronize() + metrics = { + "flashinfer_vs_reference": _metrics(self.reference, fi), + "marlin_vs_reference": _metrics(self.reference, marlin), + "flashinfer_vs_marlin": _metrics(marlin, fi), + } + print("CORRECTNESS " + json.dumps(metrics, sort_keys=True), flush=True) + _assert_close("flashinfer", self.reference, fi) + _assert_close("marlin", self.reference, marlin) + _assert_close("cross_backend", marlin, fi) + return metrics + + +def _measure(fn: Callable[[], torch.Tensor], iterations: int) -> dict: + start = torch.cuda.Event(enable_timing=True) + end = torch.cuda.Event(enable_timing=True) + torch.cuda.synchronize() + wall_start = time.perf_counter() + start.record() + for _ in range(iterations): + fn() + end.record() + torch.cuda.synchronize() + wall_ms = (time.perf_counter() - wall_start) * 1000.0 / iterations + return { + "gpu_ms": start.elapsed_time(end) / iterations, + "wall_ms": wall_ms, + } + + +def _warmup(pair: BackendPair, iterations: int) -> None: + for _ in range(iterations): + pair.marlin() + pair.flashinfer() + torch.cuda.synchronize() + + +def run_benchmark(args: argparse.Namespace) -> dict: + report = { + "created_at": datetime.now().astimezone().isoformat(), + "device": torch.cuda.get_device_name(), + "compute_capability": list(torch.cuda.get_device_capability()), + "cuda_visible_devices": os.environ.get("CUDA_VISIBLE_DEVICES"), + "rounds": args.rounds, + "iterations": args.iterations, + "shapes": {}, + } + for shape_name in args.shapes: + pair = BackendPair(SHAPES[shape_name], args.seed) + correctness = pair.validate() + _warmup(pair, args.warmup) + rounds = [] + for round_index in range(args.rounds): + order = ( + ("marlin", "flashinfer") + if round_index % 2 == 0 + else ("flashinfer", "marlin") + ) + result = {"round": round_index + 1, "order": list(order)} + for backend in order: + result[backend] = _measure(getattr(pair, backend), args.iterations) + rounds.append(result) + summary = {} + for backend in ("marlin", "flashinfer"): + summary[backend] = { + metric: statistics.median( + result[backend][metric] for result in rounds + ) + for metric in ("gpu_ms", "wall_ms") + } + summary["speedup_marlin_over_flashinfer"] = { + metric: summary["marlin"][metric] / summary["flashinfer"][metric] + for metric in ("gpu_ms", "wall_ms") + } + report["shapes"][shape_name] = { + "case": asdict(pair.case), + "correctness": correctness, + "rounds": rounds, + "summary": summary, + } + del pair + torch.cuda.empty_cache() + return report + + +def run_profile(args: argparse.Namespace) -> None: + shape_names = tuple(SHAPES) if args.shape == "all" else (args.shape,) + pairs = [ + (shape_name, BackendPair(SHAPES[shape_name], args.seed)) + for shape_name in shape_names + ] + for shape_name, pair in pairs: + print( + "PROFILE_CORRECTNESS " + + json.dumps({shape_name: pair.validate()}, sort_keys=True), + flush=True, + ) + _warmup(pair, args.warmup) + torch.cuda.synchronize() + torch.cuda.cudart().cudaProfilerStart() + backends = ( + (args.backend,) + if args.backend != "both" + else ("marlin", "flashinfer") + ) + for shape_name, pair in pairs: + for backend in backends: + for index in range(args.profile_iterations): + label = f"{backend}_{shape_name}_iteration_{index + 1}" + context = ( + torch.cuda.nvtx.range(label) + if torch.cuda.is_available() + else nullcontext() + ) + with context: + getattr(pair, backend)() + torch.cuda.synchronize() + torch.cuda.cudart().cudaProfilerStop() + + +def parse_args() -> argparse.Namespace: + parser = argparse.ArgumentParser() + parser.add_argument("--mode", choices=("benchmark", "profile"), default="benchmark") + parser.add_argument("--shapes", nargs="+", choices=tuple(SHAPES), default=list(SHAPES)) + parser.add_argument("--shape", choices=(*SHAPES, "all"), default="decode") + parser.add_argument("--backend", choices=("marlin", "flashinfer", "both"), default="both") + parser.add_argument("--rounds", type=int, default=3) + parser.add_argument("--iterations", type=int, default=30) + parser.add_argument("--warmup", type=int, default=5) + parser.add_argument("--profile-iterations", type=int, default=3) + parser.add_argument("--seed", type=int, default=20260817) + parser.add_argument("--output", type=Path) + return parser.parse_args() + + +def main() -> None: + args = parse_args() + if not torch.cuda.is_available(): + raise SystemExit("CUDA is required") + expected_uuid = os.environ.get("EXPECTED_GPU_UUID") + actual_uuid = str(torch.cuda.get_device_properties(0).uuid) + if expected_uuid and actual_uuid.lower() != expected_uuid.lower(): + raise SystemExit( + f"GPU binding mismatch: expected {expected_uuid}, got {actual_uuid}" + ) + if torch.cuda.get_device_capability() != (12, 0): + raise SystemExit(f"SM120 is required, got {torch.cuda.get_device_capability()}") + _init_sglang_distributed() + try: + with torch.inference_mode(): + if args.mode == "profile": + run_profile(args) + return + report = run_benchmark(args) + finally: + _destroy_sglang_distributed() + rendered = json.dumps(report, indent=2, sort_keys=True) + print(rendered) + if args.output is not None: + args.output.parent.mkdir(parents=True, exist_ok=True) + args.output.write_text(rendered + "\n", encoding="utf-8") + + +if __name__ == "__main__": + main() diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ab_5rounds_gpu6.json b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ab_5rounds_gpu6.json new file mode 100644 index 0000000..410afbd --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ab_5rounds_gpu6.json @@ -0,0 +1,293 @@ +{ + "compute_capability": [ + 12, + 0 + ], + "created_at": "2026-08-17T09:47:32.426483+00:00", + "cuda_visible_devices": null, + "device": "NVIDIA RTX 6000D", + "iterations": 100, + "rounds": 5, + "shapes": { + "decode": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_decode_m1_ep32", + "routing": "ep_mixed", + "tokens": 1, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996320605278015, + "finite": true, + "max_abs": 0.00978851318359375, + "mean_abs": 0.002149919280782342, + "nrmse": 0.02712450921535492, + "p95_abs": 0.00537109375, + "p99_abs": 0.007080078125, + "reference_max_abs": 0.37890625, + "reference_rms": 0.09998540580272675 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996223449707031, + "finite": true, + "max_abs": 0.009765625, + "mean_abs": 0.00218405993655324, + "nrmse": 0.027483593672513962, + "p95_abs": 0.00537109375, + "p99_abs": 0.0072021484375, + "reference_max_abs": 0.37890625, + "reference_rms": 0.10006484389305115 + }, + "marlin_vs_reference": { + "cosine": 0.9999805688858032, + "finite": true, + "max_abs": 0.00390625, + "mean_abs": 0.00045798509381711483, + "nrmse": 0.0062673031352460384, + "p95_abs": 0.0009765625, + "p99_abs": 0.001953125, + "reference_max_abs": 0.37890625, + "reference_rms": 0.10006484389305115 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 0.3265369415283203, + "wall_ms": 0.32803289126604795 + }, + "marlin": { + "gpu_ms": 0.30863103866577146, + "wall_ms": 0.3124843700788915 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + }, + { + "flashinfer": { + "gpu_ms": 0.3199043273925781, + "wall_ms": 0.32471023965626955 + }, + "marlin": { + "gpu_ms": 0.3098236846923828, + "wall_ms": 0.3145282808691263 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 2 + }, + { + "flashinfer": { + "gpu_ms": 0.32463966369628905, + "wall_ms": 0.3285454004071653 + }, + "marlin": { + "gpu_ms": 0.30631423950195313, + "wall_ms": 0.3102407115511596 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 3 + }, + { + "flashinfer": { + "gpu_ms": 0.31916448593139646, + "wall_ms": 0.32354930881410837 + }, + "marlin": { + "gpu_ms": 0.3083350372314453, + "wall_ms": 0.3130973596125841 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 4 + }, + { + "flashinfer": { + "gpu_ms": 0.3248342514038086, + "wall_ms": 0.326665451284498 + }, + "marlin": { + "gpu_ms": 0.31008224487304686, + "wall_ms": 0.31198404962196946 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 5 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 0.32463966369628905, + "wall_ms": 0.326665451284498 + }, + "marlin": { + "gpu_ms": 0.30863103866577146, + "wall_ms": 0.3124843700788915 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 0.9506880186843276, + "wall_ms": 0.9565883654061232 + } + } + }, + "prefill": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_prefill_m128_ep32", + "routing": "ep_mixed", + "tokens": 128, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996392726898193, + "finite": true, + "max_abs": 0.0126953125, + "mean_abs": 0.0021022639703005552, + "nrmse": 0.02686966024339199, + "p95_abs": 0.005126953125, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.462890625, + "reference_rms": 0.09850681573152542 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996151924133301, + "finite": true, + "max_abs": 0.013671875, + "mean_abs": 0.00217337254434824, + "nrmse": 0.02774309180676937, + "p95_abs": 0.00537109375, + "p99_abs": 0.00689697265625, + "reference_max_abs": 0.46484375, + "reference_rms": 0.09856347739696503 + }, + "marlin_vs_reference": { + "cosine": 0.9999709129333496, + "finite": true, + "max_abs": 0.00390625, + "mean_abs": 0.000566127069760114, + "nrmse": 0.007645560894161463, + "p95_abs": 0.00146484375, + "p99_abs": 0.001953125, + "reference_max_abs": 0.46484375, + "reference_rms": 0.09856347739696503 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 0.9432563018798829, + "wall_ms": 0.9479056694544852 + }, + "marlin": { + "gpu_ms": 0.8844432067871094, + "wall_ms": 0.8977009798400104 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + }, + { + "flashinfer": { + "gpu_ms": 0.9416944122314453, + "wall_ms": 0.9463393897749484 + }, + "marlin": { + "gpu_ms": 0.88412353515625, + "wall_ms": 0.8888133312575519 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 2 + }, + { + "flashinfer": { + "gpu_ms": 0.9426467132568359, + "wall_ms": 0.9474158892408013 + }, + "marlin": { + "gpu_ms": 0.8948384094238281, + "wall_ms": 0.8993784594349563 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 3 + }, + { + "flashinfer": { + "gpu_ms": 0.9381990051269531, + "wall_ms": 0.9428730909712613 + }, + "marlin": { + "gpu_ms": 0.89110595703125, + "wall_ms": 0.8956197183579206 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 4 + }, + { + "flashinfer": { + "gpu_ms": 0.9436812591552735, + "wall_ms": 0.9483181592077017 + }, + "marlin": { + "gpu_ms": 0.8909331512451172, + "wall_ms": 0.895569019485265 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 5 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 0.9426467132568359, + "wall_ms": 0.9474158892408013 + }, + "marlin": { + "gpu_ms": 0.8909331512451172, + "wall_ms": 0.8956197183579206 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 0.945140038909117, + "wall_ms": 0.9453290033752898 + } + } + } + } +} diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_aot_nojit_smoke_gpu6.json b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_aot_nojit_smoke_gpu6.json new file mode 100644 index 0000000..92b0444 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_aot_nojit_smoke_gpu6.json @@ -0,0 +1,173 @@ +{ + "compute_capability": [ + 12, + 0 + ], + "created_at": "2026-08-18T02:17:06.360422+00:00", + "cuda_visible_devices": null, + "device": "NVIDIA RTX 6000D", + "iterations": 1, + "rounds": 1, + "shapes": { + "decode": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_decode_m1_ep32", + "routing": "ep_mixed", + "tokens": 1, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996320605278015, + "finite": true, + "max_abs": 0.00978851318359375, + "mean_abs": 0.002149919280782342, + "nrmse": 0.02712450921535492, + "p95_abs": 0.00537109375, + "p99_abs": 0.007080078125, + "reference_max_abs": 0.37890625, + "reference_rms": 0.09998540580272675 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996223449707031, + "finite": true, + "max_abs": 0.009765625, + "mean_abs": 0.00218405993655324, + "nrmse": 0.027483593672513962, + "p95_abs": 0.00537109375, + "p99_abs": 0.0072021484375, + "reference_max_abs": 0.37890625, + "reference_rms": 0.10006484389305115 + }, + "marlin_vs_reference": { + "cosine": 0.9999805688858032, + "finite": true, + "max_abs": 0.00390625, + "mean_abs": 0.00045798509381711483, + "nrmse": 0.0062673031352460384, + "p95_abs": 0.0009765625, + "p99_abs": 0.001953125, + "reference_max_abs": 0.37890625, + "reference_rms": 0.10006484389305115 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 0.5889919996261597, + "wall_ms": 0.6109171081334352 + }, + "marlin": { + "gpu_ms": 0.5362880229949951, + "wall_ms": 0.6202820222824812 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 0.5889919996261597, + "wall_ms": 0.6109171081334352 + }, + "marlin": { + "gpu_ms": 0.5362880229949951, + "wall_ms": 0.6202820222824812 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 0.9105183488661707, + "wall_ms": 1.015329271392741 + } + } + }, + "prefill": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_prefill_m128_ep32", + "routing": "ep_mixed", + "tokens": 128, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996392726898193, + "finite": true, + "max_abs": 0.0126953125, + "mean_abs": 0.0021022639703005552, + "nrmse": 0.02686966024339199, + "p95_abs": 0.005126953125, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.462890625, + "reference_rms": 0.09850681573152542 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996151924133301, + "finite": true, + "max_abs": 0.013671875, + "mean_abs": 0.00217337254434824, + "nrmse": 0.02774309180676937, + "p95_abs": 0.00537109375, + "p99_abs": 0.00689697265625, + "reference_max_abs": 0.46484375, + "reference_rms": 0.09856347739696503 + }, + "marlin_vs_reference": { + "cosine": 0.9999709129333496, + "finite": true, + "max_abs": 0.00390625, + "mean_abs": 0.000566127069760114, + "nrmse": 0.007645560894161463, + "p95_abs": 0.00146484375, + "p99_abs": 0.001953125, + "reference_max_abs": 0.46484375, + "reference_rms": 0.09856347739696503 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 0.9108160138130188, + "wall_ms": 0.9314471390098333 + }, + "marlin": { + "gpu_ms": 0.813152015209198, + "wall_ms": 0.8787710685282946 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 0.9108160138130188, + "wall_ms": 0.9314471390098333 + }, + "marlin": { + "gpu_ms": 0.813152015209198, + "wall_ms": 0.8787710685282946 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 0.8927730769741712, + "wall_ms": 0.943447063955196 + } + } + } + } +} diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_mscan_ep32_5rounds_gpu6.json b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_mscan_ep32_5rounds_gpu6.json new file mode 100644 index 0000000..2772080 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_mscan_ep32_5rounds_gpu6.json @@ -0,0 +1,573 @@ +{ + "compute_capability": [ + 12, + 0 + ], + "created_at": "2026-08-18T02:53:56.080340+00:00", + "cuda_visible_devices": "0", + "device": "NVIDIA RTX 6000D", + "iterations": 30, + "rounds": 5, + "shapes": { + "prefill": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_prefill_m128_ep32", + "routing": "ep_mixed", + "tokens": 128, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996392726898193, + "finite": true, + "max_abs": 0.0126953125, + "mean_abs": 0.0021022639703005552, + "nrmse": 0.02686966024339199, + "p95_abs": 0.005126953125, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.462890625, + "reference_rms": 0.09850681573152542 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996151924133301, + "finite": true, + "max_abs": 0.013671875, + "mean_abs": 0.00217337254434824, + "nrmse": 0.02774309180676937, + "p95_abs": 0.00537109375, + "p99_abs": 0.00689697265625, + "reference_max_abs": 0.46484375, + "reference_rms": 0.09856347739696503 + }, + "marlin_vs_reference": { + "cosine": 0.9999709129333496, + "finite": true, + "max_abs": 0.00390625, + "mean_abs": 0.000566127069760114, + "nrmse": 0.007645560894161463, + "p95_abs": 0.00146484375, + "p99_abs": 0.001953125, + "reference_max_abs": 0.46484375, + "reference_rms": 0.09856347739696503 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 0.9099744160970052, + "wall_ms": 0.9106991346925497 + }, + "marlin": { + "gpu_ms": 0.8695210774739583, + "wall_ms": 0.871785699079434 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + }, + { + "flashinfer": { + "gpu_ms": 0.910638936360677, + "wall_ms": 0.91134087027361 + }, + "marlin": { + "gpu_ms": 0.8706239700317383, + "wall_ms": 0.8713232663770517 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 2 + }, + { + "flashinfer": { + "gpu_ms": 0.928394635518392, + "wall_ms": 0.9290497982874513 + }, + "marlin": { + "gpu_ms": 0.8668832143147787, + "wall_ms": 0.8675735288610061 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 3 + }, + { + "flashinfer": { + "gpu_ms": 0.9538229624430339, + "wall_ms": 0.9544791265701255 + }, + "marlin": { + "gpu_ms": 0.8697290420532227, + "wall_ms": 0.8704239269718528 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 4 + }, + { + "flashinfer": { + "gpu_ms": 0.9259029388427734, + "wall_ms": 0.9265734348446131 + }, + "marlin": { + "gpu_ms": 0.8654357274373372, + "wall_ms": 0.8660859350735942 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 5 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 0.9259029388427734, + "wall_ms": 0.9265734348446131 + }, + "marlin": { + "gpu_ms": 0.8695210774739583, + "wall_ms": 0.8704239269718528 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 0.9391060779661385, + "wall_ms": 0.9394009090254388 + } + } + }, + "prefill_m2048": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_prefill_m2048_ep32", + "routing": "ep_mixed", + "tokens": 2048, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996377229690552, + "finite": true, + "max_abs": 0.013671875, + "mean_abs": 0.0021010376513004303, + "nrmse": 0.026925193145871162, + "p95_abs": 0.005126953125, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.5546875, + "reference_rms": 0.09821589291095734 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996229410171509, + "finite": true, + "max_abs": 0.013671875, + "mean_abs": 0.002144214231520891, + "nrmse": 0.027460230514407158, + "p95_abs": 0.00537109375, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.55859375, + "reference_rms": 0.09827093780040741 + }, + "marlin_vs_reference": { + "cosine": 0.9999799132347107, + "finite": true, + "max_abs": 0.005859375, + "mean_abs": 0.00045405104174278677, + "nrmse": 0.006360496394336224, + "p95_abs": 0.0009765625, + "p99_abs": 0.001953125, + "reference_max_abs": 0.55859375, + "reference_rms": 0.09827093780040741 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 4.343468729654948, + "wall_ms": 4.344448462749521 + }, + "marlin": { + "gpu_ms": 9.073473103841145, + "wall_ms": 9.075486830746135 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + }, + { + "flashinfer": { + "gpu_ms": 4.388905843098958, + "wall_ms": 4.389951967944701 + }, + "marlin": { + "gpu_ms": 9.065022786458334, + "wall_ms": 9.065993401842812 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 2 + }, + { + "flashinfer": { + "gpu_ms": 4.355183919270833, + "wall_ms": 4.35632496761779 + }, + "marlin": { + "gpu_ms": 9.069696044921875, + "wall_ms": 9.070580204327902 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 3 + }, + { + "flashinfer": { + "gpu_ms": 4.35906016031901, + "wall_ms": 4.360084631480277 + }, + "marlin": { + "gpu_ms": 9.070074462890625, + "wall_ms": 9.071069831649462 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 4 + }, + { + "flashinfer": { + "gpu_ms": 4.34208984375, + "wall_ms": 4.343056639966865 + }, + "marlin": { + "gpu_ms": 9.072443644205729, + "wall_ms": 9.073465705538789 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 5 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 4.355183919270833, + "wall_ms": 4.35632496761779 + }, + "marlin": { + "gpu_ms": 9.070074462890625, + "wall_ms": 9.071069831649462 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 2.0825927517681464, + "wall_ms": 2.082275748269046 + } + } + }, + "prefill_m512": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_prefill_m512_ep32", + "routing": "ep_mixed", + "tokens": 512, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996380805969238, + "finite": true, + "max_abs": 0.01318359375, + "mean_abs": 0.0021038446575403214, + "nrmse": 0.026911206543445587, + "p95_abs": 0.005126953125, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.5, + "reference_rms": 0.0984053835272789 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996137619018555, + "finite": true, + "max_abs": 0.012939453125, + "mean_abs": 0.002174302702769637, + "nrmse": 0.027790850028395653, + "p95_abs": 0.00537109375, + "p99_abs": 0.0069580078125, + "reference_max_abs": 0.498046875, + "reference_rms": 0.09845462441444397 + }, + "marlin_vs_reference": { + "cosine": 0.9999691247940063, + "finite": true, + "max_abs": 0.005859375, + "mean_abs": 0.0005840405938215554, + "nrmse": 0.007868881337344646, + "p95_abs": 0.00146484375, + "p99_abs": 0.001953125, + "reference_max_abs": 0.498046875, + "reference_rms": 0.09845462441444397 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 1.81865603129069, + "wall_ms": 1.8193970046316583 + }, + "marlin": { + "gpu_ms": 2.5967445373535156, + "wall_ms": 2.5989100647469363 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + }, + { + "flashinfer": { + "gpu_ms": 1.7714890797932943, + "wall_ms": 1.7721137730404735 + }, + "marlin": { + "gpu_ms": 2.600511932373047, + "wall_ms": 2.6012318286423883 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 2 + }, + { + "flashinfer": { + "gpu_ms": 1.7895263671875, + "wall_ms": 1.7902158355961244 + }, + "marlin": { + "gpu_ms": 2.6133761088053387, + "wall_ms": 2.6140614645555615 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 3 + }, + { + "flashinfer": { + "gpu_ms": 1.7714154561360678, + "wall_ms": 1.7720839319129784 + }, + "marlin": { + "gpu_ms": 2.6104395548502604, + "wall_ms": 2.611126432505747 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 4 + }, + { + "flashinfer": { + "gpu_ms": 1.7820064544677734, + "wall_ms": 1.7826298717409372 + }, + "marlin": { + "gpu_ms": 2.6109214782714845, + "wall_ms": 2.6116128312423825 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 5 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 1.7820064544677734, + "wall_ms": 1.7826298717409372 + }, + "marlin": { + "gpu_ms": 2.6104395548502604, + "wall_ms": 2.611126432505747 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 1.4648878225471482, + "wall_ms": 1.4647608423366596 + } + } + }, + "prefill_m8192": { + "case": { + "ep_rank": 7, + "ep_size": 32, + "hidden": 3584, + "inject_nonfinite": false, + "intermediate": 3072, + "local_experts": 28, + "name": "kimi_prefill_m8192_ep32", + "routing": "ep_mixed", + "tokens": 8192, + "top_k": 16 + }, + "correctness": { + "flashinfer_vs_marlin": { + "cosine": 0.9996379613876343, + "finite": true, + "max_abs": 0.0146484375, + "mean_abs": 0.0021007475443184376, + "nrmse": 0.0269180778414011, + "p95_abs": 0.005126953125, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.5703125, + "reference_rms": 0.09823954105377197 + }, + "flashinfer_vs_reference": { + "cosine": 0.9996234178543091, + "finite": true, + "max_abs": 0.0146484375, + "mean_abs": 0.0021431385539472103, + "nrmse": 0.027442343533039093, + "p95_abs": 0.00537109375, + "p99_abs": 0.0068359375, + "reference_max_abs": 0.5703125, + "reference_rms": 0.09829506278038025 + }, + "marlin_vs_reference": { + "cosine": 0.9999799132347107, + "finite": true, + "max_abs": 0.005859375, + "mean_abs": 0.0004543001123238355, + "nrmse": 0.006363501772284508, + "p95_abs": 0.0009765625, + "p99_abs": 0.001953125, + "reference_max_abs": 0.5703125, + "reference_rms": 0.09829506278038025 + } + }, + "rounds": [ + { + "flashinfer": { + "gpu_ms": 16.167036946614584, + "wall_ms": 16.168367435845237 + }, + "marlin": { + "gpu_ms": 34.38465983072917, + "wall_ms": 34.38796966802329 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 1 + }, + { + "flashinfer": { + "gpu_ms": 16.178935750325522, + "wall_ms": 16.179970768280327 + }, + "marlin": { + "gpu_ms": 34.393994140625, + "wall_ms": 34.39523999889692 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 2 + }, + { + "flashinfer": { + "gpu_ms": 16.147456868489584, + "wall_ms": 16.148571266482275 + }, + "marlin": { + "gpu_ms": 34.362894694010414, + "wall_ms": 34.36435852975895 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 3 + }, + { + "flashinfer": { + "gpu_ms": 16.169014485677085, + "wall_ms": 16.169893369078636 + }, + "marlin": { + "gpu_ms": 34.378727213541666, + "wall_ms": 34.37981543441614 + }, + "order": [ + "flashinfer", + "marlin" + ], + "round": 4 + }, + { + "flashinfer": { + "gpu_ms": 16.138995361328124, + "wall_ms": 16.140034631825984 + }, + "marlin": { + "gpu_ms": 34.34004313151042, + "wall_ms": 34.341279161162674 + }, + "order": [ + "marlin", + "flashinfer" + ], + "round": 5 + } + ], + "summary": { + "flashinfer": { + "gpu_ms": 16.167036946614584, + "wall_ms": 16.168367435845237 + }, + "marlin": { + "gpu_ms": 34.378727213541666, + "wall_ms": 34.37981543441614 + }, + "speedup_marlin_over_flashinfer": { + "gpu_ms": 2.126470504586844, + "wall_ms": 2.126362823632778 + } + } + } + } +} diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ncu_2026_2_1_ab_gpu6.ncu-rep b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ncu_2026_2_1_ab_gpu6.ncu-rep new file mode 100644 index 0000000..ed51d36 Binary files /dev/null and b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ncu_2026_2_1_ab_gpu6.ncu-rep differ diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ncu_2026_2_1_ab_gpu6_raw.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ncu_2026_2_1_ab_gpu6_raw.csv new file mode 100644 index 0000000..6148c8e --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_ncu_2026_2_1_ab_gpu6_raw.csv @@ -0,0 +1,10 @@ +"ID","Process ID","Process Name","Host Name","Kernel Name","Context","Stream","Block Size","Grid Size","Device","CC","c2clink__enabled_mask","c2clink__present","derived__pct_occupancy_per_barrier_count","derived__pct_occupancy_per_block_size","derived__pct_occupancy_per_register_count","derived__pct_occupancy_per_shared_mem_size","derived_tempMetric0","device__attribute_architecture","device__attribute_async_engine_count","device__attribute_can_flush_remote_writes","device__attribute_can_map_host_memory","device__attribute_can_tex2d_gather","device__attribute_can_use_64_bit_stream_mem_ops","device__attribute_can_use_64_bit_stream_mem_ops_v1","device__attribute_can_use_host_pointer_for_registered_mem","device__attribute_can_use_stream_mem_ops_v1","device__attribute_can_use_stream_wait_value_nor","device__attribute_can_use_stream_wait_value_nor_v1","device__attribute_chip","device__attribute_clock_rate","device__attribute_cluster_launch","device__attribute_compute_capability_major","device__attribute_compute_capability_minor","device__attribute_compute_mode","device__attribute_compute_preemption_supported","device__attribute_concurrent_kernels","device__attribute_concurrent_managed_access","device__attribute_confidential_computing_mode","device__attribute_cooperative_launch","device__attribute_cooperative_multi_device_launch","device__attribute_deferred_mapping_cuda_array_supported","device__attribute_device_index","device__attribute_direct_managed_mem_access_from_host","device__attribute_display_name","device__attribute_dma_buf_supported","device__attribute_ecc_enabled","device__attribute_export_control_chip","device__attribute_fb_bus_width","device__attribute_fbp_count","device__attribute_generic_compression_supported","device__attribute_global_l1_cache_supported","device__attribute_global_memory_bus_width","device__attribute_gpu_direct_rdma_flush_writes_options","device__attribute_gpu_direct_rdma_supported","device__attribute_gpu_direct_rdma_with_cuda_vmm_supported","device__attribute_gpu_direct_rdma_writes_ordering","device__attribute_gpu_overlap","device__attribute_gpu_pci_device_id","device__attribute_gpu_pci_ext_device_id","device__attribute_gpu_pci_ext_downstream_link_rate","device__attribute_gpu_pci_ext_downstream_link_width","device__attribute_gpu_pci_ext_gen","device__attribute_gpu_pci_ext_gpu_gen","device__attribute_gpu_pci_ext_gpu_link_rate","device__attribute_gpu_pci_ext_gpu_link_width","device__attribute_gpu_pci_revision_id","device__attribute_gpu_pci_sub_system_id","device__attribute_handle_type_fabric_supported","device__attribute_handle_type_posix_file_descriptor_supported","device__attribute_handle_type_win32_handle_supported","device__attribute_handle_type_win32_kmt_handle_supported","device__attribute_host_native_atomic_supported","device__attribute_host_numa_id","device__attribute_host_register_supported","device__attribute_implementation","device__attribute_integrated","device__attribute_ipc_event_supported","device__attribute_kernel_exec_timeout","device__attribute_l2_cache_size","device__attribute_l2s_count","device__attribute_limits_max_cta_per_sm","device__attribute_limits_num_tpcs","device__attribute_local_l1_cache_supported","device__attribute_managed_memory","device__attribute_max_access_policy_window_size","device__attribute_max_block_dim_x","device__attribute_max_block_dim_y","device__attribute_max_block_dim_z","device__attribute_max_blocks_per_multiprocessor","device__attribute_max_gpu_frequency_khz","device__attribute_max_grid_dim_x","device__attribute_max_grid_dim_y","device__attribute_max_grid_dim_z","device__attribute_max_ipc_per_multiprocessor","device__attribute_max_ipc_per_scheduler","device__attribute_max_mem_frequency_khz","device__attribute_max_persisting_l2_cache_size","device__attribute_max_pitch","device__attribute_max_registers_per_block","device__attribute_max_registers_per_multiprocessor","device__attribute_max_registers_per_thread","device__attribute_max_shared_memory_per_block","device__attribute_max_shared_memory_per_block_optin","device__attribute_max_shared_memory_per_multiprocessor","device__attribute_max_threads_per_block","device__attribute_max_threads_per_multiprocessor","device__attribute_max_warps_per_multiprocessor","device__attribute_max_warps_per_scheduler","device__attribute_maximum_surface1d_layered_layers","device__attribute_maximum_surface1d_layered_width","device__attribute_maximum_surface1d_width","device__attribute_maximum_surface2d_height","device__attribute_maximum_surface2d_layered_height","device__attribute_maximum_surface2d_layered_layers","device__attribute_maximum_surface2d_layered_width","device__attribute_maximum_surface2d_width","device__attribute_maximum_surface3d_depth","device__attribute_maximum_surface3d_height","device__attribute_maximum_surface3d_width","device__attribute_maximum_surfacecubemap_layered_layers","device__attribute_maximum_surfacecubemap_layered_width","device__attribute_maximum_surfacecubemap_width","device__attribute_maximum_texture1d_layered_layers","device__attribute_maximum_texture1d_layered_width","device__attribute_maximum_texture1d_linear_width","device__attribute_maximum_texture1d_mipmapped_width","device__attribute_maximum_texture1d_width","device__attribute_maximum_texture2d_gather_height","device__attribute_maximum_texture2d_gather_width","device__attribute_maximum_texture2d_height","device__attribute_maximum_texture2d_layered_height","device__attribute_maximum_texture2d_layered_layers","device__attribute_maximum_texture2d_layered_width","device__attribute_maximum_texture2d_linear_height","device__attribute_maximum_texture2d_linear_pitch","device__attribute_maximum_texture2d_linear_width","device__attribute_maximum_texture2d_mipmapped_height","device__attribute_maximum_texture2d_mipmapped_width","device__attribute_maximum_texture2d_width","device__attribute_maximum_texture3d_depth","device__attribute_maximum_texture3d_depth_alternate","device__attribute_maximum_texture3d_height","device__attribute_maximum_texture3d_height_alternate","device__attribute_maximum_texture3d_width","device__attribute_maximum_texture3d_width_alternate","device__attribute_maximum_texturecubemap_layered_layers","device__attribute_maximum_texturecubemap_layered_width","device__attribute_maximum_texturecubemap_width","device__attribute_mem_sync_domain_count","device__attribute_memory_clock_rate","device__attribute_memory_pools_supported","device__attribute_mempool_supported_handle_types","device__attribute_mps_enabled","device__attribute_multi_gpu_board","device__attribute_multi_gpu_board_group_id","device__attribute_multicast_supported","device__attribute_multiprocessor_count","device__attribute_num_l2s_per_fbp","device__attribute_num_schedulers_per_multiprocessor","device__attribute_num_tex_per_multiprocessor","device__attribute_numa_config","device__attribute_pageable_memory_access","device__attribute_pageable_memory_access_uses_host_page_tables","device__attribute_pci_bus_id","device__attribute_pci_device_id","device__attribute_pci_domain_id","device__attribute_ram_location","device__attribute_ram_type","device__attribute_reserved_shared_memory_per_block","device__attribute_sass_level","device__attribute_single_to_double_precision_perf_ratio","device__attribute_sparse_cuda_array_supported","device__attribute_stream_priorities_supported","device__attribute_surface_alignment","device__attribute_tcc_driver","device__attribute_tensor_map_access_supported","device__attribute_texture_alignment","device__attribute_texture_pitch_alignment","device__attribute_total_constant_memory","device__attribute_total_memory","device__attribute_unified_addressing","device__attribute_unified_function_pointers","device__attribute_virtual_address_management_supported","device__attribute_warp_size","dram__cycles_active.avg","dram__cycles_active.avg.pct_of_peak_sustained_elapsed","dram__cycles_active.max","dram__cycles_active.max.pct_of_peak_sustained_elapsed","dram__cycles_active.min","dram__cycles_active.min.pct_of_peak_sustained_elapsed","dram__cycles_active.sum","dram__cycles_active.sum.pct_of_peak_sustained_elapsed","dram__cycles_elapsed.avg","dram__cycles_elapsed.avg.per_second","dram__cycles_elapsed.max","dram__cycles_elapsed.max.per_second","dram__cycles_elapsed.min","dram__cycles_elapsed.min.per_second","dram__cycles_elapsed.sum","dram__cycles_elapsed.sum.per_second","fbpa__dram_sectors.avg.pct_of_peak_sustained_elapsed","fbpa__dram_sectors.max.pct_of_peak_sustained_elapsed","fbpa__dram_sectors.min.pct_of_peak_sustained_elapsed","fbpa__dram_sectors.sum.pct_of_peak_sustained_elapsed","gpc__cycles_elapsed.avg","gpc__cycles_elapsed.avg.per_second","gpc__cycles_elapsed.max","gpc__cycles_elapsed.max.per_second","gpc__cycles_elapsed.min","gpc__cycles_elapsed.min.per_second","gpc__cycles_elapsed.sum","gpc__cycles_elapsed.sum.per_second","gpu__compute_memory_access_throughput_internal_activity.avg.pct_of_peak_sustained_elapsed","gpu__compute_memory_access_throughput_internal_activity.max.pct_of_peak_sustained_elapsed","gpu__compute_memory_access_throughput_internal_activity.min.pct_of_peak_sustained_elapsed","gpu__compute_memory_access_throughput_internal_activity.sum.pct_of_peak_sustained_elapsed","gpu__compute_memory_request_throughput_internal_activity.avg.pct_of_peak_sustained_elapsed","gpu__compute_memory_request_throughput_internal_activity.max.pct_of_peak_sustained_elapsed","gpu__compute_memory_request_throughput_internal_activity.min.pct_of_peak_sustained_elapsed","gpu__compute_memory_request_throughput_internal_activity.sum.pct_of_peak_sustained_elapsed","gpu__compute_memory_throughput.avg.pct_of_peak_sustained_elapsed","gpu__compute_memory_throughput.max.pct_of_peak_sustained_elapsed","gpu__compute_memory_throughput.min.pct_of_peak_sustained_elapsed","gpu__compute_memory_throughput.sum.pct_of_peak_sustained_elapsed","gpu__dram_throughput.avg.pct_of_peak_sustained_elapsed","gpu__dram_throughput.max.pct_of_peak_sustained_elapsed","gpu__dram_throughput.min.pct_of_peak_sustained_elapsed","gpu__dram_throughput.sum.pct_of_peak_sustained_elapsed","gpu__time_duration.avg","gpu__time_duration.max","gpu__time_duration.min","gpu__time_duration.sum","gr__workids_granted.avg","gr__workids_granted.max","gr__workids_granted.min","gr__workids_granted.sum","gr__workids_granted_as_ctas.avg","gr__workids_granted_as_ctas.max","gr__workids_granted_as_ctas.min","gr__workids_granted_as_ctas.sum","gr__workids_requested.avg","gr__workids_requested.max","gr__workids_requested.min","gr__workids_requested.sum","idc__request_cycles_active.avg.pct_of_peak_sustained_elapsed","idc__request_cycles_active.max.pct_of_peak_sustained_elapsed","idc__request_cycles_active.min.pct_of_peak_sustained_elapsed","idc__request_cycles_active.sum.pct_of_peak_sustained_elapsed","l1tex__cycles_active.avg","l1tex__cycles_active.max","l1tex__cycles_active.min","l1tex__cycles_active.sum","l1tex__cycles_elapsed.avg","l1tex__cycles_elapsed.max","l1tex__cycles_elapsed.min","l1tex__cycles_elapsed.sum","l1tex__data_bank_reads.avg.pct_of_peak_sustained_elapsed","l1tex__data_bank_reads.max.pct_of_peak_sustained_elapsed","l1tex__data_bank_reads.min.pct_of_peak_sustained_elapsed","l1tex__data_bank_reads.sum.pct_of_peak_sustained_elapsed","l1tex__data_bank_writes.avg.pct_of_peak_sustained_elapsed","l1tex__data_bank_writes.max.pct_of_peak_sustained_elapsed","l1tex__data_bank_writes.min.pct_of_peak_sustained_elapsed","l1tex__data_bank_writes.sum.pct_of_peak_sustained_elapsed","l1tex__data_pipe_lsu_wavefronts.avg.pct_of_peak_sustained_elapsed","l1tex__data_pipe_lsu_wavefronts.max.pct_of_peak_sustained_elapsed","l1tex__data_pipe_lsu_wavefronts.min.pct_of_peak_sustained_elapsed","l1tex__data_pipe_lsu_wavefronts.sum.pct_of_peak_sustained_elapsed","l1tex__data_pipe_tex_wavefronts.avg.pct_of_peak_sustained_elapsed","l1tex__data_pipe_tex_wavefronts.max.pct_of_peak_sustained_elapsed","l1tex__data_pipe_tex_wavefronts.min.pct_of_peak_sustained_elapsed","l1tex__data_pipe_tex_wavefronts.sum.pct_of_peak_sustained_elapsed","l1tex__f_wavefronts.avg.pct_of_peak_sustained_elapsed","l1tex__f_wavefronts.max.pct_of_peak_sustained_elapsed","l1tex__f_wavefronts.min.pct_of_peak_sustained_elapsed","l1tex__f_wavefronts.sum.pct_of_peak_sustained_elapsed","l1tex__lsu_writeback_active.avg.pct_of_peak_sustained_elapsed","l1tex__lsu_writeback_active.max.pct_of_peak_sustained_elapsed","l1tex__lsu_writeback_active.min.pct_of_peak_sustained_elapsed","l1tex__lsu_writeback_active.sum.pct_of_peak_sustained_elapsed","l1tex__lsuin_requests.avg.pct_of_peak_sustained_elapsed","l1tex__lsuin_requests.max.pct_of_peak_sustained_elapsed","l1tex__lsuin_requests.min.pct_of_peak_sustained_elapsed","l1tex__lsuin_requests.sum.pct_of_peak_sustained_elapsed","l1tex__m_l1tex2xbar_req_cycles_active.avg.pct_of_peak_sustained_elapsed","l1tex__m_l1tex2xbar_req_cycles_active.max.pct_of_peak_sustained_elapsed","l1tex__m_l1tex2xbar_req_cycles_active.min.pct_of_peak_sustained_elapsed","l1tex__m_l1tex2xbar_req_cycles_active.sum.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors.avg.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors.max.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors.min.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors.sum.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors_mem_dshared.avg.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors_mem_dshared.max.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors_mem_dshared.min.pct_of_peak_sustained_elapsed","l1tex__m_xbar2l1tex_read_sectors_mem_dshared.sum.pct_of_peak_sustained_elapsed","l1tex__tex_writeback_active.avg.pct_of_peak_sustained_elapsed","l1tex__tex_writeback_active.max.pct_of_peak_sustained_elapsed","l1tex__tex_writeback_active.min.pct_of_peak_sustained_elapsed","l1tex__tex_writeback_active.sum.pct_of_peak_sustained_elapsed","l1tex__texin_sm2tex_req_cycles_active.avg.pct_of_peak_sustained_elapsed","l1tex__texin_sm2tex_req_cycles_active.max.pct_of_peak_sustained_elapsed","l1tex__texin_sm2tex_req_cycles_active.min.pct_of_peak_sustained_elapsed","l1tex__texin_sm2tex_req_cycles_active.sum.pct_of_peak_sustained_elapsed","l1tex__throughput.avg.pct_of_peak_sustained_active","l1tex__throughput.max.pct_of_peak_sustained_active","l1tex__throughput.min.pct_of_peak_sustained_active","l1tex__throughput.sum.pct_of_peak_sustained_active","l1tex__tmain_requests.avg.pct_of_peak_sustained_elapsed","l1tex__tmain_requests.max.pct_of_peak_sustained_elapsed","l1tex__tmain_requests.min.pct_of_peak_sustained_elapsed","l1tex__tmain_requests.sum.pct_of_peak_sustained_elapsed","launch__barrier_count","launch__block_dim_x","launch__block_dim_y","launch__block_dim_z","launch__block_size","launch__cluster_dim_x","launch__cluster_dim_y","launch__cluster_dim_z","launch__cluster_max_active","launch__cluster_max_potential_size","launch__cluster_scheduling_policy","launch__cluster_size","launch__context_id","launch__device_id","launch__execution_model","launch__func_cache_config","launch__function_pcs","launch__grid_dim_x","launch__grid_dim_y","launch__grid_dim_z","launch__grid_size","launch__kernel_name","launch__occupancy_cluster_gpu_pct","launch__occupancy_cluster_pct","launch__occupancy_limit_barriers","launch__occupancy_limit_blocks","launch__occupancy_limit_registers","launch__occupancy_limit_shared_mem","launch__occupancy_limit_warps","launch__occupancy_per_barrier_count","launch__occupancy_per_block_size","launch__occupancy_per_cluster_size","launch__occupancy_per_register_count","launch__occupancy_per_shared_mem_size","launch__persisting_l2_cache_size","launch__preferred_cluster_dim_x","launch__preferred_cluster_dim_y","launch__preferred_cluster_dim_z","launch__preferred_cluster_size","launch__registers_per_thread","launch__registers_per_thread_allocated","launch__shared_mem_config_size","launch__shared_mem_per_block","launch__shared_mem_per_block_allocated","launch__shared_mem_per_block_driver","launch__shared_mem_per_block_dynamic","launch__shared_mem_per_block_static","launch__sm_count","launch__stack_size","launch__stream_id","launch__thread_count","launch__tpc_count","launch__tpc_enabled","launch__user_grid_dim_x","launch__user_grid_dim_y","launch__user_grid_dim_z","launch__user_grid_size","launch__uses_blocks_as_clusters","launch__uses_cdp","launch__uses_green_context","launch__uses_mps","launch__uses_nvlink_centric_scheduling","launch__uses_vgpu","launch__waves_per_multiprocessor","lts__cycles_active.avg","lts__cycles_active.max","lts__cycles_active.min","lts__cycles_active.sum","lts__cycles_elapsed.avg","lts__cycles_elapsed.max","lts__cycles_elapsed.min","lts__cycles_elapsed.sum","lts__d_atomic_input_cycles_active.avg.pct_of_peak_sustained_elapsed","lts__d_atomic_input_cycles_active.max.pct_of_peak_sustained_elapsed","lts__d_atomic_input_cycles_active.min.pct_of_peak_sustained_elapsed","lts__d_atomic_input_cycles_active.sum.pct_of_peak_sustained_elapsed","lts__d_decomp_input_sectors.avg.pct_of_peak_sustained_elapsed","lts__d_decomp_input_sectors.max.pct_of_peak_sustained_elapsed","lts__d_decomp_input_sectors.min.pct_of_peak_sustained_elapsed","lts__d_decomp_input_sectors.sum.pct_of_peak_sustained_elapsed","lts__d_sectors.avg.pct_of_peak_sustained_elapsed","lts__d_sectors.max.pct_of_peak_sustained_elapsed","lts__d_sectors.min.pct_of_peak_sustained_elapsed","lts__d_sectors.sum.pct_of_peak_sustained_elapsed","lts__d_sectors_fill_device.avg.pct_of_peak_sustained_elapsed","lts__d_sectors_fill_device.max.pct_of_peak_sustained_elapsed","lts__d_sectors_fill_device.min.pct_of_peak_sustained_elapsed","lts__d_sectors_fill_device.sum.pct_of_peak_sustained_elapsed","lts__lts2xbar_cycles_active.avg.pct_of_peak_sustained_elapsed","lts__lts2xbar_cycles_active.max.pct_of_peak_sustained_elapsed","lts__lts2xbar_cycles_active.min.pct_of_peak_sustained_elapsed","lts__lts2xbar_cycles_active.sum.pct_of_peak_sustained_elapsed","lts__t_sectors.avg.pct_of_peak_sustained_elapsed","lts__t_sectors.max.pct_of_peak_sustained_elapsed","lts__t_sectors.min.pct_of_peak_sustained_elapsed","lts__t_sectors.sum.pct_of_peak_sustained_elapsed","lts__t_tag_requests.avg.pct_of_peak_sustained_elapsed","lts__t_tag_requests.max.pct_of_peak_sustained_elapsed","lts__t_tag_requests.min.pct_of_peak_sustained_elapsed","lts__t_tag_requests.sum.pct_of_peak_sustained_elapsed","lts__throughput.avg.pct_of_peak_sustained_elapsed","lts__throughput.max.pct_of_peak_sustained_elapsed","lts__throughput.min.pct_of_peak_sustained_elapsed","lts__throughput.sum.pct_of_peak_sustained_elapsed","lts__xbar2lts_cycles_active.avg.pct_of_peak_sustained_elapsed","lts__xbar2lts_cycles_active.max.pct_of_peak_sustained_elapsed","lts__xbar2lts_cycles_active.min.pct_of_peak_sustained_elapsed","lts__xbar2lts_cycles_active.sum.pct_of_peak_sustained_elapsed","numa__cpu_affinity","numa__dev_display_name_all","numa__id_cpu","numa__id_memory","nvlink__bandwidth","nvlink__count_logical","nvlink__count_physical","nvlink__destination_ports","nvlink__dev0Id","nvlink__dev0type","nvlink__dev1Id","nvlink__dev1type","nvlink__dev_display_name_all","nvlink__enabled_mask","nvlink__is_direct_link","nvlink__is_nvswitch_connected","nvlink__max_count","nvlink__peer_access","nvlink__peer_atomic","nvlink__source_ports","nvlink__system_access","nvlink__system_atomic","profiler__perfworks_session_reuse","profiler__replayer_bytes_mem_accessible.avg","profiler__replayer_bytes_mem_accessible.max","profiler__replayer_bytes_mem_accessible.min","profiler__replayer_bytes_mem_accessible.sum","profiler__replayer_bytes_mem_backed_up.avg","profiler__replayer_bytes_mem_backed_up.max","profiler__replayer_bytes_mem_backed_up.min","profiler__replayer_bytes_mem_backed_up.sum","profiler__replayer_passes","profiler__replayer_passes_type_warmup","sm__cycles_active.avg","sm__cycles_active.max","sm__cycles_active.min","sm__cycles_active.sum","sm__cycles_elapsed.avg","sm__cycles_elapsed.max","sm__cycles_elapsed.min","sm__cycles_elapsed.sum","sm__inst_executed.avg.pct_of_peak_sustained_elapsed","sm__inst_executed.max.pct_of_peak_sustained_elapsed","sm__inst_executed.min.pct_of_peak_sustained_elapsed","sm__inst_executed.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_adu.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_adu.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_adu.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_adu.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_cbu_pred_on_any.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_cbu_pred_on_any.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_cbu_pred_on_any.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_cbu_pred_on_any.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_ipa.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_ipa.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_ipa.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_ipa.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_lsu.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_lsu.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_lsu.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_lsu.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_tex.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_tex.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_tex.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_tex.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_uniform.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_uniform.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_uniform.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_uniform.sum.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_xu.avg.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_xu.max.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_xu.min.pct_of_peak_sustained_elapsed","sm__inst_executed_pipe_xu.sum.pct_of_peak_sustained_elapsed","sm__instruction_throughput_internal_activity.avg.pct_of_peak_sustained_elapsed","sm__instruction_throughput_internal_activity.max.pct_of_peak_sustained_elapsed","sm__instruction_throughput_internal_activity.min.pct_of_peak_sustained_elapsed","sm__instruction_throughput_internal_activity.sum.pct_of_peak_sustained_elapsed","sm__issue_active.avg.pct_of_peak_sustained_elapsed","sm__issue_active.max.pct_of_peak_sustained_elapsed","sm__issue_active.min.pct_of_peak_sustained_elapsed","sm__issue_active.sum.pct_of_peak_sustained_elapsed","sm__maximum_warps_avg_per_active_cycle","sm__maximum_warps_per_active_cycle_pct","sm__memory_throughput_internal_activity.avg.pct_of_peak_sustained_elapsed","sm__memory_throughput_internal_activity.max.pct_of_peak_sustained_elapsed","sm__memory_throughput_internal_activity.min.pct_of_peak_sustained_elapsed","sm__memory_throughput_internal_activity.sum.pct_of_peak_sustained_elapsed","sm__mio2rf_writeback_active.avg.pct_of_peak_sustained_elapsed","sm__mio2rf_writeback_active.max.pct_of_peak_sustained_elapsed","sm__mio2rf_writeback_active.min.pct_of_peak_sustained_elapsed","sm__mio2rf_writeback_active.sum.pct_of_peak_sustained_elapsed","sm__mio_inst_issued.avg.pct_of_peak_sustained_elapsed","sm__mio_inst_issued.max.pct_of_peak_sustained_elapsed","sm__mio_inst_issued.min.pct_of_peak_sustained_elapsed","sm__mio_inst_issued.sum.pct_of_peak_sustained_elapsed","sm__mio_pq_read_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__mio_pq_read_cycles_active.max.pct_of_peak_sustained_elapsed","sm__mio_pq_read_cycles_active.min.pct_of_peak_sustained_elapsed","sm__mio_pq_read_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__mio_pq_write_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__mio_pq_write_cycles_active.max.pct_of_peak_sustained_elapsed","sm__mio_pq_write_cycles_active.min.pct_of_peak_sustained_elapsed","sm__mio_pq_write_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__pipe_aluheavy_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__pipe_aluheavy_cycles_active.max.pct_of_peak_sustained_elapsed","sm__pipe_aluheavy_cycles_active.min.pct_of_peak_sustained_elapsed","sm__pipe_aluheavy_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__pipe_fma_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__pipe_fma_cycles_active.max.pct_of_peak_sustained_elapsed","sm__pipe_fma_cycles_active.min.pct_of_peak_sustained_elapsed","sm__pipe_fma_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__pipe_fmaheavy_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__pipe_fmaheavy_cycles_active.max.pct_of_peak_sustained_elapsed","sm__pipe_fmaheavy_cycles_active.min.pct_of_peak_sustained_elapsed","sm__pipe_fmaheavy_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__pipe_fp64_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__pipe_fp64_cycles_active.max.pct_of_peak_sustained_elapsed","sm__pipe_fp64_cycles_active.min.pct_of_peak_sustained_elapsed","sm__pipe_fp64_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__pipe_tensor_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__pipe_tensor_cycles_active.max.pct_of_peak_sustained_elapsed","sm__pipe_tensor_cycles_active.min.pct_of_peak_sustained_elapsed","sm__pipe_tensor_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__pipe_tma_cycles_active.avg.pct_of_peak_sustained_elapsed","sm__pipe_tma_cycles_active.max.pct_of_peak_sustained_elapsed","sm__pipe_tma_cycles_active.min.pct_of_peak_sustained_elapsed","sm__pipe_tma_cycles_active.sum.pct_of_peak_sustained_elapsed","sm__throughput.avg.pct_of_peak_sustained_elapsed","sm__throughput.max.pct_of_peak_sustained_elapsed","sm__throughput.min.pct_of_peak_sustained_elapsed","sm__throughput.sum.pct_of_peak_sustained_elapsed","sm__warps_active.avg.pct_of_peak_sustained_active","sm__warps_active.avg.per_cycle_active","sm__warps_active.max.pct_of_peak_sustained_active","sm__warps_active.max.per_cycle_active","sm__warps_active.min.pct_of_peak_sustained_active","sm__warps_active.min.per_cycle_active","sm__warps_active.sum.pct_of_peak_sustained_active","sm__warps_active.sum.per_cycle_active","smsp__cycles_active.avg","smsp__cycles_active.max","smsp__cycles_active.min","smsp__cycles_active.sum","smsp__cycles_elapsed.avg","smsp__cycles_elapsed.max","smsp__cycles_elapsed.min","smsp__cycles_elapsed.sum","smsp__maximum_warps_avg_per_active_cycle","smsp__warps_active.avg.peak_sustained","smsp__warps_active.max.peak_sustained","smsp__warps_active.min.peak_sustained","smsp__warps_active.sum.peak_sustained","syslts__d_atomic_input_cycles_active.avg.pct_of_peak_sustained_elapsed","syslts__d_atomic_input_cycles_active.max.pct_of_peak_sustained_elapsed","syslts__d_atomic_input_cycles_active.min.pct_of_peak_sustained_elapsed","syslts__d_atomic_input_cycles_active.sum.pct_of_peak_sustained_elapsed","syslts__d_sectors.avg.pct_of_peak_sustained_elapsed","syslts__d_sectors.max.pct_of_peak_sustained_elapsed","syslts__d_sectors.min.pct_of_peak_sustained_elapsed","syslts__d_sectors.sum.pct_of_peak_sustained_elapsed","syslts__d_sectors_fill_sysmem.avg.pct_of_peak_sustained_elapsed","syslts__d_sectors_fill_sysmem.max.pct_of_peak_sustained_elapsed","syslts__d_sectors_fill_sysmem.min.pct_of_peak_sustained_elapsed","syslts__d_sectors_fill_sysmem.sum.pct_of_peak_sustained_elapsed","syslts__syslts2xbar_cycles_active.avg.pct_of_peak_sustained_elapsed","syslts__syslts2xbar_cycles_active.max.pct_of_peak_sustained_elapsed","syslts__syslts2xbar_cycles_active.min.pct_of_peak_sustained_elapsed","syslts__syslts2xbar_cycles_active.sum.pct_of_peak_sustained_elapsed","syslts__t_sectors.avg.pct_of_peak_sustained_elapsed","syslts__t_sectors.max.pct_of_peak_sustained_elapsed","syslts__t_sectors.min.pct_of_peak_sustained_elapsed","syslts__t_sectors.sum.pct_of_peak_sustained_elapsed","syslts__t_tag_requests.avg.pct_of_peak_sustained_elapsed","syslts__t_tag_requests.max.pct_of_peak_sustained_elapsed","syslts__t_tag_requests.min.pct_of_peak_sustained_elapsed","syslts__t_tag_requests.sum.pct_of_peak_sustained_elapsed","syslts__xbar2syslts_cycles_active.avg.pct_of_peak_sustained_elapsed","syslts__xbar2syslts_cycles_active.max.pct_of_peak_sustained_elapsed","syslts__xbar2syslts_cycles_active.min.pct_of_peak_sustained_elapsed","syslts__xbar2syslts_cycles_active.sum.pct_of_peak_sustained_elapsed" +"","","","","","","","","","","","","","","%","%/register","%/Kbyte","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","","cycle","%","cycle","%","cycle","%","cycle","%","cycle","Ghz","cycle","Ghz","cycle","Ghz","cycle","Ghz","%","%","%","%","cycle","Ghz","cycle","Ghz","cycle","Ghz","cycle","Ghz","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","us","us","us","us","","","","","block","block","block","block","","","","","%","%","%","%","cycle","cycle","cycle","cycle","cycle","cycle","cycle","cycle","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","","block","block","block","","","","","cluster","block","","","","","","","","","","","","","%","%","block","block","block","block","block","","","","","","Mbyte","","","","","register/thread","register/thread","Kbyte","Kbyte/block","Kbyte/block","Kbyte/block","Kbyte/block","byte/block","SM","","","thread","","","","","","","","","","","","","","cycle","cycle","cycle","cycle","cycle","cycle","cycle","cycle","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","","","","","","","","","","","","","","","","","","","","","","","","Gbyte","Gbyte","Gbyte","Gbyte","Gbyte","Gbyte","Gbyte","Gbyte","pass","pass","cycle","cycle","cycle","cycle","cycle","cycle","cycle","cycle","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","warp","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","warp","%","warp","%","warp","%","warp","cycle","cycle","cycle","cycle","cycle","cycle","cycle","cycle","warp","warp","warp","warp","warp","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%","%" +"0","62","python3.12","127.0.0.1","void sglang::Marlin<__nv_bfloat16, 562949953487106, 2814749767106568, 128, 1, 8, 4, 1, 4, 2, 0, 1, 0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)","1","7","(128, 1, 1)","(468, 1, 1)","0","12.0","0","0","385","774.000000","5633.000000","3.411000","18800","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","843851.428571","86.816399","847424.000000","87.183949","839360.000000","86.354316","11813920.000000","86.816399","971995.428571","12.458924","972800.000000","12.469237","971776.000000","12.456112","13607936.000000","174.424938","69.281271","69.515471","69.033373","69.281271","175467.700000","2.249125","175866.000000","2.254230","174809.000000","2.240681","1754677.000000","22.491245","11.351380","12.830786","10.248865","11.351380","0.391095","0.395300","0.386890","0.391095","86.816399","87.183949","86.354316","86.816399","86.816399","87.183949","86.354316","86.816399","78.016000","78.016000","78.016000","78.016000","0","0","0","0","0","0","0","0","0","0","0","0","0.393293","0.424025","0.352214","0.393293","166386.679487","169647.000000","161600.000000","25956322.000000","175461.435897","175866.000000","174809.000000","27371984.000000","2.209969","2.228285","1.839436","2.209969","1.496711","1.509591","1.244077","1.496711","8.247787","8.353972","6.889263","8.247787","0","0","0","0","0","0","0","0","4.929902","4.969183","4.119994","4.929902","12.029877","12.156517","10.046652","12.029877","1.753592","1.770190","1.492636","1.753592","11.216322","11.242356","9.248186","11.216322","0","0","0","0","0","0","0","0","0.008425","0.008549","0.007409","0.008425","12.685988","12.819536","10.594598","12.685988","0.000000","0.000000","0.000000","0.000000","1","128","1","1","128","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","468","1","1","468","","0","0","24.000000","24.000000","4.000000","3.000000","12.000000","188","377","828","2732","1672","22.020096","0","0","0","0","113","120.000000","102.400000","33.792000","33.792000","1.024000","32.768000","0","156","1024","7","59904","78","all","468","1","1","468","0","0","0","0","0","0","1","139864.446429","141731.000000","138874.000000","7832409.000000","152251.000000","152251.000000","152251.000000","8526056.000000","0.005583","0.106403","0.000000","0.005583","0","0","0","0","17.819095","18.613999","17.472463","17.819095","34.324733","34.439839","34.217181","34.324733","18.272739","19.860953","17.579523","18.272739","18.639539","20.261936","17.982148","18.639539","9.261645","10.099113","8.861682","9.261645","34.324733","34.439839","34.217181","34.324733","6.024474","6.910299","5.577632","6.024474","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","166386.679487","169647.000000","161600.000000","25956322.000000","175461.435897","175866.000000","174809.000000","27371984.000000","22.523768","22.700715","18.843599","22.523768","1.636315","1.705218","1.435073","1.636315","0.877393","0.906182","0.740334","0.877393","0","0","0","0","12.029965","12.156517","10.037533","12.029965","0.003295","0.003420","0.002280","0.003295","0.341879","0.349934","0.284963","0.341879","0.317295","0.341955","0.270145","0.317295","0","0","0","0","22.527073","22.704419","18.843314","22.527073","12.000000","25.000000","0.102937","0.108856","0.091758","0.102937","1.278430","1.291737","1.074453","1.278430","4.555427","4.620578","3.823822","4.555427","0.243607","0.282683","0.183516","0.243607","0.246610","0.298641","0.184656","0.246610","17.600262","17.733241","14.706935","17.600262","14.925580","14.972663","12.372591","14.925580","22.008341","22.162135","18.376403","22.008341","0","0","0","0","10.055946","10.067169","8.316357","10.055946","0.000000","0.000000","0.000000","0.000000","22.527073","22.704419","18.843599","22.527073","24.543954","11.781098","25.360541","12.173060","20.692236","9.932273","24.543954","1837.851257","166347.434295","169627.000000","161536.000000","103800799.000000","175461.435897","175866.000000","174809.000000","109487936.000000","3.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.133276","0.133276","0.133276","0.133276","0.000000","0.000000","0","0.000000","0.001941","0.002588","0.001294","0.001941","0.337073","0.337720","0.336426","0.337073","0.095752","0.098340","0.093164","0.095752","0.394977","0.400476","0.389478","0.394977" +"1","62","python3.12","127.0.0.1","void sglang::Marlin<__nv_bfloat16, 562949953487106, 2814749767106568, 128, 1, 8, 4, 1, 4, 2, 0, 1, 0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)","1","7","(128, 1, 1)","(468, 1, 1)","0","12.0","0","0","385","774.000000","5633.000000","3.411000","18800","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","418724.571429","77.771363","419968.000000","78.002309","417344.000000","77.514944","5862144.000000","77.771363","538404.571429","12.453844","538624.000000","12.458919","537600.000000","12.435233","7537664.000000","174.353812","62.169582","62.335194","61.974106","62.169582","97908.700000","2.264728","98107.000000","2.269314","97638.000000","2.258466","979087.000000","22.647275","10.974921","13.977907","10.302886","10.974921","0.706350","0.746112","0.666589","0.706350","77.771363","78.002309","77.514944","77.771363","77.771363","78.002309","77.514944","77.771363","43.232000","43.232000","43.232000","43.232000","0","0","0","0","0","0","0","0","0","0","0","0","0.673285","0.735407","0.596496","0.673285","90384.429487","94785.000000","86108.000000","14099971.000000","97905.025641","98107.000000","97638.000000","15273184.000000","2.083510","2.112602","1.695968","2.083510","1.427287","1.448215","1.160532","1.427287","7.881009","8.052702","6.403144","7.881009","0","0","0","0","0","0","0","0","4.698909","4.772993","3.879270","4.698909","11.273615","11.476428","9.249781","11.273615","1.830745","1.885501","1.535161","1.830745","10.254378","10.294671","8.433684","10.254378","0","0","0","0","0","0","0","0","0.015138","0.015321","0.013278","0.015138","12.211656","12.431345","10.019425","12.211656","0.000000","0.000000","0.000000","0.000000","1","128","1","1","128","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","468","1","1","468","","0","0","24.000000","24.000000","4.000000","3.000000","12.000000","188","377","828","2732","1672","22.020096","0","0","0","0","113","120.000000","102.400000","33.792000","33.792000","1.024000","32.768000","0","156","1024","7","59904","78","all","468","1","1","468","0","0","0","0","0","0","1","72893.089286","74999.000000","71710.000000","4082013.000000","84190.000000","84190.000000","84190.000000","4714640.000000","0.012705","0.409787","0.000000","0.012705","0","0","0","0","16.520413","17.082789","16.213327","16.520413","31.084897","31.205606","30.958546","31.084897","17.072025","17.885735","16.487706","17.072025","17.763000","18.777171","17.119610","17.763000","8.798254","10.053451","8.371541","8.798254","31.084897","31.205606","30.958546","31.084897","6.569346","8.015204","6.003088","6.569346","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","90384.429487","94785.000000","86108.000000","14099971.000000","97905.025641","98107.000000","97638.000000","15273184.000000","21.224299","21.523921","17.574174","21.224299","1.933768","2.083652","1.607680","1.933768","0.887143","0.965221","0.674123","0.887143","0","0","0","0","11.275003","11.476428","9.249781","11.275003","0.005997","0.006128","0.004086","0.005997","0.317661","0.328890","0.274756","0.317661","0.519459","0.563812","0.435116","0.519459","0","0","0","0","21.229922","21.529794","17.585665","21.229922","12.000000","25.000000","0.144384","0.157295","0.118482","0.144384","1.251471","1.274705","1.040039","1.251471","4.402924","4.520027","3.618473","4.402924","0.377472","0.508656","0.258414","0.377472","0.378611","0.504571","0.258414","0.378611","16.551441","16.777995","13.730654","16.551441","13.544968","13.607958","11.203077","13.544968","20.589834","20.866651","17.048410","20.589834","0","0","0","0","9.010931","9.020987","7.452120","9.010931","0.000000","0.000000","0.000000","0.000000","21.229922","21.529794","17.585665","21.229922","23.951367","11.496656","25.276339","12.132643","20.291221","9.739786","23.951367","1793.478389","90320.504808","94763.000000","85688.000000","56359995.000000","97905.025641","98107.000000","97638.000000","61092736.000000","3.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.240907","0.240907","0.240907","0.240907","0.000000","0.000000","0","0.000000","0.003508","0.004678","0.002339","0.003508","0.608701","0.632675","0.584727","0.608701","0.172494","0.182435","0.162554","0.172494","0.711028","0.741434","0.680622","0.711028" +"2","62","python3.12","127.0.0.1","void cutlass::device_kernel>, cutlass::CollectiveMma, cute::C<1>, cute::C<1>>, cutlass::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<3>>, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<2>, cute::C<1>>, cute::tuple, cute::C<4>, cute::C<0>>>, cute::tuple, cute::Layout, cute::C<2>, cute::C<2>>, cute::tuple, cute::C<16>, cute::C<8>>>, cute::C<32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::CollectiveEpilogue, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::FusionCallbacks, cutlass::LinearCombination, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)","1","7","(384, 1, 1)","(1, 156, 1)","0","12.0","0","0","625","316.000000","4225.000000","4.975000","30000","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","848731.428571","51.687082","853664.000000","51.987472","844128.000000","51.406737","11882240.000000","51.687082","1642057.142857","12.463999","1642496.000000","12.467331","1641472.000000","12.459558","22988800.000000","174.495992","41.699819","41.902860","41.483077","41.699819","295233.300000","2.240962","295687.000000","2.244406","294519.000000","2.235540","2952333.000000","22.409620","20.770393","32.068612","10.380989","20.770393","0.238532","0.244916","0.232148","0.238532","51.687082","55.967762","51.406737","51.687082","51.687082","51.987472","51.406737","51.687082","131.744000","131.744000","131.744000","131.744000","0","0","0","0","0","0","0","0","0","0","0","0","0.397899","0.451178","0.348206","0.397899","227211.589744","292332.000000","159052.000000","35445008.000000","295227.179487","295687.000000","294519.000000","46055440.000000","7.173832","8.738885","5.835453","7.173832","2.484575","3.024112","2.022066","2.484575","28.105968","34.252944","22.888137","28.105968","0","0","0","0","0","0","0","0","25.737885","31.364660","20.965549","25.737885","25.410940","30.950402","20.765026","25.410940","3.575858","4.340386","2.927237","3.575858","18.716252","22.809214","15.207611","18.716252","0","0","0","0","0","0","0","0","0.064205","0.078584","0.051486","0.064205","36.519464","44.506532","29.739680","36.519464","0.127568","0.155473","0.103649","0.127568","8","384","1","1","384","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","1","156","1","156","","0","0","3.000000","24.000000","1.000000","1.000000","4.000000","300","157","406","2028","2388","22.020096","0","0","0","0","168","168.000000","102.400000","83.968000","83.968000","1.024000","82.944000","0","156","1024","7","59904","78","all","1","156","1","156","0","0","0","0","0","0","1","240496.446429","242288.000000","238813.000000","13467801.000000","254417.000000","254417.000000","254417.000000","14247352.000000","0.075467","0.100622","0.044022","0.075467","0","0","0","0","20.566980","30.755806","10.684821","20.566980","20.605099","20.690441","20.536364","20.605099","30.362389","50.689812","10.629203","30.362389","35.629389","55.967762","15.901650","35.629389","20.272588","30.499141","10.372735","20.272588","35.629389","55.967762","20.536364","35.629389","18.497795","28.837303","10.700150","18.497795","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","227211.589744","292332.000000","159052.000000","35445008.000000","295227.179487","295687.000000","294519.000000","46055440.000000","14.853569","18.069813","12.167325","14.853569","3.512814","4.315321","2.746360","3.512814","0.624104","0.789223","0.453888","0.624104","0","0","0","0","25.410940","30.950402","20.765026","25.410940","0.000000","0.000000","0.000000","0.000000","1.926737","2.325836","1.585813","1.926737","0.100001","0.123295","0.058260","0.100001","0","0","0","0","14.939132","18.180406","12.216186","14.939132","12.000000","25.000000","0.105160","0.110085","0.100939","0.105160","6.475509","7.887824","5.278308","6.475509","9.726297","11.858890","7.888388","9.726297","3.044142","3.845852","2.250132","3.044142","3.136943","3.962711","2.329731","3.136943","5.727255","6.964298","4.751426","5.727255","2.663838","3.258635","2.163461","2.663838","5.785480","7.079887","4.769717","5.785480","0","0","0","0","47.812150","58.271058","38.847372","47.812150","0.382704","0.466420","0.310947","0.382704","47.812150","58.271058","38.847372","47.812150","22.916101","10.999729","29.492398","14.156351","16.043113","7.700694","22.916101","1715.957669","227112.243590","292308.000000","158902.000000","141718040.000000","295227.179487","295687.000000","294519.000000","184221760.000000","3.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.079704","0.079704","0.079704","0.079704","0.000193","0.000387","0","0.000193","0.002128","0.002708","0.001548","0.002128","0.204677","0.208159","0.201195","0.204677","0.060552","0.063454","0.057650","0.060552","0.248592","0.253428","0.243755","0.248592" +"3","62","python3.12","127.0.0.1","void cutlass::device_kernel>, cutlass::CollectiveMma, cute::C<1>, cute::C<1>>, cutlass::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<3>>, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<2>, cute::C<1>>, cute::tuple, cute::C<4>, cute::C<0>>>, cute::tuple, cute::Layout, cute::C<2>, cute::C<2>>, cute::tuple, cute::C<16>, cute::C<8>>>, cute::C<32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::CollectiveEpilogue, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::FusionCallbacks, cutlass::LinearCombination, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)","1","7","(384, 1, 1)","(1, 156, 1)","0","12.0","0","0","625","316.000000","4225.000000","4.975000","30000","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","420788.571429","49.912969","422464.000000","50.111704","419360.000000","49.743515","5891040.000000","49.912969","843044.571429","12.462225","843776.000000","12.473037","842752.000000","12.457900","11802624.000000","174.471145","40.404495","40.548471","40.287295","40.404495","147933.900000","2.186819","148263.000000","2.191683","147578.000000","2.181557","1479339.000000","21.868185","20.364825","33.843140","10.313412","20.364825","0.466219","0.471135","0.461303","0.466219","49.912969","61.136887","49.743515","49.912969","49.912969","50.111704","49.743515","49.912969","67.648000","67.648000","67.648000","67.648000","0","0","0","0","0","0","0","0","0","0","0","0","0.634996","0.743578","0.539432","0.634996","106977.474359","144017.000000","78141.000000","16688486.000000","147933.384615","148263.000000","147578.000000","23077608.000000","7.196652","10.003975","5.030305","7.196652","2.519552","3.495006","1.765850","2.519552","28.414630","39.475876","19.931268","28.414630","0","0","0","0","0","0","0","0","25.870342","35.945909","18.141274","25.870342","25.918596","35.881015","18.333928","25.918596","3.911766","5.347001","2.803289","3.911766","18.688297","26.025904","13.018698","18.688297","0","0","0","0","0","0","0","0","0.077296","0.108157","0.054078","0.077296","39.293061","54.589062","27.561877","39.293061","0.132977","0.185219","0.092609","0.132977","8","384","1","1","384","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","1","156","1","156","","0","0","3.000000","24.000000","1.000000","1.000000","4.000000","300","157","406","2028","2388","22.020096","0","0","0","0","168","168.000000","102.400000","83.968000","83.968000","1.024000","82.944000","0","156","1024","7","59904","78","all","1","156","1","156","0","0","0","0","0","0","1","116937.892857","118048.000000","115134.000000","6548522.000000","130180.000000","130180.000000","130180.000000","7290080.000000","0.086035","0.116761","0.049163","0.086035","0","0","0","0","20.281424","33.243202","10.579198","20.281424","20.202055","20.298049","20.109080","20.202055","29.783967","55.803887","10.482025","29.783967","35.174861","61.136887","15.791212","35.174861","20.001358","32.982025","10.233523","20.001358","35.174861","61.136887","20.109080","35.174861","19.371735","31.826701","10.902596","19.371735","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","106977.474359","144017.000000","78141.000000","16688486.000000","147933.384615","148263.000000","147578.000000","23077608.000000","15.541212","21.277651","11.200143","15.541212","3.824053","5.026587","2.839116","3.824053","0.659687","0.898377","0.479946","0.659687","0","0","0","0","25.918596","35.881015","18.333928","25.918596","0.000000","0.000000","0.000000","0.000000","2.053345","2.778109","1.494592","2.053345","0.203730","0.233889","0.104101","0.203730","0","0","0","0","15.621585","21.385301","11.263009","15.621585","12.000000","25.000000","0.191146","0.201442","0.183191","0.191146","6.528753","9.058807","4.588552","6.528753","10.002868","13.760248","7.091030","10.002868","3.049566","4.057908","2.246957","3.049566","3.204271","4.270841","2.333483","3.204271","6.172082","8.413584","4.536839","6.172082","2.724854","3.787685","1.914629","2.724854","6.101595","8.381982","4.438653","6.101595","0","0","0","0","47.708792","66.451532","33.225766","47.708792","0.398932","0.555656","0.277828","0.398932","47.708792","66.451532","33.225766","47.708792","22.925435","11.004209","30.884598","14.824607","16.746516","8.038328","22.925435","1716.656549","106878.076923","143993.000000","77990.000000","66691920.000000","147933.384615","148263.000000","147578.000000","92310432.000000","3.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.155784","0.155784","0.155784","0.155784","0.000378","0.000756","0","0.000378","0.004159","0.005294","0.003025","0.004159","0.400048","0.402317","0.397780","0.400048","0.116460","0.120998","0.111923","0.116460","0.470756","0.480966","0.460547","0.470756" +"4","62","python3.12","127.0.0.1","void sglang::Marlin<__nv_bfloat16, 562949953487106, 2814749767106568, 256, 4, 16, 4, 0, 4, 2, 0, 1, 0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)","1","7","(256, 1, 1)","(156, 1, 1)","0","12.0","0","0","400","146.000000","4112.000000","3.184000","20000","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","3146546.285714","76.078215","3151296.000000","76.193055","3141888.000000","75.965586","44051648.000000","76.078215","4135936.000000","12.468455","4135936.000000","12.468455","4135936.000000","12.468455","57903104.000000","174.558364","60.245149","60.309131","60.198235","60.245149","750064.900000","2.261193","752837.000000","2.269550","745891.000000","2.248610","7500649.000000","22.611931","11.590613","11.761273","11.496133","11.590613","0.093037","0.093113","0.092962","0.093037","76.078215","76.193055","75.965586","76.078215","76.078215","76.193055","75.965586","76.078215","331.712000","331.712000","331.712000","331.712000","0","0","0","0","0","0","0","0","0","0","0","0","0.086150","0.097329","0.065331","0.086150","726290.980769","740267.000000","376475.000000","113301393.000000","750030.782051","752837.000000","745891.000000","117004802.000000","5.695145","5.779346","2.892460","5.695145","2.056138","2.180998","1.013429","2.056138","15.849382","16.130671","8.094601","15.849382","0","0","0","0","0","0","0","0","12.051663","12.196166","6.155614","12.051663","16.101416","16.363862","8.258061","16.101416","2.906553","3.165870","1.480339","2.906553","13.644118","14.180351","6.643994","13.644118","0","0","0","0","0","0","0","0","0.001456","0.001467","0.001200","0.001456","16.627713","16.898737","8.527987","16.627713","0.000000","0.000000","0.000000","0.000000","1","256","1","1","256","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","156","1","1","156","","0","0","24.000000","24.000000","1.000000","1.000000","6.000000","200","73","406","2056","1592","22.020096","0","0","0","0","255","256.000000","102.400000","102.400000","102.400000","1.024000","101.376000","0","156","1024","7","39936","78","all","156","1","1","156","0","0","0","0","0","0","1","629144.053571","632705.000000","627754.000000","35232067.000000","652863.000000","652863.000000","652863.000000","36560328.000000","0.000410","0.013479","0.000000","0.000410","0","0","0","0","18.862911","18.944557","18.792917","18.862911","28.630509","28.659612","28.601560","28.630509","21.893007","21.988917","21.797988","21.893007","22.868489","23.000844","22.753855","22.868489","11.438494","11.600596","11.372983","11.438494","28.630509","28.659612","28.601560","28.630509","9.371119","9.584400","9.184929","9.371119","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","726290.980769","740267.000000","376475.000000","113301393.000000","750030.782051","752837.000000","745891.000000","117004802.000000","26.085860","26.344752","13.331520","26.085860","1.421815","1.471940","0.747969","1.421815","0.702666","0.736103","0.354119","0.702666","0","0","0","0","16.101416","16.363862","8.258061","16.101416","0.000256","0.000267","0.000000","0.000256","0.462393","0.471814","0.245723","0.462393","0.085730","0.094929","0.061331","0.085730","0","0","0","0","26.086092","26.345019","13.331653","26.086092","8.000000","16.666667","0.114669","0.123328","0.061331","0.114669","3.025674","3.062441","1.546903","3.025674","5.841077","5.945267","3.001921","5.841077","0.695322","0.810233","0.360119","0.695322","0.707684","0.810233","0.372918","0.707684","16.105786","16.262933","8.229462","16.105786","12.743291","12.811041","6.453118","12.743291","18.232125","18.426977","9.323517","18.232125","0","0","0","0","65.869379","66.079421","33.312766","65.869379","0.000000","0.000000","0.000000","0.000000","65.869379","66.079421","33.312766","65.869379","16.660800","7.997184","16.983107","8.151891","8.631085","4.142921","16.660800","1247.560733","726126.014423","740237.000000","375866.000000","453102633.000000","750030.782051","752837.000000","745891.000000","468019208.000000","2.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.031088","0.031088","0.031088","0.031088","0.000075","0.000151","0","0.000075","0.000830","0.001056","0.000604","0.000830","0.079833","0.079983","0.079682","0.079833","0.023240","0.024448","0.022033","0.023240","0.093943","0.096433","0.091453","0.093943" +"5","62","python3.12","127.0.0.1","void sglang::Marlin<__nv_bfloat16, 562949953487106, 2814749767106568, 256, 4, 16, 4, 0, 4, 2, 0, 1, 0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)","1","7","(256, 1, 1)","(156, 1, 1)","0","12.0","0","0","400","146.000000","4112.000000","3.184000","20000","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","1665792.000000","73.701498","1671360.000000","73.947850","1659904.000000","73.440989","23321088.000000","73.701498","2260187.428571","12.465735","2260992.000000","12.470173","2259968.000000","12.464525","31642624.000000","174.520297","59.025260","59.152822","58.890328","59.025260","404439.600000","2.230628","405540.000000","2.236697","402922.000000","2.222258","4044396.000000","22.306279","11.904166","12.430444","11.620286","11.904166","0.172165","0.173980","0.170350","0.172165","73.701498","73.947850","73.440989","73.701498","73.701498","73.947850","73.440989","73.701498","181.312000","181.312000","181.312000","181.312000","0","0","0","0","0","0","0","0","0","0","0","0","0.139982","0.158742","0.110279","0.139982","383765.179487","398289.000000","206936.000000","59867368.000000","404429.320513","405540.000000","402922.000000","63090974.000000","5.422744","5.531985","2.753911","5.422744","2.049060","2.193283","0.996937","2.049060","15.822924","16.363057","8.025383","15.822924","0","0","0","0","0","0","0","0","11.491980","11.686344","5.903875","11.491980","15.742211","16.163517","8.098819","15.742211","3.976304","4.632701","1.950650","3.976304","12.838730","13.375143","6.175368","12.838730","0","0","0","0","0","0","0","0","0.002707","0.002720","0.002225","0.002707","16.674922","17.244139","8.534907","16.674922","0.000000","0.000000","0.000000","0.000000","1","256","1","1","256","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","156","1","1","156","","0","0","24.000000","24.000000","1.000000","1.000000","6.000000","200","73","406","2056","1592","22.020096","0","0","0","0","255","256.000000","102.400000","102.400000","102.400000","1.024000","101.376000","0","156","1024","7","39936","78","all","156","1","1","156","0","0","0","0","0","0","1","335759.500000","337562.000000","334034.000000","18802532.000000","352771.000000","352771.000000","352771.000000","19755176.000000","0.000785","0.025512","0.000000","0.000785","0","0","0","0","18.951529","19.282764","18.667067","18.951529","27.724218","27.833921","27.595239","27.724218","20.617260","21.139068","20.145222","20.617260","23.516976","24.084038","23.018615","23.516976","11.795273","12.277937","11.486772","11.795273","27.724218","27.833921","27.595239","27.724218","12.845368","13.604576","12.227762","12.845368","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","383765.179487","398289.000000","206936.000000","59867368.000000","404429.320513","405540.000000","402922.000000","63090974.000000","24.765857","25.116811","12.740607","24.765857","1.437004","1.515221","0.774919","1.437004","0.838042","0.921545","0.397597","0.838042","0","0","0","0","15.742211","16.163517","8.098819","15.742211","0.000482","0.000495","0.000000","0.000482","0.436328","0.456755","0.243677","0.436328","0.123637","0.136489","0.093960","0.123637","0","0","0","0","24.766291","25.117306","12.740854","24.766291","8.000000","16.666667","0.123073","0.134511","0.067750","0.123073","2.892578","2.940254","1.488332","2.892578","5.726405","5.893572","2.957748","5.726405","0.881090","1.038748","0.440868","0.881090","0.904294","1.038748","0.464605","0.904294","15.224080","15.431374","7.845623","15.224080","11.937326","12.028740","6.045679","11.937326","17.288705","17.557085","8.910395","17.288705","0","0","0","0","61.078734","61.273500","30.889946","61.078734","0.000000","0.000000","0.000000","0.000000","61.078734","61.273500","30.889946","61.078734","16.658064","7.995871","17.292617","8.300456","8.972343","4.306725","16.658064","1247.355861","383643.674679","398267.000000","206355.000000","239393653.000000","404429.320513","405540.000000","402922.000000","252363896.000000","2.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.057528","0.057528","0.057528","0.057528","0.000140","0.000279","0","0.000140","0.001536","0.001955","0.001117","0.001536","0.147729","0.148567","0.146892","0.147729","0.043006","0.043844","0.042169","0.043006","0.173840","0.177610","0.170070","0.173840" +"6","62","python3.12","127.0.0.1","void cutlass::device_kernel>, cutlass::CollectiveMma, cute::C<1>, cute::C<1>>, cutlass::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<3>>, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<2>, cute::C<1>>, cute::tuple, cute::C<4>, cute::C<0>>>, cute::tuple, cute::Layout, cute::C<2>, cute::C<2>>, cute::tuple, cute::C<16>, cute::C<8>>>, cute::C<32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::CollectiveEpilogue, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::FusionCallbacks, cutlass::LinearCombination, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)","1","7","(384, 1, 1)","(1, 156, 1)","0","12.0","0","0","625","316.000000","4225.000000","4.975000","30000","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","3077019.428571","70.676251","3080192.000000","70.749122","3072352.000000","70.569045","43078272.000000","70.676251","4353682.285714","12.468161","4354048.000000","12.469208","4353024.000000","12.466276","60951552.000000","174.554252","56.679801","56.723505","56.595594","56.679801","781009.500000","2.236670","782755.000000","2.241669","778315.000000","2.228954","7810095.000000","22.366704","27.062028","32.531974","22.921705","27.062028","0.089457","0.089529","0.089384","0.089457","70.676251","70.749122","70.569045","70.676251","70.676251","70.749122","70.569045","70.676251","349.184000","349.184000","349.184000","349.184000","0","0","0","0","0","0","0","0","0","0","0","0","0.320319","0.336496","0.297315","0.320319","713682.724359","769593.000000","655000.000000","111334505.000000","780991.089744","782755.000000","778315.000000","121834610.000000","9.502038","9.926674","8.824857","9.502038","3.269500","3.415228","3.036398","3.269500","37.000109","38.669455","34.362876","37.000109","0","0","0","0","0","0","0","0","33.919189","35.441505","31.510475","33.919189","33.299503","34.801165","30.950929","33.299503","5.337747","5.576120","4.961260","5.337747","24.754276","25.859578","22.986050","24.754276","0","0","0","0","0","0","0","0","0.081251","0.085916","0.074777","0.081251","40.489638","42.316423","37.603685","40.489638","0.168780","0.176314","0.156724","0.168780","8","384","1","1","384","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","1","156","1","156","","0","0","3.000000","24.000000","1.000000","1.000000","4.000000","300","157","406","2028","2388","22.020096","0","0","0","0","168","168.000000","102.400000","83.968000","83.968000","1.024000","82.944000","0","156","1024","7","59904","78","all","1","156","1","156","0","0","0","0","0","0","1","658788.767857","660389.000000","657403.000000","36892171.000000","678597.000000","678597.000000","678597.000000","38001432.000000","0.099028","0.143826","0.037725","0.099028","0","0","0","0","27.327402","32.547742","23.330195","27.327402","27.287869","27.302361","27.280109","27.287869","39.741343","50.297084","31.767382","39.741343","46.950083","57.387301","38.950216","46.950083","26.945327","32.137042","22.909179","26.945327","46.950083","57.387301","38.950216","46.950083","26.383927","29.679618","23.207589","26.383927","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","713682.724359","769593.000000","655000.000000","111334505.000000","780991.089744","782755.000000","778315.000000","121834610.000000","19.173217","20.062425","17.827668","19.173217","4.311947","4.589297","3.971620","4.311947","0.802129","0.860061","0.743030","0.802129","0","0","0","0","33.299503","34.801165","30.950929","33.299503","0.000000","0.000000","0.000000","0.000000","2.449819","2.557648","2.277907","2.449819","0.051985","0.060436","0.035852","0.051985","0","0","0","0","19.283013","20.177183","17.923700","19.283013","12.000000","25.000000","0.061027","0.062357","0.058900","0.061027","8.518240","8.900358","7.913919","8.518240","12.649670","13.248721","11.740296","12.649670","3.845008","4.115796","3.533459","3.845008","3.919608","4.216053","3.600809","3.919608","7.297815","7.638179","6.800014","7.297815","3.500585","3.664014","3.249381","3.500585","7.445112","7.804410","6.928952","7.445112","0","0","0","0","63.258163","66.082188","58.739723","63.258163","0.506339","0.528943","0.470172","0.506339","63.258163","66.082188","58.739723","63.258163","22.917401","11.000353","24.715654","11.863514","21.033789","10.096219","22.917401","1716.054996","713577.035256","769569.000000","654849.000000","445272070.000000","780991.089744","782755.000000","778315.000000","487338440.000000","3.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.030037","0.030182","0.029891","0.030037","0.000073","0.000145","0","0.000073","0.000798","0.001016","0.000580","0.000798","0.076760","0.076905","0.076615","0.076760","0.022346","0.023652","0.021040","0.022346","0.090327","0.091416","0.089239","0.090327" +"7","62","python3.12","127.0.0.1","void cutlass::device_kernel>, cutlass::CollectiveMma, cute::C<1>, cute::C<1>>, cutlass::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<3>>, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<0>> *, cute::Layout, cute::C<4>>, int>, cute::tuple, cute::C<4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<4>>, int>, cute::tuple, cute::C<1>>, cute::C<512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<2>, cute::C<1>>, cute::tuple, cute::C<4>, cute::C<0>>>, cute::tuple, cute::Layout, cute::C<2>, cute::C<2>>, cute::tuple, cute::C<16>, cute::C<8>>>, cute::C<32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<8>, cute::Layout, cute::C<128>>, cute::tuple, cute::C<1>>>>, cute::Layout, cute::C<4>>, cute::C<1>>, cute::tuple, cute::C<1>>, cute::C<4>, cute::C<1>>>, cute::tuple, cute::C<4>>, cute::C<512>>, cute::tuple, cute::C<1>>, cute::C<1>, cute::C<512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::CollectiveEpilogue, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<0>> *, cutlass::FusionCallbacks, cutlass::LinearCombination, cute::tuple, cute::C<128>, cute::C<128>>, cute::tuple, cute::C<32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<16>, cute::Layout, cute::C<32>>, cute::tuple, cute::C<1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)","1","7","(384, 1, 1)","(1, 156, 1)","0","12.0","0","0","625","316.000000","4225.000000","4.975000","30000","432","2","0","1","1","1","0","1","0","1","0","434","2430000","1","12","0","0","1","1","1","No-CC","1","1","1","0","0","NVIDIA RTX 6000D","1","1","1","448","7","1","1","448","1","1","1","100","1","733548766","11193","32000","16","4","4","32000","16","161","546377950","1","1","0","0","0","1","1","434","0","1","0","117440512","84","24","78","1","1","134217728","1024","1024","64","24","2430000","2147483647","65535","65535","4","1","12481000","73400320","2147483647","65536","65536","255","49152","101376","102400","1024","1536","48","12","2048","32768","32768","65536","32768","2048","32768","131072","16384","16384","16384","2046","32768","32768","2048","32768","268435456","32768","131072","32768","32768","65536","32768","2048","32768","65000","2097120","131072","32768","32768","131072","16384","32768","16384","8192","16384","8192","2046","32768","32768","4","12481000","1","9","0","0","0","0","156","12","4","1","0","0","0","174","0","0","1","0","1024","12","64","1","1","512","0","1","512","32","65536","89171230720","1","1","1","32","1557922.285714","67.214866","1562624.000000","67.417716","1553632.000000","67.029766","21810912.000000","67.214866","2317824.000000","12.466781","2318336.000000","12.469535","2317312.000000","12.464028","32449536.000000","174.534940","55.158469","55.301709","55.038294","55.158469","404021.400000","2.173093","405055.000000","2.178652","402627.000000","2.165593","4040214.000000","21.730927","26.147572","30.006854","21.347038","26.147572","0.171782","0.178051","0.165513","0.171782","67.214866","67.417716","67.029766","67.214866","67.214866","67.417716","67.029766","67.214866","185.920000","185.920000","185.920000","185.920000","0","0","0","0","0","0","0","0","0","0","0","0","0.417971","0.472267","0.398011","0.417971","337880.346154","391076.000000","323760.000000","52709334.000000","404008.846154","405055.000000","402627.000000","63025380.000000","9.211633","10.988613","9.160675","9.211633","3.195104","3.811952","3.178674","3.195104","36.036049","42.959950","35.785355","36.036049","0","0","0","0","0","0","0","0","32.882271","39.181320","32.661414","32.882271","32.554936","38.708063","32.282956","32.554936","5.404686","6.425107","5.372160","5.404686","23.937423","28.577345","23.814083","23.937423","0","0","0","0","0","0","0","0","0.092709","0.111879","0.090592","0.092709","43.088871","51.367889","42.789112","43.088871","0.170420","0.203461","0.169551","0.170420","8","384","1","1","384","0","0","0","0","8","PolicySpread","0","1","0","SIMT","CachePreferNone","1","1","156","1","156","","0","0","3.000000","24.000000","1.000000","1.000000","4.000000","300","157","406","2028","2388","22.020096","0","0","0","0","168","168.000000","102.400000","83.968000","83.968000","1.024000","82.944000","0","156","1024","7","59904","78","all","1","156","1","156","0","0","0","0","0","0","1","316027.642857","321285.000000","313187.000000","17697548.000000","353056.000000","353056.000000","353056.000000","19771136.000000","0.111031","0.158615","0.045319","0.111031","0","0","0","0","26.371848","30.296610","21.654355","26.371848","26.471064","26.506843","26.439432","26.471064","38.249704","46.067338","28.857320","38.249704","45.380612","53.251609","35.950104","45.380612","26.078800","29.979380","21.315882","26.078800","45.380612","53.251609","35.950104","45.380612","26.322352","30.272535","21.957706","26.322352","1","1","1","1","0","0","0","0","0","0","0","0","1","1787273352","0","0","0","0","0","0","0","0","0","8.077216","8.077216","8.077216","72.694940","8.077216","8.077216","8.077216","72.694940","9.000000","0","337880.346154","391076.000000","323760.000000","52709334.000000","404008.846154","405055.000000","402627.000000","63025380.000000","18.980437","22.472156","18.761532","18.980437","4.333023","5.081572","4.204858","4.333023","0.814938","0.950227","0.781666","0.814938","0","0","0","0","32.554936","38.708063","32.282956","32.554936","0.000000","0.000000","0.000000","0.000000","2.438959","2.895667","2.425689","2.438959","0.090592","0.099008","0.051484","0.090592","0","0","0","0","19.073081","22.567513","18.841048","19.073081","12.000000","25.000000","0.093981","0.100493","0.093810","0.093981","8.266448","9.847309","8.210464","8.266448","12.409600","14.741096","12.274979","12.409600","3.684551","4.232828","3.515517","3.684551","3.810255","4.375399","3.604377","3.810255","7.338381","8.626296","7.208258","7.338381","3.444097","4.095610","3.409517","3.444097","7.378415","8.675676","7.228555","7.378415","0","0","0","0","61.142302","72.996421","60.830351","61.142302","0.511261","0.610383","0.508652","0.511261","61.142302","72.996421","60.830351","61.142302","22.919774","11.001492","26.516975","12.728148","21.953993","10.537917","22.919774","1716.232686","337792.562500","391052.000000","323695.000000","210782559.000000","404008.846154","405055.000000","402627.000000","252101520.000000","3.000000","12.000000","12.000000","12.000000","7488.000000","0","0","0","0","0.057679","0.057957","0.057400","0.057679","0.000139","0.000279","0","0.000139","0.001533","0.001950","0.001115","0.001533","0.147401","0.151581","0.143221","0.147401","0.043747","0.044861","0.042632","0.043747","0.180141","0.180838","0.179445","0.180141" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_ab_gpu6.nsys-rep b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_ab_gpu6.nsys-rep new file mode 100644 index 0000000..2947a65 Binary files /dev/null and b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_ab_gpu6.nsys-rep differ diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_decode_iteration_5_cuda_api_sum_nvtx=flashinfer_decode_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_decode_iteration_5_cuda_api_sum_nvtx=flashinfer_decode_iteration_5.csv new file mode 100644 index 0000000..a482481 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_decode_iteration_5_cuda_api_sum_nvtx=flashinfer_decode_iteration_5.csv @@ -0,0 +1,4 @@ +Time (%),Total Time (ns),Num Calls,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +87.0,139383,10,13938.3,11355.5,9370,21685,4468.6,cudaLaunchKernelExC +7.2,11500,12,958.3,916.0,880,1324,122.6,cudaGetDriverEntryPointByVersion +5.8,9349,12,779.1,705.5,565,1516,256.7,cuTensorMapEncodeTiled diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_decode_iteration_5_cuda_gpu_kern_sum_nvtx=flashinfer_decode_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_decode_iteration_5_cuda_gpu_kern_sum_nvtx=flashinfer_decode_iteration_5.csv new file mode 100644 index 0000000..3375c01 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_decode_iteration_5_cuda_gpu_kern_sum_nvtx=flashinfer_decode_iteration_5.csv @@ -0,0 +1,9 @@ +Time (%),Total Time (ns),Instances,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +90.4,191837,2,95918.5,95918.5,63391,128446,46000.8,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +4.2,8992,1,8992.0,8992.0,8992,8992,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +1.3,2720,1,2720.0,2720.0,2720,2720,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +1.2,2528,1,2528.0,2528.0,2528,2528,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +1.0,2144,1,2144.0,2144.0,2144,2144,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +0.8,1792,1,1792.0,1792.0,1792,1792,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +0.5,1055,1,1055.0,1055.0,1055,1055,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" +0.5,1024,1,1024.0,1024.0,1024,1024,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_prefill_iteration_5_cuda_api_sum_nvtx=flashinfer_prefill_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_prefill_iteration_5_cuda_api_sum_nvtx=flashinfer_prefill_iteration_5.csv new file mode 100644 index 0000000..3e41c8c --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_prefill_iteration_5_cuda_api_sum_nvtx=flashinfer_prefill_iteration_5.csv @@ -0,0 +1,4 @@ +Time (%),Total Time (ns),Num Calls,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +85.2,127306,10,12730.6,10292.0,8707,19421,4222.6,cudaLaunchKernelExC +7.8,11727,12,977.3,641.0,518,3906,959.1,cuTensorMapEncodeTiled +7.0,10386,12,865.5,818.5,790,1158,114.1,cudaGetDriverEntryPointByVersion diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_prefill_iteration_5_cuda_gpu_kern_sum_nvtx=flashinfer_prefill_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_prefill_iteration_5_cuda_gpu_kern_sum_nvtx=flashinfer_prefill_iteration_5.csv new file mode 100644 index 0000000..5c9799a --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_flashinfer_prefill_iteration_5_cuda_gpu_kern_sum_nvtx=flashinfer_prefill_iteration_5.csv @@ -0,0 +1,10 @@ +Time (%),Total Time (ns),Instances,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +95.0,865299,3,288433.0,339835.0,185501,339963,89141.7,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +1.4,13120,1,13120.0,13120.0,13120,13120,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +1.4,12736,1,12736.0,12736.0,12736,12736,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +0.8,7200,1,7200.0,7200.0,7200,7200,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +0.6,5248,1,5248.0,5248.0,5248,5248,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +0.3,2304,1,2304.0,2304.0,2304,2304,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +0.2,2144,1,2144.0,2144.0,2144,2144,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +0.1,1344,1,1344.0,1344.0,1344,1344,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +0.1,1087,1,1087.0,1087.0,1087,1087,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_decode_iteration_5_cuda_api_sum_nvtx=marlin_decode_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_decode_iteration_5_cuda_api_sum_nvtx=marlin_decode_iteration_5.csv new file mode 100644 index 0000000..d92a35b --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_decode_iteration_5_cuda_api_sum_nvtx=marlin_decode_iteration_5.csv @@ -0,0 +1,5 @@ +Time (%),Total Time (ns),Num Calls,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +61.2,71109,5,14221.8,14981.0,12385,15556,1523.4,cudaLaunchKernel +24.7,28632,2,14316.0,14316.0,13516,15116,1131.4,cuLaunchKernelEx +11.3,13082,1,13082.0,13082.0,13082,13082,0.0,cudaLaunchKernelExC +2.8,3307,5,661.4,627.0,593,747,67.7,cuKernelGetName diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_decode_iteration_5_cuda_gpu_kern_sum_nvtx=marlin_decode_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_decode_iteration_5_cuda_gpu_kern_sum_nvtx=marlin_decode_iteration_5.csv new file mode 100644 index 0000000..8836176 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_decode_iteration_5_cuda_gpu_kern_sum_nvtx=marlin_decode_iteration_5.csv @@ -0,0 +1,7 @@ +Time (%),Total Time (ns),Instances,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +94.4,109374,2,54687.0,54687.0,38783,70591,22491.7,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +1.6,1888,1,1888.0,1888.0,1888,1888,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +1.2,1344,1,1344.0,1344.0,1344,1344,0.0,_moe_align_small_numel_kernel +1.1,1312,1,1312.0,1312.0,1312,1312,0.0,_situ_and_mul_kernel +1.1,1248,2,624.0,624.0,608,640,22.6,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +0.6,704,1,704.0,704.0,704,704,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_prefill_iteration_5_cuda_api_sum_nvtx=marlin_prefill_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_prefill_iteration_5_cuda_api_sum_nvtx=marlin_prefill_iteration_5.csv new file mode 100644 index 0000000..4ffbfec --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_prefill_iteration_5_cuda_api_sum_nvtx=marlin_prefill_iteration_5.csv @@ -0,0 +1,5 @@ +Time (%),Total Time (ns),Num Calls,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +75.4,96744,7,13820.6,14257.0,10984,15791,1900.7,cudaLaunchKernel +11.6,14830,1,14830.0,14830.0,14830,14830,0.0,cuLaunchKernelEx +9.7,12416,1,12416.0,12416.0,12416,12416,0.0,cudaLaunchKernelExC +3.3,4295,7,613.6,582.0,475,798,114.7,cuKernelGetName diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_prefill_iteration_5_cuda_gpu_kern_sum_nvtx=marlin_prefill_iteration_5.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_prefill_iteration_5_cuda_gpu_kern_sum_nvtx=marlin_prefill_iteration_5.csv new file mode 100644 index 0000000..e1a46b6 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_marlin_prefill_iteration_5_cuda_gpu_kern_sum_nvtx=marlin_prefill_iteration_5.csv @@ -0,0 +1,8 @@ +Time (%),Total Time (ns),Instances,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +94.1,709879,3,236626.3,181534.0,180702,347643,96144.2,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +2.2,16671,1,16671.0,16671.0,16671,16671,0.0,_situ_and_mul_kernel +1.7,13120,2,6560.0,6560.0,4896,8224,2353.3,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +1.1,8448,1,8448.0,8448.0,8448,8448,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +0.5,4064,1,4064.0,4064.0,4064,4064,0.0,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +0.2,1696,1,1696.0,1696.0,1696,1696,0.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +0.1,768,1,768.0,768.0,768,768,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_cuda_api_sum.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_cuda_api_sum.csv new file mode 100644 index 0000000..ba1783c --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_cuda_api_sum.csv @@ -0,0 +1,9 @@ +Time (%),Total Time (ns),Num Calls,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +45.0,1657471,110,15067.9,13500.5,8707,37211,5252.2,cudaLaunchKernelExC +27.8,1024642,60,17077.4,15240.0,10648,99929,11361.2,cudaLaunchKernel +11.0,404869,1,404869.0,404869.0,404869,404869,0.0,cudaDeviceSynchronize +7.7,283828,15,18921.9,16005.0,12865,41329,8082.9,cuLaunchKernelEx +3.3,121690,120,1014.1,915.0,790,4516,414.6,cudaGetDriverEntryPointByVersion +2.9,105105,120,875.9,712.0,518,3906,507.8,cuTensorMapEncodeTiled +1.2,43805,60,730.1,650.0,468,2774,328.4,cuKernelGetName +1.1,40880,1,40880.0,40880.0,40880,40880,0.0,cuProfilerStart diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_cuda_gpu_kern_sum.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_cuda_gpu_kern_sum.csv new file mode 100644 index 0000000..cf1b64b --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_cuda_gpu_kern_sum.csv @@ -0,0 +1,21 @@ +Time (%),Total Time (ns),Instances,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Name +48.6,3587945,20,179397.3,155933.5,63135,345051,105231.0,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +35.7,2635992,10,263599.2,262860.0,180702,348859,86575.8,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +7.7,565685,10,56568.5,59183.0,38303,80415,17466.0,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +1.5,109663,10,10966.3,10752.0,8320,13664,2443.9,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +1.2,89534,10,8953.4,8959.5,1280,16672,8008.5,_situ_and_mul_kernel +1.1,81600,10,8160.0,8048.0,3648,13024,4706.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +1.0,72093,20,3604.7,2879.5,576,8224,3254.5,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +0.7,51583,10,5158.3,5088.0,1856,8703,3384.5,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +0.6,45152,10,4515.2,2736.0,1920,7872,2671.3,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +0.5,40223,10,4022.3,3983.5,2688,5472,1382.3,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +0.3,21632,10,2163.2,2144.0,2112,2368,78.7,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +0.3,20447,5,4089.4,4064.0,4032,4224,79.7,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +0.2,12191,5,2438.2,2304.0,2304,2975,300.1,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +0.2,11968,10,1196.8,1184.0,1024,1376,156.2,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +0.1,9376,5,1875.2,1792.0,1760,2240,204.4,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +0.1,8640,5,1728.0,1728.0,1696,1760,32.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +0.1,7520,10,752.0,752.0,704,832,43.3,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +0.1,7104,5,1420.8,1376.0,1344,1632,118.9,_moe_align_small_numel_kernel +0.1,5631,5,1126.2,1120.0,1087,1184,42.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" +0.1,5278,5,1055.6,1056.0,1055,1056,0.5,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_gpu_proj_sum.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_gpu_proj_sum.csv new file mode 100644 index 0000000..6b76832 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_gpu_proj_sum.csv @@ -0,0 +1,21 @@ +Range,Style,Total Proj Time (ns),Total Range Time (ns),Range Instances,Proj Avg (ns),Proj Med (ns),Proj Min (ns),Proj Max (ns),Proj StdDev (ns),Total GPU Ops,Avg GPU Ops,Avg Range Lvl,Avg Num Child +:marlin_decode_iteration_1,PushPop,1646632,2030238,1,1646632.0,1646632.0,1646632,1646632,0.0,8,8.0,0.0,0.0 +:flashinfer_prefill_iteration_1,PushPop,1499497,1236905,1,1499497.0,1499497.0,1499497,1499497,0.0,10,10.0,0.0,0.0 +:marlin_prefill_iteration_1,PushPop,1400491,1514107,1,1400491.0,1400491.0,1400491,1400491,0.0,9,9.0,0.0,0.0 +:marlin_decode_iteration_2,PushPop,1317581,1499161,1,1317581.0,1317581.0,1317581,1317581,0.0,8,8.0,0.0,0.0 +:flashinfer_decode_iteration_1,PushPop,1304108,1433573,1,1304108.0,1304108.0,1304108,1304108,0.0,10,10.0,0.0,0.0 +:marlin_prefill_iteration_2,PushPop,1252429,1302983,1,1252429.0,1252429.0,1252429,1252429,0.0,9,9.0,0.0,0.0 +:marlin_prefill_iteration_3,PushPop,1181582,1220545,1,1181582.0,1181582.0,1181582,1181582,0.0,9,9.0,0.0,0.0 +:marlin_decode_iteration_3,PushPop,1171887,1334668,1,1171887.0,1171887.0,1171887,1171887,0.0,8,8.0,0.0,0.0 +:marlin_prefill_iteration_4,PushPop,1161231,1184045,1,1161231.0,1161231.0,1161231,1161231,0.0,9,9.0,0.0,0.0 +:marlin_prefill_iteration_5,PushPop,1156238,1170223,1,1156238.0,1156238.0,1156238,1156238,0.0,9,9.0,0.0,0.0 +:marlin_decode_iteration_5,PushPop,1147087,1295194,1,1147087.0,1147087.0,1147087,1147087,0.0,8,8.0,0.0,0.0 +:flashinfer_prefill_iteration_2,PushPop,1132207,1082480,1,1132207.0,1132207.0,1132207,1132207,0.0,10,10.0,0.0,0.0 +:marlin_decode_iteration_4,PushPop,1126735,1274663,1,1126735.0,1126735.0,1126735,1126735,0.0,8,8.0,0.0,0.0 +:flashinfer_decode_iteration_2,PushPop,1081231,1167266,1,1081231.0,1081231.0,1081231,1081231,0.0,10,10.0,0.0,0.0 +:flashinfer_prefill_iteration_3,PushPop,1067216,1023953,1,1067216.0,1067216.0,1067216,1067216,0.0,10,10.0,0.0,0.0 +:flashinfer_prefill_iteration_4,PushPop,1003985,967242,1,1003985.0,1003985.0,1003985,1003985,0.0,10,10.0,0.0,0.0 +:flashinfer_decode_iteration_3,PushPop,991185,1054475,1,991185.0,991185.0,991185,991185,0.0,10,10.0,0.0,0.0 +:flashinfer_prefill_iteration_5,PushPop,955122,904533,1,955122.0,955122.0,955122,955122,0.0,10,10.0,0.0,0.0 +:flashinfer_decode_iteration_4,PushPop,924402,977971,1,924402.0,924402.0,924402,924402,0.0,10,10.0,0.0,0.0 +:flashinfer_decode_iteration_5,PushPop,900691,947759,1,900691.0,900691.0,900691,900691,0.0,10,10.0,0.0,0.0 diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_kern_sum.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_kern_sum.csv new file mode 100644 index 0000000..0ca89e0 --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_kern_sum.csv @@ -0,0 +1,156 @@ +NVTX Range,Style,PID,TID,NVTX Inst,Kern Inst,Total Time (ns),Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Kernel Name +:flashinfer_decode_iteration_1,PushPop,71,71,1,2,194717,97358.5,97358.5,65631,129086,44869.5,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,8320,8320.0,8320.0,8320,8320,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,3712,3712.0,3712.0,3712,3712,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,2752,2752.0,2752.0,2752,2752,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,2368,2368.0,2368.0,2368,2368,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,2240,2240.0,2240.0,2240,2240,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,1920,1920.0,1920.0,1920,1920,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_decode_iteration_1,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,2,191325,95662.5,95662.5,63135,128190,46000.8,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,8639,8639.0,8639.0,8639,8639,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,3648,3648.0,3648.0,3648,3648,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,2688,2688.0,2688.0,2688,2688,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,2496,2496.0,2496.0,2496,2496,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,2112,2112.0,2112.0,2112,2112,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,1792,1792.0,1792.0,1792,1792,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_decode_iteration_2,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,2,192061,96030.5,96030.5,63391,128670,46159.2,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,8640,8640.0,8640.0,8640,8640,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,3648,3648.0,3648.0,3648,3648,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,2720,2720.0,2720.0,2720,2720,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,2464,2464.0,2464.0,2464,2464,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,2112,2112.0,2112.0,2112,2112,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,1792,1792.0,1792.0,1792,1792,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_decode_iteration_3,PushPop,71,71,1,1,1055,1055.0,1055.0,1055,1055,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,2,191485,95742.5,95742.5,63391,128094,45751.9,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,8992,8992.0,8992.0,8992,8992,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,3680,3680.0,3680.0,3680,3680,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,2688,2688.0,2688.0,2688,2688,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,2400,2400.0,2400.0,2400,2400,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,2112,2112.0,2112.0,2112,2112,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,1760,1760.0,1760.0,1760,1760,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_decode_iteration_4,PushPop,71,71,1,1,1056,1056.0,1056.0,1056,1056,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,2,191645,95822.5,95822.5,63199,128446,46136.6,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,8768,8768.0,8768.0,8768,8768,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,3808,3808.0,3808.0,3808,3808,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,2720,2720.0,2720.0,2720,2720,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,2528,2528.0,2528.0,2528,2528,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,2144,2144.0,2144.0,2144,2144,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,1792,1792.0,1792.0,1792,1792,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)32>(const int *, int *, int *, long, long, int)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,1055,1055.0,1055.0,1055,1055,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)32>(const int *, int *, long *, long, long)" +:flashinfer_decode_iteration_5,PushPop,71,71,1,1,1024,1024.0,1024.0,1024,1024,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,2,529720,264860.0,264860.0,184669,345051,113407.2,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,13568,13568.0,13568.0,13568,13568,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,12288,12288.0,12288.0,12288,12288,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,5472,5472.0,5472.0,5472,5472,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,2975,2975.0,2975.0,2975,2975,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,2944,2944.0,2944.0,2944,2944,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,2208,2208.0,2208.0,2208,2208,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,1376,1376.0,1376.0,1376,1376,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_prefill_iteration_1,PushPop,71,71,1,1,1184,1184.0,1184.0,1184,1184,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,2,523096,261548.0,261548.0,183837,339259,109900.0,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,13664,13664.0,13664.0,13664,13664,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,13024,13024.0,13024.0,13024,13024,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,7616,7616.0,7616.0,7616,7616,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,5472,5472.0,5472.0,5472,5472,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,2304,2304.0,2304.0,2304,2304,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,2176,2176.0,2176.0,2176,2176,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,1344,1344.0,1344.0,1344,1344,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_prefill_iteration_2,PushPop,71,71,1,1,1152,1152.0,1152.0,1152,1152,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,2,523160,261580.0,261580.0,182781,340379,111438.6,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,13440,13440.0,13440.0,13440,13440,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,12448,12448.0,12448.0,12448,12448,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,7872,7872.0,7872.0,7872,7872,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,5248,5248.0,5248.0,5248,5248,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,2304,2304.0,2304.0,2304,2304,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,2144,2144.0,2144.0,2144,2144,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,1312,1312.0,1312.0,1312,1312,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_prefill_iteration_3,PushPop,71,71,1,1,1120,1120.0,1120.0,1120,1120,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,2,525336,262668.0,262668.0,185501,339835,109130.6,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,13120,13120.0,13120.0,13120,13120,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,12736,12736.0,12736.0,12736,12736,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,7712,7712.0,7712.0,7712,7712,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,5215,5215.0,5215.0,5215,5215,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,2304,2304.0,2304.0,2304,2304,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,2112,2112.0,2112.0,2112,2112,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,1344,1344.0,1344.0,1344,1344,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_prefill_iteration_4,PushPop,71,71,1,1,1088,1088.0,1088.0,1088,1088,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,2,525400,262700.0,262700.0,185437,339963,109266.4,"void cutlass::device_kernel>, cutlass::gemm::collective::CollectiveMma, cute::C<(int)1>, cute::C<(int)1>>, cutlass::gemm::KernelPtrArrayTmaWarpSpecializedCooperativeBlockScaledSm120<(int)3>>, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::tuple, cute::tuple, cute::C<(int)0>> *, cute::Layout, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, int>>, cute::tuple, cute::C<(int)4>>, int>, cute::tuple, cute::C<(int)1>>, cute::C<(int)512>>, cute::tuple, int>>> *>, cute::TiledMMA>, cute::Layout, cute::C<(int)2>, cute::C<(int)1>>, cute::tuple, cute::C<(int)4>, cute::C<(int)0>>>, cute::tuple, cute::Layout, cute::C<(int)2>, cute::C<(int)2>>, cute::tuple, cute::C<(int)16>, cute::C<(int)8>>>, cute::C<(int)32>>>, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity, cute::tuple, cute::tuple, cute::smem_ptr_flag_bits<(int)8>, cute::Layout, cute::C<(int)128>>, cute::tuple, cute::C<(int)1>>>>, cute::Layout, cute::C<(int)4>>, cute::C<(int)1>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)4>, cute::C<(int)1>>>, cute::tuple, cute::C<(int)4>>, cute::C<(int)512>>, cute::tuple, cute::C<(int)1>>, cute::C<(int)1>, cute::C<(int)512>>>>>, cute::tuple, cute::Copy_Atom, cutlass::float_ue8m0_t>>, cute::identity>, cutlass::epilogue::collective::CollectiveEpilogue, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::bfloat16_t, cute::tuple, cute::C<(int)0>> *, cutlass::epilogue::fusion::FusionCallbacks, cutlass::epilogue::fusion::LinearCombination, cute::tuple, cute::C<(int)128>, cute::C<(int)128>>, cute::tuple, cute::C<(int)32>>, >, cute::SM90_TMA_LOAD, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM75_U32x2_LDSM_N, cute::SM90_TMA_STORE, cute::ComposedLayout, cute::smem_ptr_flag_bits<(int)16>, cute::Layout, cute::C<(int)32>>, cute::tuple, cute::C<(int)1>>>>, cute::SM90_U32x2_STSM_N, cute::Copy_Atom, void>, void, void>>(T1::Params)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,12608,12608.0,12608.0,12608,12608,0.0,"void tensorrt_llm::kernels::cutlass_kernels::doActivationKernel<__nv_fp8_e4m3, __nv_bfloat16, __nv_bfloat16, tensorrt_llm::kernels::cutlass_kernels::SituAdaptor, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, std::integral_constant>(T1 *, const T2 *, const float *, const T3 *, bool, const long *, const int *, int, long, const float *, bool, unsigned char *, float *, const float *, tensorrt_llm::kernels::cutlass_kernels::ActivationParams)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,12512,12512.0,12512.0,12512,12512,0.0,"void tensorrt_llm::kernels::cutlass_kernels::finalizeMoeRoutingKernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (tensorrt_llm::kernels::cutlass_kernels::ScaleMode)1>(const T2 *, T1 *, const T3 *, const float *, const int *, const int *, long, long, long, int, int)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,7200,7200.0,7200.0,7200,7200,0.0,"void tensorrt_llm::kernels::quantize_with_block_size<(tensorrt_llm::BlockScaleQuantizationType)2, __nv_bfloat16, (int)32, (bool)1, (bool)0, (bool)0, (bool)0, std::integral_constant>(int, int, int, int, const T2 *, const float *, void *, unsigned int *, flashinfer::QuantizationSFLayout)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,5248,5248.0,5248.0,5248,5248,0.0,"void tensorrt_llm::kernels::cutlass_kernels::expandInputRowsKernel<__nv_fp8_e4m3, __nv_fp8_e4m3, (tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput::FpXBlockScalingType)0, (bool)0, (bool)0, std::integral_constant>(const T1 *, T2 *, const float *, float *, const int *, const int *, long, long, long, const float *, bool, const long *, unsigned char *, const unsigned char *, bool, long, const T1 *, float *, const float *, const float **)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,2304,2304.0,2304.0,2304,2304,0.0,"void tensorrt_llm::kernels::cutlass_kernels::blockExpertPrefixSumKernel<(int)64>(const int *, int *, int *, long, long, int)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,2144,2144.0,2144.0,2144,2144,0.0,"void tensorrt_llm::kernels::cutlass_kernels::computeStridesTmaWarpSpecializedKernel<__nv_fp8_e4m3, __nv_fp4_e2m1, __nv_bfloat16, __nv_bfloat16>(const long *, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, tensorrt_llm::kernels::cutlass_kernels::TmaWarpSpecializedGroupedGemmInput, long, long, long, long, long, long, long, const T1 *, const T1 *, const T2 *, const T2 *, const float *, const float *, const unsigned char *, const unsigned char *, tensorrt_llm::kernels::cutlass_kernels::QuantParams, const T4 *, const T4 *, T3 *, T3 *, const float *, const int *)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,1344,1344.0,1344.0,1344,1344,0.0,"tensorrt_llm::kernels::cutlass_kernels::mergeExpertPrefixSumKernel(const int *, const int *, const int *, int *, int *, int *, int)" +:flashinfer_prefill_iteration_5,PushPop,71,71,1,1,1087,1087.0,1087.0,1087,1087,0.0,"void tensorrt_llm::kernels::cutlass_kernels::globalExpertPrefixSumKernel<(int)64>(const int *, int *, long *, long, long)" +:marlin_decode_iteration_1,PushPop,71,71,1,2,128702,64351.0,64351.0,48287,80415,22717.9,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_decode_iteration_1,PushPop,71,71,1,1,2144,2144.0,2144.0,2144,2144,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_decode_iteration_1,PushPop,71,71,1,1,1632,1632.0,1632.0,1632,1632,0.0,_moe_align_small_numel_kernel +:marlin_decode_iteration_1,PushPop,71,71,1,2,1567,783.5,783.5,704,863,112.4,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_1,PushPop,71,71,1,1,1312,1312.0,1312.0,1312,1312,0.0,_situ_and_mul_kernel +:marlin_decode_iteration_1,PushPop,71,71,1,1,800,800.0,800.0,800,800,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_2,PushPop,71,71,1,2,110174,55087.0,55087.0,38623,71551,23283.6,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_decode_iteration_2,PushPop,71,71,1,1,1952,1952.0,1952.0,1952,1952,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_decode_iteration_2,PushPop,71,71,1,1,1536,1536.0,1536.0,1536,1536,0.0,_situ_and_mul_kernel +:marlin_decode_iteration_2,PushPop,71,71,1,1,1376,1376.0,1376.0,1376,1376,0.0,_moe_align_small_numel_kernel +:marlin_decode_iteration_2,PushPop,71,71,1,2,1152,576.0,576.0,576,576,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_2,PushPop,71,71,1,1,704,704.0,704.0,704,704,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_3,PushPop,71,71,1,2,108382,54191.0,54191.0,38303,70079,22469.0,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_decode_iteration_3,PushPop,71,71,1,1,1920,1920.0,1920.0,1920,1920,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_decode_iteration_3,PushPop,71,71,1,1,1376,1376.0,1376.0,1376,1376,0.0,_moe_align_small_numel_kernel +:marlin_decode_iteration_3,PushPop,71,71,1,1,1344,1344.0,1344.0,1344,1344,0.0,_situ_and_mul_kernel +:marlin_decode_iteration_3,PushPop,71,71,1,2,1248,624.0,624.0,576,672,67.9,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_3,PushPop,71,71,1,1,704,704.0,704.0,704,704,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_4,PushPop,71,71,1,2,109053,54526.5,54526.5,38335,70718,22898.2,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_decode_iteration_4,PushPop,71,71,1,1,1856,1856.0,1856.0,1856,1856,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_decode_iteration_4,PushPop,71,71,1,1,1376,1376.0,1376.0,1376,1376,0.0,_moe_align_small_numel_kernel +:marlin_decode_iteration_4,PushPop,71,71,1,1,1280,1280.0,1280.0,1280,1280,0.0,_situ_and_mul_kernel +:marlin_decode_iteration_4,PushPop,71,71,1,2,1248,624.0,624.0,608,640,22.6,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_4,PushPop,71,71,1,1,736,736.0,736.0,736,736,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_5,PushPop,71,71,1,2,109374,54687.0,54687.0,38783,70591,22491.7,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)128, (int)1, (int)8, (int)4, (bool)1, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_decode_iteration_5,PushPop,71,71,1,1,1888,1888.0,1888.0,1888,1888,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_decode_iteration_5,PushPop,71,71,1,1,1344,1344.0,1344.0,1344,1344,0.0,_moe_align_small_numel_kernel +:marlin_decode_iteration_5,PushPop,71,71,1,1,1312,1312.0,1312.0,1312,1312,0.0,_situ_and_mul_kernel +:marlin_decode_iteration_5,PushPop,71,71,1,2,1248,624.0,624.0,608,640,22.6,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_decode_iteration_5,PushPop,71,71,1,1,704,704.0,704.0,704,704,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_1,PushPop,71,71,1,2,525559,262779.5,262779.5,182012,343547,114222.5,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_prefill_iteration_1,PushPop,71,71,1,1,16383,16383.0,16383.0,16383,16383,0.0,_situ_and_mul_kernel +:marlin_prefill_iteration_1,PushPop,71,71,1,2,13152,6576.0,6576.0,4992,8160,2240.1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_1,PushPop,71,71,1,1,8352,8352.0,8352.0,8352,8352,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_prefill_iteration_1,PushPop,71,71,1,1,4224,4224.0,4224.0,4224,4224,0.0,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +:marlin_prefill_iteration_1,PushPop,71,71,1,1,1760,1760.0,1760.0,1760,1760,0.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +:marlin_prefill_iteration_1,PushPop,71,71,1,1,832,832.0,832.0,832,832,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_2,PushPop,71,71,1,2,525720,262860.0,262860.0,182269,343451,113972.9,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_prefill_iteration_2,PushPop,71,71,1,1,16384,16384.0,16384.0,16384,16384,0.0,_situ_and_mul_kernel +:marlin_prefill_iteration_2,PushPop,71,71,1,2,13151,6575.5,6575.5,4959,8192,2286.1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_2,PushPop,71,71,1,1,8032,8032.0,8032.0,8032,8032,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_prefill_iteration_2,PushPop,71,71,1,1,4032,4032.0,4032.0,4032,4032,0.0,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +:marlin_prefill_iteration_2,PushPop,71,71,1,1,1760,1760.0,1760.0,1760,1760,0.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +:marlin_prefill_iteration_2,PushPop,71,71,1,1,768,768.0,768.0,768,768,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_3,PushPop,71,71,1,2,529751,264875.5,264875.5,180892,348859,118770.6,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_prefill_iteration_3,PushPop,71,71,1,1,16672,16672.0,16672.0,16672,16672,0.0,_situ_and_mul_kernel +:marlin_prefill_iteration_3,PushPop,71,71,1,2,13056,6528.0,6528.0,4960,8096,2217.5,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_3,PushPop,71,71,1,1,8288,8288.0,8288.0,8288,8288,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_prefill_iteration_3,PushPop,71,71,1,1,4032,4032.0,4032.0,4032,4032,0.0,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +:marlin_prefill_iteration_3,PushPop,71,71,1,1,1728,1728.0,1728.0,1728,1728,0.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +:marlin_prefill_iteration_3,PushPop,71,71,1,1,768,768.0,768.0,768,768,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_4,PushPop,71,71,1,2,525785,262892.5,262892.5,180702,345083,116234.9,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_prefill_iteration_4,PushPop,71,71,1,1,16640,16640.0,16640.0,16640,16640,0.0,_situ_and_mul_kernel +:marlin_prefill_iteration_4,PushPop,71,71,1,2,13151,6575.5,6575.5,4927,8224,2331.3,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_4,PushPop,71,71,1,1,8448,8448.0,8448.0,8448,8448,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_prefill_iteration_4,PushPop,71,71,1,1,4095,4095.0,4095.0,4095,4095,0.0,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +:marlin_prefill_iteration_4,PushPop,71,71,1,1,1696,1696.0,1696.0,1696,1696,0.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +:marlin_prefill_iteration_4,PushPop,71,71,1,1,736,736.0,736.0,736,736,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_5,PushPop,71,71,1,2,529177,264588.5,264588.5,181534,347643,117456.8,"void sglang::device::marlin_moe::Marlin<__nv_bfloat16, (long)562949953487106, (long)2814749767106568, (int)256, (int)4, (int)16, (int)4, (bool)0, (int)4, (int)2, (bool)0, (bool)1, (bool)0>(const int4 *, const int4 *, int4 *, int4 *, const int4 *, const int4 *, const unsigned short *, const int4 *, const int *, const int *, const int *, const int *, const float *, int, bool, bool, int, int, int, int, int *, bool, bool, bool, int)" +:marlin_prefill_iteration_5,PushPop,71,71,1,1,16671,16671.0,16671.0,16671,16671,0.0,_situ_and_mul_kernel +:marlin_prefill_iteration_5,PushPop,71,71,1,2,13120,6560.0,6560.0,4896,8224,2353.3,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" +:marlin_prefill_iteration_5,PushPop,71,71,1,1,8703,8703.0,8703.0,8703,8703,0.0,"void sglang::topk_sum_kernel<(int)256, (bool)1>(sglang::TopkSumParams)" +:marlin_prefill_iteration_5,PushPop,71,71,1,1,4064,4064.0,4064.0,4064,4064,0.0,"void moe_align_block_size_kernel(const T1 *, int *, int *, int *, int, int, unsigned long, int *, bool, bool, int, int)" +:marlin_prefill_iteration_5,PushPop,71,71,1,1,1696,1696.0,1696.0,1696,1696,0.0,"void count_and_sort_expert_tokens_kernel(const T1 *, int *, int *, unsigned long, bool)" +:marlin_prefill_iteration_5,PushPop,71,71,1,1,768,768.0,768.0,768,768,0.0,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" diff --git a/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_sum.csv b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_sum.csv new file mode 100644 index 0000000..9e6509f --- /dev/null +++ b/experiments/pro6000/kimi3_pro6000_sglang_sm120_flashinfer_mxfp4/results/phase4_nsys_stats_nvtx_sum.csv @@ -0,0 +1,21 @@ +Time (%),Total Time (ns),Instances,Avg (ns),Med (ns),Min (ns),Max (ns),StdDev (ns),Style,Range +8.2,2030238,1,2030238.0,2030238.0,2030238,2030238,0.0,PushPop,:marlin_decode_iteration_1 +6.1,1514107,1,1514107.0,1514107.0,1514107,1514107,0.0,PushPop,:marlin_prefill_iteration_1 +6.1,1499161,1,1499161.0,1499161.0,1499161,1499161,0.0,PushPop,:marlin_decode_iteration_2 +5.8,1433573,1,1433573.0,1433573.0,1433573,1433573,0.0,PushPop,:flashinfer_decode_iteration_1 +5.4,1334668,1,1334668.0,1334668.0,1334668,1334668,0.0,PushPop,:marlin_decode_iteration_3 +5.3,1302983,1,1302983.0,1302983.0,1302983,1302983,0.0,PushPop,:marlin_prefill_iteration_2 +5.3,1295194,1,1295194.0,1295194.0,1295194,1295194,0.0,PushPop,:marlin_decode_iteration_5 +5.2,1274663,1,1274663.0,1274663.0,1274663,1274663,0.0,PushPop,:marlin_decode_iteration_4 +5.0,1236905,1,1236905.0,1236905.0,1236905,1236905,0.0,PushPop,:flashinfer_prefill_iteration_1 +5.0,1220545,1,1220545.0,1220545.0,1220545,1220545,0.0,PushPop,:marlin_prefill_iteration_3 +4.8,1184045,1,1184045.0,1184045.0,1184045,1184045,0.0,PushPop,:marlin_prefill_iteration_4 +4.8,1170223,1,1170223.0,1170223.0,1170223,1170223,0.0,PushPop,:marlin_prefill_iteration_5 +4.7,1167266,1,1167266.0,1167266.0,1167266,1167266,0.0,PushPop,:flashinfer_decode_iteration_2 +4.4,1082480,1,1082480.0,1082480.0,1082480,1082480,0.0,PushPop,:flashinfer_prefill_iteration_2 +4.3,1054475,1,1054475.0,1054475.0,1054475,1054475,0.0,PushPop,:flashinfer_decode_iteration_3 +4.2,1023953,1,1023953.0,1023953.0,1023953,1023953,0.0,PushPop,:flashinfer_prefill_iteration_3 +4.0,977971,1,977971.0,977971.0,977971,977971,0.0,PushPop,:flashinfer_decode_iteration_4 +3.9,967242,1,967242.0,967242.0,967242,967242,0.0,PushPop,:flashinfer_prefill_iteration_4 +3.8,947759,1,947759.0,947759.0,947759,947759,0.0,PushPop,:flashinfer_decode_iteration_5 +3.7,904533,1,904533.0,904533.0,904533,904533,0.0,PushPop,:flashinfer_prefill_iteration_5