Skip to main content

Metrics Reference

Zymtrace collects metrics across four layers — the host, GPUs (including MIG partitions), AWS Neuron accelerators, and inference servers (vLLM, NVIDIA Dynamo-Triton, and SGLang). This page lists every metric by category: its key, type, the aggregation applied, the dimensions it can be grouped by, and the chart it drives.

To enable collection, see GPU Metrics & Profiles and Inference Server Metrics. The scrape frequency is controlled by -collect-metrics-interval — see Profiler ENV & CLI Args.

Conventions

  • Metric key — the metric identifier queried by the dashboard.
  • Temporal — aggregation over time: avg, max, rate, increase.
  • Spatial — aggregation across series/hosts: avg, sum, max.
  • Group-by — the dimensions a chart breaks down by. by process / script / container means the metric is charted per main executable, per script (Python), and per container.
  • Latency histograms report the p50, p95, and p99 percentiles.

Dashboards

DashboardRoute
Host/dashboards/host
GPU (incl. MIG)/dashboards/gpu
Neuron/dashboards/neuron
vLLM/dashboards/vllm
Triton/dashboards/triton
SGLang/dashboards/sglang

Host

The memory-source toggle selects working-set (WSS) vs resident-set (RSS) memory.

Metric keyTypeTemporalSpatialGroup-byChartDescription
process.utimegaugeavgsumCPU UtilizationUser-mode CPU.
process.stimegaugeavgsumCPU UtilizationSystem/kernel-mode CPU.
process.utimegaugeavgsumprocess / script / containerCPU Consumer (User)User-mode CPU by consumer.
process.stimegaugeavgsumprocess / script / containerCPU Consumer (System)System-mode CPU by consumer.
process.wssgaugeavgsumpod / container / deployment / namespaceMemory Consumer (cgroup)Working-set memory by cgroup entity.
process.rssgaugeavgsumprocess / script / containerMemory Consumer (non-cgroup)Resident-set memory by consumer.
process.wssgaugemaxsumMemory Utilization (cgroup)Total WSS across containers.
process.rssgaugemaxsumMemory Utilization (non-cgroup)Total RSS across processes.
io.read_throughputgaugeavgsumprocess / script / containerDisk Bytes ReadBytes/s read per consumer.
io.write_throughputgaugeavgsumprocess / script / containerDisk Bytes WrittenBytes/s written per consumer.
io.network.read_throughputgaugeavgsumprocess / script / containerNetwork Bytes ReceivedBytes/s received per consumer.
io.network.write_throughputgaugeavgsumprocess / script / containerNetwork Bytes SentBytes/s sent per consumer.
io.read_latencyhistogramincreasemaxDisk LatencyRead op latency (p50/p95/p99).
io.write_latencyhistogramincreasemaxDisk LatencyWrite op latency (p50/p95/p99).
io.discard_latencyhistogramincreasemaxDisk LatencyDiscard/TRIM op latency (p50/p95/p99).
io.flush_latencyhistogramincreasemaxDisk LatencyFlush op latency (p50/p95/p99).

GPU

Metric keyTypeTemporalSpatialGroup-byChartDescription
hw.gpu.utilizationgaugeavgavgGPU Utilization% time GPU actively processing.
hw.gpu.process.utilizationgaugeavgavgprocess / script / containerGPU ConsumerGPU utilization by process.
hw.gpu.memory.utilizationgaugemaxsumGPU Memory Utilization% VRAM in use.
hw.gpu.process.memory.utilizationgaugemaxsumprocess / script / containerGPU Memory ConsumerGPU memory by process.
hw.gpu.powergaugeavgsumGPU Power UsageCurrent power draw (W).
hw.gpu.tempgaugeavgmaxGPU TemperatureCurrent GPU temp (°C).
hw.gpu.clock.smgaugeavgavgClock FrequenciesSM clock (MHz).
hw.gpu.clock.memgaugeavgavgClock FrequenciesMemory clock (MHz).
hw.gpu.clocks_throttlegaugeavgmaxgpu.throttle_reasonClocks Throttle ReasonsFraction of time each throttle reason active.
hw.gpu.sm.efficiencygaugeavgavgSM EfficiencySM efficiency (%).
hw.gpu.sm.occupancygaugeavgavgSM OccupancySM occupancy (%).
hw.gpu.tensor_utilgaugeavgavgTensor Core UtilizationTensor Core utilization (%).
hw.gpu.pcie.rxgaugeavgsumPCIe Transmission ThroughputPCIe received.
hw.gpu.pcie.txgaugeavgsumPCIe Transmission ThroughputPCIe transmitted.
hw.gpu.nvlink.rxgaugeavgsumNVLink Transmission ThroughputNVLink received.
hw.gpu.nvlink.txgaugeavgsumNVLink Transmission ThroughputNVLink transmitted.
hw.gpu.tensor_util.dfmagaugeavgavgTensor Core BreakdownDFMA (FP64).
hw.gpu.tensor_util.hmmagaugeavgavgTensor Core BreakdownHMMA (FP16).
hw.gpu.tensor_util.dmmagaugeavgavgTensor Core BreakdownDMMA (INT8 sparse).
hw.gpu.tensor_util.immagaugeavgavgTensor Core BreakdownIMMA (integer).
hw.gpu.fp64_utilgaugeavgavgFP & Integer UtilizationFP64.
hw.gpu.fp32_utilgaugeavgavgFP & Integer UtilizationFP32.
hw.gpu.fp16_utilgaugeavgavgFP & Integer UtilizationFP16.
hw.gpu.integer_utilgaugeavgavgFP & Integer UtilizationInteger.
hw.gpu.dram_bw_utilgaugeavgavgDRAM Bandwidth Utilization% DRAM bandwidth vs max.
hw.gpu.hostmem_cache_hitgaugeavgavgL2 Cache Hit RatesHost memory (PCIe); Grace-coupled only.
hw.gpu.peermem_cache_hitgaugeavgavgL2 Cache Hit RatesPeer GPU memory (NVLink).
hw.gpu.dram_cache_hitgaugeavgavgL2 Cache Hit RatesCPU DRAM (C2C).
hw.gpu.hostmem_cache_missgaugeavgavgL2 Cache Miss RatesHost memory (PCIe); Grace-coupled only.
hw.gpu.peermem_cache_missgaugeavgavgL2 Cache Miss RatesPeer GPU memory (NVLink).
hw.gpu.dram_cache_missgaugeavgavgL2 Cache Miss RatesCPU DRAM (C2C).
hw.gpu.c2c.data_rxgaugeavgsumC2C BandwidthChip-to-chip received; Grace/NVL only.
hw.gpu.c2c.data_txgaugeavgsumC2C BandwidthChip-to-chip transmitted.

GPU — MIG partitions

Scoped to MIG devices.

Metric keyTypeTemporalSpatialGroup-byChart / usageDescription
hw.gpu.memory.utilizationgaugemaxsumCombined MIG — GPU Memory UtilizationVRAM % for selected/all MIG devices.
hw.gpu.utilizationgaugeavgavgCombined MIG — GPU UtilizationActive-processing % for MIG devices.
hw.gpu.tensor_utilgaugeavgavgCombined MIG — Tensor Core UtilizationTensor Core % for MIG devices.
hw.gpu.utilizationgaugeavgavggpu.uuid, gpu.name, host.nameMIG devices table"Utilization" column + device discovery.
hw.gpu.memory.utilizationgaugemaxsumgpu.uuid, gpu.name, host.nameMIG devices table"Memory" column per MIG device.
hw.gpu.tensor_utilgaugeavgavggpu.uuid, gpu.name, host.nameMIG devices table"Tensor Util" column per MIG device.

Neuron

Metric keyTypeTemporalSpatialGroup-byChartDescription
hw.process.neuron.memory.utilizationgaugeavgsumprocess / script / containerNeuron Runtime Memory Usage by processRuntime memory by process.
hw.process.neuron.inference_countgaugeavgsumprocess / script / containerNeuron Inferences by processSuccessful inferences by process.
hw.process.neuron.model_load_countgaugeavgsumprocess / script / containerNeuron Model Loads by processModel loads by process.
hw.process.neuron.flop_countgaugeavgsumprocess / script / containerNeuron Device FLOP/s by processDevice FLOP/s by process.
hw.process.neuron.memory.utilizationgaugemaxsumNeuron Device Memory UsageTotal device memory usage.
hw.neuron.power.utilizationgaugemaxavgNeuron Device Peak Power UtilizationPeak device power.
hw.neuron.core.inference_countgaugeavgsumNeuron InferencesTotal successful inferences.
hw.neuron.core.model_load_countgaugeavgsumNeuron Model LoadsTotal model loads.
hw.process.neuron.flop_countgaugeavgsumNeuron Device FLOP/sTotal device FLOP/s.

vLLM

Optionally scoped to a selected model.

Metric keyTypeTemporalSpatialGroup-byChartDescription
vllm:generation_tokens_totalgaugerate / avgsumprocess / script / containerGenerated TokensOutput tokens produced.
vllm:prompt_tokens_totalgaugerate / avgsumprocess / script / containerPrompt TokensInput tokens processed.
vllm:time_per_output_token_secondshistogramincreasemaxprocess / script / containerTime per output TokenPer-output-token latency (p50/p95/p99).
vllm:time_to_first_token_secondshistogramincreasemaxprocess / script / containerTime to first tokenTTFT latency (p50/p95/p99).
vllm:e2e_request_latency_secondshistogramincreasemaxprocess / script / containerEnd to end request latencyE2E latency (p50/p95/p99).
vllm:num_requests_runninggaugeavgsumprocess / script / containerRunning RequestsIn-flight requests.
vllm:kv_cache_usage_percgaugeavgavgprocess / script / containerKV Cache UsageKV-cache memory utilization %.

Triton

Optionally scoped to a selected model.

Metric keyTypeTemporalSpatialGroup-byChartDescription
nv_inference_countgaugeavgsumprocess / script / containerInferencesInferences performed (excl. cached).
nv_inference_request_successgaugeavgsumprocess / script / containerSuccessful InferencesSuccessful requests, all batch sizes.
nv_inference_request_failuregaugeavgsumprocess / script / containerFailed InferencesFailed requests, all batch sizes.
nv_inference_exec_countgaugeavgsumprocess / script / containerModel ExecutionsModel executions (excl. cached).
nv_inference_request_duration_usgaugeavgsumprocess / script / containerRequest DurationCumulative request duration (incl. cached).
nv_inference_queue_duration_usgaugeavgsumprocess / script / containerQueue DurationCumulative queuing duration (incl. cached).
nv_inference_compute_input_duration_usgaugeavgsumprocess / script / containerCompute Input DurationCumulative compute-input duration (excl. cached).
nv_inference_compute_infer_duration_usgaugeavgsumprocess / script / containerCompute Inference DurationCumulative compute-infer duration (excl. cached).
nv_inference_compute_output_duration_usgaugeavgsumprocess / script / containerCompute Output DurationCumulative compute-output duration (excl. cached).
nv_inference_pending_request_countgaugeavgsumprocess / script / containerPending RequestsPending requests awaiting execution per model.
nv_model_load_duration_secsgaugeavgsumprocess / script / containerModel Load DurationModel load duration.
nv_pinned_memory_pool_used_bytesgaugeavgsumprocess / script / containerPinned Memory Pool UsedPinned memory pool used.
nv_pinned_memory_pool_total_bytesgaugeavgsumprocess / script / containerPinned Memory Pool TotalTotal pinned memory pool size.

SGLang

Optionally scoped to a selected model.

Metric keyTypeTemporalSpatialGroup-byChartDescription
sglang:generation_tokens_totalgaugeavgsumprocess / script / containerGenerated TokensOutput tokens produced.
sglang:num_requests_totalgaugeavgsumprocess / script / containerRequests ProcessedRequests processed.
sglang:prompt_tokens_totalgaugeavgsumprocess / script / containerPrompt TokensInput tokens processed.
sglang:gen_throughputgaugeavgsumprocess / script / containerGeneration ThroughputTokens/s generation throughput.
sglang:time_to_first_token_secondshistogramincreasemaxprocess / script / containerTime to first tokenTTFT latency (p50/p95/p99).
sglang:e2e_request_latency_secondshistogramincreasemaxprocess / script / containerEnd to end request latencyE2E latency (p50/p95/p99).
sglang:cache_hit_rategaugeavgavgprocess / script / containerPrefix Cache Hit RatePrefix cache hit rate.
sglang:num_running_reqsgaugeavgsumprocess / script / containerRunning RequestsIn-flight requests.
sglang:num_queue_reqsgaugeavgsumprocess / script / containerQueued RequestsRequests in waiting queue.

Host summary cards

Metrics behind the host-stats summary cards. Spatial aggregation is max (or sum depending on the view).

Metric keyTypeTemporalSpatialGroup-byPurpose
host.core_countgaugemaxmax|sumCPU cores card.
host.memorygaugemaxmax|sumMemory card.
gpu.memorygaugemaxmax|sumGPU memory card.
gpu.countgaugemaxmax|sumGPU count card.
neuron.memorygaugemaxmax|sumNeuron memory card.
neuron.device.countgaugemaxmax|sumNeuron device count card.
neuron.core.countgaugemaxmax|sumNeuron core count card.