Skip to main content

Metrics Reference

Zymtrace collects metrics across five layers: the host, NVIDIA GPUs (including MIG partitions), AMD GPUs, AWS Neuron accelerators, and inference servers (vLLM, NVIDIA Dynamo-Triton, and SGLang). This page lists every metric by category: its key, type, the aggregation applied, the dimensions it can be grouped by, and the chart it drives.

To enable collection, see NVIDIA GPU Metrics & Profiles, AMD GPU Metrics & Profiles, and Inference Server Metrics. The scrape frequency is controlled by -collect-metrics-interval; see Profiler ENV & CLI Args.

Conventions

  • Metric key — the metric identifier queried by the dashboard.
  • Temporal — aggregation over time: avg, max, rate, increase.
  • Spatial — aggregation across series/hosts: avg, sum, max.
  • Group-by — the dimensions a chart breaks down by. by process / script / container means the metric is charted per main executable, per script (Python), and per container.
  • Latency histograms report the p50, p95, and p99 percentiles.

Dashboards

DashboardRoute
Host/dashboards/host
NVIDIA GPU (incl. MIG)/dashboards/gpu
AMD GPU (ROCm)/dashboards/rocm
Neuron/dashboards/neuron
vLLM/dashboards/vllm
Triton/dashboards/triton
SGLang/dashboards/sglang

Host

The memory-source toggle selects working-set (WSS) vs resident-set (RSS) memory.

Metric keyTypeTemporalSpatialGroup-byChartDescription
process.utimegaugeavgsumCPU UtilizationUser-mode CPU.
process.stimegaugeavgsumCPU UtilizationSystem/kernel-mode CPU.
process.utimegaugeavgsumprocess / script / containerCPU Consumer (User)User-mode CPU by consumer.
process.stimegaugeavgsumprocess / script / containerCPU Consumer (System)System-mode CPU by consumer.
process.wssgaugeavgsumpod / container / deployment / namespaceMemory Consumer (cgroup)Working-set memory by cgroup entity.
process.rssgaugeavgsumprocess / script / containerMemory Consumer (non-cgroup)Resident-set memory by consumer.
process.wssgaugemaxsumMemory Utilization (cgroup)Total WSS across containers.
process.rssgaugemaxsumMemory Utilization (non-cgroup)Total RSS across processes.
io.read_throughputgaugeavgsumprocess / script / containerDisk Bytes ReadBytes/s read per consumer.
io.write_throughputgaugeavgsumprocess / script / containerDisk Bytes WrittenBytes/s written per consumer.
io.network.read_throughputgaugeavgsumprocess / script / containerNetwork Bytes ReceivedBytes/s received per consumer.
io.network.write_throughputgaugeavgsumprocess / script / containerNetwork Bytes SentBytes/s sent per consumer.
io.read_latencyhistogramincreasemaxDisk LatencyRead op latency (p50/p95/p99).
io.write_latencyhistogramincreasemaxDisk LatencyWrite op latency (p50/p95/p99).
io.discard_latencyhistogramincreasemaxDisk LatencyDiscard/TRIM op latency (p50/p95/p99).
io.flush_latencyhistogramincreasemaxDisk LatencyFlush op latency (p50/p95/p99).

NVIDIA GPU

Metric keyTypeTemporalSpatialGroup-byChartDescription
hw.gpu.utilizationgaugeavgavgGPU Utilization% time GPU actively processing.
hw.gpu.process.utilizationgaugeavgavgprocess / script / containerGPU ConsumerGPU utilization by process.
hw.gpu.memory.utilizationgaugemaxsumGPU Memory Utilization% VRAM in use.
hw.gpu.process.memory.utilizationgaugemaxsumprocess / script / containerGPU Memory ConsumerGPU memory by process.
hw.gpu.powergaugeavgsumGPU Power UsageCurrent power draw (W).
hw.gpu.tempgaugeavgmaxGPU TemperatureCurrent GPU temp (°C).
hw.gpu.clock.smgaugeavgavgClock FrequenciesSM clock (MHz).
hw.gpu.clock.memgaugeavgavgClock FrequenciesMemory clock (MHz).
hw.gpu.clocks_throttlegaugeavgmaxgpu.throttle_reasonClocks Throttle ReasonsFraction of time each throttle reason active.
hw.gpu.sm.efficiencygaugeavgavgSM EfficiencySM efficiency (%).
hw.gpu.sm.occupancygaugeavgavgSM OccupancySM occupancy (%).
hw.gpu.tensor_utilgaugeavgavgTensor Core UtilizationTensor Core utilization (%).
hw.gpu.pcie.rxgaugeavgsumPCIe Transmission ThroughputPCIe received.
hw.gpu.pcie.txgaugeavgsumPCIe Transmission ThroughputPCIe transmitted.
hw.gpu.nvlink.rxgaugeavgsumNVLink Transmission ThroughputNVLink received.
hw.gpu.nvlink.txgaugeavgsumNVLink Transmission ThroughputNVLink transmitted.
hw.gpu.tensor_util.dfmagaugeavgavgTensor Core BreakdownDFMA (FP64).
hw.gpu.tensor_util.hmmagaugeavgavgTensor Core BreakdownHMMA (FP16).
hw.gpu.tensor_util.dmmagaugeavgavgTensor Core BreakdownDMMA (INT8 sparse).
hw.gpu.tensor_util.immagaugeavgavgTensor Core BreakdownIMMA (integer).
hw.gpu.fp64_utilgaugeavgavgFP & Integer UtilizationFP64.
hw.gpu.fp32_utilgaugeavgavgFP & Integer UtilizationFP32.
hw.gpu.fp16_utilgaugeavgavgFP & Integer UtilizationFP16.
hw.gpu.integer_utilgaugeavgavgFP & Integer UtilizationInteger.
hw.gpu.dram_bw_utilgaugeavgavgDRAM Bandwidth Utilization% DRAM bandwidth vs max.
hw.gpu.hostmem_cache_hitgaugeavgavgL2 Cache Hit RatesHost memory (PCIe); Grace-coupled only.
hw.gpu.peermem_cache_hitgaugeavgavgL2 Cache Hit RatesPeer GPU memory (NVLink).
hw.gpu.dram_cache_hitgaugeavgavgL2 Cache Hit RatesCPU DRAM (C2C).
hw.gpu.hostmem_cache_missgaugeavgavgL2 Cache Miss RatesHost memory (PCIe); Grace-coupled only.
hw.gpu.peermem_cache_missgaugeavgavgL2 Cache Miss RatesPeer GPU memory (NVLink).
hw.gpu.dram_cache_missgaugeavgavgL2 Cache Miss RatesCPU DRAM (C2C).
hw.gpu.c2c.data_rxgaugeavgsumC2C BandwidthChip-to-chip received; Grace/NVL only.
hw.gpu.c2c.data_txgaugeavgsumC2C BandwidthChip-to-chip transmitted.

NVIDIA GPU — MIG partitions

Scoped to MIG devices.

Metric keyTypeTemporalSpatialGroup-byChart / usageDescription
hw.gpu.memory.utilizationgaugemaxsumCombined MIG — GPU Memory UtilizationVRAM % for selected/all MIG devices.
hw.gpu.utilizationgaugeavgavgCombined MIG — GPU UtilizationActive-processing % for MIG devices.
hw.gpu.tensor_utilgaugeavgavgCombined MIG — Tensor Core UtilizationTensor Core % for MIG devices.
hw.gpu.utilizationgaugeavgavggpu.uuid, gpu.name, host.nameMIG devices table"Utilization" column + device discovery.
hw.gpu.memory.utilizationgaugemaxsumgpu.uuid, gpu.name, host.nameMIG devices table"Memory" column per MIG device.
hw.gpu.tensor_utilgaugeavgavggpu.uuid, gpu.name, host.nameMIG devices table"Tensor Util" column per MIG device.

AMD GPU

AMD device metrics are reported per device and are not available per process. Metric availability depends on the GPU and AMD SMI support for that ASIC; without libdrm, GPU names and memory metrics are unavailable.

Metric keyTypeTemporalSpatialGroup-byChartDescription
hw.amd_gpu.utilizationgaugeavgavgGPU Utilization% time GPU actively processing.
hw.amd_gpu.memory.activitygaugeavgavgGPU Memory ActivityHow actively the memory controllers service requests (%).
hw.amd_gpu.multimedia.utilizationgaugeavgavgMultimedia Engine UtilizationMultimedia encode/decode engine utilization (%).
hw.amd_gpu.memory.utilizationgaugemaxsumGPU Memory UtilizationGPU memory currently in use (bytes); reported per device, fleet total is the spatial sum.
hw.amd_gpu.powergaugeavgsumGPU PowerCurrent power usage (mW).
hw.amd_gpu.power_limitgaugemaxsumGPU PowerConfigured power limit (mW).
hw.amd_gpu.tempgaugeavgmaxGPU TemperatureGPU edge temperature (°C), where the ASIC exposes an edge sensor.
hw.amd_gpu.clock.graphicsgaugeavgavgClock FrequenciesCurrent graphics clock (MHz).
hw.amd_gpu.clock.memgaugeavgavgClock FrequenciesCurrent memory clock (MHz).

Neuron

Metric keyTypeTemporalSpatialGroup-byChartDescription
hw.process.neuron.memory.utilizationgaugeavgsumprocess / script / containerNeuron Runtime Memory Usage by processRuntime memory by process.
hw.process.neuron.inference_countgaugeavgsumprocess / script / containerNeuron Inferences by processSuccessful inferences by process.
hw.process.neuron.model_load_countgaugeavgsumprocess / script / containerNeuron Model Loads by processModel loads by process.
hw.process.neuron.flop_countgaugeavgsumprocess / script / containerNeuron Device FLOP/s by processDevice FLOP/s by process.
hw.process.neuron.memory.utilizationgaugemaxsumNeuron Device Memory UsageTotal device memory usage.
hw.neuron.power.utilizationgaugemaxavgNeuron Device Peak Power UtilizationPeak device power.
hw.neuron.core.inference_countgaugeavgsumNeuron InferencesTotal successful inferences.
hw.neuron.core.model_load_countgaugeavgsumNeuron Model LoadsTotal model loads.
hw.process.neuron.flop_countgaugeavgsumNeuron Device FLOP/sTotal device FLOP/s.

vLLM

Optionally scoped to a selected model.

Metric keyTypeTemporalSpatialGroup-byChartDescription
vllm:generation_tokens_totalgaugerate / avgsumprocess / script / containerGenerated TokensOutput tokens produced.
vllm:prompt_tokens_totalgaugerate / avgsumprocess / script / containerPrompt TokensInput tokens processed.
vllm:time_per_output_token_secondshistogramincreasemaxprocess / script / containerTime per output TokenPer-output-token latency (p50/p95/p99).
vllm:time_to_first_token_secondshistogramincreasemaxprocess / script / containerTime to first tokenTTFT latency (p50/p95/p99).
vllm:e2e_request_latency_secondshistogramincreasemaxprocess / script / containerEnd to end request latencyE2E latency (p50/p95/p99).
vllm:num_requests_runninggaugeavgsumprocess / script / containerRunning RequestsIn-flight requests.
vllm:kv_cache_usage_percgaugeavgavgprocess / script / containerKV Cache UsageKV-cache memory utilization %.

Triton

Optionally scoped to a selected model.

Metric keyTypeTemporalSpatialGroup-byChartDescription
nv_inference_countgaugeavgsumprocess / script / containerInferencesInferences performed (excl. cached).
nv_inference_request_successgaugeavgsumprocess / script / containerSuccessful InferencesSuccessful requests, all batch sizes.
nv_inference_request_failuregaugeavgsumprocess / script / containerFailed InferencesFailed requests, all batch sizes.
nv_inference_exec_countgaugeavgsumprocess / script / containerModel ExecutionsModel executions (excl. cached).
nv_inference_request_duration_usgaugeavgsumprocess / script / containerRequest DurationCumulative request duration (incl. cached).
nv_inference_queue_duration_usgaugeavgsumprocess / script / containerQueue DurationCumulative queuing duration (incl. cached).
nv_inference_compute_input_duration_usgaugeavgsumprocess / script / containerCompute Input DurationCumulative compute-input duration (excl. cached).
nv_inference_compute_infer_duration_usgaugeavgsumprocess / script / containerCompute Inference DurationCumulative compute-infer duration (excl. cached).
nv_inference_compute_output_duration_usgaugeavgsumprocess / script / containerCompute Output DurationCumulative compute-output duration (excl. cached).
nv_inference_pending_request_countgaugeavgsumprocess / script / containerPending RequestsPending requests awaiting execution per model.
nv_model_load_duration_secsgaugeavgsumprocess / script / containerModel Load DurationModel load duration.
nv_pinned_memory_pool_used_bytesgaugeavgsumprocess / script / containerPinned Memory Pool UsedPinned memory pool used.
nv_pinned_memory_pool_total_bytesgaugeavgsumprocess / script / containerPinned Memory Pool TotalTotal pinned memory pool size.

SGLang

Optionally scoped to a selected model.

Metric keyTypeTemporalSpatialGroup-byChartDescription
sglang:generation_tokens_totalgaugeavgsumprocess / script / containerGenerated TokensOutput tokens produced.
sglang:num_requests_totalgaugeavgsumprocess / script / containerRequests ProcessedRequests processed.
sglang:prompt_tokens_totalgaugeavgsumprocess / script / containerPrompt TokensInput tokens processed.
sglang:gen_throughputgaugeavgsumprocess / script / containerGeneration ThroughputTokens/s generation throughput.
sglang:time_to_first_token_secondshistogramincreasemaxprocess / script / containerTime to first tokenTTFT latency (p50/p95/p99).
sglang:e2e_request_latency_secondshistogramincreasemaxprocess / script / containerEnd to end request latencyE2E latency (p50/p95/p99).
sglang:cache_hit_rategaugeavgavgprocess / script / containerPrefix Cache Hit RatePrefix cache hit rate.
sglang:num_running_reqsgaugeavgsumprocess / script / containerRunning RequestsIn-flight requests.
sglang:num_queue_reqsgaugeavgsumprocess / script / containerQueued RequestsRequests in waiting queue.

Host summary cards

Metrics behind the host-stats summary cards. Spatial aggregation is max (or sum depending on the view).

Metric keyTypeTemporalSpatialGroup-byPurpose
host.core_countgaugemaxmax|sumCPU cores card.
host.memorygaugemaxmax|sumMemory card.
gpu.memorygaugemaxmax|sumGPU memory card.
gpu.countgaugemaxmax|sumGPU count card.
amd_gpu.memorygaugemaxmax|sumAMD GPU memory card.
amd_gpu.countgaugemaxmax|sumAMD GPU count card.
neuron.memorygaugemaxmax|sumNeuron memory card.
neuron.device.countgaugemaxmax|sumNeuron device count card.
neuron.core.countgaugemaxmax|sumNeuron core count card.