<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Observability on Kueue</title><link>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/</link><description>Recent content in Observability on Kueue</description><generator>Hugo</generator><language>en</language><lastBuildDate>Wed, 30 Sep 2026 22:11:28 +0300</lastBuildDate><atom:link href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/index.xml" rel="self" type="application/rss+xml"/><item><title>Setup Prometheus</title><link>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/setup_prometheus/</link><pubDate>Wed, 04 Feb 2026 00:00:00 +0000</pubDate><guid>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/setup_prometheus/</guid><description>&lt;p&gt;This page shows how to set up Prometheus to scrape Kueue metrics. For TLS-secured metrics endpoints, see &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/productization/prometheus/"&gt;Configure Prometheus with TLS&lt;/a&gt;.&lt;/p&gt;&#10;&lt;p&gt;The page is intended for a &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/#batch-administrator"&gt;batch administrator&lt;/a&gt;.&lt;/p&gt;&#10;&lt;h2 id="before-you-begin"&gt;&#10;Before you begin&#10;&lt;a href="#before-you-begin" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;Make sure the following conditions are met:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;A Kubernetes cluster is running.&lt;/li&gt;&#10;&lt;li&gt;The kubectl command-line tool has communication with your cluster.&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/installation"&gt;Kueue is installed&lt;/a&gt;.&lt;/li&gt;&#10;&lt;li&gt;Prometheus Operator is &lt;a href="https://prometheus-operator.dev/docs/getting-started/installation/"&gt;installed&lt;/a&gt;.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="1-setup"&gt;&#10;1. Setup&#10;&lt;a href="#1-setup" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;Choose the setup method that matches your Kueue installation.&lt;/p&gt;</description></item><item><title>Common Grafana Queries</title><link>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/common_grafana_queries/</link><pubDate>Tue, 03 Feb 2026 00:00:00 +0000</pubDate><guid>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/common_grafana_queries/</guid><description>&lt;p&gt;This page shows you how to use common PromQL queries to monitor Kueue metrics in Grafana.&lt;/p&gt;&#10;&lt;p&gt;The intended audience for this page are &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/#batch-administrator"&gt;batch administrators&lt;/a&gt;.&lt;/p&gt;&#10;&lt;h2 id="before-you-begin"&gt;&#10;Before you begin&#10;&lt;a href="#before-you-begin" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;Make sure the following conditions are met:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;A Kubernetes cluster is running.&lt;/li&gt;&#10;&lt;li&gt;The kubectl command-line tool has communication with your cluster.&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/installation"&gt;Kueue is installed&lt;/a&gt;.&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="https://github.com/prometheus-operator/kube-prometheus"&gt;kube-prometheus&lt;/a&gt; is installed.&lt;/li&gt;&#10;&lt;li&gt;Kueue Prometheus metrics are enabled (see &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/setup_prometheus/"&gt;Setup Prometheus&lt;/a&gt;).&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="quota-utilization"&gt;&#10;Quota utilization&#10;&lt;a href="#quota-utilization" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&#10;&#10;&lt;div class="alert alert-primary" role="alert"&gt;&#10;&lt;h4 class="alert-heading"&gt;Note&lt;/h4&gt;&#10;&#10; The queries in this section require &lt;code&gt;metrics.enableClusterQueueResources: true&lt;/code&gt;&#10;in the Kueue configuration. See &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/installation/#install-a-custom-configured-released-version"&gt;Installation&lt;/a&gt; for details.&#10;&#10;&lt;/div&gt;&#10;&#10;&lt;p&gt;To monitor the percentage of CPU quota being used in a ClusterQueue:&lt;/p&gt;</description></item><item><title>Monitor actual resource usage</title><link>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/monitor_resource_usage/</link><pubDate>Tue, 24 Feb 2026 00:00:00 +0000</pubDate><guid>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/monitor_resource_usage/</guid><description>&lt;p&gt;This page shows you how to use Kueue labels assigned to pods to monitor resource&#10;usage.&lt;/p&gt;&#10;&lt;p&gt;The intended audience for this page are &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/#batch-administrator"&gt;batch administrators&lt;/a&gt;.&lt;/p&gt;&#10;&lt;h2 id="before-you-begin"&gt;&#10;Before you begin&#10;&lt;a href="#before-you-begin" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;Make sure the following conditions are met:&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;A Kubernetes cluster is running.&lt;/li&gt;&#10;&lt;li&gt;The kubectl command-line tool has communication with your cluster.&lt;/li&gt;&#10;&lt;li&gt;&lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/installation"&gt;Kueue is installed&lt;/a&gt;.&lt;/li&gt;&#10;&lt;li&gt;The cluster has at least one &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/administer_cluster_quotas/"&gt;local queue and cluster queue&lt;/a&gt;. Presented commands assume your local queue is named &amp;ldquo;user-queue&amp;rdquo; and cluster queue is named &amp;ldquo;cluster-queue&amp;rdquo;, if this is not the case adjust them appropriately.&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&#10;&#10;&lt;div class="alert alert-primary" role="alert"&gt;&#10;&lt;h4 class="alert-heading"&gt;Note&lt;/h4&gt;&#10;&#10; The queries in this page require &lt;code&gt;AssignQueueLabelsForPods&lt;/code&gt; Feature Gate, which is enabled by default.&#10;If it is not enabled, see &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/installation/#change-the-feature-gates-configuration"&gt;Installation&lt;/a&gt; for details how to enable it.&#10;&#10;&lt;/div&gt;&#10;&#10;&lt;h2 id="kubectl-top-for-command-line-resource-usage-debugging"&gt;&#10;&lt;code&gt;kubectl top&lt;/code&gt; for command line resource usage debugging&#10;&lt;a href="#kubectl-top-for-command-line-resource-usage-debugging" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&#10;&#10;&lt;div class="alert alert-warning" role="alert"&gt;&#10;&lt;h4 class="alert-heading"&gt;Warning&lt;/h4&gt;&#10;&#10; As mentioned on &lt;a href="https://github.com/kubernetes-sigs/metrics-server?tab=readme-ov-file#kubernetes-metrics-server"&gt;Metrics Server repository site&lt;/a&gt;,&#10;Metrics Server and provided command line tool - &lt;code&gt;kubectl top&lt;/code&gt; - is not meant as a monitoring solution. The tool is convenient&#10;for quick troubleshooting but is not a substitute for full-scale monitoring. See the &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/monitor_resource_usage/#production-resource-monitoring"&gt;Production resource monitoring&lt;/a&gt; section for a more robust setup.&#10;&#10;&lt;/div&gt;&#10;&#10;&lt;ol&gt;&#10;&lt;li&gt;To use &lt;code&gt;kubectl top&lt;/code&gt; you need to install metrics-server for you cluster.&#10;Follow the &lt;a href="https://github.com/kubernetes-sigs/metrics-server?tab=readme-ov-file#installation"&gt;Metrics Server Installation&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;Schedule a couple of jobs that have some actual cpu usage to your local queue:&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-sh" data-lang="sh"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;for&lt;/span&gt; i in &lt;span class="o"&gt;{&lt;/span&gt;1..3&lt;span class="o"&gt;}&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt; &lt;span class="k"&gt;do&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;kubectl create -f - &lt;span class="s"&gt;&amp;lt;&amp;lt;&amp;#39;EOF&amp;#39;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;apiVersion: batch/v1&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;kind: Job&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;metadata:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; generateName: sample-job-&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; namespace: default&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; labels:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; kueue.x-k8s.io/queue-name: &amp;#34;user-queue&amp;#34;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;spec:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; parallelism: 1&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; completions: 1&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; template:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; spec:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; containers:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; - name: dummy-job&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; image: registry.k8s.io/e2e-test-images/agnhost:2.53&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; command: [ &amp;#34;/bin/sh&amp;#34; ]&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; args: [ &amp;#34;-c&amp;#34;, &amp;#34;end_time=$(($(date +%s) + 60)); while [ $(date +%s) -lt $end_time ]; do :; done&amp;#34;]&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; resources:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; requests:&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; cpu: &amp;#34;1&amp;#34;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt; restartPolicy: Never&#10;&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="s"&gt;EOF&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;&lt;span class="k"&gt;done&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;ol start="3"&gt;&#10;&lt;li&gt;Monitor the usage of cpu and memory in nearly real time for this local queue with &lt;code&gt;kubectl top&lt;/code&gt;:&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-sh" data-lang="sh"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;watch -n &lt;span class="m"&gt;15&lt;/span&gt; &lt;span class="s1"&gt;&amp;#39;kubectl top pod --sum -l kueue.x-k8s.io/local-queue-name=user-queue&amp;#39;&lt;/span&gt;&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;You will see a list of pods currently running on the local queue named &amp;ldquo;user-queue&amp;rdquo; with their current cpu and memory measurements and the sum of the usage at the bottom. The list will be automatically refreshed every 15 seconds.&#10;The outcome should look like this:&lt;/p&gt;</description></item><item><title>Configure Custom Metric Labels</title><link>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/configure_custom_metric_labels/</link><pubDate>Tue, 10 Mar 2026 00:00:00 +0000</pubDate><guid>https://kueue.sigs.k8s.io/v0.20/docs/tasks/manage/observability/configure_custom_metric_labels/</guid><description>&lt;p&gt;This page shows you how to configure custom metric labels that promote Kubernetes&#10;labels or annotations on ClusterQueues, LocalQueues, Cohorts, and Workloads into&#10;additional Prometheus metric label dimensions.&lt;/p&gt;&#10;&lt;p&gt;The intended audience for this page are &lt;a href="https://kueue.sigs.k8s.io/v0.20/docs/tasks/#batch-administrator"&gt;batch administrators&lt;/a&gt;.&lt;/p&gt;&#10;&lt;h2 id="before-you-begin"&gt;&#10;Before you begin&#10;&lt;a href="#before-you-begin" class="anchor-link"&gt;&#10; &lt;svg xmlns="http://www.w3.org/2000/svg" fill="currentColor" width="24" height="24" viewBox="0 0 24 24"&gt;&#10; &lt;path d="M0 0h24v24H0z" fill="none"&gt;&lt;/path&gt;&#10; &lt;path d="M3.9 12c0-1.71 1.39-3.1 3.1-3.1h4V7H7c-2.76 0-5 2.24-5 5s2.24 5 5 5h4v-1.9H7c-1.71 0-3.1-1.39-3.1-3.1zM8 13h8v-2H8v2zm9-6h-4v1.9h4c1.71 0 3.1 1.39 3.1 3.1s-1.39 3.1-3.1 3.1h-4V17h4c2.76 0 5-2.24 5-5s-2.24-5-5-5z"&gt;&lt;/path&gt;&#10;&lt;/svg&gt;&#10;&lt;/a&gt;&#10;&lt;/h2&gt;&#10;&lt;p&gt;Make sure the following conditions are met:&lt;/p&gt;</description></item></channel></rss>