Files
k3s-cluster/monitoring
Platform Engineer 6df0be81c9 fix(platform): fix high-restart pods - prometheus nodeSelector, litellm resources, gitea-runner limits
- Prometheus: change nodeSelector from hardware=high-memory (nonexistent label) to kubernetes.io/arch: amd64
  Fixes OOMKilled cause - pod was being scheduled on wrong nodes.
- litellm-deployment: add resource limits (2Gi/500m requests, 4Gi/2000m limits) + pin image to v1.34.0
  Fixes OOMKilled cause - no resource limits were set.
- gitea-runner: pin image to v0.12.0 from :latest + add resource limits (512Mi/250m requests, 1Gi/500m limits)
  Addresses extreme restart count (281) caused by unbounded memory usage and rolling image updates.
2026-07-21 20:28:12 +00:00
..
2026-01-24 18:24:16 +01:00
2026-01-24 18:24:16 +01:00
2026-06-26 18:06:01 +02:00
2026-01-24 18:24:16 +01:00
2026-01-24 18:24:16 +01:00
2026-01-24 18:24:16 +01:00
2026-01-24 18:24:16 +01:00
2026-01-24 18:24:16 +01:00