Commit Graph

187 Commits

Author SHA1 Message Date
Roger Oriol
58bba66f18 simplify all of platform engineer's crons into one single daily cron 2026-08-01 16:52:45 +02:00
Roger Oriol
33b1b2dc8f fix deepseek pvc 2026-08-01 10:46:09 +02:00
Roger Oriol
27307ff683 fix deepseek pvc 2026-08-01 10:34:54 +02:00
Roger Oriol
475bf48fe4 fix deepseek deployment 2026-08-01 10:20:05 +02:00
Roger Oriol
b132aae09c deploy deepseek v4 2026-08-01 00:24:26 +02:00
Roger Oriol
5fe0ee361a add openwakeword deployment 2026-07-29 00:43:23 +02:00
Roger Oriol
fba742b34f add kubernetes local host resolution to homeassistant 2026-07-29 00:29:20 +02:00
Roger Oriol
90a04b96a3 give whisper pod more memory 2026-07-29 00:15:29 +02:00
Roger Oriol
8c5c884b4d add stt and tts services 2026-07-29 00:07:10 +02:00
Roger Oriol
9eb425f7f5 merge 2026-07-28 23:02:08 +02:00
Roger Oriol
6970313822 fix homeassistant not being able to see scripts saved 2026-07-28 23:01:22 +02:00
Hermes Platform Engineer
9a230d03c9 Merge fix(homeassistant): reduce memory requests + clean up restartedAt annotation 2026-07-28 19:22:16 +00:00
Hermes Platform Engineer
71f724420e Merge fix(homeassistant): memory reduction with restart annotation cleanup 2026-07-28 19:22:16 +00:00
Hermes Platform Engineer
6967925c4f fix(homeassistant): add restartedAt annotation to trigger rollout and clean up stale Pending pod
The old ReplicaSet 789f79897c left a Pending pod (home-assistant-789f79897c-plf7n)
because the nucbox node is at 95.9% memory. Adding restartedAt annotation to
trigger a fresh rollout so the new ReplicaSet takes over.
2026-07-28 13:11:08 +00:00
Hermes Platform Engineer
2f1ae311f7 fix(homeassistant): reduce memory requests to 256Mi, add node affinity for raspberrypi
Node roger-nucbox-evo-x2 is at 3.78% memory free causing home-assistant
pods to flap Pending/Running. Reduce resource requests to fit within
cluster capacity and prefer scheduling on raspberrypi (63% mem free).
2026-07-28 12:58:19 +00:00
7ca919b7c7 Merge pull request 'fix(homeassistant): pin image to 2026.7.4 to avoid cffi version mismatch' (#28) from fix/homeassistant-pin-version into main
Reviewed-on: roger/k3s-cluster#28
2026-07-28 11:07:26 +02:00
Hermes Platform Engineer
d266086c1b fix(homeassistant): pin image to 2026.7.4 to avoid cffi version mismatch with Python 3.14 2026-07-28 09:01:06 +00:00
Roger Oriol
d3798f47ac fix homeassistant configuration.yaml not being writable 2026-07-28 00:31:23 +02:00
Roger Oriol
707ec39291 fix hermes api not being reachable 2026-07-26 17:19:20 +02:00
Roger Oriol
5bb1066d0d fix hermes api not being reachable 2026-07-26 17:08:27 +02:00
Roger Oriol
575c7bf9e0 agents fix language and time zone 2026-07-26 14:59:58 +02:00
Roger Oriol
4222582a54 Merge branch 'main' of https://git.rogi.casa/roger/k3s-cluster 2026-07-26 14:38:02 +02:00
Roger Oriol
4f6255800b enable api access for agents home manager and platform engineer 2026-07-26 14:37:37 +02:00
d1e86ce5ec fix(prometheus): add restart annotation to trigger rollout and clean up stale pods 2026-07-26 13:26:46 +02:00
Platform Engineer Agent
d5e4e37358 fix(prometheus): bump memory limit from 2Gi to 4Gi to prevent OOMKilled 2026-07-26 10:44:19 +00:00
platform-engineer-agent
63557ef1b4 fix(argocd): delete argocd/apps/argocd.yaml (moved to argocd/argocd.yaml) 2026-07-26 07:04:51 +02:00
platform-engineer-agent
65bcb0c7a4 fix(argocd): remove argocd app from apps/ to avoid circular dependency 2026-07-26 07:02:15 +02:00
Roger Oriol
7af7ae66de increase qwen3.6 models context available to 131k 2026-07-26 01:29:23 +02:00
Roger Oriol
5eaea8c387 fix home manager discord integration 2026-07-26 01:00:25 +02:00
Roger Oriol
8f24290f38 fix platform engineer daily cron 2026-07-26 00:27:38 +02:00
Roger Oriol
a7e78c18c3 fix pod restart cron 2026-07-25 20:19:27 +02:00
Roger Oriol
8caf49fdf6 fix home manager crons 2026-07-25 20:03:16 +02:00
Roger Oriol
842815d370 home manager crons fix 2026-07-25 00:54:46 +02:00
Roger Oriol
4694034a04 set qwen models parameters to allow for a higher context window 2026-07-24 21:30:01 +02:00
Roger Oriol
bc165d3cf1 change home-manager model to qwen3.6-35b-a3b 2026-07-24 20:37:43 +02:00
Roger Oriol
c982b33015 increase llamacpp models context window! 2026-07-24 20:11:30 +02:00
Roger Oriol
496e46076c set platform engineer url to platform-engineer.rogi.casa 2026-07-23 23:57:41 +02:00
Roger Oriol
04bd4d8e5e deploy both qwen3.6 versions 2026-07-23 22:10:44 +02:00
Roger Oriol
8ef9db1e37 fix llamacpp 2026-07-23 00:26:58 +02:00
Roger Oriol
70e4baf5e3 fix llamacpp image 2026-07-23 00:12:08 +02:00
Roger Oriol
0143ebefd9 new llamacpp service 2026-07-22 23:54:52 +02:00
Roger Oriol
5f7f1bd52a set litellm master key 2026-07-22 22:03:40 +02:00
Roger Oriol
b58abda201 update gitea runner image 2026-07-22 21:32:09 +02:00
Roger Oriol
4307545436 drop master key from litellm general settings 2026-07-22 21:26:38 +02:00
Roger Oriol
84be8f2c36 merge 2026-07-22 21:20:27 +02:00
Roger Oriol
a8c7df67fe increase litellm memory allowance 2026-07-22 21:17:51 +02:00
platform-engineer
097fe2e0e7 fix(prometheus): bump memory limit from 1Gi to 2Gi due to OOM
fix(litellm): add resource limits (512Mi/1Gi) to prevent unbounded memory consumption
2026-07-22 05:58:23 +00:00
Platform Engineer
6df0be81c9 fix(platform): fix high-restart pods - prometheus nodeSelector, litellm resources, gitea-runner limits
- Prometheus: change nodeSelector from hardware=high-memory (nonexistent label) to kubernetes.io/arch: amd64
  Fixes OOMKilled cause - pod was being scheduled on wrong nodes.
- litellm-deployment: add resource limits (2Gi/500m requests, 4Gi/2000m limits) + pin image to v1.34.0
  Fixes OOMKilled cause - no resource limits were set.
- gitea-runner: pin image to v0.12.0 from :latest + add resource limits (512Mi/250m requests, 1Gi/500m limits)
  Addresses extreme restart count (281) caused by unbounded memory usage and rolling image updates.
2026-07-21 20:28:12 +00:00
a5291da0b2 fix(gitea): bump restartedAt annotation to clear stuck gitea-runner pods (281 restarts from DNS resolution failures) 2026-07-21 15:36:57 +02:00
platform-engineer
075bdd8ca3 fix(gitea-runner): pin image tag to v0.7.2, add resource limits (256Mi/100m req, 512Mi/500m lim) to prevent OOM restarts 2026-07-20 22:19:37 +00:00