GreenCluster, c'est deux serveurs NVIDIA GB10 (128 Go de mémoire unifiée chacun) qui travaillent en duo, orchestrés par k3s + ArgoCD (GitOps). Le stockage vit sur ZFS, répliqué par Syncoid. Chaque pièce d'infra est versionnée dans git : rien n'est « bricolé à la main », tout se re-déploie d'un geste.
Deux serveurs, un cluster
- msi-living — le plan de contrôle (contrôleur k3s + ArgoCD) et le stockage ZFS primaire. SPOF assumé, mais remplaçable à la conception.
- dell-living — le nœud de calcul (worker). Son cycle de vie est automatisé : drain à l'extinction, rejoin + nettoyage au boot.
🏠 Home Assistant — le cerveau énergie

Home Assistant n'est pas juste un détail : c'est lui qui orchestre la consommation du cluster. Quand la mémoire unifiée de msi passe sous un seuil critique (< 11 %), HA décide de faire tourner la grosse lifeline ou de la vider.
- La machine à 3 états —
solo(modèle léger sur msi) /stop(vidage) /cluster(DeepSeek sur les deux). - Le capteur MQTT
home/greencluster/modepublie le mode en cours = source de vérité. - La porte mémoire — HA ne lance
clusterque si la mémoire est libre : la lifeline ne peut plus jamais crasher. - Power — HA allume/éteint même dell-living selon les besoins.
En savoir plus sur le héros qui veille sur nous : home-assistant.io.
✨ La lifeline — DeepSeek sur vLLM
Le cœur qui fait battre l'équipe : un modèle DeepSeek V4 Flash 0731 — voir DeepSeek-V4-Flash-0731 sur Hugging Face — qui sert une API compatible OpenAI (alias gpt-4o) à travers le cluster, porté par vLLM (le serveur d'inférence open-source). Il tourne grâce à une image Docker communautaire pensée pour les NVIDIA GB10 : eugr/spark-vllm-docker — un kit qui rend pratique l'exécution de vLLM sur un ou plusieurs DGX Spark, avec des recettes prêtes (DeepSeek, Qwen…), le chargement multi-nœuds et l'accélération RoCE.
- solo — un modèle léger (Qwen) sur msi, pour la vie de tous les jours sans effort.
- cluster — DeepSeek en tensor-parallélisme 2 (les deux GB10 reliés par QSFP/RoCE), quand la puissance est nécessaire.
L'idée fondatrice : de la puissance IA importante seulement quand nécessaire, en limitant la consommation le reste du temps. Sobre par design 🌿.