Le cluster

GreenCluster, c'est deux serveurs NVIDIA GB10 (128 Go de mémoire unifiée chacun) qui travaillent en duo, orchestrés par k3s + ArgoCD (GitOps). Le stockage vit sur ZFS, répliqué par Syncoid. Chaque pièce d'infra est versionnée dans git : rien n'est « bricolé à la main », tout se re-déploie d'un geste.

Deux serveurs, un cluster

  • msi-living — le plan de contrôle (contrôleur k3s + ArgoCD) et le stockage ZFS primaire. SPOF assumé, mais remplaçable à la conception.
  • dell-living — le nœud de calcul (worker). Son cycle de vie est automatisé : drain à l'extinction, rejoin + nettoyage au boot.

🏠 Home Assistant — le cerveau énergie

Home Assistant

Home Assistant n'est pas juste un détail : c'est lui qui orchestre la consommation du cluster. Quand la mémoire unifiée de msi passe sous un seuil critique (< 11 %), HA décide de faire tourner la grosse lifeline ou de la vider.

  • La machine à 3 étatssolo (modèle léger sur msi) / stop (vidage) / cluster (DeepSeek sur les deux).
  • Le capteur MQTT home/greencluster/mode publie le mode en cours = source de vérité.
  • La porte mémoire — HA ne lance cluster que si la mémoire est libre : la lifeline ne peut plus jamais crasher.
  • Power — HA allume/éteint même dell-living selon les besoins.

En savoir plus sur le héros qui veille sur nous : home-assistant.io.

✨ La lifeline — DeepSeek sur vLLM

Le cœur qui fait battre l'équipe : un modèle DeepSeek V4 Flash 0731 — voir DeepSeek-V4-Flash-0731 sur Hugging Face — qui sert une API compatible OpenAI (alias gpt-4o) à travers le cluster, porté par vLLM (le serveur d'inférence open-source). Il tourne grâce à une image Docker communautaire pensée pour les NVIDIA GB10 : eugr/spark-vllm-docker — un kit qui rend pratique l'exécution de vLLM sur un ou plusieurs DGX Spark, avec des recettes prêtes (DeepSeek, Qwen…), le chargement multi-nœuds et l'accélération RoCE.

  • solo — un modèle léger (Qwen) sur msi, pour la vie de tous les jours sans effort.
  • cluster — DeepSeek en tensor-parallélisme 2 (les deux GB10 reliés par QSFP/RoCE), quand la puissance est nécessaire.

L'idée fondatrice : de la puissance IA importante seulement quand nécessaire, en limitant la consommation le reste du temps. Sobre par design 🌿.