# SoberCloud > Cloud provider français sobre à tous les étages, solaire et souverain, basé à Briançon (1 326 m, Hautes-Alpes). Politique « fusée sobre » en 5 étages : surcouche d'optimisation, services à la demande, extinction des serveurs inactifs, matériel sobre et compact — le datacenter solaire alpin (free cooling, zéro eau) n'est que le dernier étage. Hébergement Kubernetes managé et SaaS, serveurs ARM basse consommation. Conformité NIS2 et RGPD, données 100 % en France. ## Pages clés - [Accueil](https://sobercloud.fr/): Présentation, fusée sobre (la sobriété en 5 étages), vision, infrastructure solaire, services cloud et SaaS, sécurité (SOC), contact. - [Découvertes](https://sobercloud.fr/decouvertes/): Carnet technique : retours d'expérience sur l'inférence LLM open source souveraine. - [Kit de communication](https://sobercloud.fr/communication/): Logos SoberCloud (SVG/PNG : sombre, clair, transparent, icône, LinkedIn) et ressources de marque téléchargeables. - [Mentions légales](https://sobercloud.fr/mentions-legales/): Identité de l'éditeur, hébergement, conditions d'utilisation. - [Politique de confidentialité](https://sobercloud.fr/politique-confidentialite/): Traitement des données personnelles conforme RGPD, absence de cookies de suivi. - [Conditions d'utilisation — Atlas](https://sobercloud.fr/cgv-atlas/conditions-utilisation/): CGU de la plateforme Atlas (selfcare client, portail partenaires, gestion SaaS). - [Politique de confidentialité — Atlas](https://sobercloud.fr/cgv-atlas/politique-confidentialite/): Traitement des données de la plateforme Atlas, conforme RGPD. ## Services - Hébergement Kubernetes managé — cluster souverain avec scale-to-zero, monitoring et CI/CD intégrés. - Hébergement web & API éco-responsable — applications, API REST/GraphQL et bases de données (PostgreSQL, Redis, MongoDB) sur infrastructure solaire. - Inférence LLM open source servie depuis nos propres nodes GPU, en souveraineté française. - Stockage objet S3-compatible, sites statiques haute performance (via Altilink), services SaaS managés. - Security Operations Center — chiffrement AES-256 au repos, TLS 1.3 en transit, clés souveraines en France, monitoring 24/7. - Décarbonation du numérique — accompagnement de A à Z : audit & mesure de l'empreinte, stratégie de sobriété, migration vers l'infrastructure solaire, optimisation continue, mesure et reporting (CSRD, bilan carbone). ## Domaines d’expertise - Cloud souverain & sobriété numérique (Green IT) - Sobriété à tous les étages — fusée sobre en 5 étages : optimisation applicative, services à la demande, extinction des serveurs inactifs, matériel sobre, datacenter solaire alpin - Datacenter solaire autonome et free cooling montagnard (PUE visé < 1.1, zéro eau de refroidissement) - Serveurs ARM basse consommation pour workloads cloud-native - Kubernetes managé, scale-to-zero, conteneurs isolés multi-tenant - Inférence LLM open source souveraine sur nodes GPU dédiés - Conformité NIS2 et RGPD, hébergement 100 % France hors Cloud Act ## Découvertes (articles) - [Benchmarks LLM : lire les scores sans se faire piéger](https://sobercloud.fr/decouvertes/benchmarks-llm/): Code, raisonnement, contamination, saturation : panorama des benchmarks LLM et pourquoi nous gardons BenchLocal, notre évaluation qualité interne. - [Harness IA et agents de code en 2026 : le harness compte plus que le modèle](https://sobercloud.fr/decouvertes/harness-agents-code/): Coding tools vs agents autonomes, tool calling, boucles agentiques, mémoire projet et benchmarks 2026 : pourquoi le harness fait la différence. - [Le paysage des modèles ouverts à la mi-2026](https://sobercloud.fr/decouvertes/paysage-modeles-ouverts-2026/): Qwen3.6, Gemma 4, GLM-5, Kimi K2.6, DeepSeek V4 : panorama des modèles open-weight mi-2026 et pourquoi la sparsité (MoE) s'est imposée partout. - [Pénurie de mémoire 2026 : quand la sobriété devient un avantage](https://sobercloud.fr/decouvertes/penurie-memoire-2026/): Prix de la DRAM et des SSD doublés en 2026 : pourquoi les techniques d'inférence sobres (MoE, MLA, quantification) transforment la contrainte mémoire en atout. - [Le lexique de l'inférence LLM, expliqué simplement](https://sobercloud.fr/decouvertes/lexique-inference/): Tous les mots de l'inférence d'IA — token, quantification, KV cache, MoE, MTP, VRAM… — définis en langage clair, avec un lien vers l'article pour creuser. - [Aide-mémoire LLM : formats, quantification et commandes](https://sobercloud.fr/decouvertes/aide-memoire/): La référence rapide pour l'inférence locale : formats, K-quants GGUF, calcul mémoire, paramètres de génération et flags llama.cpp, vLLM et Ollama. - [Le cache KV (Key-Value) expliqué](https://sobercloud.fr/decouvertes/cache-kv/): Comment le cache KV accélère l'inférence, comment calculer sa taille, et comment le compresser : GQA, MLA, quantification q8_0/fp8, SWA, PagedAttention. - [Choisir son matériel pour l'inférence LLM locale](https://sobercloud.fr/decouvertes/choix-du-materiel/): VRAM, bande passante, mémoire unifiée : pourquoi le decode est limité par la mémoire et comment arbitrer entre GPU discret et iGPU à mémoire partagée. - [Comprendre les LLM open source](https://sobercloud.fr/decouvertes/comprendre-les-llm-open-source/): Architecture Transformer, tokens, attention, quantification : les fondamentaux des LLM open source, avec un lexique complet des termes IA. - [Décodage accéléré : spéculatif, MTP, EAGLE et draft models](https://sobercloud.fr/decouvertes/decodage-accelere/): Speculative decoding, Multi-Token Prediction, EAGLE-3, Medusa : comment générer plusieurs tokens par passe sans dégrader la qualité du LLM. - [Drivers GPU pour l'inférence : Vulkan, ROCm, CUDA, Metal](https://sobercloud.fr/decouvertes/drivers-gpu/): Comparatif des stacks GPU pour l'inférence LLM : CUDA, ROCm, Vulkan, Metal, et pourquoi Strix Halo passe par Vulkan. - [Fine-tuning complet : LoRA, QLoRA, Spectrum et alignement](https://sobercloud.fr/decouvertes/fine-tuning-complet/): Guide pratique du fine-tuning de LLM en 2026 : quand fine-tuner, LoRA vs QLoRA, Spectrum, préparation de datasets et alignement DPO/ORPO. - [Flash Attention : de FA1 à FA4](https://sobercloud.fr/decouvertes/flash-attention/): Flash Attention optimise l'attention en minimisant les transferts HBM/SRAM : tiling, recomputation, et l'évolution FA1 à FA4 (Ampere → Blackwell). - [Formats de modèles : GGUF, SafeTensors, MLX](https://sobercloud.fr/decouvertes/formats-de-modeles/): Comprendre les formats de stockage des LLM open source — GGUF, SafeTensors, MLX — et les distinguer des méthodes de quantification. - [Guide pratique : faire tourner un LLM local en production](https://sobercloud.fr/decouvertes/guide-pratique/): Commandes concrètes llama.cpp, vLLM et Ollama, flags clés et configurations réelles pour servir Qwen3.6 sur GPU discret ou mémoire unifiée. - [Logiciels d'inférence LLM : llama.cpp, vLLM, SGLang](https://sobercloud.fr/decouvertes/logiciels-inference/): Comparatif des moteurs d'inférence LLM en 2026 et le choix concret de SoberCloud : llama.cpp Vulkan, vLLM et LiteLLM. - [Paramètres de génération des LLM](https://sobercloud.fr/decouvertes/parametres-de-generation/): Temperature, top-p, top-k, pénalités : comment ces paramètres contrôlent la créativité et la cohérence des réponses d'un LLM. - [Quantification avancée des LLM](https://sobercloud.fr/decouvertes/quantification-avancee/): GGUF K-quants, nomenclature Q4_K_M et UD-Q5_K_XL, GPTQ, AWQ, EXL2/EXL3, REAP : panorama des méthodes de quantification et de leurs compromis. - [Unsloth en profondeur : fine-tuning rapide et GGUF dynamiques](https://sobercloud.fr/decouvertes/unsloth-en-profondeur/): Comment Unsloth accélère le fine-tuning LoRA et produit des GGUF Dynamic supérieurs, avec un exemple sur Qwen3.6-27B. - [Dense ou MoE ? Pourquoi Qwen3.6-35B-A3B bat le 27B dense sur Strix Halo](https://sobercloud.fr/decouvertes/dense-vs-moe-strix-halo/): Retour d'expérience SoberCloud : à fichier équivalent, un Mixture-of-Experts 35B-A3B sert plus vite qu'un modèle dense 27B sur un iGPU à mémoire unifiée. ## Localisation - Briançon, Hautes-Alpes (05100), Provence-Alpes-Côte d’Azur, France — 44.8967, 6.6350. - Contact : contact@sobercloud.fr ## Endpoints lisibles par IA - [sitemap.xml](https://sobercloud.fr/sitemap-index.xml): index des URL du site. - [robots.txt](https://sobercloud.fr/robots.txt): gouvernance des crawlers (bots de recherche IA autorisés, Content-Signal permissif). - [rss.xml](https://sobercloud.fr/rss.xml): flux des découvertes. - Chaque article est exposé en Markdown brut via le suffixe .md (ex : /decouvertes/.md).