Aller au contenu principal
IA souveraine

Inférence LLM open source souveraine

Des modèles ouverts servis depuis nos GPU — vos prompts restent en France.

Servi depuis Briançon, 1 326 m · Données 100 % France

Sur devis, dimensionné au besoin réel.

Le problème

Un prompt, c’est une donnée métier

Envoyer vos prompts à une API américaine, c'est exporter vos données métier — souvent les plus sensibles — hors de l'Union européenne, et dépendre d'un modèle qui peut changer ou disparaître du jour au lendemain.

Un contrat relu, un dossier patient résumé, un cahier des charges reformulé : ce que vous envoyez à un modèle est souvent ce que vous avez de plus sensible. La question n’est pas seulement « le modèle est-il bon », mais « où part le texte, et sous quelle juridiction ».

Ce qu’on fait

Des modèles ouverts, servis depuis nos GPU

Nous servons des modèles ouverts depuis nos propres nodes GPU. Le texte que vous envoyez est traité sur notre matériel, en France, et n’est confié à aucune API tierce.

Les poids sont ouverts et téléchargeables : le modèle que vous validez aujourd’hui ne peut pas être retiré du catalogue ni remplacé par une autre version du jour au lendemain. Ce que vous recettez reste ce que vous servez.

Ce que nous servons

Deux familles de modèles, deux usages

Nous servons des modèles à poids ouverts, dans deux architectures qui ne se choisissent pas au hasard. Le modèle retenu pour votre cas est arrêté au cadrage : l'écosystème bouge trop vite pour qu'un nom gravé sur une page ait un sens.

Le dense

Un modèle dense mobilise l’intégralité de ses paramètres à chaque token généré. C’est le calcul le plus régulier et le plus prévisible : la qualité ne dépend pas d’un aiguillage interne. En contrepartie, chaque token coûte le modèle entier.

Le MoE

Un modèle « mixture of experts » stocke beaucoup de paramètres mais n’en active qu’une fraction par token, en routant chaque token vers les experts pertinents. Dit simplement : beaucoup de connaissances stockées, peu de calcul dépensé à chaque mot — donc davantage de débit à énergie égale.

Le vocabulaire, en clair

Trois mots qui décident du coût réel

Quantification

Les poids d’un modèle peuvent être stockés avec une précision réduite. Le modèle occupe alors nettement moins de mémoire vidéo et se lit plus vite, au prix d’une approximation des poids. C’est ce qui permet de servir un modèle sérieux sur une carte raisonnable, plutôt que d’empiler du matériel. Le format retenu se décide par la mesure, carte par carte et modèle par modèle.

Décodage spéculatif

Plutôt que de produire un mot puis d’attendre, le moteur propose plusieurs tokens d’avance et le modèle les vérifie d’un bloc. Ce qui est validé est gardé, le reste est jeté. Le texte produit reste identique : seul le temps d’attente diminue.

Débit mesuré

Nous tenons nos propres bancs de mesure, et nous publions ce qu’ils donnent dans le carnet « Découvertes ». Un débit n’a de sens qu’attaché à un modèle, à une carte, à une longueur de contexte et à un nombre de requêtes simultanées : c’est pourquoi nous le remesurons sur votre cas avant de chiffrer, plutôt que d’afficher un chiffre de brochure.

Ce qui est inclus

Le périmètre, sans zone grise

  • Modèles ouverts servis depuis nos propres nodes GPU
  • Architecture (dense ou MoE) et dimensionnement choisis selon votre besoin de qualité, de débit et de contexte
  • Débit et longueur de contexte mesurés sur votre cas avant chiffrage
  • Vauban, notre IA gardienne hébergée en local, supervise la disponibilité et la sobriété
  • Prompts et données traités en France, hors Cloud Act
  • Retours d’expérience publiés dans le carnet « Découvertes »
Vauban

Une IA gardienne, hébergée en local

Comme les forteresses qui veillent sur Briançon, Vauban veille sur l’infrastructure. C’est notre IA gardienne : elle tourne sur nos propres machines, en France, et ne délègue sa surveillance à aucun service tiers. Elle observe en continu, 24/7, sans intervention humaine.

  • Disponibilité des services — chaque workload répond ; les services endormis se réveillent à la demande.
  • Sobriété énergétique — traque du gaspillage : ressources sur-dimensionnées, workloads jamais mis en veille.
  • Performance et conformité — contrôle continu des bonnes pratiques : performance, sécurité, éco-conception.
Illustration à l’encre : un cœur de calcul relié à un réseau de connexions.
L’inférence et sa surveillance vivent sur le même site, à Briançon.
Pour qui

À qui ce service s’adresse

  • Organisations qui veulent de l'IA sans exporter leurs documents internes
  • Équipes techniques qui évaluent le coût réel de l’inférence auto-hébergée
  • Structures publiques et professions à secret (santé, droit, RH)
Comment on démarre

Trois étapes, pas de formulaire

  1. Vous écrivez

    Un mail suffit : décrivez vos cas d’usage, la sensibilité des documents concernés et le volume attendu.

  2. On qualifie et on mesure

    On choisit l’architecture — dense ou MoE — selon votre besoin de qualité, de débit et de longueur de contexte, puis on mesure sur votre cas plutôt que sur une brochure.

  3. On met en service

    Les modèles sont servis depuis nos GPU, supervisés par Vauban. Vos prompts et vos données restent en France.

Les faits
  • Modèles Ouverts, poids téléchargeables
  • Débit Mesuré sur votre cas
  • Supervision Vauban, en local
  • Données 100 % France
Le carnet

Nos retours d’expérience sont publics

Choix du matériel, quantification, contexte long, mesures de débit : ce que nous apprenons en servant des modèles est écrit dans « Découvertes », notre carnet technique. Vous pouvez juger sur pièces avant de nous écrire.

Prise de contact

Décrivez vos cas d’usage

Dites-nous ce que vous voulez faire faire à un modèle, et sur quels documents. On répond avec une architecture, une mesure et un chiffrage.

Sur devis, dimensionné au besoin réel.