Inférence LLM open source souveraine
Des modèles ouverts servis depuis nos GPU — vos prompts restent en France.
Sur devis, dimensionné au besoin réel.
Un prompt, c’est une donnée métier
Envoyer vos prompts à une API américaine, c'est exporter vos données métier — souvent les plus sensibles — hors de l'Union européenne, et dépendre d'un modèle qui peut changer ou disparaître du jour au lendemain.
Un contrat relu, un dossier patient résumé, un cahier des charges reformulé : ce que vous envoyez à un modèle est souvent ce que vous avez de plus sensible. La question n’est pas seulement « le modèle est-il bon », mais « où part le texte, et sous quelle juridiction ».
Des modèles ouverts, servis depuis nos GPU
Nous servons des modèles ouverts depuis nos propres nodes GPU. Le texte que vous envoyez est traité sur notre matériel, en France, et n’est confié à aucune API tierce.
Les poids sont ouverts et téléchargeables : le modèle que vous validez aujourd’hui ne peut pas être retiré du catalogue ni remplacé par une autre version du jour au lendemain. Ce que vous recettez reste ce que vous servez.
Deux familles de modèles, deux usages
Nous servons des modèles à poids ouverts, dans deux architectures qui ne se choisissent pas au hasard. Le modèle retenu pour votre cas est arrêté au cadrage : l'écosystème bouge trop vite pour qu'un nom gravé sur une page ait un sens.
Le dense
Un modèle dense mobilise l’intégralité de ses paramètres à chaque token généré. C’est le calcul le plus régulier et le plus prévisible : la qualité ne dépend pas d’un aiguillage interne. En contrepartie, chaque token coûte le modèle entier.
Le MoE
Un modèle « mixture of experts » stocke beaucoup de paramètres mais n’en active qu’une fraction par token, en routant chaque token vers les experts pertinents. Dit simplement : beaucoup de connaissances stockées, peu de calcul dépensé à chaque mot — donc davantage de débit à énergie égale.
Trois mots qui décident du coût réel
Quantification
Les poids d’un modèle peuvent être stockés avec une précision réduite. Le modèle occupe alors nettement moins de mémoire vidéo et se lit plus vite, au prix d’une approximation des poids. C’est ce qui permet de servir un modèle sérieux sur une carte raisonnable, plutôt que d’empiler du matériel. Le format retenu se décide par la mesure, carte par carte et modèle par modèle.
Décodage spéculatif
Plutôt que de produire un mot puis d’attendre, le moteur propose plusieurs tokens d’avance et le modèle les vérifie d’un bloc. Ce qui est validé est gardé, le reste est jeté. Le texte produit reste identique : seul le temps d’attente diminue.
Débit mesuré
Nous tenons nos propres bancs de mesure, et nous publions ce qu’ils donnent dans le carnet « Découvertes ». Un débit n’a de sens qu’attaché à un modèle, à une carte, à une longueur de contexte et à un nombre de requêtes simultanées : c’est pourquoi nous le remesurons sur votre cas avant de chiffrer, plutôt que d’afficher un chiffre de brochure.
Le périmètre, sans zone grise
- Modèles ouverts servis depuis nos propres nodes GPU
- Architecture (dense ou MoE) et dimensionnement choisis selon votre besoin de qualité, de débit et de contexte
- Débit et longueur de contexte mesurés sur votre cas avant chiffrage
- Vauban, notre IA gardienne hébergée en local, supervise la disponibilité et la sobriété
- Prompts et données traités en France, hors Cloud Act
- Retours d’expérience publiés dans le carnet « Découvertes »
Une IA gardienne, hébergée en local
Comme les forteresses qui veillent sur Briançon, Vauban veille sur l’infrastructure. C’est notre IA gardienne : elle tourne sur nos propres machines, en France, et ne délègue sa surveillance à aucun service tiers. Elle observe en continu, 24/7, sans intervention humaine.
- Disponibilité des services — chaque workload répond ; les services endormis se réveillent à la demande.
- Sobriété énergétique — traque du gaspillage : ressources sur-dimensionnées, workloads jamais mis en veille.
- Performance et conformité — contrôle continu des bonnes pratiques : performance, sécurité, éco-conception.
À qui ce service s’adresse
- Organisations qui veulent de l'IA sans exporter leurs documents internes
- Équipes techniques qui évaluent le coût réel de l’inférence auto-hébergée
- Structures publiques et professions à secret (santé, droit, RH)
Trois étapes, pas de formulaire
-
Vous écrivez
Un mail suffit : décrivez vos cas d’usage, la sensibilité des documents concernés et le volume attendu.
-
On qualifie et on mesure
On choisit l’architecture — dense ou MoE — selon votre besoin de qualité, de débit et de longueur de contexte, puis on mesure sur votre cas plutôt que sur une brochure.
-
On met en service
Les modèles sont servis depuis nos GPU, supervisés par Vauban. Vos prompts et vos données restent en France.
- Modèles Ouverts, poids téléchargeables
- Débit Mesuré sur votre cas
- Supervision Vauban, en local
- Données 100 % France
Nos retours d’expérience sont publics
Choix du matériel, quantification, contexte long, mesures de débit : ce que nous apprenons en servant des modèles est écrit dans « Découvertes », notre carnet technique. Vous pouvez juger sur pièces avant de nous écrire.
Décrivez vos cas d’usage
Dites-nous ce que vous voulez faire faire à un modèle, et sur quels documents. On répond avec une architecture, une mesure et un chiffrage.
Sur devis, dimensionné au besoin réel.