Inférence confidentielle
IA confidentielle et RGPD : une alternative à ChatGPT pour vos données sensibles
Une API d'inférence compatible OpenAI dont les modèles tournent dans des enclaves matérielles Intel TDX, avec des GPU NVIDIA en mode confidentiel. Nous ne journalisons ni le contenu de vos requêtes ni les réponses des modèles, et vous pouvez vérifier vous-même le matériel qui sert un modèle.
14 modèles open-weight servis en enclave, facturés au token, sans abonnement.
01 / intégration
Changer une ligne de code
Si votre outil parle déjà à l'API d'OpenAI, il suffit de changer l'adresse de base et la clé. Le reste de votre code, y compris le streaming, ne bouge pas. Une fois le compte créé, la clé se génère depuis la page Clés API.
from openai import OpenAI
client = OpenAI(
base_url="https://api.voltagegpu.com/v1",
api_key="vgpu_sk_xxxxxxxx",
)
reponse = client.chat.completions.create(
model="deepseek-ai/DeepSeek-V3.2-TEE",
messages=[{"role": "user", "content": "Résume ce contrat en cinq points."}],
)
print(reponse.choices[0].message.content)02 / confidentialité
Ce que « confidentielle » veut dire ici
Une inférence en enclave
Les modèles s'exécutent dans des enclaves Intel TDX, sur des GPU NVIDIA en mode confidentiel : pendant l'inférence, vos données sont dans une mémoire chiffrée que l'hôte ne lit pas en clair.
Pas de journalisation du contenu
Nous ne journalisons ni le contenu des requêtes ni les réponses des modèles, et vos données ne servent à entraîner aucun modèle. Nous conservons des métadonnées techniques (route, statut, latence, nombre de tokens, jamais le corps de la requête) pendant 90 jours.
Le matériel, vérifiable par vous
GET /v1/attestation renvoie les quotes Intel TDX et les preuves GPU NVIDIA des machines qui servent un modèle, liées à un nonce que vous choisissez. Vous les vérifiez vous-même : Intel DCAP pour la quote, le vérificateur de NVIDIA pour le GPU.
03 / fiabilité
Fiable et vérifiable
Ce qui se passe quand un modèle est chargé, et comment vous contrôlez ce qui a réellement tourné. Le détail est dans la documentation de l'inférence (en anglais).
Un modèle saturé est relancé pour vous
Une requête vers un modèle saturé est retentée avec un délai croissant pendant environ 12 secondes. Vous pouvez autoriser des modèles de repli avec fallback_models ; nous ne remplaçons jamais un modèle en silence.
Chaque réponse dit ce qui a tourné
L'en-tête X-VoltageGPU-Model indique le modèle qui a répondu et qui a été facturé, avec le nombre de nouvelles tentatives et le coût exact de l'appel.
L'état de chaque modèle, en direct
GET /v1/models indique pour chaque modèle s'il est disponible, occupé, saturé ou indisponible, avec un rafraîchissement chaque minute : vous choisissez un modèle qui a de la marge.
04 / alternative
Une alternative à ChatGPT pour les données sensibles
Avec un service d'IA classique, la confidentialité repose sur un contrat et sur les politiques du fournisseur : techniquement, son infrastructure peut lire ce que vous lui envoyez. Ici, le contrat existe aussi, avec un accord de sous-traitance article 28, mais l'inférence a lieu dans une enclave dont la mémoire est illisible pour l'hôte, le contenu de vos requêtes n'est pas journalisé, et vous pouvez vérifier le matériel.
C'est utile pour ce que vous hésitez aujourd'hui à coller dans un chatbot : contrats, dossiers clients, documents RH, données financières. Pour les professions tenues au secret, voir nos pages pour les cabinets comptables et les cabinets d'avocats.
05 / limites
Les limites, dites franchement
Notre passerelle voit passer la requête
Entre votre application et l'enclave, la requête est chiffrée en transit (TLS), mais elle traverse notre passerelle d'API, une fonction serveur ordinaire hors enclave, qui la lit en mémoire pour l'acheminer et la facturer, sans la journaliser. Il n'y a pas de chiffrement de bout en bout jusqu'à l'enclave. Si personne d'autre que vous ne doit jamais voir les données en clair hors d'une enclave, faites tourner le modèle vous-même dans une VM confidentielle.
L'attestation ne désigne pas une réponse
L'attestation prouve que les machines qui servent le modèle sont des invités Intel TDX authentiques avec des GPU NVIDIA en mode confidentiel, sur un nonce que vous choisissez. Elle ne prouve pas qu'une réponse donnée vient de l'une d'elles, ni quel code elles exécutent : il n'existe pas encore de mesures de référence publiées.
Un sous-traitant américain
L'API d'inférence est exploitée par un sous-traitant américain, dans des enclaves Intel TDX. Un transfert hors de l'Union existe donc : il est encadré par des clauses contractuelles types, et l'enclave limite ce que l'exploitant peut voir, mais votre DPO doit l'intégrer à son analyse.
Des modèles ouverts, pas GPT
Les modèles servis sont des modèles open-weight, pas ceux d'OpenAI. Selon la tâche, les résultats diffèrent : testez sur vos propres cas avant de basculer, et faites relire ce qui engage votre responsabilité.
Pas de certification, pas de données de santé
VoltageGPU n'est à ce jour certifié ni SOC 2, ni ISO 27001, ni HDS. Si votre politique d'achat l'exige, nous ne sommes pas le bon choix aujourd'hui. En France, l'hébergement de données de santé relève de la certification HDS : n'envoyez pas ce type de données sur notre API.
Un risque résiduel
Aucune mesure de sécurité n'élimine tout risque résiduel, par exemple les attaques par canal auxiliaire sur du matériel partagé ou une intervention physique sur un serveur.
06 / RGPD
Ce qui est en place côté RGPD, et ce qui vous revient
Côté VoltageGPU. VOLTAGE EI est une entreprise individuelle française (SIREN 943 808 824), fondée par Julien Aubry à Solaize, près de Lyon, et soumise au droit de l'Union européenne. Nous agissons comme sous-traitant au sens de l'article 28 ; notre accord de traitement des données et la liste des sous-traitants sont publics (en anglais). Votre compte et votre facturation sont stockés dans une base de données hébergée à Francfort, dans l'Union européenne.
Le transfert. L'API d'inférence est exploitée par un sous-traitant américain, dans des enclaves Intel TDX. Il existe donc un transfert hors de l'Union, encadré par des clauses contractuelles types : nous le documentons au lieu de le taire. Si votre traitement exige un hébergement exclusivement européen, demandez-le-nous par écrit avant de vous y fier ; nous vous dirons ce qui peut être garanti pour votre cas, et nous ne revendiquons pas une résidence européenne que nous ne pouvons pas vérifier.
Côté vous. La base légale du traitement, son inscription au registre, l'information des personnes concernées et, si les données le justifient, une analyse d'impact restent de votre responsabilité. Notre rôle est de vous donner des garanties que vous pouvez y verser.
FAQ
Questions fréquentes
Qu'est-ce qu'une IA confidentielle ?
Une IA dont les modèles s'exécutent dans un environnement d'exécution de confiance : ici, des enclaves Intel TDX avec des GPU NVIDIA en mode confidentiel. Pendant l'inférence, la mémoire qui contient vos données est chiffrée et illisible pour l'hôte, et une attestation matérielle permet de vérifier que les machines sont authentiques. Avant d'atteindre l'enclave, la requête passe par notre passerelle d'API, qui ne la journalise pas.
Mes prompts sont-ils conservés ou utilisés pour entraîner des modèles ?
Nous ne journalisons ni le contenu des requêtes ni les réponses des modèles, et vos données ne servent à entraîner aucun modèle. Nous conservons des métadonnées techniques (route, statut, latence, nombre de tokens, jamais le corps de la requête) pendant 90 jours.
Est-ce une alternative à ChatGPT conforme au RGPD ?
Aucun outil n'est conforme au RGPD en lui-même : la conformité porte sur votre traitement. Notre API vous apporte des garanties qu'un service d'IA grand public n'offre pas : traitement en enclave, absence de journalisation du contenu, accord de sous-traitance article 28 signé avec une société française. En revanche, l'inférence est exploitée par un sous-traitant américain : c'est un transfert à documenter.
Comment passer de l'API OpenAI à la vôtre ?
Remplacez l'adresse de base par https://api.voltagegpu.com/v1, utilisez une clé VoltageGPU et choisissez un modèle TEE dans la liste renvoyée par /v1/models. Les SDK OpenAI fonctionnent sans autre changement.
Comment vérifier que l'inférence tourne sur du matériel confidentiel ?
Appelez GET /v1/attestation avec le nom du modèle et un nonce de 64 caractères hexadécimaux que vous générez. Vous recevez, pour chaque machine qui sert le modèle, une quote Intel TDX et les preuves GPU NVIDIA liées à ce nonce, à vérifier avec Intel DCAP et le vérificateur de NVIDIA. Cela prouve que le matériel est authentique, pas quelle machine a produit une réponse donnée.
Combien coûte l'inférence confidentielle ?
Elle est facturée au token sur un solde prépayé, sans abonnement ni minimum. Le prix de chaque modèle, en entrée et en sortie, est affiché en direct sur la page des modèles.
Aller plus loin
Pages liées
- GPU confidentielUne VM Intel TDX avec GPU attesté, pour vos propres modèles.
- IA et données sensibles en entrepriseCe que dit le RGPD, article détaillé.
- Confidential AI InferenceLa page détaillée, avec le catalogue en direct.en anglais
- SécuritéArchitecture, journalisation, protection des données.en anglais