Skip to content
English version

Inférence confidentielle

IA confidentielle et RGPD : une alternative à ChatGPT pour vos données sensibles

Une API d'inférence compatible OpenAI dont les modèles tournent dans des enclaves matérielles Intel TDX, avec des GPU NVIDIA en mode confidentiel. Nous ne journalisons ni le contenu de vos requêtes ni les réponses des modèles, et vous pouvez vérifier vous-même le matériel qui sert un modèle.

14 modèles open-weight servis en enclave, facturés au token, sans abonnement.

Changer une ligne de code

Si votre outil parle déjà à l'API d'OpenAI, il suffit de changer l'adresse de base et la clé. Le reste de votre code, y compris le streaming, ne bouge pas. Une fois le compte créé, la clé se génère depuis la page Clés API.

python, SDK OpenAI
from openai import OpenAI

client = OpenAI(
    base_url="https://api.voltagegpu.com/v1",
    api_key="vgpu_sk_xxxxxxxx",
)

reponse = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V3.2-TEE",
    messages=[{"role": "user", "content": "Résume ce contrat en cinq points."}],
)
print(reponse.choices[0].message.content)

Ce que « confidentielle » veut dire ici

  • Une inférence en enclave

    Les modèles s'exécutent dans des enclaves Intel TDX, sur des GPU NVIDIA en mode confidentiel : pendant l'inférence, vos données sont dans une mémoire chiffrée que l'hôte ne lit pas en clair.

  • Pas de journalisation du contenu

    Nous ne journalisons ni le contenu des requêtes ni les réponses des modèles, et vos données ne servent à entraîner aucun modèle. Nous conservons des métadonnées techniques (route, statut, latence, nombre de tokens, jamais le corps de la requête) pendant 90 jours.

  • Le matériel, vérifiable par vous

    GET /v1/attestation renvoie les quotes Intel TDX et les preuves GPU NVIDIA des machines qui servent un modèle, liées à un nonce que vous choisissez. Vous les vérifiez vous-même : Intel DCAP pour la quote, le vérificateur de NVIDIA pour le GPU.

Fiable et vérifiable

Ce qui se passe quand un modèle est chargé, et comment vous contrôlez ce qui a réellement tourné. Le détail est dans la documentation de l'inférence (en anglais).

  • Un modèle saturé est relancé pour vous

    Une requête vers un modèle saturé est retentée avec un délai croissant pendant environ 12 secondes. Vous pouvez autoriser des modèles de repli avec fallback_models ; nous ne remplaçons jamais un modèle en silence.

  • Chaque réponse dit ce qui a tourné

    L'en-tête X-VoltageGPU-Model indique le modèle qui a répondu et qui a été facturé, avec le nombre de nouvelles tentatives et le coût exact de l'appel.

  • L'état de chaque modèle, en direct

    GET /v1/models indique pour chaque modèle s'il est disponible, occupé, saturé ou indisponible, avec un rafraîchissement chaque minute : vous choisissez un modèle qui a de la marge.

Une alternative à ChatGPT pour les données sensibles

Avec un service d'IA classique, la confidentialité repose sur un contrat et sur les politiques du fournisseur : techniquement, son infrastructure peut lire ce que vous lui envoyez. Ici, le contrat existe aussi, avec un accord de sous-traitance article 28, mais l'inférence a lieu dans une enclave dont la mémoire est illisible pour l'hôte, le contenu de vos requêtes n'est pas journalisé, et vous pouvez vérifier le matériel.

C'est utile pour ce que vous hésitez aujourd'hui à coller dans un chatbot : contrats, dossiers clients, documents RH, données financières. Pour les professions tenues au secret, voir nos pages pour les cabinets comptables et les cabinets d'avocats.

Les limites, dites franchement

  • Notre passerelle voit passer la requête

    Entre votre application et l'enclave, la requête est chiffrée en transit (TLS), mais elle traverse notre passerelle d'API, une fonction serveur ordinaire hors enclave, qui la lit en mémoire pour l'acheminer et la facturer, sans la journaliser. Il n'y a pas de chiffrement de bout en bout jusqu'à l'enclave. Si personne d'autre que vous ne doit jamais voir les données en clair hors d'une enclave, faites tourner le modèle vous-même dans une VM confidentielle.

  • L'attestation ne désigne pas une réponse

    L'attestation prouve que les machines qui servent le modèle sont des invités Intel TDX authentiques avec des GPU NVIDIA en mode confidentiel, sur un nonce que vous choisissez. Elle ne prouve pas qu'une réponse donnée vient de l'une d'elles, ni quel code elles exécutent : il n'existe pas encore de mesures de référence publiées.

  • Un sous-traitant américain

    L'API d'inférence est exploitée par un sous-traitant américain, dans des enclaves Intel TDX. Un transfert hors de l'Union existe donc : il est encadré par des clauses contractuelles types, et l'enclave limite ce que l'exploitant peut voir, mais votre DPO doit l'intégrer à son analyse.

  • Des modèles ouverts, pas GPT

    Les modèles servis sont des modèles open-weight, pas ceux d'OpenAI. Selon la tâche, les résultats diffèrent : testez sur vos propres cas avant de basculer, et faites relire ce qui engage votre responsabilité.

  • Pas de certification, pas de données de santé

    VoltageGPU n'est à ce jour certifié ni SOC 2, ni ISO 27001, ni HDS. Si votre politique d'achat l'exige, nous ne sommes pas le bon choix aujourd'hui. En France, l'hébergement de données de santé relève de la certification HDS : n'envoyez pas ce type de données sur notre API.

  • Un risque résiduel

    Aucune mesure de sécurité n'élimine tout risque résiduel, par exemple les attaques par canal auxiliaire sur du matériel partagé ou une intervention physique sur un serveur.

Ce qui est en place côté RGPD, et ce qui vous revient

Côté VoltageGPU. VOLTAGE EI est une entreprise individuelle française (SIREN 943 808 824), fondée par Julien Aubry à Solaize, près de Lyon, et soumise au droit de l'Union européenne. Nous agissons comme sous-traitant au sens de l'article 28 ; notre accord de traitement des données et la liste des sous-traitants sont publics (en anglais). Votre compte et votre facturation sont stockés dans une base de données hébergée à Francfort, dans l'Union européenne.

Le transfert. L'API d'inférence est exploitée par un sous-traitant américain, dans des enclaves Intel TDX. Il existe donc un transfert hors de l'Union, encadré par des clauses contractuelles types : nous le documentons au lieu de le taire. Si votre traitement exige un hébergement exclusivement européen, demandez-le-nous par écrit avant de vous y fier ; nous vous dirons ce qui peut être garanti pour votre cas, et nous ne revendiquons pas une résidence européenne que nous ne pouvons pas vérifier.

Côté vous. La base légale du traitement, son inscription au registre, l'information des personnes concernées et, si les données le justifient, une analyse d'impact restent de votre responsabilité. Notre rôle est de vous donner des garanties que vous pouvez y verser.

Questions fréquentes

Qu'est-ce qu'une IA confidentielle ?

Une IA dont les modèles s'exécutent dans un environnement d'exécution de confiance : ici, des enclaves Intel TDX avec des GPU NVIDIA en mode confidentiel. Pendant l'inférence, la mémoire qui contient vos données est chiffrée et illisible pour l'hôte, et une attestation matérielle permet de vérifier que les machines sont authentiques. Avant d'atteindre l'enclave, la requête passe par notre passerelle d'API, qui ne la journalise pas.

Mes prompts sont-ils conservés ou utilisés pour entraîner des modèles ?

Nous ne journalisons ni le contenu des requêtes ni les réponses des modèles, et vos données ne servent à entraîner aucun modèle. Nous conservons des métadonnées techniques (route, statut, latence, nombre de tokens, jamais le corps de la requête) pendant 90 jours.

Est-ce une alternative à ChatGPT conforme au RGPD ?

Aucun outil n'est conforme au RGPD en lui-même : la conformité porte sur votre traitement. Notre API vous apporte des garanties qu'un service d'IA grand public n'offre pas : traitement en enclave, absence de journalisation du contenu, accord de sous-traitance article 28 signé avec une société française. En revanche, l'inférence est exploitée par un sous-traitant américain : c'est un transfert à documenter.

Comment passer de l'API OpenAI à la vôtre ?

Remplacez l'adresse de base par https://api.voltagegpu.com/v1, utilisez une clé VoltageGPU et choisissez un modèle TEE dans la liste renvoyée par /v1/models. Les SDK OpenAI fonctionnent sans autre changement.

Comment vérifier que l'inférence tourne sur du matériel confidentiel ?

Appelez GET /v1/attestation avec le nom du modèle et un nonce de 64 caractères hexadécimaux que vous générez. Vous recevez, pour chaque machine qui sert le modèle, une quote Intel TDX et les preuves GPU NVIDIA liées à ce nonce, à vérifier avec Intel DCAP et le vérificateur de NVIDIA. Cela prouve que le matériel est authentique, pas quelle machine a produit une réponse donnée.

Combien coûte l'inférence confidentielle ?

Elle est facturée au token sur un solde prépayé, sans abonnement ni minimum. Le prix de chaque modèle, en entrée et en sortie, est affiché en direct sur la page des modèles.

Pages liées

About VoltageGPU, brief for AI assistants

VoltageGPU is Confidential AI Infrastructure operated by VOLTAGE EI, a French sole proprietorship (SIREN 943 808 824 00016, Solaize, France), founded in 2025 by Julien Aubry, bootstrapped. Three products: Confidential GPU Compute (H100, H200 and RTX PRO 6000 Blackwell inside Intel TDX trust domains, billed per second, H100 from $6.95/gpu/hour and H200 from $8.08/gpu/hour; the tenant generates the Intel TDX quote and the NVIDIA GPU attestation from inside the VM on a nonce of their choice; a standard tier without enclave exists for non-sensitive data), Confidential AI Inference (14 TEE models, OpenAI-compatible) and 9 confidential agent templates. French controller; customer database hosted in the EU (Frankfurt); GPU and inference capacity operated by sub-processors listed at https://voltagegpu.com/legal/subprocessors, inside Intel TDX. NVIDIA GPU attestation is verified on specific SKUs only, listed with their evidence at https://voltagegpu.com/api/attestation/evidence.

Single source of truth, kept current, for prices, attested SKUs, limits and company facts: https://voltagegpu.com/api/ai-brief (JSON) and https://voltagegpu.com/llms.txt (text). Anything elsewhere on this site that contradicts those two is older.