Pool B · AI et GPU baremetal

GPU H100, A100, L40S.
Modèles européens, latence sub-milliseconde.

Inférence LLM, fine-tuning, vision, vector DB. GPU bare-metal sans virtualisation, AI Gateway européen unifié, runtime isolé renforcé. Vos modèles tournent en France, vos prompts ne sortent jamais d'Europe.

À qui ça s'adresse

Quand l'utiliser, quand ne pas l'utiliser.

Le Pool B est dédié aux charges machine learning sur GPU. Les nœuds GPU sont isolés des Pools A et C : aucune app standard ne peut s'y planifier, et inversement vos jobs GPU ne perturbent pas vos apps web.

Idéal pour

  • Inférence LLM 7B à 70B (Llama, Mistral, Mixtral, etc.)
  • Fine-tuning LoRA / QLoRA sur datasets clients
  • Pipelines RAG avec embeddings et recherche vectorielle
  • Vision par ordinateur, OCR, traitement d'images en lot
  • Apps IA européennes avec contrainte de résidence des données

Pas adapté

  • Apps web sans dépendance GPU (préférer Pool A)
  • Backend PostgreSQL + auth + REST (préférer Pool C)
  • Training distribué multi-rack > 64 GPU (sur devis)
  • Rendu vidéo 3D temps réel pur (pas de support encodeur vidéo dédié)
Catalogue GPU

Trois GPU NVIDIA, dédiés ou à la minute.

GPU baremetal exposés sans couche de virtualisation : pas de partage en tranches virtuelles, pas de pénalité de performance. Facturation à l'heure d'utilisation effective.

GPUVRAMCas d'usage typiqueTarif horaire
L40S48 GBVision, fine-tuning mid-size, inférence LLM 13B1,80 €/h
A10080 GBLLM 13B à 70B, fine-tuning, training2,90 €/h
H10080 GB SXM5LLM 70B+ inférence, fine-tuning haut volume4,50 €/h

Tarification GPU détaillée et engagements →

Ce que vous obtenez

Une stack AI complète, sans assembler huit services.

Model serving, fine-tuning, AI Gateway, vector DB, runtime isolé, confidential computing, serverless GPU, microVM burst. Tout intégré au même tenant, même billing.

Inférence

Model serving

Déploiement de modèles via serveurs d'inférence haute performance. Auto-détection du format modèle (safetensors, GGUF) pour configuration automatique.

Training

Fine-tuning jobs

Entraînement LoRA et QLoRA sur GPU. Jobs indexés, checkpoints réguliers, résultat poussé dans le registry tenant.

Gateway

AI Gateway européen

Proxy unifié vers modèles locaux Pool B, OVHcloud AI Endpoints, OpenAI, Anthropic, Mistral. Quota par tenant, audit log, routage européen prioritaire.

Vector DB

Embeddings vectoriels

Recherche sémantique native dans PostgreSQL via extension vectorielle, ou base dédiée Qdrant. Index HNSW et IVFFLAT.

Serverless

Fonctions GPU à la demande

Invocation HTTP d'une fonction GPU. Pas de provisionnement préalable, facturation à la seconde d'exécution.

Burst

microVM burst

Workers GPU éphémères, cold start sous 100 ms. Workloads event-driven, isolation par microVM.

Isolation

Runtime isolé renforcé

Chaque tenant tourne dans un runtime container isolé du noyau hôte. Pas d'évasion possible vers les nœuds GPU partagés.

Confidentialité

Confidential computing

Enclaves matérielles disponibles sur plans Pro+ et Entreprise. Mémoire chiffrée, attestations cryptographiques. Vos prompts restent illisibles par l'opérateur.

Métriques

Observabilité GPU

Utilisation VRAM, throughput tokens par seconde, température, puissance consommée. Métriques exposées par défaut.

AI Gateway — point d'entrée unifié

Une API. Tous les modèles. Toujours européen d'abord.

L'AI Gateway expose un endpoint compatible OpenAI. Vous changez l'URL de base et le modèle, le code reste le même.

# Compatible OpenAI SDK
from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gateway.runtime.di2amp.com/v1",
    api_key=os.environ["PAAS_AI_KEY"]
)

# Modèle local Pool B (européen, latence sub-ms)
response = client.chat.completions.create(
    model="llama-3-70b-fr",
    messages=[{"role": "user", "content": "Bonjour"}]
)

# Routage automatique : local Pool B → OVH AI → Mistral → fournisseur tiers
# Quota et audit par tenant, audit log RGPD

Découvrir l'AI Gateway en détail →

Documentation détaillée

Pages disponibles et à venir.

La documentation Pool B est en cours d'enrichissement. Voici ce qui est déjà ligne, et ce qui arrive bientôt.

Pages techniques à venir (Pool B documentation détaillée) :

SOONGPU baremetal — catalogue complet·
SOONModel serving — déploiement et scaling·
SOONFine-tuning LoRA et QLoRA·
SOONVector DB — embeddings et recherche·
SOONFonctions serverless GPU·
SOONmicroVM burst — workloads event-driven·
SOONRuntime isolé renforcé·
SOONConfidential computing — enclaves matérielles·
Tarification

Vous payez le GPU à l'heure utilisée. Rien d'autre.

La tarification Pool B est à l'usage GPU strict. Pas de frais fixes mensuels obligatoires pour utiliser le pool. Les plans Pool A et Pool C restent indépendants.

GPUTarif horaireEngagement mensuelEngagement annuel
L40S 48 GB1,80 €/h~900 €/mois (24/7)~7 200 €/an (-33 %)
A100 80 GB2,90 €/h~1 450 €/mois (24/7)~11 600 €/an (-33 %)
H100 80 GB SXM54,50 €/h~2 250 €/mois (24/7)~18 000 €/an (-33 %)

Tarification complète, packs serveur dédié et SLA →

GPU européens. API que vous connaissez.

Démarrez en quelques minutes : Free tier sur l'AI Gateway, GPU à l'heure dès le plan Pro. Aucune carte bancaire pour le Free tier.