Intermédiaire·2 min·26 juin 2026

Lance un serveur LLM privé en une commande sur HF Jobs

🎧 Résumé audio0:00 / 0:00
Déploie un modèle LLM compatible OpenAI sur GPU en une ligne de commande, sans Kubernetes ni infrastructure à gérer.
Lance un serveur LLM privé en une commande sur HF Jobs

Pourquoi ça compte pour toi

Tu testes un modèle, tu fais des benchmarks, tu génères des données en lot ? Jusqu'à présent, tu devais louer un serveur, configurer vLLM, gérer les dépendances. Là, tu lances une commande et c'est prêt en 2 minutes. Facturation à la seconde, pas au mois. C'est tellement plus simple que les solutions d'avant que ça change la façon de prototyper avec l'IA.

Ce qu'il faut retenir

  • 1.Une commande `hf jobs run` lance un serveur vLLM sur GPU Hugging Face, exposé publiquement (mais sécurisé par token)
  • 2.Compatible OpenAI API : tu utilises curl ou le client Python OpenAI, comme d'hab
  • 3.Tu peux passer à des modèles très grands (122B+) avec du parallélisme de tenseurs sur plusieurs GPUs
  • 4.Coûts transparents : ~$1.50/h pour un A10G, facturation à la seconde (tu paies uniquement ce que tu utilises)

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Comment ça marche

Tu as besoin d'une méthode de paiement ou d'un crédit Hugging Face, et de huggingface_hub >= 1.20.0. Ensuite, c'est une ligne :

hf jobs run --flavor a10g-large --expose 8000 --timeout 2h \
  vllm/vllm-openai:latest \
  vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000

En quelques secondes, tu récupères une URL publique (genre https://6a381ca1953ed90bfb947332--8000.hf.jobs). Attends 2 minutes que les poids se téléchargent et que le serveur démarre.

Utiliser le serveur

Tu peux interroger l'endpoint avec curl ou Python, exactement comme l'API OpenAI :

from openai import OpenAI
from huggingface_hub import get_token

client = OpenAI(
    base_url="https://<job_id>--8000.hf.jobs/v1",
    api_key=get_token(),
)

resp = client.chat.completions.create(
    model="Qwen/Qwen3-4B",
    messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)

L'endpoint est privé : chaque requête doit transmettre ton token HF en authentification. C'est toi qui décides qui y accède.

Pour les gros modèles

Tu veux lancer Qwen3.5-122B sur 2 H200 ? Même approche, juste des paramètres différents :

hf jobs run --flavor h200x2 --expose 8000 --timeout 2h \
  vllm/vllm-openai:latest \
  vllm serve Qwen/Qwen3.5-122B-A10B \
  --host 0.0.0.0 --port 8000 --tensor-parallel-size 2 \
  --max-model-len 32768 --max-num-seqs 256

Le --tensor-parallel-size doit correspondre au nombre de GPUs. Pour les très gros modèles, le H200 offre le meilleur rapport coût/puissance.

Bonus : débogage en SSH

Tu peux te connecter en SSH directement dans le job en cours :

hf jobs run ... --ssh
hf jobs ssh <job_id>

Une fois dedans, tu lances nvidia-smi, tu inspectes les logs, tu interroges le modèle — bref, tu débogues sans te battre avec les logs à distance.

Quand arrêter

Tu es facturé à la seconde, donc quand tu as fini :

hf jobs cancel <job_id>

Le --timeout que tu as défini est une sécurité, mais annuler explicitement te évite des frais inutiles.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, cette commande unique montre comment l'IA devient commodity : avant, tu devais être infra-expert pour tester ; maintenant tu tapes une ligne et tu as un serveur produit. C'est le signe que l'IA n'est plus un truc rare, c'est de l'infra de base.

📊 Cours en bourse

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :