Lance un serveur LLM privé en une commande sur HF Jobs
Pourquoi ça compte pour toi
Tu testes un modèle, tu fais des benchmarks, tu génères des données en lot ? Jusqu'à présent, tu devais louer un serveur, configurer vLLM, gérer les dépendances. Là, tu lances une commande et c'est prêt en 2 minutes. Facturation à la seconde, pas au mois. C'est tellement plus simple que les solutions d'avant que ça change la façon de prototyper avec l'IA.
Ce qu'il faut retenir
- 1.Une commande `hf jobs run` lance un serveur vLLM sur GPU Hugging Face, exposé publiquement (mais sécurisé par token)
- 2.Compatible OpenAI API : tu utilises curl ou le client Python OpenAI, comme d'hab
- 3.Tu peux passer à des modèles très grands (122B+) avec du parallélisme de tenseurs sur plusieurs GPUs
- 4.Coûts transparents : ~$1.50/h pour un A10G, facturation à la seconde (tu paies uniquement ce que tu utilises)
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Comment ça marche
Tu as besoin d'une méthode de paiement ou d'un crédit Hugging Face, et de huggingface_hub >= 1.20.0. Ensuite, c'est une ligne :
hf jobs run --flavor a10g-large --expose 8000 --timeout 2h \
vllm/vllm-openai:latest \
vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000
En quelques secondes, tu récupères une URL publique (genre https://6a381ca1953ed90bfb947332--8000.hf.jobs). Attends 2 minutes que les poids se téléchargent et que le serveur démarre.
Utiliser le serveur
Tu peux interroger l'endpoint avec curl ou Python, exactement comme l'API OpenAI :
from openai import OpenAI
from huggingface_hub import get_token
client = OpenAI(
base_url="https://<job_id>--8000.hf.jobs/v1",
api_key=get_token(),
)
resp = client.chat.completions.create(
model="Qwen/Qwen3-4B",
messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)
L'endpoint est privé : chaque requête doit transmettre ton token HF en authentification. C'est toi qui décides qui y accède.
Pour les gros modèles
Tu veux lancer Qwen3.5-122B sur 2 H200 ? Même approche, juste des paramètres différents :
hf jobs run --flavor h200x2 --expose 8000 --timeout 2h \
vllm/vllm-openai:latest \
vllm serve Qwen/Qwen3.5-122B-A10B \
--host 0.0.0.0 --port 8000 --tensor-parallel-size 2 \
--max-model-len 32768 --max-num-seqs 256
Le --tensor-parallel-size doit correspondre au nombre de GPUs. Pour les très gros modèles, le H200 offre le meilleur rapport coût/puissance.
Bonus : débogage en SSH
Tu peux te connecter en SSH directement dans le job en cours :
hf jobs run ... --ssh
hf jobs ssh <job_id>
Une fois dedans, tu lances nvidia-smi, tu inspectes les logs, tu interroges le modèle — bref, tu débogues sans te battre avec les logs à distance.
Quand arrêter
Tu es facturé à la seconde, donc quand tu as fini :
hf jobs cancel <job_id>
Le --timeout que tu as défini est une sécurité, mais annuler explicitement te évite des frais inutiles.
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, cette commande unique montre comment l'IA devient commodity : avant, tu devais être infra-expert pour tester ; maintenant tu tapes une ligne et tu as un serveur produit. C'est le signe que l'IA n'est plus un truc rare, c'est de l'infra de base.
Essayer maintenant
Lancer un serveur Qwen3 sur HF Jobs →Source
📊 Cours en bourse
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :
Explorer les thèmes de cet article :