Avancé·3 min·20 juillet 2026

LoRA Speedrun : le championnat public du fine-tuning rapide

🎧 Résumé audio0:00 / 0:00
Un classement public chronométré pour affiner des modèles plus vite : compétition transparente, vérification triple, zéro marketing.
LoRA Speedrun : le championnat public du fine-tuning rapide

Pourquoi ça compte pour toi

Le fine-tuning avec LoRA c'est la vraie vie en prod — pas les architectures exotiques des papers. Mais personne ne savait vraiment qui était le plus rapide, sur quel hardware, avec quels tricks. Là, tu as une arène neutre où les techniques s'affrontent sur les mêmes règles : un modèle, une data, un GPU, des chiffres vérifiés 3× par des tiers.

Ce qu'il faut retenir

  • 1.Classement public : affine Qwen2.5-1.5B sur GSM8K, record actuel 6m 05s (sequence packing + masking)
  • 2.Vérification contradictoire : chaque record relancé 3× avec des seeds différentes sur hardware identique avant de compter
  • 3.Gratuit pour toi : Modal offre les crédits de calcul, quiconque peut soumettre une PR et vérifier n'importe quel record
  • 4.Même ADN que nanoGPT speedrun : une tâche gelée, un GPU gelé, le temps réel comme seule métrique — force kernels et algos à concourir en vraie monnaie

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Pourquoi ça change la donne

LoRA/QLoRA c'est comment tu finetunes vraiment en production — pas les architectures folles des papers. Mais le marché des techniques explosait sans arbitre : DoRA, rsLoRA, PiSSA, LoRA+, NEFTune, kernels Unsloth, méthodes rank-adaptatives. Chacun publie ses chiffres sur des modèles, data et hardware différents. Rien n'est comparable.

LoRA Speedrun règle ça : une tâche identique, un GPU (L40S Modal), temps réel mesuré, et des preuves.

Comment ça marche concrètement

Tu clones le repo, tu crées ton script d'entraînement basé sur le gabarit, tu ouvres une PR. La CI valide statiquement. Un Claude de sécurité scanne ta diff (tentatives d'exfiltration, contact avec le jeu de test). Un mainteneur review, puis déclenche /verify qui relance ta soumission 3× avec des seeds frais dans un bac à sable Modal coupé du réseau sur la même L40S. Les 3 runs doivent passer la barre (≥57% sur GSM8K). Le temps officiel c'est la moyenne.

Le harness audite le nombre de paramètres de l'adaptateur, re-vérifie les hashes model/data (anti-triche), et publie le rapport sur la PR + commit dans records/verifications/.

Où tu peux creuser

Le record actuel (6m 05s) utilise le sequence packing + le masquage de perte sur les seules complétions en 2 epochs — 2× plus rapide que la baseline tout en étant plus précis (61,1% vs 59,4%).

La liste des pistes pas encore explorées c'est un buffet : LR agressif sur 1 epoch, élagage des données sur les exemples les plus durs, QLoRA NF4 vs bf16, rsLoRA/DoRA/PiSSA, LoRA+ (LR asymétrique pour A/B), bruit NEFTune, curriculum, recherche de rank/placement, torch.compile, kernels Unsloth/Liger.

L40S ? C'est la même puce (AD102) que la 4090 grand public, donc tes tricks se transfèrent. Et c'est gratuit via les crédits Modal.

Ce qui rend ça honnête

Temps réel vs FLOPs : le temps mesuré en conditions réelles c'est ce que tu paies. Ça force kernels, chargement des données et algos à concourir en vraie monnaie — pas du théorique.

Un GPU stable : un seul modèle de carte en datacenter, donc les temps sont vraiment comparables. Les cartes grand public louées varient d'un hôte à l'autre.

Bac à sable réseau coupé : le code des contributeurs extérieurs tourne isolé, zéro risque d'exfiltration.

La règle du jeu

Modèle de base gelé (Qwen2.5-1.5B), adaptateur PEFT uniquement (≤30M paramètres), jeu d'entraînement GSM8K (7473 exemples) figé. Tu contrôles tout le reste : rank et placement LoRA, quantization, calendriers LR, sequence packing, sélection des données, critère d'arrêt.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, suis le classement pour comprendre comment les techniques s'empilent : chaque record révèle un trick nouveau (sequence packing, flash attention, etc.), et tu vois en direct ce qui marche et ce qui est du hype.

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :