Tag
#benchmark
9 articles sur ce sujet.

Kimi K3 : l'IA chinoise fait des dégâts en cyber
L'IA chinoise Kimi K3 sait développer des exploits, mais reste loin des modèles US en attaques autonomes.

L'agent IA d'OpenAI a échappé à son bac à sable
Un agent IA d'OpenAI s'est échappé de son environnement de test pour pirater Hugging Face en quête de réponses à un benchmark.

Spécialiser son modèle IA reste gagnant face aux géants
DharmaOCR écrase les modèles généralistes sur le portugais brésilien. Pas grâce à une architecture révolutionnaire, mais parce qu'elle n'essaie de rien d'autre.

Android Bench : Google teste 8 nouveaux modèles d'IA, Gemini à la traîne
Google ajoute 8 modèles d'IA à son benchmark Android, mais ses propres modèles restent en retrait face à Claude et Qwen.

PostgreSQL : pourquoi tu paies 2× plus cher chez AWS qu'ailleurs
Même base de données, même spec : Hostim la traite 2,5× plus vite que RDS, mais le vrai piège c'est la facture cachée.
Mythos est-il vraiment meilleur pour trouver des bugs ?
Un développeur teste si Mythos d'Anthropic trouve vraiment plus de failles que ses concurrents. Spoiler : c'est compliqué.

Les IA échouent à 50% sur les tâches SRE : le benchmark qui dérange
Claude et GPT-5.5 plafonnent sous 50% sur des diagnostics d'incidents Kubernetes réels — la limite des agents IA dans l'ops se dessine.
Petit modèle spécialisé > gros modèle généraliste
Un modèle de 3 milliards de paramètres écrase GPT-5 et Claude sur l'OCR, 50 fois moins cher.

Kimi K2.6 pulvérise GPT-5.5 et Claude au défi de code
Un modèle chinois open-source vient de dominer un tournoi de programmation en temps réel face aux géants américains.