Ok - c'est pourquoi vous ne devriez jamais faire confiance aux benchmarks d'IA.
Une étude récente a comparé Opus 4.6 (le dernier modèle Claude) versus Opus 4.5 sur 165 tâches différentes. La recherche approfondie a conclu qu'Opus 4.6 n'était pas meilleur que le modèle précédent. Mais Opus 4.6 a fait cela avec 50 % du coût et 50 % du temps de traitement. Des améliorations massives, il faut simplement se méfier des titres de benchmarks. La meilleure façon de déterminer si un modèle est meilleur que les versions précédentes est de le tester pour vos besoins spécifiques. En tout cas, bravo à l'équipe d'Anthropic pour cette réduction massive des coûts et du temps de traitement.
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
Ok - c'est pourquoi vous ne devriez jamais faire confiance aux benchmarks d'IA.
Une étude récente a comparé Opus 4.6 (le dernier modèle Claude) versus Opus 4.5 sur 165 tâches différentes.
La recherche approfondie a conclu qu'Opus 4.6 n'était pas meilleur que le modèle précédent.
Mais Opus 4.6 a fait cela avec 50 % du coût et 50 % du temps de traitement.
Des améliorations massives, il faut simplement se méfier des titres de benchmarks.
La meilleure façon de déterminer si un modèle est meilleur que les versions précédentes est de le tester pour vos besoins spécifiques.
En tout cas, bravo à l'équipe d'Anthropic pour cette réduction massive des coûts et du temps de traitement.