Accueil / Tech News / IA : accumuler toujours plus de données ne garantit pas de meilleurs modèles

IA : accumuler toujours plus de données ne garantit pas de meilleurs modèles

À l’heure où la course à l’IA repose largement sur l’accumulation de données, ThinkForBL défend une approche différente : mieux vaut des données pertinentes et représentatives qu’un volume massif de données redondantes ou biaisées.

Pour entraîner leurs modèles d’IA, les entreprises cherchent généralement à disposer du plus grand volume de données possible. Mais cette logique du « toujours plus » se heurte au fait que toutes les données ne se valent pas.

C’est le message porté par ThinkForBL lors de l’AI Festa 2026. L’entreprise spécialisée dans l’évaluation de la fiabilité des systèmes d’IA a présenté une démonstration comparant des modèles entraînés sur des volumes de données différents, dont un jeu de 50 000 images et un autre de 2 000.

L’objectif n’est pas de démontrer qu’un petit jeu de données serait systématiquement préférable à un grand, mais de montrer que la quantité ne suffit pas à elle seule. Des doublons, des données surreprésentées ou des exemples qui ne correspondent pas aux conditions réelles d’utilisation peuvent influencer les résultats du modèle.

Le problème se déplace donc du modèle vers le jeu de données lui-même.

ThinkForBL parle notamment de « biais contextuel ». Le terme désigne une situation dans laquelle les données sont individuellement correctes, mais où leur répartition ne correspond pas suffisamment à l’environnement dans lequel l’IA sera utilisée.

Un modèle peut ainsi obtenir de bons résultats lors de ses tests tout en se comportant différemment lorsqu’il rencontre une situation moins représentée dans ses données d'entraînement.

Pour identifier ces problèmes, l'entreprise a développé Reeinn, une solution qui analyse les données utilisées pour entraîner les systèmes d’IA. Elle cherche notamment à détecter les redondances et les déséquilibres susceptibles d'affecter leur comportement.

Cette approche illustre une évolution plus large du marché de l’IA : évaluer un modèle uniquement sur son taux de réussite ne suffit plus. Sa robustesse face à des données différentes de celles rencontrées pendant l'entraînement devient elle aussi un critère important.

L’enjeu devient particulièrement important lorsque l’IA est déployée dans des environnements où une erreur peut avoir des conséquences importantes, comme les services publics, la sécurité ou la défense. Une question se pose alors : comment s’assurer qu’un système reste fiable lorsqu’il sort des conditions contrôlées de son développement ?

Cette problématique pourrait faire évoluer la manière dont les projets d’IA sont évalués. Il ne s’agit plus seulement de comparer les modèles sur la base de leurs performances à des benchmarks, mais aussi d’examiner les données qui ont servi à leur entraînement, les situations dans lesquelles ils ont été testés et leur capacité à conserver des résultats cohérents lorsque leur environnement évolue.

Dans cette perspective, le recours à des standards internationaux de fiabilité pourrait également prendre davantage d’importance. Ils permettraient de disposer de critères communs pour évaluer les systèmes d’IA, au-delà des méthodes ou des référentiels propres à chaque fournisseur.

L'intelligence artificielle devient un véritable tremplin professionnel. En automatisant les tâches chronophages, les salariés débloquent un temps précieux. Une aubaine financière pour ceux qui associent avec brio algorithmes et intelligence émotionnelle.

SAP se lance dans les paiements avec SAP Pay, un service intégré à son ERP cloud et opéré par sa filiale Tereina : il exécute et rapproche les règlements à l’échéance d’une facture, sans fichier manuel ni système externe.

Quelle que soit votre position sur la question de la conscience de l'IA, les chercheurs souhaitent que tout le monde prête attention à ce que les développeurs négligent.

Mistral AI a présenté son nouveau modèle, Mistral Large 4 baptisé "le Chonk." Avec plus de mille milliards de paramètres, ce nouveau modèle massif ambitionne de montrer que Mistral AI reste dans la course face à la concurrence.

Si vous souhaitez utiliser l'intelligence artificielle sous l’OS libre, découvrez ces options.

Même en version gratuite, cette application de montage vidéo regorge de fonctionnalités et est très simple d'utilisation.

Linux AI OS est une distribution qui intègre l'IA, qui se distingue des autres distributions par une fonctionnalité unique.

Si la dictée est votre méthode préférée pour prendre des notes et que vous travaillez sous l’OS libre, ce logiciel est certainement ce qu'il vous faut. Voici comment vous lancer.

Les contenus de mauvaise qualité produites par l’intelligence artificielle sont omniprésents, et il devient de plus en plus difficile de distinguer le vrai du faux. Ces conseils et outils peuvent vous aider.

Je ne suis pas développeur, mais j'ai réussi à utiliser une IA installée localement pour créer un logiciel d'écriture adapté à mes besoins. Voici comment j'ai procédé.

Quatre architectes de systèmes d'intelligence artificielle nous expliquent comment intégrer la supervision humaine dans les processus à haut risque.

Origine de l’article : lire l’article original

Traduction