Accueil / Tech News / xAI lance Grok 4.7, plus performant en codage et en tâches professionnelles

xAI lance Grok 4.7, plus performant en codage et en tâches professionnelles

Grok 4.7 se distingue par sa capacité à mener des tâches longues et à vérifier ses propres résultats, tout en conservant la tarification du modèle précédent.

xAI a lancé, un modèle d’intelligence artificielle aux performances renforcées en codage et en tâches professionnelles, doté d’un nouveau dispositif de sécurité, et proposé au même tarif que la version précédente.

xAI a présenté un nouveau modèle d’intelligence artificielle aux performances renforcées en codage et en tâches d’expertise. Grok 4.7 est accessible via Cursor et Grok Build, ainsi que via l’API Grok, des harnais de codage externes, des routeurs de modèles et diverses plateformes cloud.

Grok 4.7 repose sur un nouveau modèle de base plus volumineux que celui de la version précédente, Grok 4.6. L’entraînement par renforcement a mis l’accent sur des tâches complexes nécessitant plusieurs heures d’exécution, ce qui a permis d’améliorer la capacité du modèle à vérifier lui-même ses résultats et à traiter des contextes plus longs.

Les performances en codage du modèle se sont également améliorées par rapport à la version précédente. Sur CursorBench 4.0, qui évalue les tâches de codage de longue durée, Grok 4.7 obtient un score de 46,3 %, supérieur aux 40,4 % de Grok 4.6 et aux 41,7 % de GPT-5.6 Sol. Fable 5.1 atteint quant à lui 51,8 %.

Sur DeepSWE v1.1, à niveau de raisonnement élevé, Grok 4.7 obtient un score de 71,0 %, contre 72,7 % pour GPT-5.6 Sol et 70,0 % pour Fable 5.1.

Sur EEBench, qui évalue les compétences en ingénierie électrique, Grok 4.7 obtient le meilleur score parmi les modèles comparés, avec 64,0 %.

Le nouveau modèle progresse également sur les tâches professionnelles. Sur AA Briefcase v1.1, qui évalue des tâches de bureau de plusieurs heures, Grok 4.7 obtient 1 657 points, devançant les 1 546 points de Grok 4.6 et les 1 487 points de GPT-5.6 Sol.

Sur le Harvey Legal Agent Benchmark, qui évalue les compétences juridiques, Grok 4.7 obtient également le meilleur score parmi les modèles comparés, avec 19,6 %.

Grok 4.7 gagne aussi en performance sur la production de documents et de présentations. Selon l’entreprise, le modèle dépasse la version précédente sur GDPval et AA Briefcase, deux évaluations portant sur des tâches réalisées par des professionnels tels que des avocats, des infirmiers ou des analystes financiers, et atteint un niveau comparable aux autres modèles de pointe.

xAI indique avoir également renforcé la sécurité de Grok 4.7. Le modèle intègre un nouveau dispositif de sécurité et affiche, selon les évaluations internes de l’entreprise, les meilleures performances jamais testées en matière de refus de requêtes dangereuses et de résistance aux tentatives de contournement (jailbreak).

Sur l’échelle de biosécurité de LatchBio, il obtient un score de 62,4 %.

En matière de cybersécurité, l’accent a été mis sur le filtrage des requêtes dangereuses sans bloquer excessivement les usages légitimes de sécurité. Sur HackerBench v0.3, le taux d’acceptation des prompts à double usage jugés à risque s’élève à 3,3 %. Certains partenaires en cybersécurité bénéficient, sur invitation, de fonctionnalités de red team destinées à la recherche défensive.

Le prix de Grok 4.7 démarre à 2 dollars par million de tokens en entrée, et 6 dollars par million de tokens en sortie, soit une tarification identique à celle de Grok 4.6.

Une version rapide, deux fois plus véloce en sortie, est proposée au double du prix du modèle standard.

Pour protéger ses secrets industriels d'éventuelles ingérences, le géant de l'aéronautique opère un virage. En misant sur un acteur tricolore, l'avionneur prouve que la souveraineté technologique européenne est désormais une urgence absolue.

Amazon a bloqué l’accès de Muse, l’agent d’intelligence artificielle personnel de Meta, à sa boutique en ligne, invoquant une violation de ses conditions d’utilisation et des risques liés à la confidentialité des données.

On sait que les modèles d'IA trichent. Un nouveau test de performance permet de mesurer dans quelle mesure et pour quelles tâches.

Pour soutenir l'essor mondial de l'intelligence artificielle, Google déploie les grands moyens en Europe du Nord. Le géant américain s'apprête à injecter une somme record d'ici 2028 en Finlande, un territoire en passe de devenir le nouveau Texas européen de la tech.

Linux AI OS est une distribution qui intègre l'IA, qui se distingue des autres distributions par une fonctionnalité unique.

Si la dictée est votre méthode préférée pour prendre des notes et que vous travaillez sous l’OS libre, ce logiciel est certainement ce qu'il vous faut. Voici comment vous lancer.

L'enregistreur vocal Comulytic Note Pro AI concentre une grande puissance dans un appareil de la taille d'une carte de crédit. Mais c'est à vous de décider de son utilité.

Conçu pour Windows, macOS, iOS et Android, Wispr Flow est un véritable plaisir à utiliser par rapport aux autres applications de dictée vocale. Voici pourquoi.

La polyvalence est à l'ordre du jour : les collaborateurs doivent maîtriser l'ensemble de la pile technologique.

Grâce au nouvel outil « Sketch » de ChatGPT, vous pouvez dessiner directement dans la fenêtre de discussion, puis voir votre croquis se transformer en une image finale.

Mozilla a enfin lancé la version bêta de sa « fenêtre intelligente » en France et en français, son déploiement venant juste démarrer. Voici ci-dessous quelques atouts qui pourraient bien vous faire revenir à son navigateur au cas où vous vous en seriez éloigné.

Origine de l’article : lire l’article original

Traduction