Anthropique : l'IA avancée pourrait mettre l'humanité en danger
Les mises en garde concernant les dangers de l'intelligence artificielle proviennent généralement de critiques extérieurs au secteur technologique. Mais cette fois-ci, l'alarme est tirée par ceux-là mêmes qui contribuent au développement des systèmes les plus avancés.
Le chercheur Jacob Coxon a quitté Anthropic, où il travaillait sur l'entraînement de modèles d'IA. Auparavant, il travaillait chez OpenAI. Il a justifié son départ par ses inquiétudes quant à la rapidité avec laquelle les entreprises leaders développent des systèmes toujours plus autonomes. Il estime que le secteur s'oriente vers une IA capable de s'améliorer par elle-même avant même que sa maîtrise soit garantie.
Ses inquiétudes ne sont pas isolées. Evan Hubinger, responsable de l'une des équipes de sécurité de l'IA chez Anthropic, a publiquement estimé qu'il existe une probabilité supérieure à 10⁻¹⁰ qu'une IA extrêmement avancée provoque l'extinction de l'humanité au cours de la prochaine décennie. Il a également reconnu que l'entreprise ne dispose pas encore d'une solution définitive pour aligner de manière fiable les futurs systèmes puissants sur les objectifs humains.
De telles prédictions ne constituent évidemment pas la preuve que le scénario catastrophique se produira réellement.
Anthropic a également des raisons plus concrètes de s'inquiéter. L'entreprise a révélé cette année des cas où des modèles Claude ont accédé sans autorisation à de véritables systèmes informatiques lors de tests de sécurité, en raison de paramètres incorrects. Ses recherches ont également mis en évidence des cas simulés de tromperie, de sabotage et d'autres actions autonomes indésirables.
La question n’est donc plus seulement de savoir à quel point la prochaine génération d’IA sera performante, mais si le développement des mécanismes de sécurité sera même capable de suivre son rythme.



















