Lors de la keynote de la WWDC26, Apple a annoncé sa troisième génération de Modèles de Fondation Apple (AFM), comprenant cinq modèles, dont certains fonctionnent localement et d’autres dans le cloud, avec un modèle hébergé sur des serveurs Google utilisant des puces Nvidia. Voici un aperçu de leur fonctionnement.

Un peu de contexte

Lorsque Apple a présenté pour la première fois ses modèles de fondation en 2024, la gamme incluait un modèle de langue sur appareil d’environ 3 milliards de paramètres, ainsi qu’un modèle linguistique plus grand disponible via le Private Cloud Compute, fonctionnant sur des serveurs Apple Silicon. Ce dernier projet visait à offrir des capacités d’IA cloud tout en préservant les garanties de confidentialité que les utilisateurs attendent du traitement sur appareil.

En raison de cela, il était crucial de rester dans le giron de l’entreprise. Le Private Cloud Compute s’exécutait dans des centres de données Apple, sur des serveurs alimentés par des puces Apple. Malgré cela, ses garanties de confidentialité pouvaient être vérifiées de manière indépendante par des chercheurs en sécurité tiers.

Toutefois, alors qu’Apple peinait à faire décoller ses ambitions en matière d’IA, l’entreprise a formé un partenariat avec Google pour utiliser Gemini comme base de ses nouveaux efforts en matière d’IA, dont les résultats ont été annoncés plus tôt cette semaine lors de la WWDC26.

Les nouveaux modèles de fondation d’Apple

La troisième génération d’AFM comprend cinq modèles : l’AFM 3 Core et l’AFM 3 Code Advanced, qui sont des modèles sur appareil, et l’AFM Cloud, l’ADM 3 Cloud (Image) et l’AFM 3 Cloud Pro, qui sont basés sur des serveurs. Le D dans ADM 3 Cloud (Image) signifie diffusion, une technologie que nous avons abordée précédemment.

À l’exception de l’AFM 3 Cloud Pro, tous les autres modèles ont été conçus pour fonctionner sur des appareils Apple Silicon. L’AFM 3 Cloud Pro, quant à lui, fonctionne sur des GPU NVIDIA hébergés dans Google Cloud.

Cela a été rendu possible après qu’Apple ait étendu son architecture Private Cloud Compute à l’infrastructure tierce pour la première fois, tout en « maintenant les puissantes protections en matière de sécurité et de confidentialité d’Apple », selon la société.

Voici un aperçu de chaque modèle, tel qu’expliqué par Apple :

  • AFM 3 Core : la nouvelle génération de notre modèle dense de 3 milliards de paramètres offrant une amélioration de la qualité.
  • AFM 3 Core Advanced : notre modèle sur appareil le plus puissant. Il est multimodal par nature.
  • AFM 3 Cloud : notre modèle serveur optimisé pour la vitesse et l’efficacité.
  • ADM 3 Cloud (Image) : pour la génération et l’édition d’images.
  • AFM 3 Cloud Pro : notre modèle serveur le plus capable, pour des cas d’utilisation exigeants.

Les points forts ici sont l’AFM 3 Core Advanced et l’AFM 3 Cloud Pro.

En ce qui concerne l’AFM 3 Core Advanced, il intègre 20 milliards de paramètres dans un modèle sur appareil, une performance notable. Afin de bien faire fonctionner l’AFM 3 Core Advanced, Apple a utilisé une architecture sparse activant jusqu’à 4 milliards de paramètres à la fois.

Bien que conceptuellement similaire à l’approche Mixture of Experts, cette activation sélective repose sur une technique inventée par Apple et détaillée dans l’étude Instruction-Following Pruning for Large Language Models publiée l’année dernière.

Les résultats

Apple affirme avoir mené des évaluations humaines approfondies de ses modèles de fondation de troisième génération, avec des examinateurs internes notant les réponses sur des critères tels que le suivi des instructions, la véracité et la compréhension d’image.

Les modèles ont été évalués par rapport à leurs prédécesseurs, lorsque cela était applicable, et vous pouvez voir certaines des résultats ci-dessous.

Partager un commentaire