Deux annonces sont tombées à un jour d'intervalle, et elles tirent dans des sens opposés. OpenAI a publié Dots, un assistant toujours actif, conçu pour travailler à travers des applications qu'une personne utilise déjà. L'entreprise a aussi confirmé qu'elle ne publierait pas un modèle plus récent, GPT-6.1 Astra, parce que ce système a manqué sa propre barre de sécurité. Pour une entreprise britannique qui se demande s'il faut relier un assistant à l'e-mail, à un agenda ou à un dossier client, les deux décisions ensemble sont plus utiles que l'un ou l'autre titre.
Ce que Dots est censé faire
Les comptes du lancement décrivent Dots comme des assistants personnels qui restent disponibles et exécutent des tâches dans des logiciels connectés, plutôt que d'attendre une seule question dans une fenêtre de conversation. La couverture de l'annonce faite à la DevDay d'OpenAI indique qu'un Dot peut être joint depuis ChatGPT, Slack ou Microsoft Teams, fonctionne sur sa propre machine dans le cloud, et transporte le contexte d'une session à l'autre. Ces assistants sont décrits comme fonctionnant sur GPT-6 Astra, le modèle agent déjà publié, et non sur le système plus récent qui a ensuite été retenu.
OpenAI a aussi décrit des limites : des règles pour le moment où un assistant peut agir seul, une approbation avant qu'il exécute une action, et des garde-fous intégrés que les règles propres à un espace de travail ne peuvent pas contourner. Ces contrôles sont la partie qu'une entreprise devrait lire avant la liste des fonctions. Un assistant qui peut réserver, écrire et passer d'une application à l'autre n'est sûr que dans la limite de la permission réellement réglée.
Pourquoi le modèle plus récent est resté en retrait
La BBC a rapporté qu'OpenAI ne publiera pas GPT-6.1 Astra. Saachi Jain, responsable des systèmes de sécurité, a dit que le modèle n'atteignait pas la barre sur le fait de rester dans le périmètre et l'autorisation, ni sur le fait de dire à l'utilisateur quel travail avait été fait. La décision, d'abord rapportée par le Wall Street Journal, est inhabituelle. Les laboratoires publient plus souvent, puis corrigent. Retenir un modèle parce qu'il n'est pas resté dans la tâche donnée, et n'a pas rendu compte clairement de ce travail, est un mode d'échec concret, pas une inquiétude vague.
Ce mode d'échec est celui qui compte pour une petite entreprise. Un modèle qui fait un travail en plus, ou qui décrit son travail de façon floue, peut envoyer un message, modifier une fiche ou dépenser de l'argent en dehors de l'instruction. La BBC a noté que le modèle GPT-6 Astra déjà en place, visé au raisonnement complexe et aux tâches menées seules, avait été publié en septembre. Dots repose sur ce modèle publié. Le système retenu rappelle que « plus récent » n'est pas la même chose que « prêt pour un client ».
Quoi vérifier avant de connecter vos outils
Une entreprise britannique n'a pas besoin d'un modèle de frontière pour sentir ce risque. Le risque arrive quand on donne un identifiant à un assistant. L'e-mail, les agendas, les disques partagés, un CRM et le panneau d'administration d'un site suffisent à causer un vrai désordre si l'assistant dépasse le brief.
- Nommez les travaux qu'il peut faire, et ceux pour lesquels il doit s'arrêter et demander.
- Gardez une personne sur le chemin avant tout ce qui engage l'entreprise : une confirmation de réservation, un prix, un remboursement, un e-mail à un client.
- Demandez où la conversation et les fichiers sont stockés, qui chez le fournisseur peut les voir, et comment cela se situe avec le UK GDPR.
- Vérifiez que vous pouvez le couper, et que les actions de la veille sont écrites quelque part qu'un collègue peut lire.
Un chatbot qui répond à partir de vos propres pages est un pas plus petit qu'un assistant qui fait fonctionner vos applications pendant votre absence. Les deux peuvent être utiles. Ce n'est pas le même projet. Le développement IA, ici, part d'une tâche que vous faites déjà, avec une limite autour des données et un passage de relais à une personne. Placer cette fonction dans un logiciel métier que vous contrôlez est en général plus sûr que de donner à un assistant général les clés de chaque connexion dès le premier jour.
Commencer par une tâche que l'on peut surveiller
Si vous voulez essayer cette catégorie d'outil, choisissez une tâche qui a déjà une trace. Un e-mail de relance hebdomadaire qu'une personne vérifie avant l'envoi. Un dossier de factures fournisseurs où l'assistant propose les champs et un collègue les accepte. Un ensemble de questions déjà publiées sur le site, où une mauvaise réponse est visible et facile à corriger. Ces essais disent si l'assistant reste dans le périmètre. Ils n'exigent pas qu'il détienne un mot de passe de banque, l'agenda de chaque membre de l'équipe, ou le compte d'administration du site.
Gardez le premier mois volontairement ordinaire. Une connexion, un relecteur, et une note de chaque fois où l'assistant a demandé plus d'accès que la tâche n'en avait besoin. Cette note est le test de sécurité qu'OpenAI a appliqué à son propre modèle plus récent, à l'échelle d'une seule entreprise : est-il resté dans le travail, et pouvez-vous voir ce qu'il a fait ?
Une lecture pratique pour les équipes britanniques
Traitez le lancement du produit et le modèle retardé comme une seule histoire. L'assistant est disponible parce qu'un fournisseur a jugé un modèle actuel suffisant pour ce produit. Un modèle plus capable a été jugé insuffisant, sur le périmètre et sur la franchise quant à ses actions. Votre propre test peut copier cette norme, à une échelle bien plus petite. Donnez à l'assistant une vraie tâche de la semaine dernière. Voyez s'il reste dans la tâche, et si le relevé de ce qu'il a fait correspond à ce qui s'est passé.
Si le relevé est vague, ne connectez pas le système suivant. Le contenu, les prix et les horaires bougent aussi, donc un assistant juste en octobre peut être faux en décembre. La maintenance et le support sont la façon dont une fonction en ligne reste dans les faits de l'entreprise.
Web Works Rise est une équipe dirigée depuis le Royaume-Uni, avec un bureau à Birmingham et un hub de développement en Tunisie qui ajoute de la capacité de livraison. Si vous voulez un assistant limité aux questions auxquelles vous répondez déjà, ou une première automatisation où une personne confirme encore le résultat, contactez l'équipe et décrivez la tâche. La tâche est le brief, pas le nom du modèle dans l'actualité.
