GPT-5.6 Sol, Terra, Luna: ce que ça change pour une PME
GPT-5.6 (9 juil. 2026): Sol, Terra, Luna, accès ChatGPT, prix API, multi-agent ultra. Angle PME: tester, pinner, mesurer tokens avant de tout migrer.

GPT-5.6: ce qui a été annoncé le 9 juillet 2026
GPT-5.6 est sorti en disponibilité générale le 9 juillet 2026, après un aperçu limité lancé le 26 juin. OpenAI le présente comme une famille de modèles (Sol, Terra, Luna), pas un monolithe unique, disponible progressivement dans ChatGPT, Codex et l'API.
D'après le post de lancement OpenAI, Sol est le flagship (codage, cyber, science, travail de connaissance). Terra vise un équilibre coût / perf (annoncé compétitif face à GPT-5.5 pour environ la moitié du coût estimé sur certains usages). Luna est le palier le plus économique et le plus rapide de la famille.
Côté produit, OpenAI met en avant: plus de travail utile par token, computer use renforcé, design et artefacts, Programmatic Tool Calling dans l'API Responses, et un mode multi-agent (dont le réglage ultra) pour les tâches lourdes. Les scores de benchmarks restent des mesures sous harness; on y revient plus bas.
Pour une PME, la question n'est pas « est-ce le meilleur modèle du monde ». C'est: quel palier on active, sur quel flux, avec quel plafond de tokens et quelle revue humaine.
Sol, Terra, Luna: lire le naming avant le marketing
OpenAI le dit explicitement: le numéro (5.6) identifie la génération; Sol, Terra et Luna sont des paliers de capacité qui peuvent évoluer chacun à leur rythme. Tu ne « achètes pas GPT-5.6 » comme un seul SKU. Tu choisis un niveau de modèle pour un usage.
Règle simple pour l'équipe: Sol pour les flux à fort enjeu (refactor large, cyber défensif autorisé, analyse multi-étapes). Terra pour le quotidien (tickets, rédaction, outillage léger). Luna pour le volume (classement, extraction simple, brouillons) où le coût unit compte plus que le dernier point de score.
Si tout le monde force Sol sur chaque prompt, la facture suit. Si tout le monde reste sur Luna pour du code critique, la qualité chute. Le gain de la famille, c'est le routing explicite, pas le monolithe premium par défaut.
Documente le mapping dans une page d'équipe: type de tâche → palier → effort (medium, max, ultra si dispo) → qui valide. Sans ce mapping, le modèle picker devient du hasard personnel.
Accès ChatGPT et prix API (faits OpenAI)
Selon le post OpenAI du 9 juillet 2026: en chat classique, les comptes Plus, Pro, Business et Enterprise accèdent à GPT-5.6 Sol via les niveaux d'effort medium et plus. Pro et Enterprise peuvent aussi viser Sol Pro pour les tâches les plus dures. Le déploiement est progressif: si le picker ne montre pas encore Sol, le compte peut simplement ne pas être basculé.
Sur ChatGPT Work et Codex: Free et Go reçoivent Terra. Plus, Pro, Business et Enterprise peuvent choisir Sol, Terra ou Luna et régler l'effort. Le mode max est annoncé pour les utilisateurs qui ont accès à GPT-5.6 sur ces surfaces. Ultra (multi-agents en parallèle) est annoncé pour Pro et Enterprise sur Work, et pour Plus et plus haut sur Codex.
Tarifs API annoncés pour GPT-5.6 (par million de tokens): Sol 5 $ entrée / 30 $ sortie; Terra 2,50 $ / 15 $; Luna 1 $ / 6 $. OpenAI ajoute un cache de prompts plus prévisible (dont breakpoints explicites) avec écriture cache facturée à 1,25× le tarif input non caché, et lectures cache toujours en réduction 90% sur l'input caché. Vérifie toujours la page pricing live avant un budget annuel: ces chiffres sont ceux du lancement.
Impact PME: Terra et Luna existent pour éviter de coller le flagship partout. Un flux support à fort volume sur Luna + revue humaine sur les cas ambigus coûte autre chose qu'un flux architecture sur Sol + ultra.
Computer use, multi-agent et ultra: opportunité et risque
OpenAI annonce un computer use plus solide (inspection du rendu, finitions) et un multi-agent dans l'API Responses (bêta). Ultra coordonne par défaut plusieurs agents en parallèle (quatre dans les illustrations OpenAI) pour gagner en score et en latence perçue, au prix d'une consommation tokens plus élevée.
C'est utile quand le job est long, parallèle et vérifiable (recherche multi-sources, suite de tests, exploration de codebase large). C'est dangereux si tu lances ultra sur un ticket trivial: tu multiplies les fenêtres de contexte et les appels outils sans ROI.
Programmatic Tool Calling: le modèle peut écrire et exécuter un petit programme en mémoire pour filtrer des sorties d'outils avant de tout renvoyer au LLM. OpenAI le présente comme un levier d'efficacité tokens (moins d'allers-retours bruts). En prod, traite-le comme une surface d'exécution: sandbox, logs, limites de durée.
Sans HITL sur les actions à risque (paiement, envoi client, droits admin, secrets), tu as juste un POC plus cher. Le curseur d'autonomie reste un design d'équipe, pas un réglage marketing.
Benchmarks: mesurer le harness, pas le screenshot
OpenAI publie des tableaux (Agents' Last Exam, coding agent index, OSWorld, BrowseComp, etc.) et des comparaisons face à d'autres modèles frontière. Ces chiffres dépendent du harness: outils, temps, raisonnement, multi-agent, réglages de sécurité.
Un leaderboard sans protocole de rejeu ne dit pas comment ton monorepo, tes MCP et ta revue se comporteront. Les partenaires cités (Cursor, Qodo, Notion, etc.) testent leurs stacks; ce ne sont pas tes KPI métier.
Méthode PME: 20 à 50 cas réels versionnés (entrée, sortie attendue, critère pass/fail). Même harness avant/après. Mesure tokens, latence, % accepté sans edit, incidents. Change un levier à la fois (modèle, effort, tools).
Si le score monte mais la revue humaine explose, tu n'as pas gagné. Si le score stagne mais les tokens chutent de 30% à qualité égale, tu as gagné.
Que faire concrètement cette semaine
1) Vérifie l'accès réel de l'équipe (picker ChatGPT / Work / Codex / clés API) et note qui a Sol, Terra, Luna. 2) Pin le modèle en prod: snapshot ou ID stable, pas « latest » silencieux. 3) Choisis un seul flux pilote (ex: résumé de ticket, revue de PR non critique). 4) Route: Luna ou Terra par défaut, Sol seulement si le cas échoue un seuil clair. 5) Plafond tokens + alerte budget. 6) Interdiction ultra hors sandbox sauf owner nommé. 7) Journal: modèle, effort, tokens, accept/edit/reject.
Garde un chemin de repli GPT-5.5 (ou le palier précédent encore supporté) pendant 2 à 4 semaines. Les bascules brutales multiplient les régressions silencieuses.
Sources à relire avant de figer la policy: post OpenAI GPT-5.6 (openai.com/index/gpt-5-6), page d'aide GPT-5.6 dans ChatGPT, et la pricing API live. Les synthèses tierces aident pour le contexte; les chiffres d'accès et de prix se prennent chez l'éditeur.
Si vous voulez cadrer le routing Sol/Terra/Luna et le HITL sur un process réel, on peut le faire en 20-40 minutes.
FAQ
- GPT-5.6 est-il sorti ?
- Oui. OpenAI a lancé la famille en GA le 9 juillet 2026 (aperçu limité dès le 26 juin). Le rollout ChatGPT / Work / API peut encore être progressif selon le compte.
- Quelle différence entre Sol, Terra et Luna ?
- Ce sont trois paliers de la génération GPT-5.6: Sol (flagship), Terra (équilibre, positionné face à GPT-5.5 à moindre coût estimé), Luna (rapide et économique). Le numéro = génération; le nom = capacité / coût.
- Quel est le prix de l'API GPT-5.6 ?
- Annoncé au lancement: Sol 5/30 $, Terra 2,50/15 $, Luna 1/6 $ par million de tokens (entrée/sortie). Vérifie la page pricing OpenAI avant tout budget figé.
- Faut-il migrer toute la stack vers Sol ?
- Non. Teste un flux borné, compare tokens et qualité, pin le modèle, garde un fallback. Route Terra/Luna pour le volume.
- C'est quoi ultra sur GPT-5.6 ?
- Un réglage haute capacité qui coordonne plusieurs agents en parallèle (illustré avec quatre agents par défaut). Plus de puissance et souvent plus de tokens. À réserver aux jobs longs et bornés, avec budget et revue.
- GPT-5.6 est-il gratuit ?
- Sur Work/Codex, Free et Go ont accès à Terra selon OpenAI. Sol et le choix multi-paliers restent liés aux plans payants et aux workspaces. L'API est facturée au token.
- Comment éviter de cannibaliser nos guides agents ?
- Cet article couvre le catalogue OpenAI et le routing de modèles. Le build d'agent métier, le HITL et le multi-agents restent sur leurs pages dédiées. Un sujet = une intention de recherche.
Cadrez votre premier agent IA
20 minutes pour vérifier vos outils, vos données et le premier cas utile. Sans jargon, sans engagement.