Les agents IA ne se contentent plus de répondre à une question. Certains travaillent en fond: un digest de veille au réveil, le programme de la journée en podcast, les alertes de la nuit déjà triées, les issues Dependabot suivies dépôt par dépôt. Puis ils attendent la tâche suivante.
C’est très pratique. Mais au moment de les héberger, une question arrive vite : où faire tourner un programme qui ne s’arrête jamais, sans administrer de serveur ?
Dans cet article, je pars d’un cas concret : un agent open source que j’ai déployé sur Google Cloud. Je présente les trois besoins d’un agent permanent, puis les trois options d’hébergement possibles. J’ai testé la troisième, Cloud Run instances , en Preview depuis fin août 2026.
📌 Les trois besoins d’un agent permanent
A. Tourner en continu. L’agent planifie lui-même ses tâches et se réveille tout seul, sans planificateur externe.
B. Se souvenir. Sa mémoire, son historique et son planning doivent survivre à une mise à jour ou à un redémarrage.
C. Rester simple. Une adresse web qui ne change pas, et aucun serveur à maintenir.
Pris un par un, ces besoins sont bien outillés. Les trois ensemble, c’est le vrai problème.
1️⃣ Option 1 : un service Cloud Run
Première idée : déployer l’agent comme une application web classique. L’adresse, la sécurité et les logs sont fournis, sans rien administrer. Le besoin C est couvert.
Pourquoi ça coince : un service Cloud Run s’éteint quand personne ne l’appelle. C’est son grand intérêt pour un site web, et le défaut rédhibitoire pour un agent : sa boucle de travail et sa mémoire disparaissent avec lui.
2️⃣ Option 2 : une machine virtuelle
Deuxième idée : une VM. Elle tourne en continu et garde tout en mémoire. Les besoins A et B sont couverts.
Pourquoi ça coince : on récupère tout le travail d’administration (mises à jour, pare-feu, supervision, certificats). C’est beaucoup pour un programme qui passe l’essentiel de son temps à attendre.
3️⃣ Option 3 : une instance Cloud Run
Troisième voie : Cloud Run instances , un nouveau type de ressource. Un conteneur unique, toujours allumé, avec une adresse fixe et un espace de stockage qui survit à tout. On le démarre, on l’arrête, on le met à jour, et c’est tout. Le tout pour 5,70 $ par mois dans sa plus petite taille.
J’ai testé cette approche avec Hermes Agent, un agent open source. Il s’appuie sur un modèle Gemma 4 hébergé à côté, sur un service Cloud Run équipé d’un GPU.
⚡️ Voici ce que j’ai constaté pendant le test :
- La mémoire tient. Ce que l’agent écrit sur son stockage survit aux mises à jour, aux arrêts et aux redémarrages.
- L’adresse ne bouge pas , quoi qu’il arrive.
- Tout reste privé. L’agent parle à son modèle sans passer par Internet.
- Une instance arrêtée ne coûte rien. Ma première session de tests complète m’a coûté deux centimes.
- Le redémarrage hebdomadaire a bien lieu, et l’agent s’en remet seul. Après une semaine pile sans interruption, Google a redémarré l’instance pour maintenance. Elle était de retour en une vingtaine de secondes, et l’agent avait repris son travail une minute et demie plus tard.
Pourquoi le prix est si bas
L’instance ne réserve qu’une petite fraction de processeur en continu, mais elle peut accélérer à pleine puissance pendant quelques minutes quand elle en a besoin. En test, le plein régime tient environ trois minutes et demie, et deux minutes de calme suffisent à le retrouver.
Un agent réfléchit, appelle un outil, attend, reprend. Il travaille par à-coups, et c’est exactement ce profil que ce modèle de prix récompense.
Les limites de l’instance
- C’est une Preview. Certaines régions ne la proposent pas encore.
- Pas de GPU sur l’instance. Le modèle d’IA se place à côté, sur un service Cloud Run avec GPU. En Europe, une seule région propose aujourd’hui les deux.
- Le stockage n’est pas un vrai disque. Il convient très bien à des fichiers écrits d’un coup par un seul programme, moins à une base de données.
- Un redémarrage par semaine. L’agent doit savoir reprendre son planning au réveil, d’où l’intérêt de garder son état sur le stockage plutôt qu’en mémoire.
- Une mise à jour coupe le service pendant près de deux minutes.
💪 ProTip : gardez la configuration qui change souvent hors du conteneur, dans un gestionnaire de secrets ou un fichier du stockage. Vous n’aurez presque plus de mises à jour, donc presque plus de coupures.
🧪 Bonus : des bacs à sable pour le code généré
Un agent qui écrit du code doit pouvoir l’exécuter sans risquer de casser son propre environnement. L’instance peut lancer ce code dans des bacs à sable isolés, en quelques dixièmes de seconde. Par défaut, ils n’ont accès ni à Internet, ni aux identifiants de l’agent, ni à sa mémoire : une ligne de code hallucinée ne peut rien abîmer.
⚖️ Comparatif des trois options
| 1. Service Cloud Run | 2. Machine virtuelle | 3. Instance Cloud Run | |
|---|---|---|---|
| Tourne en continu (A) | non | oui | oui |
| Garde sa mémoire (B) | non | oui | oui |
| Adresse web fournie (C) | oui | à construire | oui, et fixe |
| Serveur à maintenir (C) | non | oui | non |
| Coût | nul quand rien n’arrive | non mesuré | 5,70 $ par mois allumée, 0 arrêtée |
🎯 Conclusion : le serverless apprend à garder son état
Pendant des années, il fallait choisir entre la simplicité du serverless et un serveur qui ne s’éteint jamais. L’instance Cloud Run est la seule des trois options qui couvre A, B et C à la fois : je pousse un conteneur, il tourne, il se souvient, et il coûte le prix d’un abonnement de streaming.
Elle ne remplace pas tout : un traitement massif en parallèle, une API publique très sollicitée ou un modèle d’IA à servir ont chacun leur propre brique Cloud Run. Mais pour un agent qui travaille en fond, c’est exactement la brique qui manquait.
C’est encore une Preview : pas de production dessus demain. Pour mes propres agents, en revanche, je continue à tester et explorer de nouveaux cas d’usage.
Et surprise, prochainement, un nouveau service Cloud Run qui va plaire à beaucoup de monde ! 🤫😁
📚 Références
🎓 Aller plus loin avec les agents IA
Vous voulez construire votre propre agent ? En une journée, la formation Développer son propre agent de TechTown couvre :
- les cas d’usage ;
- l’architecture d’un agent ;
- trois ateliers pratiques, dont la construction d’un agent IA avec un serveur MCP sur Cloud Run.

Top comments (0)