Si vous utilisez souvent l'IA comme ChatGPT, Claude, Gemini, ou des modèles d'IA via API, le terme jeton reviendra certainement souvent.
Les jetons sont essentiellement des morceaux de texte traités par l'IA. Plus la conversation, la requête, le document et la réponse générée sont longs, plus le nombre de jetons utilisés est élevé.
Si vous n'utilisez l'IA qu'occasionnellement, vous ne le remarquerez peut-être pas trop. Mais si l'IA est utilisée pour des applications, de l'automatisation, des chatbots, des traducteurs ou la génération d'articles en grande quantité, une utilisation non maîtrisée des jetons peut faire exploser les coûts.
Voici quelques moyens simples d'économiser des jetons IA sans sacrifier trop la qualité des résultats.
1. Ne rendez pas vos requêtes trop longues
Une erreur assez courante est de mettre trop d'instructions dans la requête.
Par exemple :
Veuillez écrire un article sur Bali.
L'article doit être facile à lire.
Utilisez l'anglais.
Ne soyez pas trop formel.
Faites en sorte que cela semble humain.
N'utilisez pas un langage trop difficile.
Assurez-vous que c'est facile à comprendre pour les touristes.
Utilisez des phrases simples.
Certaines instructions peuvent en réalité être combinées.
Par exemple :
Écrivez un article de voyage en anglais, décontracté et facile à lire sur Bali pour les touristes internationaux.
Le résultat demandé reste clair, mais le nombre de jetons envoyés est bien inférieur.
Le principe simple est le suivant :
Les requêtes doivent être claires, pas longues.
2. Limitez la longueur de la réponse de l'IA
Si vous n'avez besoin que d'une réponse courte, ne laissez pas l'IA produire un texte trop long.
Vous pouvez ajouter des instructions comme :
Répondez en 150 mots maximum.
ou :
Donnez uniquement la réponse finale sans explication.
C'est très utile si l'IA est utilisée via API, car la sortie de l'IA est également généralement comptée en jetons.
Plus la sortie est longue, plus le coût est élevé.
3. N'envoyez pas toute la conversation si ce n'est pas nécessaire
Dans les applications de chatbot, l'une des causes d'une utilisation élevée de jetons est que tout l'historique de la conversation est toujours renvoyé à l'IA.
Par exemple, la conversation a atteint 50 messages.
Si chaque requête envoie les 50 messages, l'IA doit tous les relire à chaque nouvelle question.
Mais l'IA n'a peut-être besoin que des 5 à 10 derniers messages.
La solution est de n'envoyer que :
Instruction système
+
5 derniers messages
+
derneier message de l'utilisateur
Pour des applications plus complexes, les conversations plus anciennes peuvent également être résumées au préalable.
4. Utilisez des résumés pour les longues conversations
Si l'IA a toujours besoin du contexte des conversations précédentes, vous n'avez pas à tout envoyer en entier.
Par exemple, une conversation précédente contenait 10 000 jetons.
Au lieu de tout renvoyer, créez un résumé comme :
L'utilisateur construit une application de réservation de villas avec Next.js et Laravel.
Progrès actuel :
- Authentification terminée
- API de réservation terminée
- Intégration du calendrier encore en développement
- L'utilisateur préfère JavaScript plutôt que TypeScript
Ce résumé peut n'utiliser que quelques centaines de jetons tout en fournissant un contexte suffisant à l'IA.
Cette méthode est très efficace pour les chatbots avec de longues conversations.
5. Choisissez le modèle selon la tâche
Toutes les tâches ne nécessitent pas le modèle d'IA le plus avancé.
Pour des tâches simples comme :
- Traduction
- Classification
- Création de méta-descriptions
- Nettoyage de texte
- Extraction de données
- Détermination de catégories
- Création de balises
- Analyse des sentiments
un modèle plus petit est généralement suffisant.
Les modèles plus puissants sont mieux adaptés à des tâches comme :
- Analyse complexe
- Codage
- Planification
- Raisonnement
- Lecture de documents complexes
- Prise de décision basée sur de grandes quantités de données
Une bonne stratégie est d'utiliser plusieurs modèles au sein d'une même application.
Par exemple :
Traduction → petit modèle
Classification → petit modèle
Génération d'articles → modèle moyen
Raisonnement complexe → grand modèle
Ainsi, les coûts de l'IA peuvent être bien mieux maîtrisés.
6. N'envoyez pas de données inutiles
Par exemple, vous voulez que l'IA crée une description de produit.
N'envoyez pas toutes les données du produit comme ceci :
{
"id": 8293,
"created_at": "...",
"updated_at": "...",
"internal_code": "...",
"database_id": "...",
"name": "Villa Bumi",
"bedroom": 4,
"location": "Kerobokan",
"description": "...",
"internal_notes": "...",
"staff_id": "...",
"supplier_id": "..."
}
Si l'IA n'a besoin que de :
{
"name": "Villa Bumi",
"bedroom": 4,
"location": "Kerobokan",
"description": "..."
}
Envoyez uniquement cette partie.
Plus les données envoyées à l'IA sont propres, moins on gaspille de jetons.
7. Évitez les JSON trop volumineux
Le JSON est en effet pratique pour la communication entre les applications et l'IA.
Le problème est que le format JSON peut utiliser pas mal de jetons car les noms de champs sont répétés.
Par exemple :
{
"villa_name": "Villa A",
"villa_location": "Seminyak",
"villa_bedroom": 4
}
Si les données contiennent des milliers de lignes, l'utilisation de jetons rien que pour les noms de champs peut être significative.
Pour de grandes quantités de données, un format plus simple peut parfois être plus efficace.
Par exemple :
Villa A | Seminyak | 4CH
Villa B | Umalas | 3CH
Villa C | Canggu | 5CH
Assurez-vous simplement que le format soit facile à comprendre pour l'IA et votre application.
8. Utilisez le RAG pour les grands documents
Si vous avez des centaines d'articles ou de documents, ne les envoyez pas tous à chaque fois qu'un utilisateur pose une question.
Utilisez le système RAG (Retrieval-Augmented Generation).
Le concept de base :
L'utilisateur pose une question
↓
Recherche de documents pertinents
↓
Prendre quelques parties importantes
↓
Envoyer ces parties à l'IA
↓
L'IA génère une réponse
Par exemple, votre base de données contient 1 000 articles.
L'utilisateur demande :
Combien coûte le transfert depuis l'aéroport ?
Le système prend uniquement les documents qui parlent du transfert aéroport.
L'IA n'a pas besoin de lire les 1 000 articles.
En plus d'économiser des jetons, cette méthode rend généralement les réponses plus pertinentes.
9. Limitez la quantité de données provenant de la base de données
La même chose s'applique lorsque l'IA récupère des données d'une base de données.
Par exemple, vous avez 50 000 réservations.
N'envoyez pas directement :
SELECT * FROM bookings;
Si la question est :
Combien de réservations en août ?
il est préférable que la base de données fasse d'abord le filtrage.
Par exemple :
SELECT *
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';
Même si l'IA n'a besoin que du nombre de réservations, la base de données peut directement faire :
SELECT COUNT(*)
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';
Laissez la base de données faire le travail qui lui convient vraiment.
Ne jetez pas tout à l'IA.
10. Ne demandez pas à l'IA de produire des données qui existent déjà
Par exemple, l'application sait déjà :
Arrivée : 10 août
Départ : 15 août
Si vous voulez simplement connaître le nombre de nuits, vous n'avez en fait pas besoin de l'IA.
Des calculs comme :
15 août - 10 août = 5 nuits
sont mieux faits directement avec du code.
L'IA doit être utilisée pour des tâches qui nécessitent véritablement des capacités linguistiques ou de raisonnement.
Des choses simples comme :
- Calculs
- Filtrage
- Tri
- Formatage de dates
- Conversion de données
- Validation simple
sont généralement moins chères et plus rapides à faire directement dans l'application.
11. Mettez en cache les résultats d'IA fréquemment utilisés
Si les mêmes questions reviennent souvent, envisagez d'utiliser le cache.
Par exemple, les utilisateurs demandent souvent :
À quelle heure est l'arrivée ?
Si l'information est toujours la même, il n'est pas nécessaire d'appeler l'IA à chaque fois.
Le résultat précédent peut être stocké.
Le concept :
Requête utilisateur
↓
Vérifier le cache
↓
Résultat disponible ?
├── Oui → utiliser l'ancien résultat
└── Non → demander à l'IA → enregistrer dans le cache
La mise en cache est très utile pour les applications à fort trafic.
12. Ne fournissez pas trop d'exemples
Les exemples dans les requêtes aident l'IA à comprendre le format souhaité.
Mais trop d'exemples augmentent également l'utilisation de jetons.
Par exemple, vous avez 20 exemples d'articles.
Il n'est pas nécessaire de tous les envoyer.
En général, il suffit de fournir :
1 à 3 meilleurs exemples
Choisissez les exemples qui représentent le mieux le style de sortie que vous souhaitez.
13. Séparez les instructions obligatoires et facultatives
Si vous avez un grand prompt système, essayez de revoir chaque instruction.
Demandez :
L'IA a-t-elle vraiment besoin de cette instruction pour chaque requête ?
Si la réponse est non, cette instruction peut peut-être être supprimée ou n'être envoyée que lorsque c'est nécessaire.
Un prompt système qui faisait initialement 3 000 jetons peut parfois être réduit à 800 à 1 500 jetons sans changement majeur de sortie.
Si l'application traite des milliers de requêtes, de telles économies peuvent être assez significatives.
14. Surveillez l'utilisation des jetons
Ne vous contentez pas de regarder la facture totale de l'IA à la fin du mois.
Il est préférable d'enregistrer l'utilisation des jetons pour chaque requête.
Par exemple :
Fonctionnalité : Générateur d'articles
Jetons d'entrée : 1 240
Jetons de sortie : 1 850
Total de jetons : 3 090
Ensuite, comparez avec d'autres fonctionnalités :
Traducteur
Moyenne : 850 jetons
Générateur d'articles
Moyenne : 3 500 jetons
Support client
Moyenne : 6 200 jetons
À partir de cela, vous pouvez voir quelle fonctionnalité utilise le plus de jetons.
15. Calculez le coût par requête
Pour les applications commerciales, un chiffre important est le coût par requête.
Par exemple :
1 requête = 20 Rp
S'il y a :
100 requêtes par jour
cela représente environ :
2 000 Rp par jour
Mais s'il y a :
100 000 requêtes par jour
le coût devient :
2 000 000 Rp par jour
C'est pourquoi de petites optimisations peuvent avoir un impact énorme lorsqu'une application commence à avoir de nombreux utilisateurs.
La combinaison de stratégies la plus efficace
Si vous souhaitez utiliser les jetons plus efficacement, vous pouvez utiliser un flux comme celui-ci :
Requête utilisateur
↓
Peut-on le faire sans IA ?
↓
Oui → traiter avec l'application
↓
Non
↓
Prendre uniquement les données pertinentes
↓
Utiliser le modèle le moins cher capable de faire la tâche
↓
Limiter la longueur de la sortie
↓
Enregistrer le résultat en cache si possible
Avec un tel système, l'IA n'est utilisée que lorsque c'est vraiment nécessaire.
Conclusion
Économiser des jetons ne signifie pas rendre l'IA moins intelligente ou rendre les requêtes aussi courtes que possible.
Ce qu'il faut faire, c'est supprimer les informations qui n'apportent pas de valeur au résultat final.
Certaines des optimisations les plus efficaces sont :
- Rendre les requêtes plus concises
- Limiter la longueur de la sortie
- Ne pas envoyer tout l'historique de la conversation
- Résumer les anciennes conversations
- Choisir le modèle selon la tâche
- N'envoyer que les données nécessaires
- Utiliser le RAG pour les grands documents
- Filtrer dans la base de données
- Utiliser du code pour les tâches simples
- Utiliser le cache
- Surveiller le coût par requête
Si l'IA est utilisée à grande échelle, économiser seulement quelques centaines de jetons par requête peut conduire à des économies significatives.
En fin de compte, n'utilisez pas l'IA pour traiter des données que l'IA n'a pas réellement besoin de lire.
Articles Similaires
Conseils pour faire face aux hausses de prix des composants PC : RAM, SSD et GPU
Écrit par
Wilan
Contributeur permanent de Bali Island Tekno qui partage activement des connaissances sur la technologie, la programmation et le monde du génie logiciel.