Tips om AI-tokens te besparen en te veel uitgaven te voorkomen

WI
Wilan
8 min. leestijd
Efficiency AI Token

Als je vaak AI gebruikt zoals ChatGPT, Claude, Gemini, of AI-modellen via API, zul je de term token zeker vaak tegenkomen.

Tokens zijn in wezen stukjes tekst die door AI worden verwerkt. Hoe langer het gesprek, de prompt, het document en de gegenereerde reactie zijn, hoe meer tokens er worden gebruikt.

Als je AI slechts af en toe gebruikt, valt het misschien niet zo op. Maar als AI wordt gebruikt voor applicaties, automatisering, chatbots, vertalers of het in grote hoeveelheden genereren van artikelen, kan onbeheerd tokenverbruik ervoor zorgen dat de kosten uit de hand lopen.

Hier zijn een paar eenvoudige manieren om AI-tokens te besparen zonder al te veel in te leveren op de kwaliteit van de output.

1. Maak prompts niet te lang

Een veelvoorkomende fout is dat er te veel instructies in de prompt worden gezet.

Bijvoorbeeld:

Schrijf een artikel over Bali.
Het artikel moet makkelijk leesbaar zijn.
Gebruik het Engels.
Wees niet te formeel.
Laat het menselijk klinken.
Gebruik geen te moeilijke taal.
Zorg dat het makkelijk te begrijpen is voor toeristen.
Gebruik eenvoudige zinnen.

Sommige instructies kunnen juist worden gecombineerd.

Bijvoorbeeld:

Schrijf een informeel en makkelijk leesbaar Engelstalig reisartikel over Bali voor internationale toeristen.

Het gevraagde resultaat blijft duidelijk, maar het aantal verzonden tokens is veel lager.

Het eenvoudige principe is:

Prompts moeten duidelijk zijn, niet lang.

2. Beperk de lengte van AI-reacties

Als je alleen een kort antwoord nodig hebt, laat AI dan geen overdreven lange tekst produceren.

Je kunt instructies toevoegen zoals:

Antwoord in maximaal 150 woorden.

of:

Geef alleen het definitieve antwoord zonder uitleg.

Dit is erg handig als AI via API wordt gebruikt, omdat AI-output meestal ook als tokens wordt meegeteld.

Hoe langer de output, hoe hoger de kosten.

3. Stuur niet het hele gesprek als het niet nodig is

Bij chatbot-applicaties is een oorzaak van hoog tokenverbruik dat de hele chatgeschiedenis altijd naar de AI wordt teruggestuurd.

Stel dat het gesprek 50 berichten heeft bereikt.

Als elk verzoek alle 50 berichten verzendt, moet de AI ze elke keer opnieuw lezen wanneer er een nieuwe vraag is.

Maar de AI heeft misschien alleen de laatste 5 tot 10 berichten nodig.

De oplossing is om alleen te sturen:

Systeeminstructie
+
laatste 5 berichten
+
nieuwste gebruikersbericht

Voor complexere applicaties kunnen oudere gesprekken eerst worden samengevat.

4. Gebruik samenvattingen voor lange gesprekken

Als de AI nog steeds context nodig heeft van eerdere gesprekken, hoef je niet alles volledig te verzenden.

Stel dat een eerder gesprek 10.000 tokens bevatte.

In plaats van alles opnieuw te sturen, maak je een samenvatting zoals:

Gebruiker bouwt een villa-boekingsapplicatie met Next.js en Laravel.

Huidige voortgang:
- Authenticatie voltooid
- Boekings-API voltooid
- Kalenderintegratie nog in ontwikkeling
- Gebruiker geeft de voorkeur aan JavaScript in plaats van TypeScript

Die samenvatting gebruikt misschien maar een paar honderd tokens, maar geeft de AI toch voldoende context.

Deze methode is zeer effectief voor chatbots met lange gesprekken.

5. Kies het model op basis van de taak

Niet alle taken vereisen het meest geavanceerde AI-model.

Voor eenvoudige taken zoals:

  • Vertaling
  • Classificatie
  • Maken van metabeschrijvingen
  • Opruimen van tekst
  • Extraheren van gegevens
  • Bepalen van categorieën
  • Maken van tags
  • Sentimentanalyse

is een kleiner model meestal voldoende.

Krachtigere modellen zijn beter geschikt voor taken zoals:

  • Complexe analyses
  • Coderen
  • Plannen
  • Redeneren
  • Lezen van complexe documenten
  • Beslissingen nemen op basis van grote hoeveelheden gegevens

Een goede strategie is om meerdere modellen binnen één applicatie te gebruiken.

Bijvoorbeeld:

Vertaling → klein model
Classificatie → klein model
Artikelgeneratie → middelgroot model
Complex redeneren → groot model

Op deze manier kunnen AI-kosten veel beter worden beheerd.

6. Stuur geen onnodige gegevens

Stel dat je AI een productbeschrijving wilt laten maken.

Stuur dan niet de volledige productgegevens zoals dit:

{
  "id": 8293,
  "created_at": "...",
  "updated_at": "...",
  "internal_code": "...",
  "database_id": "...",
  "name": "Villa Bumi",
  "bedroom": 4,
  "location": "Kerobokan",
  "description": "...",
  "internal_notes": "...",
  "staff_id": "...",
  "supplier_id": "..."
}

Als de AI alleen dit nodig heeft:

{
  "name": "Villa Bumi",
  "bedroom": 4,
  "location": "Kerobokan",
  "description": "..."
}

stuur dan alleen dat deel.

Hoe schoner de gegevens die naar AI worden gestuurd, hoe minder tokens er worden verspild.

7. Vermijd te grote JSON

JSON is inderdaad handig voor communicatie tussen applicaties en AI.

Het probleem is dat JSON-formaat behoorlijk wat tokens kan gebruiken omdat veldnamen worden herhaald.

Bijvoorbeeld:

{
  "villa_name": "Villa A",
  "villa_location": "Seminyak",
  "villa_bedroom": 4
}

Als de gegevens duizenden rijen bevatten, kan het tokenverbruik alleen al vanwege veldnamen aanzienlijk zijn.

Voor grote hoeveelheden gegevens kan een eenvoudiger formaat soms efficiënter zijn.

Bijvoorbeeld:

Villa A | Seminyak | 4BR
Villa B | Umalas | 3BR
Villa C | Canggu | 5BR

Zorg er wel voor dat het formaat gemakkelijk te begrijpen is voor zowel de AI als je applicatie.

8. Gebruik RAG voor grote documenten

Als je honderden artikelen of documenten hebt, stuur ze dan niet elke keer allemaal wanneer een gebruiker iets vraagt.

Gebruik het RAG (Retrieval-Augmented Generation)-systeem.

Het basisconcept:

Gebruiker stelt een vraag
↓
Zoek naar relevante documenten
↓
Neem een paar belangrijke delen
↓
Stuur die delen naar AI
↓
AI genereert een antwoord

Stel dat je database 1.000 artikelen bevat.

De gebruiker vraagt:

Hoeveel kost een luchthaventransfer?

Het systeem neemt gewoon documenten die over luchthaventransfers gaan.

De AI hoeft niet alle 1.000 artikelen te lezen.

Naast dat het tokens bespaart, maakt deze methode antwoorden meestal ook relevanter.

9. Beperk de hoeveelheid gegevens uit de database

Hetzelfde geldt wanneer AI gegevens uit een database haalt.

Stel dat je 50.000 boekingen hebt.

Stuur dan niet direct:

SELECT * FROM bookings;

Als de vraag is:

Hoeveel boekingen zijn er in augustus?

kan de database beter eerst filteren.

Bijvoorbeeld:

SELECT *
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';

Zelfs als de AI alleen het aantal boekingen nodig heeft, kan de database direct dit doen:

SELECT COUNT(*)
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';

Laat de database het werk doen dat inderdaad beter bij de database past.

Gooi niet alles naar de AI.

10. Vraag AI niet om gegevens te produceren die al bestaan

Stel dat de applicatie al weet:

Inchecken: 10 augustus
Uitchecken: 15 augustus

Als je alleen het aantal nachten wilt weten, heb je eigenlijk geen AI nodig.

Berekeningen zoals:

15 augustus - 10 augustus = 5 nachten

kun je beter direct met code doen.

AI zou moeten worden gebruikt voor taken die echt taal- of redeneervermogen vereisen.

Eenvoudige dingen zoals:

  • Berekeningen
  • Filteren
  • Sorteren
  • Datumnotatie
  • Gegevensconversie
  • Eenvoudige validatie

zijn meestal goedkoper en sneller om direct in de applicatie te doen.

11. Cache veelgebruikte AI-resultaten

Als dezelfde vragen vaak voorkomen, overweeg dan om cache te gebruiken.

Stel dat gebruikers vaak vragen:

Hoe laat is het inchecken?

Als de informatie altijd hetzelfde is, hoef je niet elke keer de AI aan te roepen.

Het vorige resultaat kan worden opgeslagen.

Het concept:

Gebruikersverzoek
↓
Cache controleren
↓
Resultaat beschikbaar?
├── Ja → gebruik oud resultaat
└── Nee → AI vragen → opslaan in cache

Caching is zeer nuttig voor applicaties met veel verkeer.

12. Geef niet te veel voorbeelden

Voorbeelden in prompts helpen AI zeker om het gewenste formaat te begrijpen.

Maar te veel voorbeelden verhogen ook het tokenverbruik.

Stel dat je 20 artikelvoorbeelden hebt.

Niet al die voorbeelden hoeven noodzakelijkerwijs te worden verzonden.

Meestal is het voldoende om dit te geven:

1 tot 3 beste voorbeelden

Kies voorbeelden die het beste de gewenste outputstijl vertegenwoordigen.

13. Scheid verplichte en optionele prompts

Als je een grote systeemprompt hebt, probeer dan elke instructie opnieuw te bekijken.

Vraag:

Heeft de AI deze instructie echt nodig voor elk verzoek?

Als het antwoord nee is, kan die instructie misschien worden verwijderd of alleen worden verzonden wanneer dat nodig is.

Een systeemprompt die oorspronkelijk 3.000 tokens bevatte, kan soms worden teruggebracht tot 800 tot 1.500 tokens zonder grote wijzigingen in de output.

Als de applicatie duizenden verzoeken verwerkt, kunnen dergelijke besparingen behoorlijk aanzienlijk zijn.

14. Houd tokenverbruik in de gaten

Kijk niet alleen naar de totale AI-rekening aan het einde van de maand.

Het is beter om het tokenverbruik voor elk verzoek bij te houden.

Bijvoorbeeld:

Functie: Artikelgenerator
Invoertokens: 1.240
Uitvoertokens: 1.850
Totaal aantal tokens: 3.090

Vergelijk dit vervolgens met andere functies:

Vertaler
Gemiddelde: 850 tokens

Artikelgenerator
Gemiddelde: 3.500 tokens

Klantenservice
Gemiddelde: 6.200 tokens

Hierdoor kun je zien welke functie de meeste tokens gebruikt.

15. Bereken de kosten per verzoek

Voor commerciële applicaties is kosten per verzoek een belangrijk getal.

Bijvoorbeeld:

1 verzoek = Rp20

Als er zijn:

100 verzoeken per dag

betekent dat ongeveer:

Rp2.000 per dag

Maar als er zijn:

100.000 verzoeken per dag

worden de kosten:

Rp2.000.000 per dag

Daarom kunnen kleine optimalisaties een enorme impact hebben wanneer een applicatie veel gebruikers krijgt.

De meest effectieve strategiecombinatie

Als je tokens efficiënter wilt gebruiken, kun je een stroom als deze gebruiken:

Gebruikersverzoek
↓
Kan het zonder AI worden gedaan?
↓
Ja → verwerken met de applicatie
↓
Nee
↓
Alleen relevante gegevens nemen
↓
Gebruik het goedkoopste model dat de taak aankan
↓
Beperk de uitvoerlengte
↓
Sla resultaat op in cache indien mogelijk

Met een dergelijk systeem wordt AI alleen gebruikt wanneer dat echt nodig is.

Conclusie

Tokens besparen betekent niet dat AI dommer moet worden gemaakt of dat prompts zo kort mogelijk moeten zijn.

Wat er moet gebeuren is het verwijderen van informatie die geen waarde toevoegt aan het eindresultaat.

Enkele van de meest effectieve optimalisaties zijn:

  • Prompts beknopter maken
  • De uitvoerlengte beperken
  • Niet de hele chatgeschiedenis verzenden
  • Oude gesprekken samenvatten
  • Het model kiezen op basis van de taak
  • Alleen noodzakelijke gegevens verzenden
  • RAG gebruiken voor grote documenten
  • Filteren in de database
  • Code gebruiken voor eenvoudige taken
  • Cache gebruiken
  • Kosten per verzoek controleren

Als AI op grote schaal wordt gebruikt, kan het besparen van slechts een paar honderd tokens per verzoek leiden tot aanzienlijke besparingen.

De kern is: gebruik AI niet om gegevens te verwerken die AI niet echt hoeft te lezen.

W

Geschreven door

Wilan

Vaste bijdrager van Bali Island Tekno die actief kennis deelt over technologie, programmeren en de wereld van software-engineering.

Terug naar Home Bijgewerkt op: 18 augustus 2026