Tips Menghemat Token AI agar Tidak Boncos

WI
Wilan
8 menit baca
Efficiency AI Token

Kalau kamu sering menggunakan AI seperti ChatGPT, Claude, Gemini, atau model AI lewat API, istilah token pasti akan sering muncul.

Token pada dasarnya adalah potongan teks yang diproses oleh AI. Semakin panjang percakapan, prompt, dokumen, dan jawaban yang dihasilkan, semakin banyak token yang digunakan.

Kalau hanya menggunakan AI sesekali mungkin tidak terlalu terasa. Tapi kalau AI dipakai untuk aplikasi, automation, chatbot, translator, atau generate artikel dalam jumlah besar, penggunaan token yang tidak terkontrol bisa bikin biaya membengkak.

Berikut beberapa cara sederhana untuk menghemat token AI tanpa terlalu mengorbankan kualitas hasilnya.

1. Jangan Membuat Prompt Terlalu Panjang

Kesalahan yang cukup sering terjadi adalah memasukkan terlalu banyak instruksi ke dalam prompt.

Contohnya:

Tolong buatkan artikel tentang Bali.
Artikel harus mudah dibaca.
Gunakan bahasa Inggris.
Jangan terlalu formal.
Buat seperti manusia.
Jangan menggunakan bahasa yang terlalu sulit.
Pastikan mudah dipahami oleh wisatawan.
Gunakan kalimat sederhana.

Sebagian instruksi sebenarnya bisa digabungkan.

Misalnya:

Write a casual and easy-to-read English travel article about Bali for international tourists.

Hasil yang diminta tetap jelas, tetapi jumlah token yang dikirim jauh lebih sedikit.

Prinsip sederhananya:

Prompt harus jelas, bukan panjang.

2. Batasi Panjang Jawaban AI

Kalau kamu hanya membutuhkan jawaban singkat, jangan biarkan AI menghasilkan tulisan terlalu panjang.

Kamu bisa menambahkan instruksi seperti:

Answer in maximum 150 words.

atau:

Give only the final answer without explanation.

Ini sangat berguna jika AI digunakan melalui API karena output dari AI biasanya juga dihitung sebagai token.

Semakin panjang output, semakin besar biaya yang digunakan.

3. Jangan Kirim Seluruh Percakapan Jika Tidak Dibutuhkan

Dalam aplikasi chatbot, salah satu penyebab penggunaan token besar adalah seluruh riwayat chat selalu dikirim kembali ke AI.

Misalnya percakapan sudah mencapai 50 pesan.

Kalau setiap request mengirim semua 50 pesan tersebut, AI harus membaca ulang semuanya setiap kali ada pertanyaan baru.

Padahal mungkin AI hanya membutuhkan 5 sampai 10 pesan terakhir.

Solusinya bisa dengan hanya mengirim:

System instruction
+
5 pesan terakhir
+
pesan terbaru user

Untuk aplikasi yang lebih kompleks, percakapan lama juga bisa diringkas terlebih dahulu.

4. Gunakan Summary untuk Percakapan Panjang

Kalau AI tetap membutuhkan konteks dari percakapan sebelumnya, tidak harus semuanya dikirim secara lengkap.

Misalnya percakapan sebelumnya memiliki 10.000 token.

Daripada mengirim ulang semuanya, buat summary seperti:

User is building a villa booking application using Next.js and Laravel.

Current progress:
- Authentication completed
- Booking API completed
- Calendar integration still in development
- User prefers JavaScript instead of TypeScript

Summary tersebut mungkin hanya menggunakan beberapa ratus token tetapi masih memberikan konteks yang cukup kepada AI.

Cara ini sangat efektif untuk chatbot dengan percakapan panjang.

5. Pilih Model Sesuai Pekerjaan

Tidak semua pekerjaan membutuhkan model AI paling canggih.

Untuk pekerjaan sederhana seperti:

  • Translation
  • Classification
  • Membuat meta description
  • Merapikan teks
  • Extract data
  • Menentukan kategori
  • Membuat tag
  • Sentiment analysis

model yang lebih kecil biasanya sudah cukup.

Model yang lebih kuat lebih cocok digunakan untuk pekerjaan seperti:

  • Analisis kompleks
  • Coding
  • Planning
  • Reasoning
  • Membaca dokumen kompleks
  • Membuat keputusan berdasarkan banyak data

Strategi yang bagus adalah menggunakan beberapa model dalam satu aplikasi.

Contohnya:

Translation โ†’ model kecil
Classification โ†’ model kecil
Generate artikel โ†’ model menengah
Complex reasoning โ†’ model besar

Dengan cara ini biaya AI bisa jauh lebih terkontrol.

6. Jangan Mengirim Data yang Tidak Dibutuhkan

Misalnya kamu ingin AI membuat deskripsi produk.

Jangan mengirim seluruh data produk seperti ini:

{
  "id": 8293,
  "created_at": "...",
  "updated_at": "...",
  "internal_code": "...",
  "database_id": "...",
  "name": "Villa Bumi",
  "bedroom": 4,
  "location": "Kerobokan",
  "description": "...",
  "internal_notes": "...",
  "staff_id": "...",
  "supplier_id": "..."
}

Kalau AI hanya membutuhkan:

{
  "name": "Villa Bumi",
  "bedroom": 4,
  "location": "Kerobokan",
  "description": "..."
}

kirim bagian tersebut saja.

Semakin bersih data yang dikirim ke AI, semakin sedikit token yang terbuang.

7. Hindari JSON yang Terlalu Besar

JSON memang nyaman digunakan untuk komunikasi antara aplikasi dan AI.

Masalahnya, format JSON bisa menggunakan cukup banyak token karena nama field terus diulang.

Misalnya:

{
  "villa_name": "Villa A",
  "villa_location": "Seminyak",
  "villa_bedroom": 4
}

Kalau datanya ribuan baris, penggunaan token dari nama field saja bisa cukup besar.

Untuk data dalam jumlah besar, terkadang format yang lebih sederhana bisa lebih hemat.

Contohnya:

Villa A | Seminyak | 4BR
Villa B | Umalas | 3BR
Villa C | Canggu | 5BR

Tetap pastikan format tersebut mudah dipahami oleh AI dan aplikasi kamu.

8. Gunakan RAG untuk Dokumen Besar

Kalau kamu mempunyai ratusan artikel atau dokumen, jangan mengirim semuanya setiap kali user bertanya.

Gunakan sistem RAG atau Retrieval-Augmented Generation.

Konsep sederhananya:

User bertanya
โ†“
Cari dokumen yang relevan
โ†“
Ambil beberapa bagian penting
โ†“
Kirim bagian tersebut ke AI
โ†“
AI membuat jawaban

Misalnya database kamu mempunyai 1.000 artikel.

User bertanya:

Berapa biaya airport transfer?

Sistem cukup mengambil dokumen yang membahas airport transfer.

AI tidak perlu membaca 1.000 artikel tersebut.

Selain menghemat token, cara ini biasanya juga membuat jawaban lebih relevan.

9. Batasi Jumlah Data dari Database

Hal yang sama berlaku ketika AI mengambil data dari database.

Misalnya kamu mempunyai 50.000 booking.

Jangan langsung mengirim:

SELECT * FROM bookings;

Kalau pertanyaannya:

Berapa booking bulan Agustus?

lebih baik database melakukan filtering terlebih dahulu.

Contohnya:

SELECT *
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';

Bahkan kalau AI hanya membutuhkan jumlah booking, database bisa langsung melakukan:

SELECT COUNT(*)
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';

Biarkan database melakukan pekerjaan yang memang lebih cocok dilakukan database.

Jangan semuanya dilempar ke AI.

10. Jangan Minta AI Menghasilkan Data yang Sudah Ada

Misalnya aplikasi sudah mengetahui:

Check-in: 10 August
Check-out: 15 August

Kalau hanya ingin mengetahui jumlah malam, kamu sebenarnya tidak membutuhkan AI.

Perhitungan seperti:

15 August - 10 August = 5 nights

lebih baik dilakukan langsung melalui kode.

AI sebaiknya digunakan untuk pekerjaan yang memang membutuhkan kemampuan bahasa atau reasoning.

Hal sederhana seperti:

  • Kalkulasi
  • Filtering
  • Sorting
  • Format tanggal
  • Konversi data
  • Validasi sederhana

biasanya lebih murah dan lebih cepat dilakukan langsung oleh aplikasi.

11. Simpan Hasil AI yang Sering Digunakan

Kalau pertanyaan yang sama sering muncul, pertimbangkan menggunakan cache.

Misalnya user sering bertanya:

What time is check-in?

Kalau informasinya selalu sama, tidak perlu menghubungi AI setiap kali.

Hasil sebelumnya bisa disimpan.

Konsepnya:

User request
โ†“
Check cache
โ†“
Ada hasil?
โ”œโ”€โ”€ Yes โ†’ gunakan hasil lama
โ””โ”€โ”€ No โ†’ request AI โ†’ simpan cache

Caching sangat berguna untuk aplikasi dengan traffic besar.

12. Jangan Terlalu Banyak Memberikan Contoh

Contoh dalam prompt memang membantu AI memahami format yang diinginkan.

Tetapi terlalu banyak contoh juga akan meningkatkan token.

Misalnya kamu mempunyai 20 contoh artikel.

Belum tentu semuanya perlu dikirim.

Biasanya cukup berikan:

1 sampai 3 contoh terbaik

Pilih contoh yang paling mewakili gaya output yang kamu inginkan.

13. Pisahkan Prompt yang Wajib dan Opsional

Kalau mempunyai system prompt besar, coba periksa kembali setiap instruksinya.

Tanyakan:

Apakah AI benar-benar membutuhkan instruksi ini setiap request?

Kalau jawabannya tidak, instruksi tersebut mungkin bisa dihapus atau hanya dikirim ketika diperlukan.

System prompt yang awalnya 3.000 token terkadang bisa dipangkas menjadi 800 sampai 1.500 token tanpa perubahan besar pada hasil.

Kalau aplikasi melakukan ribuan request, penghematan seperti ini bisa cukup signifikan.

14. Pantau Penggunaan Token

Jangan hanya melihat total tagihan AI di akhir bulan.

Sebaiknya catat penggunaan token setiap request.

Contohnya:

Feature: Article Generator
Input Tokens: 1,240
Output Tokens: 1,850
Total Tokens: 3,090

Kemudian bandingkan dengan fitur lain:

Translator
Average: 850 tokens

Article Generator
Average: 3,500 tokens

Customer Support
Average: 6,200 tokens

Dari sini kamu bisa mengetahui fitur mana yang paling banyak menghabiskan token.

15. Hitung Cost per Request

Untuk aplikasi komersial, salah satu angka yang penting adalah cost per request.

Misalnya:

1 request = Rp20

Kalau ada:

100 request per hari

berarti sekitar:

Rp2.000 per hari

Tetapi kalau ada:

100.000 request per hari

biayanya sudah menjadi:

Rp2.000.000 per hari

Karena itu optimasi kecil bisa memberikan pengaruh besar ketika aplikasi mulai mempunyai banyak pengguna.

Kombinasi Strategi yang Paling Efektif

Kalau ingin penggunaan token lebih hemat, kamu bisa menggunakan alur seperti ini:

User Request
โ†“
Apakah bisa diselesaikan tanpa AI?
โ†“
Ya โ†’ proses dengan aplikasi
โ†“
Tidak
โ†“
Ambil hanya data yang relevan
โ†“
Gunakan model paling murah yang mampu mengerjakannya
โ†“
Batasi panjang output
โ†“
Simpan hasil ke cache jika memungkinkan

Dengan sistem seperti ini, AI digunakan hanya ketika memang dibutuhkan.

Kesimpulan

Menghemat token bukan berarti membuat AI menjadi lebih bodoh atau memberikan prompt sesingkat mungkin.

Yang perlu dilakukan adalah menghilangkan informasi yang tidak memberikan nilai terhadap hasil akhir.

Beberapa optimasi yang paling efektif adalah:

  • Membuat prompt lebih ringkas
  • Membatasi panjang output
  • Tidak mengirim seluruh chat history
  • Merangkum percakapan lama
  • Memilih model sesuai pekerjaan
  • Mengirim hanya data yang diperlukan
  • Menggunakan RAG untuk dokumen besar
  • Melakukan filtering di database
  • Menggunakan kode untuk pekerjaan sederhana
  • Menggunakan cache
  • Memantau cost per request

Kalau AI digunakan dalam skala besar, optimasi beberapa ratus token per request saja bisa menghasilkan penghematan yang cukup besar.

Intinya, jangan menggunakan AI untuk memproses data yang sebenarnya tidak perlu dibaca AI.

W

Ditulis oleh

Wilan

Kontributor tetap Bali Island Tekno yang aktif berbagi pengetahuan seputar teknologi, pemrograman, dan dunia rekayasa perangkat lunak.

Kembali ke Beranda Diperbarui pada: 18 Agustus 2026