Si utilizas a menudo IA como ChatGPT, Claude, Gemini o modelos de IA a través de API, el término token seguramente aparecerá con frecuencia.
Los tokens son esencialmente fragmentos de texto que la IA procesa. Cuanto más larga sea la conversación, el prompt, el documento y la respuesta generada, más tokens se utilizan.
Si solo usas IA ocasionalmente, quizás no lo notes demasiado. Pero si la IA se utiliza para aplicaciones, automatizaciones, chatbots, traductores o para generar artículos en grandes cantidades, el uso descontrolado de tokens puede hacer que los costos se disparen.
Aquí hay algunas formas sencillas de ahorrar tokens de IA sin sacrificar demasiado la calidad de los resultados.
1. No hagas los prompts demasiado largos
Un error bastante común es incluir demasiadas instrucciones en el prompt.
Por ejemplo:
Escribe un artículo sobre Bali.
El artículo debe ser fácil de leer.
Usa inglés.
No seas demasiado formal.
Haz que suene humano.
No uses un lenguaje demasiado difícil.
Asegúrate de que sea fácil de entender para los turistas.
Usa oraciones simples.
Algunas instrucciones pueden combinarse.
Por ejemplo:
Escribe un artículo de viajes en inglés, casual y fácil de leer, sobre Bali para turistas internacionales.
El resultado solicitado sigue siendo claro, pero el número de tokens enviados es mucho menor.
El principio simple es:
Los prompts deben ser claros, no largos.
2. Limita la longitud de la respuesta de la IA
Si solo necesitas una respuesta corta, no dejes que la IA genere un texto demasiado extenso.
Puedes añadir instrucciones como:
Responde en un máximo de 150 palabras.
o:
Da solo la respuesta final sin explicación.
Esto es muy útil si la IA se utiliza a través de una API, porque la salida de la IA también suele contarse como tokens.
Cuanto más larga sea la salida, mayor será el costo.
3. No envíes toda la conversación si no es necesario
En las aplicaciones de chatbot, una causa del alto uso de tokens es que siempre se envía todo el historial del chat a la IA.
Por ejemplo, la conversación ha llegado a 50 mensajes.
Si cada solicitud envía los 50 mensajes, la IA tiene que releerlos todos cada vez que hay una nueva pregunta.
Pero la IA quizás solo necesite los últimos 5 a 10 mensajes.
La solución es enviar solo:
Instrucción del sistema
+
últimos 5 mensajes
+
último mensaje del usuario
Para aplicaciones más complejas, las conversaciones más antiguas también pueden resumirse antes.
4. Usa resúmenes para conversaciones largas
Si la IA todavía necesita contexto de conversaciones anteriores, no tienes que enviar todo completo.
Por ejemplo, una conversación anterior tenía 10.000 tokens.
En lugar de reenviar todo, crea un resumen como:
El usuario está creando una aplicación de reserva de villas usando Next.js y Laravel.
Progreso actual:
- Autenticación completada
- API de reservas completada
- La integración del calendario aún está en desarrollo
- El usuario prefiere JavaScript en lugar de TypeScript
Ese resumen podría usar solo unos cientos de tokens, pero sigue proporcionando suficiente contexto a la IA.
Este método es muy efectivo para chatbots con conversaciones largas.
5. Elige el modelo según la tarea
No todas las tareas requieren el modelo de IA más avanzado.
Para tareas simples como:
- Traducción
- Clasificación
- Creación de meta descripciones
- Limpieza de texto
- Extracción de datos
- Determinación de categorías
- Creación de etiquetas
- Análisis de sentimiento
un modelo más pequeño suele ser suficiente.
Los modelos más potentes son más adecuados para tareas como:
- Análisis complejo
- Programación
- Planificación
- Razonamiento
- Lectura de documentos complejos
- Toma de decisiones basada en grandes cantidades de datos
Una buena estrategia es usar múltiples modelos dentro de una misma aplicación.
Por ejemplo:
Traducción → modelo pequeño
Clasificación → modelo pequeño
Generación de artículos → modelo mediano
Razonamiento complejo → modelo grande
De esta manera, los costos de IA pueden controlarse mucho más.
6. No envíes datos innecesarios
Por ejemplo, quieres que la IA cree una descripción de producto.
No envíes todos los datos del producto así:
{
"id": 8293,
"created_at": "...",
"updated_at": "...",
"internal_code": "...",
"database_id": "...",
"name": "Villa Bumi",
"bedroom": 4,
"location": "Kerobokan",
"description": "...",
"internal_notes": "...",
"staff_id": "...",
"supplier_id": "..."
}
Si la IA solo necesita:
{
"name": "Villa Bumi",
"bedroom": 4,
"location": "Kerobokan",
"description": "..."
}
solo envía esa parte.
Cuanto más limpios sean los datos enviados a la IA, menos tokens se desperdician.
7. Evita JSON demasiado grande
JSON es ciertamente conveniente para la comunicación entre aplicaciones y la IA.
El problema es que el formato JSON puede usar muchos tokens porque los nombres de los campos se repiten.
Por ejemplo:
{
"villa_name": "Villa A",
"villa_location": "Seminyak",
"villa_bedroom": 4
}
Si los datos tienen miles de filas, el uso de tokens solo por los nombres de los campos puede ser significativo.
Para grandes cantidades de datos, a veces un formato más simple puede ser más eficiente.
Por ejemplo:
Villa A | Seminyak | 4BR
Villa B | Umalas | 3BR
Villa C | Canggu | 5BR
Solo asegúrate de que el formato sea fácil de entender para la IA y para tu aplicación.
8. Usa RAG para documentos grandes
Si tienes cientos de artículos o documentos, no los envíes todos cada vez que un usuario pregunte.
Usa el sistema RAG (Retrieval-Augmented Generation), es decir, generación aumentada por recuperación.
El concepto básico:
El usuario pregunta
↓
Buscar documentos relevantes
↓
Tomar algunas partes importantes
↓
Enviar esas partes a la IA
↓
La IA genera una respuesta
Por ejemplo, tu base de datos tiene 1.000 artículos.
El usuario pregunta:
¿Cuánto cuesta el traslado desde el aeropuerto?
El sistema solo toma los documentos que hablan del traslado desde el aeropuerto.
La IA no necesita leer los 1.000 artículos.
Además de ahorrar tokens, este método generalmente hace que las respuestas sean más relevantes.
9. Limita la cantidad de datos de la base de datos
Lo mismo aplica cuando la IA toma datos de una base de datos.
Por ejemplo, tienes 50.000 reservas.
No envíes directamente:
SELECT * FROM bookings;
Si la pregunta es:
¿Cuántas reservas hay en agosto?
es mejor que la base de datos haga el filtrado primero.
Por ejemplo:
SELECT *
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';
Incluso si la IA solo necesita el número de reservas, la base de datos puede hacer directamente:
SELECT COUNT(*)
FROM bookings
WHERE check_in >= '2026-08-01'
AND check_in < '2026-09-01';
Deja que la base de datos haga el trabajo que es más adecuado para ella.
No le des todo a la IA.
10. No le pidas a la IA que genere datos que ya existen
Por ejemplo, la aplicación ya sabe:
Check-in: 10 de agosto
Check-out: 15 de agosto
Si solo quieres saber el número de noches, en realidad no necesitas IA.
Cálculos como:
15 de agosto - 10 de agosto = 5 noches
se hacen mejor directamente con código.
La IA debe usarse para tareas que realmente requieren habilidades de lenguaje o razonamiento.
Cosas simples como:
- Cálculos
- Filtrado
- Ordenamiento
- Formato de fechas
- Conversión de datos
- Validación simple
generalmente son más baratas y rápidas de hacer directamente en la aplicación.
11. Almacena en caché los resultados de IA usados con frecuencia
Si las mismas preguntas aparecen con frecuencia, considera usar caché.
Por ejemplo, los usuarios suelen preguntar:
¿A qué hora es el check-in?
Si la información es siempre la misma, no hay necesidad de llamar a la IA cada vez.
El resultado anterior puede guardarse.
El concepto:
Solicitud del usuario
↓
Verificar caché
↓
¿Resultado disponible?
├── Sí → usar resultado anterior
└── No → pedir a la IA → guardar en caché
El caché es muy útil para aplicaciones con alto tráfico.
12. No proporciones demasiados ejemplos
Los ejemplos en los prompts ayudan a la IA a entender el formato deseado.
Pero demasiados ejemplos también aumentan el uso de tokens.
Por ejemplo, tienes 20 ejemplos de artículos.
No es necesario enviarlos todos.
Normalmente basta con proporcionar:
1 a 3 mejores ejemplos
Elige ejemplos que representen mejor el estilo de salida que deseas.
13. Separa los prompts obligatorios y opcionales
Si tienes un system prompt grande, trata de revisar cada instrucción de nuevo.
Pregunta:
¿La IA realmente necesita esta instrucción en cada solicitud?
Si la respuesta es no, esa instrucción puede eliminarse o enviarse solo cuando sea necesario.
Un system prompt que inicialmente tenía 3.000 tokens a veces puede reducirse a 800-1.500 tokens sin cambios importantes en la salida.
Si la aplicación procesa miles de solicitudes, esos ahorros pueden ser bastante significativos.
14. Supervisa el uso de tokens
No te limites a mirar la factura total de IA a final de mes.
Es mejor registrar el uso de tokens para cada solicitud.
Por ejemplo:
Función: Generador de artículos
Tokens de entrada: 1.240
Tokens de salida: 1.850
Tokens totales: 3.090
Luego compara con otras funciones:
Traductor
Promedio: 850 tokens
Generador de artículos
Promedio: 3.500 tokens
Atención al cliente
Promedio: 6.200 tokens
Con esto, puedes ver qué función usa más tokens.
15. Calcula el costo por solicitud
Para aplicaciones comerciales, un número importante es el costo por solicitud.
Por ejemplo:
1 solicitud = Rp20
Si hay:
100 solicitudes por día
eso significa alrededor de:
Rp2.000 por día
Pero si hay:
100.000 solicitudes por día
el costo se convierte en:
Rp2.000.000 por día
Por eso las pequeñas optimizaciones pueden tener un gran impacto cuando una aplicación empieza a tener muchos usuarios.
La combinación de estrategias más efectiva
Si quieres usar los tokens de manera más eficiente, puedes utilizar un flujo como este:
Solicitud del usuario
↓
¿Se puede hacer sin IA?
↓
Sí → procesar con la aplicación
↓
No
↓
Tomar solo los datos relevantes
↓
Usar el modelo más barato que pueda hacer la tarea
↓
Limitar la longitud de la salida
↓
Guardar el resultado en caché si es posible
Con un sistema así, la IA se utiliza solo cuando realmente se necesita.
Conclusión
Ahorrar tokens no significa hacer que la IA sea menos inteligente ni que los prompts sean lo más cortos posible.
Lo que hay que hacer es eliminar la información que no aporta valor al resultado final.
Algunas de las optimizaciones más efectivas son:
- Hacer los prompts más concisos
- Limitar la longitud de la salida
- No enviar todo el historial del chat
- Resumir conversaciones antiguas
- Elegir el modelo según la tarea
- Enviar solo los datos necesarios
- Usar RAG para documentos grandes
- Filtrar en la base de datos
- Usar código para tareas simples
- Usar caché
- Supervisar el costo por solicitud
Si la IA se utiliza a gran escala, ahorrar solo unos cientos de tokens por solicitud puede generar ahorros significativos.
En resumen, no uses IA para procesar datos que la IA no necesita leer realmente.
Artículos Relacionados
Consejos para lidiar con los aumentos de precios de componentes de PC: RAM, SSD y GPU
Escrito por
Wilan
Colaborador permanente de Bali Island Tekno que activamente comparte conocimientos sobre tecnología, programación y el mundo de la ingeniería de software.