Skip to main content
PromptQuorum
Inicio/Prompt Engineering/Tokens, costes y límites: La economía del prompting de IA en 2026
Fundamentals

Tokens, costes y límites: La economía del prompting de IA en 2026

·13 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Cada llamada a la API de IA se mide y factura en tokens — la unidad que controla tanto lo que el modelo puede procesar como cuánto pagas. Entender los tokens es la base del prompting eficiente y rentable.

Tokens, costes y límites: La economía del prompting de IA en 2026

Puntos clave

  • Los tokens son la unidad de coste y procesamiento de la IA. Aproximadamente 3–4 caracteres = 1 token en inglés; otros idiomas requieren más tokens.
  • Pagas por separado los tokens de input y de output — los tokens de output cuestan típicamente 2–5× más.
  • El conteo de tokens incluye los system prompts, el historial completo de conversación, los archivos adjuntos y las imágenes — no solo tu último mensaje.
  • Los límites de tasa existen para prevenir el abuso y garantizar una asignación justa de recursos.
  • Usar el modelo correcto para la tarea reduce el coste en 10–25×.
  • Los LLMs locales mediante Ollama o LM Studio tienen coste cero de API por token pero requieren inversión en VRAM.

Resumen visual: Tokens, costes y límites: La economía del prompting de IA en 2026

¿Prefieres slides a la lectura? Navega por esta presentación interactiva con todos los conceptos clave, ajustes y casos de uso — y guárdala como PDF de referencia.

El deck cubre: precios de tokens, límites de tasa, selección de modelos y estrategias de reducción de costes. Descarga el PDF como tarjeta de referencia de economía de tokens de IA.

Download Tokens, costes y límites: La economía del prompting de IA en 2026 Reference Card (PDF)

¿Qué es un token?

Un token es la unidad de texto más pequeña que procesa un modelo de IA, aproximadamente 3–4 caracteres o ¾ de una palabra en inglés. En texto inglés, "ChatGPT" cuenta como 2 tokens, y "Hello, how are you?" son aproximadamente 5–6 tokens. Otros idiomas tokenizan menos eficientemente — la misma frase en alemán o japonés puede consumir un 20–40% más de tokens. Se te cobra por cada token de tu prompt (input) y por cada token que el modelo produce.

Los modelos no "piensan" en palabras o caracteres. Internamente, convierten tu texto en IDs de token y los procesan numéricamente.

En una oración: un token es la unidad de texto más pequeña que procesa un modelo de IA, aproximadamente 3–4 caracteres o ¾ de una palabra en inglés, y se te cobra por cada token de entrada y cada token de salida.

Cómo funciona el conteo de tokens en la práctica

Cada elemento de tu llamada a la API — system prompt, historial de conversación, nuevo mensaje, archivos y el propio output del modelo — consume tokens de tu cuota.

  • System prompt: Contado una vez por mensaje. Un system prompt de 200 palabras = ~250 tokens en cada llamada a la API.
  • Historial completo de conversación: Incluido en cada solicitud a menos que se resuma o descarte explícitamente.
  • Tu mensaje de input: Contado tal cual.
  • Archivos o imágenes adjuntas: Las imágenes consumen 100–2.000 tokens según el tamaño y la resolución.
  • Output del modelo: La respuesta generada se cuenta íntegramente a tasas de tokens de output (generalmente 2–5× más altas que las tasas de input).
  • Ejemplo práctico: System prompt (300) + Pregunta 1 (150) + Respuesta 1 (200) + Pregunta 2 (200) + Respuesta 2 (300) + Pregunta 3 (100) = 1.250 tokens. Cuando envías la pregunta 3, pagas de nuevo por todo el historial más el output de la respuesta 3.

¿Cuánto cuestan GPT-5.6, Claude y Gemini por millón de tokens en 2026?

Los precios varían drásticamente según la capacidad del modelo. Todos los valores a continuación son precios públicos a partir de abril de 2026.

Precios a partir de abril de 2026. Verifica las tasas actuales: Precios OpenAI · Precios Anthropic · Precios Google

ModeloInput (por 1M tokens)Output (por 1M tokens)
OpenAI GPT-5.6$5.00$15.00
Anthropic Claude Opus 5$5.00$25.00
Google Gemini 3.1 Pro$2.00$12.00
OpenAI GPT-5.6 Luna$0.20$1.20
Anthropic Claude Haiku 4.5$0.25$1.25
Google Gemini 3.5 Flash$0.075$0.30

¿Qué son los límites de tasa y por qué existen?

Los límites de tasa son topes en cuántas solicitudes puedes hacer por minuto (RPM), cuántos tokens puedes procesar por minuto (TPM) o cuántos tokens por día (TPD).

  • Solicitudes por minuto (RPM): El número de llamadas a la API que puedes hacer en una ventana de 60 segundos.
  • Tokens por minuto (TPM): El rendimiento total de tokens. Un solo prompt grande puede consumir toda tu cuota de TPM en segundos.
  • Escenarios comunes donde alcanzas los límites: Pipelines automatizados, grandes trabajos de procesamiento por lotes, o usuarios del nivel gratuito en situaciones de pico.
  • Límites típicos: Nivel gratuito: 3–15 RPM, 40k–100k TPM. Nivel de pago 1: 500 RPM, 200k–500k TPM. Empresa: 3.000+ RPM, millones de TPM.
  • Estrategias de solución: Agrupa tareas pequeñas en solicitudes más grandes, añade retrasos entre solicitudes, o actualiza a una cuenta de nivel superior.

¿Cómo puedo reducir mis costes de API LLM un 30–25×?

Cada token innecesario en tu prompt desperdicia dinero. Reducir un system prompt de 500 tokens a 300 tokens ahorra $0.001 por llamada, pero a 1.000 llamadas al día, eso es $1/día o $365/año.

  • Recorta el contexto agresivamente: No repitas lo que el modelo ya sabe.
  • Usa restricciones de longitud explícitas: "Responde en 3 puntos" o "Máximo 100 palabras" fuerza la brevedad.
  • Evita el relleno en los system prompts: Cada palabra de relleno cuesta dinero.

Cómo reducir los costes de API de LLM en 5 pasos

  1. 1
    Ajusta el modelo a la complejidad de la tarea: usa GPT-5.6 Luna o Claude Haiku 4.5 para clasificación simple y Q&A — 25× más barato que los modelos frontier
  2. 2
    Resume el historial de conversación cada 5 turnos: evita que el historial completo se vuelva a cobrar en cada llamada
  3. 3
    Limita la longitud del output explícitamente: "Responde en 3 puntos" o "Máximo 100 palabras" evita respuestas verbosas
  4. 4
    Recorta los system prompts a lo esencial: elimina las frases de relleno
  5. 5
    Prueba los LLMs locales mediante Ollama para flujos de trabajo privados de alto volumen: coste cero de API por token

Elegir el modelo correcto para la tarea correcta

No toda tarea requiere OpenAI GPT-5.6 o Anthropic Claude Opus.

Tipo de tareaModelo recomendadoCoste vs GPT-5.6
Clasificación simple / Sí-NoGPT-5.6 Luna, Claude Haiku 4.5 o Gemini Flash25× más barato
Q&A factual cortoGPT-5.6 Luna o Claude Haiku 4.510–25× más barato
Análisis complejo o códigoGPT-5.6 o Claude Opus 5Referencia
Escritura creativa largaClaude Opus 5 o GPT-5.6Referencia
Flujos de trabajo privados de alto volumenModelo local mediante OllamaCoste de API cero

¿Cuáles son los trade-offs entre LLMs locales (Ollama) y APIs cloud?

Los modelos locales mediante Ollama o LM Studio tienen coste cero de API por token — solo pagas por el hardware (VRAM y electricidad).

  • Costes de hardware: LLaMA 3.1 7B requiere ~8 GB VRAM, modelos 13B necesitan ~16 GB, modelos 70B necesitan 40 GB+.
  • Trade-off de capacidad: Los modelos locales son excelentes para clasificación, resumen y tareas repetitivas. Tienen dificultades con el razonamiento de varios pasos.
  • Trade-off de latencia: Los modelos cloud responden en 500ms–2s. Los modelos locales en hardware de consumo: 2–10s.
  • Cuándo usar local: Automatización de alto volumen, datos sensibles al RGPD, o flujos de trabajo críticos.
  • Cuándo usar cloud: Aplicaciones sensibles a la latencia o análisis únicos donde el coste de la API es insignificante.

Contexto regional

UE / RGPD Para las organizaciones de la UE que procesan datos personales a través de APIs de IA, los costes de tokens incluyen un coste de cumplimiento no visible en las tablas de precios: cada token enviado a una API en la nube es un dato personal procesado por un tercero según el Artículo 28 del RGPD, lo que requiere un Acuerdo de Tratamiento de Datos y un mecanismo de transferencia según el Artículo 46 para proveedores fuera de la UE.

Los LLM locales mediante Ollama eliminan esto por completo. Para los equipos de la UE que procesan datos de clientes, tickets de soporte o documentos internos: el coste real de una llamada a una API en la nube incluye la sobrecarga de cumplimiento de la transferencia externa de datos. A escala, esto puede hacer que la inferencia local sea económicamente competitiva incluso teniendo en cuenta la inversión en hardware.

Las organizaciones alemanas sujetas a las directrices BSI IT-Grundschutz deben documentar los costes de procesamiento de IA y los flujos de datos — los registros de tokens de las APIs en la nube satisfacen este requisito si se conservan con controles de acceso adecuados.

Japón (METI) El texto en japonés requiere entre un 20% y un 40% más de tokens que el texto equivalente en inglés debido a la ineficiencia del tokenizador en escrituras CJK. Un documento japonés de 1.000 palabras cuesta aproximadamente $0.007 en GPT-5.6 frente a $0.005 para el mismo contenido en inglés. Para flujos de trabajo de IA en japonés, los modelos Qwen3 mediante Ollama son significativamente más eficientes en tokens — la tokenización nativa CJK reduce el recuento de tokens en japonés entre un 30% y un 40%, lo que reduce directamente el coste por llamada.

China Según la Ley de Seguridad de Datos de China (数据安全法), el envío de datos empresariales a APIs de IA en la nube extranjeras requiere una revisión de cumplimiento de localización de datos. Para los equipos empresariales chinos, la inferencia local mediante Qwen3 (Alibaba) elimina simultáneamente el coste de transferencia de datos transfronteriza y el riesgo de cumplimiento. Con 1.000 o más llamadas a la API por día, el coste de amortización del hardware de un servidor de inferencia local suele ser inferior a las tarifas de API en un plazo de 6 a 12 meses.

Cómo PromptQuorum te ayuda a gestionar los costes de tokens

PromptQuorum utiliza dos LLM: un LLM de backend y un LLM de frontend (el modelo que elijas para responder tu pregunta). El LLM de backend optimiza tu prompt y ejecuta un análisis de consenso Quorum en varios modelos de frontend. A diferencia de las interfaces de chat de un solo modelo, PromptQuorum hace que el uso de tokens sea visible y procesable.

Los tokens del LLM de backend siempre son visibles. La visibilidad de los tokens de frontend depende de cómo accedas al modelo:

  • Interfaces públicas (Copilot, chat web público de Claude): Los tokens de frontend NO son visibles — solo se muestran los del backend.
  • Modelos locales (LM Studio, Ollama): Los tokens de frontend SÍ son visibles — se ejecuta en tu hardware, y PromptQuorum ve el uso de tokens directamente.
  • APIs (OpenAI, Anthropic): Depende. Con integración directa de API, los tokens de frontend son visibles. A través de un endpoint de terceros o una interfaz pública, no lo son.

Probado en PromptQuorum — 20 prompts idénticos de resumen de investigación enviados a GPT-5.6 y GPT-5.6 Luna: La calidad de salida coincidió en 17 de 20 tareas. Diferencia de coste: $0.003 por prompt (GPT-5.6) frente a $0.00007 por prompt (mini) — una reducción de coste de 43×. En las 3 tareas donde GPT-5.6 fue superior, la complejidad implicaba razonamiento de varios pasos entre documentos.

Recetas de costes de tokens — Escenarios comunes

Usa estas plantillas como puntos de partida para optimizar los costes en flujos de trabajo específicos.

  • "Búsqueda rápida / Tarea Sí-No": Usa GPT-5.6 Luna o Haiku. System prompt mínimo (≤50 tokens). Sin historial. Coste total por tarea: ~$0.00001–0.0001.
  • "Tarea de investigación larga (5–10 turnos)": Usa Claude Opus 5. Después de cada 5 turnos, resume el historial (reduce los tokens en un 70%). Costes: ~$0.01–0.05 por sesión.
  • "Pipeline automatizado / Procesamiento por lotes": Usa GPT-5.6 Luna para filtrado (25× más barato). Escala a GPT-5.6 solo para síntesis final.
  • "Flujo de trabajo sensible a la privacidad": Dirige a Ollama local. Coste de API cero.
  • "Comparación de outputs en modelos": Envía a GPT-5.6, Claude Opus 5 y Claude Haiku 4.5 simultáneamente. Elige el más barato que cumpla tu umbral de calidad.

Errores comunes que disparan tu factura de tokens

Evita estos patrones de desperdicio de tokens.

  • Enviar el historial completo de conversación en cada llamada: Resume cada 5 turnos o usa caché de prompts.
  • Usar un modelo de alta capacidad para tareas simples: Diferencia de coste: 25× en tareas simples.
  • No restringir la longitud del output: "Resume en 50 palabras" cuesta 8× menos que "cuéntame sobre X".
  • Repetir los system prompts largos en cada llamada: Usa caché de prompts si la API lo admite.
  • Olvidar los tokens de imagen: Una imagen de alta resolución puede consumir 500–2.000 tokens.

Preguntas frecuentes

¿Qué es un token en IA?

Un token es la unidad de texto más pequeña que procesa un modelo de IA — aproximadamente 3–4 caracteres o ¾ de una palabra en inglés. "ChatGPT" cuenta como 2 tokens. Se te cobra por cada token de entrada y cada token de salida, y los tokens de salida suelen costar 2–5× más que los de entrada.

¿Cuánto cuesta GPT-5.6 por token?

A partir de agosto de 2026: GPT-5.6 (Sol) cuesta $5.00 por 1M de tokens de entrada y $30.00 por 1M de tokens de salida. GPT-5.6 Luna cuesta $0.20 por 1M de entrada y $1.20 por 1M de salida — ~25× más barato para tareas que no requieren la capacidad completa de GPT-5.6 Sol.

¿Cómo funcionan los límites de tasa?

Los límites de tasa restringen las solicitudes por minuto (RPM) y los tokens por minuto (TPM). Nivel gratuito: 3–15 RPM, 40k–100k TPM. Nivel de pago: 500 RPM, 200k–500k TPM. Empresa: 3.000+ RPM. Soluciones: agrupa tareas pequeñas en solicitudes más grandes, añade retrasos entre llamadas o actualiza a un nivel superior.

¿Cuántos tokens tiene un artículo o informe típico?

Un artículo de 1.000 palabras ≈ 1.200–1.500 tokens. Un PDF de 10 páginas ≈ 4.000–6.000 tokens. Una imagen de alta resolución ≈ 500–2.000 tokens.

¿Por qué mi factura de API es más alta de lo esperado, incluso con prompts cortos?

Tres causas comunes: (1) Envías el historial completo en cada llamada. (2) Tu system prompt es largo. (3) Usas un modelo de alta capacidad para tareas simples.

¿Un system prompt más largo siempre significa un mejor output?

No. Un system prompt bien diseñado de 100 tokens a menudo supera a un prompt verboso de 500 tokens. La calidad gana a la cantidad.

¿Cuándo debo usar un LLM local en lugar de una API en la nube?

Usa LLMs locales para: automatización de alto volumen (1.000+ llamadas/día), datos sensibles al RGPD donde ningún dato personal debe salir de tu infraestructura, o pipelines críticos en coste donde la calidad es suficientemente buena. Usa APIs en la nube para: aplicaciones sensibles a la latencia, tareas de razonamiento complejo, o análisis puntuales donde el coste de la API es insignificante.

¿Cómo puedo reducir mis costes de tokens de la API de IA?

Siete estrategias: recorta los system prompts, limita la longitud del output, resume el historial de conversación cada 5 turnos, usa modelos más baratos para tareas simples, evita enviar el historial completo, reduce el tamaño de las imágenes antes de subirlas, y agrupa las llamadas de prueba en vez de ejecutarlas manualmente.

¿Cuántos tokens usa un prompt de IA típico?

Un prompt típico usa 150–500 tokens según la complejidad. Una pregunta simple (5–20 tokens), un párrafo medio (50–150 tokens), un prompt de investigación completo con ejemplos (200–600 tokens). Los tokens por prompt varían según el idioma y la complejidad.

¿Qué significa que un prompt tenga 3.000 tokens?

Un prompt de 3.000 tokens equivale aproximadamente a un artículo de 2.000 palabras o más de 10 páginas de texto. Esto indica un system prompt largo, historial de conversación completo, o contexto de documento extenso. Para mayor eficiencia, considera resumir el historial de conversación o recortar el contexto innecesario.

¿Cuánto cuesta cada prompt de IA según el modelo?

Los costes varían según el modelo: GPT-5.6 Luna = ~$0.00005–0.0001 por prompt. GPT-5.6 = ~$0.001–0.01. Claude Haiku = ~$0.00003 por prompt. Claude Opus = ~$0.005–0.02. Gemini Flash = ~$0.00002. Los costes dependen de la longitud del prompt y del output.

¿Cómo se calculan los tokens de un prompt de IA?

Los tokens se calculan dividiendo el texto en unidades de 3–4 caracteres (aproximadamente ¾ de palabras en inglés). Cuentan los system prompts, el historial de conversación, las imágenes, los archivos adjuntos y el output. La mayoría de los proveedores de API muestran el recuento exacto de tokens en las respuestas. Prompts más cortos y output limitado reducen el uso de tokens.

¿Cuántos tokens tiene un prompt de 1.000 palabras?

Un prompt de 1.000 palabras es aproximadamente 1.200–1.500 tokens en inglés. Otros idiomas tokenizan menos eficientemente y pueden requerir un 20–40% más de tokens. El recuento de tokens depende de la elección de palabras y la longitud media de las palabras del idioma usado.

¿Los límites de tokens se basan en un solo prompt o en toda la conversación?

Los límites de tokens se aplican a todo el historial de conversación, incluyendo todos los system prompts, mensajes anteriores, documentos recuperados y el prompt actual. Los límites de tasa (tokens por minuto) se acumulan en todas tus llamadas a la API en ese periodo, no solo en un prompt.

¿Cuántos prompts se pueden obtener de 1 millón de tokens?

Con 1 millón de tokens: 2.000–6.667 prompts si cada prompt promedia 150–500 tokens. Prompts de GPT-5.6 Luna (~300 tokens) = ~3.333 prompts. Prompts de GPT-5.6 (~500 tokens) = ~2.000 prompts. El recuento real depende del tamaño del prompt y la longitud del output.

¿La optimización de prompts reduce significativamente los costes de la API?

Sí. Reducir un system prompt de 500 tokens a 300 tokens ahorra ~$0.001 por llamada a la API. A 1.000 llamadas/día, eso son $365/año ahorrados. Limitar la longitud del output y resumir el historial de conversación cada 5 turnos reduce los costes en un 30–50%. La selección del modelo es la palanca más grande — GPT-5.6 Luna cuesta 25× menos que GPT-5.6.

Lecturas relacionadas

Aplica estas técnicas con un LLM local o tus propias claves de API — PromptQuorum funciona con cualquier backend.

Prueba PromptQuorum gratis →

← Volver a Prompt Engineering