Modelos, tokens y ventana de contexto: qué pasa entre bastidores
Cada vez que escribes a Claude o a ChatGPT, tres cosas determinan el resultado: qué modelo responde, cuántos tokens usa el chat y cuánto espacio queda en la ventana de contexto. Si entiendes las tres, elegirás la herramienta adecuada, ahorrarás uso y obtendrás respuestas más precisas.
01Pero ¿qué es un modelo de lenguaje?
Un modelo de lenguaje (LLM) es un software entrenado con una cantidad enorme de texto: libros, sitios web, código, documentos. Con ese entrenamiento aprendió los patrones del lenguaje y muchísimo conocimiento.
En esencia hace una sola cosa: adivina lo que viene después. Lee lo que escribiste, predice la siguiente palabra (más exactamente, el siguiente token), la añade y repite hasta formar una respuesta completa.
Parece sencillo, pero cuando el modelo es grande y está bien entrenado, esas predicciones son lo bastante buenas como para redactar un correo, revisar un cálculo o escribir código.
02Un motor y un escritorio
Piensa en el modelo como la cilindrada del motor de un vehículo: un motor grande es más potente, pero consume más combustible, y no lo necesitas para ir a la tienda de la esquina. La ventana de contexto es la superficie del escritorio en el que trabajas: cada documento, plano y mensaje que pones encima ocupa espacio. Cuando el escritorio está lleno, resumes, retiras algunos papeles o empiezas en un escritorio limpio.
03Qué pasa cuando pulsas enviar
- 1Tu textoLa pregunta, los archivos y todos los mensajes anteriores del chat
- 2División en tokensEl texto se corta en pequeños fragmentos de palabras
- 3El modeloCalcula cuál es el siguiente token más probable
- 4Nuevos tokensSe generan uno a uno, cada uno a partir de los anteriores
- 5La respuestaLos tokens se vuelven a unir en el texto que lees
04Familias de modelos de Claude
Haiku
El modelo pequeño y rápido. Bueno para tareas breves y repetitivas: clasificar correos, extraer datos de una tabla, respuestas rápidas.
Sonnet
Una buena combinación de velocidad e inteligencia. Una opción por defecto sensata para la mayor parte del trabajo diario: redactar, resumir, revisar documentos.
Opus
Un modelo grande para trabajos complejos y largos: revisar un cálculo delicado, agentes de programación, analizar muchos documentos a la vez. Es más lento y consume más de tu cuota.
Gama más alta
A fecha de octubre de 2026, existe también un modelo llamado Fable por encima de Opus, para las tareas de razonamiento más difíciles. Los nombres y las versiones cambian, así que consulta siempre la página oficial de modelos.
ChatGPT y Gemini
OpenAI y Google también ofrecen modelos más grandes y más pequeños, además de variantes con razonamiento. La lógica es la misma: más grande significa más inteligente, pero más lento y más caro.
05Tokens, contexto y razonamiento: los términos clave
Token
Un fragmento de palabra. Una palabra corta puede ser un token; una larga, varios. Todo lo que entra en el modelo y sale de él se cuenta en tokens.
Hebreo frente a inglés
En general, el mismo contenido en hebreo suele dividirse en más tokens que en inglés, porque los modelos se entrenaron sobre todo con textos en inglés. Por eso los chats en hebreo se llenan antes.
Ventana de contexto
Cuántos tokens puede ver el modelo a la vez en un chat: instrucciones, archivos, tus mensajes y sus respuestas. Lo que quede fuera, no lo ve. Con cada mensaje, el modelo vuelve a leer todo el chat.
Cuando se llena
En los planes de pago, Claude resume automáticamente las partes más antiguas para hacer espacio (Claude Code lo llama compaction). Los primeros detalles pueden volverse difusos, así que para un tema nuevo abre un chat nuevo con un breve resumen.
Modo de razonamiento
El modelo razona en silencio antes de responder: descompone el problema y se revisa a sí mismo. Es mejor para cálculos y análisis, pero más lento y usa más tokens.
Límites de uso
Los planes de Claude tienen límites de uso. Los chats largos, los archivos grandes, los modelos pesados y el modo de razonamiento consumen más de tu cuota.
06Un correo rápido a un cliente
07Revisar un informe de cálculo extenso
08Un agente de programación que corrige una aplicación
09Qué modelo para cada tarea
| Tarea | Nivel de modelo | Razonamiento | Por qué |
|---|---|---|---|
| Correo breve o reformulación | Haiku o Sonnet | Desactivado | Tarea sencilla, importa la rapidez |
| Resumir actas de reunión | Sonnet | Desactivado | Texto de extensión media, sin cálculos |
| Traducir una especificación técnica | Sonnet | Desactivado o bajo | Requiere términos precisos, no un razonamiento profundo |
| Extraer datos de decenas de facturas | Haiku | Desactivado | Muchas tareas pequeñas y repetitivas |
| Revisar un informe de cálculo o una norma | Opus | Activado | Requiere lógica, unidades y autocomprobación |
| Comparar presupuestos complejos | Sonnet u Opus | Activado | Muchos parámetros y condiciones |
| Agente de programación o automatización larga | Opus | Activado | Muchos pasos, requiere planificar y corregir |
| Lluvia de ideas para títulos de artículos | Sonnet | Desactivado | Creatividad, no cálculo |
10Cómo ahorrar uso
- 1
Ajusta el modelo a la tarea
No uses Opus para un correo de dos líneas. Sonnet o Haiku lo harán más rápido y más barato.
- 2
Un tema, un chat
Un chat largo se vuelve a leer con cada mensaje. Tema nuevo = chat nuevo con un breve resumen.
- 3
Envía solo lo necesario
En lugar de un PDF de 200 páginas, adjunta el capítulo pertinente o pega la tabla que necesitas.
- 4
Usa Projects
En Projects, los documentos se recuperan según se necesitan, en lugar de cargarse todos en cada chat (ver Contexto que permanece).
- 5
Desactiva las herramientas que no necesitas
Los conectores y las herramientas activos ocupan espacio en la ventana de contexto. Deja activado solo lo que usas.
- 6
Razonamiento solo cuando ayuda
Sí para cálculos y análisis; no para redactar un correo.
11Por qué siempre hay que verificar: las alucinaciones
Lo que el modelo puede hacer
- Inventar un número de apartado de una norma que no existe
- Dar un valor de coeficiente que parece correcto, pero es erróneo
- Citar una fuente que no existe
- Sonar totalmente seguro incluso cuando se equivoca
Lo que haces tú
- Comprobar cada número con la norma o el catálogo original
- Pedir la fuente y verificarla tú mismo
- Adjuntar el propio documento en lugar de fiarte de la memoria del modelo
- Firmar solo lo que hayas comprobado tú mismo
12Preguntas frecuentes
¿Por qué el modelo "olvida" cosas que dije al principio del chat?
Probablemente la ventana de contexto se llenó y Claude resumió las partes más antiguas, o el chat es tan largo que los detalles se pierden. Abre un chat nuevo con un resumen de los puntos clave.
¿Debo escribir en inglés para ahorrar tokens?
No necesariamente. El hebreo suele usar más tokens, pero si te sientes cómodo en hebreo, las respuestas son buenas. Para documentos muy largos, vale la pena considerar el inglés.
¿Cómo sé qué modelos tengo?
En el selector de modelos de la interfaz de Claude. La lista depende de tu plan, y los nombres cambian con el tiempo. La lista actualizada está en la página de modelos de la documentación de Claude.
¿Un modelo más grande siempre es mejor?
No. Para tareas sencillas es más lento y consume más cuota sin mucha ganancia. Elige el modelo más pequeño que haga bien el trabajo.
¿El modo de razonamiento evita las alucinaciones?
Reduce los errores en cálculos y razonamientos, pero no los elimina. Sigues teniendo que comprobar cada número importante.