Модели, токены и контекстное окно: что происходит за кулисами
Каждый раз, когда вы пишете Claude или ChatGPT, на результат влияют три вещи: какая модель отвечает, сколько токенов расходует чат и сколько места осталось в контекстном окне. Разберитесь во всех трёх — и вы будете выбирать правильный инструмент, экономить лимиты и получать более точные ответы.
01Что вообще такое языковая модель?
Языковая модель (LLM) — это программа, обученная на огромном объёме текстов: книгах, сайтах, коде, документах. В ходе обучения она усвоила закономерности языка и множество знаний.
По сути она делает одно: угадывает, что будет дальше. Она читает написанное вами, предсказывает следующее слово (точнее, следующий токен), добавляет его и повторяет это, пока не сложится полный ответ.
Звучит просто, но когда модель большая и хорошо обучена, её догадки достаточно хороши, чтобы составить письмо, проверить расчёт или написать код.
02Двигатель и рабочий стол
Представьте модель как объём двигателя автомобиля: большой двигатель мощнее, но расходует больше топлива, и для поездки в магазин за углом он не нужен. Контекстное окно — это поверхность рабочего стола: каждый документ, чертёж и сообщение, которые вы на него кладёте, занимают место. Когда стол заполнен, вы делаете краткую сводку, убираете часть бумаг или начинаете за чистым столом.
03Что происходит, когда вы нажимаете «Отправить»
- 1Ваш текстВопрос, файлы и все предыдущие сообщения в чате
- 2Разбиение на токеныТекст режется на небольшие фрагменты слов
- 3МодельВычисляет наиболее вероятный следующий токен
- 4Новые токеныГенерируются один за другим, каждый — на основе предыдущих
- 5ОтветТокены снова собираются в текст, который вы читаете
04Семейства моделей Claude
Haiku
Небольшая быстрая модель. Хороша для коротких однотипных задач: сортировки писем, извлечения данных из таблицы, быстрых ответов.
Sonnet
Удачное сочетание скорости и интеллекта. Разумный выбор по умолчанию для большей части повседневной работы: написания текстов, кратких сводок, проверки документов.
Opus
Большая модель для сложной и долгой работы: проверки непростого расчёта, агентов для программирования, анализа множества документов одновременно. Работает медленнее и расходует больше вашего лимита.
Высший уровень
По состоянию на октябрь 2026 года над Opus есть ещё модель Fable — для самых сложных задач на рассуждение. Названия и версии меняются, поэтому всегда сверяйтесь с официальной страницей моделей.
ChatGPT и Gemini
OpenAI и Google тоже предлагают большие и малые модели, а также варианты с режимом размышления. Логика та же: чем больше модель, тем она умнее, но медленнее и дороже.
05Токены, контекст и размышление: ключевые термины
Токен
Фрагмент слова. Короткое слово может быть одним токеном, длинное — несколькими. Всё, что поступает в модель и выходит из неё, считается в токенах.
Иврит и английский
Как правило, один и тот же текст на иврите разбивается на большее число токенов, чем на английском, потому что модели обучались в основном на английском. Поэтому чаты на иврите заполняются быстрее.
Контекстное окно
Сколько токенов модель может видеть одновременно в одном чате: инструкции, файлы, ваши сообщения и её ответы. Всё, что выходит за эти пределы, ей не видно. С каждым сообщением модель перечитывает весь чат.
Когда окно заполняется
На платных тарифах Claude автоматически сжимает старые части диалога в краткую сводку, чтобы освободить место (в Claude Code это называется compaction). Ранние подробности могут размываться, поэтому для новой темы начинайте новый чат с краткой сводкой.
Режим размышления
Модель молча рассуждает перед ответом: разбивает задачу на части и проверяет себя. Лучше подходит для расчётов и анализа, но работает медленнее и расходует больше токенов.
Лимиты использования
У тарифов Claude есть лимиты использования. Длинные чаты, большие файлы, тяжёлые модели и режим размышления — всё это расходует лимит быстрее.
06Короткое письмо клиенту
07Проверка длинного расчётного отчёта
08Агент для программирования исправляет приложение
09Какая модель для какой задачи
| Задача | Уровень модели | Размышление | Почему |
|---|---|---|---|
| Короткое письмо или перефразирование | Haiku или Sonnet | Выкл. | Простая задача, важна скорость |
| Краткая сводка протокола совещания | Sonnet | Выкл. | Текст средней длины, без расчётов |
| Перевод технической спецификации | Sonnet | Выкл. или низкий уровень | Нужны точные термины, а не глубокие рассуждения |
| Извлечение данных из десятков счетов | Haiku | Выкл. | Много мелких однотипных задач |
| Проверка расчётного отчёта или стандарта | Opus | Вкл. | Нужны логика, контроль единиц и самопроверка |
| Сравнение сложных коммерческих предложений | Sonnet или Opus | Вкл. | Много параметров и условий |
| Агент для программирования или долгая автоматизация | Opus | Вкл. | Много шагов, нужны планирование и исправления |
| Мозговой штурм заголовков для статьи | Sonnet | Выкл. | Нужна креативность, а не расчёт |
10Как экономить лимиты
- 1
Подбирайте модель под задачу
Не используйте Opus для письма в две строки. Sonnet или Haiku справятся быстрее и дешевле.
- 2
Одна тема — один чат
Длинный чат перечитывается с каждым сообщением. Новая тема — новый чат с краткой сводкой.
- 3
Отправляйте только нужное
Вместо PDF на 200 страниц прикрепите нужную главу или вставьте нужную таблицу.
- 4
Используйте Projects
В Projects документы подтягиваются по мере необходимости, а не загружаются целиком в каждый чат (см. Контекст, который остаётся).
- 5
Отключайте ненужные инструменты
Активные коннекторы и инструменты занимают место в контекстном окне. Оставляйте включённым только то, чем пользуетесь.
- 6
Размышление — только когда оно помогает
Да — для расчётов и анализа, нет — для составления письма.
11Почему проверять нужно всегда: галлюцинации
Что может сделать модель
- Выдумать номер пункта стандарта, которого не существует
- Назвать значение коэффициента, которое звучит правдоподобно, но неверно
- Сослаться на несуществующий источник
- Звучать совершенно уверенно, даже когда ошибается
Что делаете вы
- Сверяете каждое число с первоисточником — стандартом или каталогом
- Просите указать источник и проверяете его сами
- Прикладываете сам документ, а не полагаетесь на память модели
- Подписываете только то, что проверили лично
12Частые вопросы
Почему модель «забывает» то, что я сказал в начале чата?
Вероятно, контекстное окно заполнилось и Claude сжал старые части в сводку, или чат просто настолько длинный, что детали теряются. Начните новый чат с краткой сводкой ключевых моментов.
Стоит ли писать по-английски, чтобы экономить токены?
Не обязательно. Иврит обычно расходует больше токенов, но если вам удобно писать на иврите, ответы будут хорошими. Для очень длинных документов английский стоит рассмотреть.
Как узнать, какие модели мне доступны?
В селекторе моделей в интерфейсе Claude. Список зависит от вашего тарифа, а названия со временем меняются. Актуальный список — на странице моделей в документации Claude.
Большая модель всегда лучше?
Нет. В простых задачах она работает медленнее и расходует больше лимита почти без выигрыша. Выбирайте самую маленькую модель, которая хорошо справляется с задачей.
Избавляет ли режим размышления от галлюцинаций?
Он уменьшает число ошибок в расчётах и рассуждениях, но не устраняет их полностью. Каждое важное число всё равно нужно проверять.