# Сколько токенов в длинном запросе: как разделить его на 6 этапов в 2026 году

> Токены - это небольшие единицы текста, из которых модель собирает запрос, ответ и рабочий контекст. Разбираю, почему длинная сессия ломается и как разделить задачу на этапы.

Источник: https://vibeceh.ru/guides/tokeny-razdelit-dlinnyj-zapros-na-etapy
Автор: Сергей Мазур · опубликовано 2026-08-19

Если ты ищешь, сколько токенов занимает запрос, что такое гпт токены и почему длинная сессия расходует контекст, я обычно объясняю это так: нейросеть не читает текст как человек. Она разбивает его на небольшие фрагменты, обрабатывает их как последовательность и использует тот же принцип для ответа и внутреннего контекста. Чем длиннее работа, тем больше токенов накапливается и тем ближе лимит модели.

## Что такое токены в нейросети простыми словами?

я считаю токен рабочей единицей текста: Claude получает их во входе, выдаёт в ответе и тратит на контекст. Токен относится к способу обработки текста, а не к функции, продукту или настройке. AI-токены не связаны с электронными носителями, ключами доступа и авторизацией: здесь речь только о том, как модель считает и обрабатывает текст.

Когда ты отправляешь сообщение, Claude работает не с ним целиком. Текст превращается в последовательность токенов. Ответ тоже состоит из токенов. Внутренний контекст, который модель учитывает во время работы, измеряется в них же.

Отсюда две практические вещи.

Первая: токены относятся не только к твоей последней фразе. В них входят материалы, которые модель получила для текущего ответа: переписка, файлы, результаты команд и служебные инструкции.

Вторая: токены не равны словам. Один и тот же объём текста в разных языках и моделях может занимать разное количество токенов. Поэтому условный пример «в запросе 500 слов» ещё не говорит, сколько места текст займёт в контексте.

Не смешивай это значение с другими.

| Вид токена | Что означает | Где используется | Чем не является |
| --- | --- | --- | --- |
| Токен текста | Единица обработки текста моделью | Запросы, ответы и контекст | Не ключ доступа |
| Токен доступа | Данные для подтверждения доступа программы или пользователя | API и сервисы | Не единица обработки текста |

В этой статье токен всегда означает единицу обработки текста нейросетью.

## Как нейросеть делит слова на токены?

модель обрабатывает текст через последовательность небольших фрагментов. Эти фрагменты могут соответствовать части слова, целому слову или другому участку текста. Я не буду придумывать пример для русского слова: без конкретного токенизатора это будет догадка.

Запрос «токены слов» звучит так, будто модель берёт готовый словарь и раскладывает каждое слово целиком. На деле такой гарантии нет. Модель получает последовательность фрагментов и обрабатывает ее без человеческого представления о словах.

Поэтому не стоит рассуждать так: «В сообщении 20 слов, значит, токенов тоже 20». Это разные единицы подсчёта.

На количество влияют сам текст и модель. Русская фраза, английская фраза, код, путь к файлу и вывод команды могут занимать разный объём. Но точные правила для конкретного русского запроса зависят от конкретного токенизатора. В фактуре таких примеров нет, и я не буду подменять их догадкой.

Для работы с агентом я держу в голове другой вывод: любой прочитанный текст увеличивает рабочий контекст. Это касается не только сообщения в чате, но и файлов, команд и результатов поиска по проекту.

Если агент несколько раз перечитывает одни и те же файлы, он снова обрабатывает их содержимое, что отмечают в пользовательском отчёте о расходе контекста [19 days, 245 sessions, 123M tokens in Claude Code](https://www.reddit.com/r/ClaudeAI/comments/1ut866f/19_days_245_sessions_123m_tokens_in_claude_code/). Поэтому длинная сессия может расходовать токены даже тогда, когда новое сообщение короткое.

## Сколько текста помещает 1 токен?

одинакового объёма текста для одного токена нет. Размер зависит от самого текста и модели, поэтому у меня нет проверенного диапазона для русского языка. Известна только более крупная оценка Anthropic: 100 000 токенов в описании соответствовали примерно 75 000 словам.

Запрос «1 токен» часто заставляет искать простую конвертацию: один токен равен какому-то фиксированному числу символов или слов. Такой формулы для всех моделей нет.

Токен может занимать разный объём текста. На подсчёт влияет содержимое сообщения и способ, которым конкретная модель разбивает его на фрагменты. Поэтому даже два текста одинаковой длины по словам не обязаны занимать одинаковое место.

У меня нет проверенного диапазона для русского языка и примера токенизации одного запроса в конкретной модели, поэтому правило вроде «один токен - это четыре символа» я не пишу.

Есть только ориентир от Anthropic. При описании контекстного окна в 100 000 токенов компания сопоставила такой объём примерно с 75 000 словами. Это оценка для большого объёма. Она не служит переводчиком каждого отдельного токена.

Практический вывод простой: не пытайся оценивать длинную задачу только по числу слов. Смотри на весь контекст, который агент получает в работе, и оставляй запас для ответа.

## От чего зависит количество токенов в запросе?

я смотрю не на последнюю фразу, а на всё, что агент получил к этому ответу. В контекст попадают переписка, прочитанные файлы, результаты команд, системные инструкции, инструменты, skills, MCP и файлы проекта, включая скрытый стартовый контекст.

![Кот рассматривает карточки с источниками расхода контекста и командой /context.](https://s3.regru.cloud/crossmark/statejnik/images/guides/tokeny-razdelit-dlinnyj-zapros-na-etapy/kadr-1.webp)

Запрос «количество токенов» обычно считают слишком узко. Человек смотрит на своё сообщение и не видит остальную часть рабочего контекста.

В Claude Code до первого сообщения контекст может быть занят служебными материалами и содержимым проекта. Одно пользовательское измерение [скрытого расхода Claude Code](https://www.reddit.com/r/ClaudeCode/comments/1s3xjn4/) описывает такой стартовый объём, но это не норматив: точный расход зависит от настроек запуска, подключённых инструментов и файлов проекта.

Дальше я добавляю к этому ещё несколько источников расхода:

- сообщения текущей и предыдущей переписки;
- файлы, которые прочитал агент;
- результаты команд;
- системные инструкции;
- подключённые инструменты;
- skills;
- MCP;
- файлы проекта.

По мере заполнения окна Claude начинает забывать ранние инструкции и чаще ошибаться. Поэтому проблема длинного диалога не только в том, что он когда-нибудь упрётся в формальный предел. Качество может ухудшаться раньше.

Если агент прочитал большой файл, результат команды попал в чат, а потом ты продолжил работу, этот материал остаётся частью контекста. Новое короткое сообщение не обнуляет накопленное.

Я бы проверял [лимиты и расход контекста](/guides/tokeny-limity-i-schet-tablica-kontrolya-rashodov-claude-code) до начала сложной работы. Если в твоей версии интерфейса доступна команда `/context`, введи её:

```text
/context
```

Команда не превращает длинную сессию в короткую. Она помогает увидеть, что уже заняло место.

На этом месте я останавливаюсь с обещанием «сэкономить токены одной командой». Универсального счётчика для конкретного интерфейса в фактуре нет. Рабочее правило надёжнее: передавай только материалы, которые нужны для текущего действия.

Разделение работы на этапы уменьшает повторную передачу старого контекста: между сессиями переходят только результат, решения и файлы. Оно не отменяет расход токенов.

На практикуме по вайб-кодингу я показываю эту связку руками: как ставить задачу агенту, фиксировать решения в [файлах журнала решений между сессиями](/guides/claude-code-zhurnal-resheniy-dlya-proekta), проверять отдельный этап и передавать результат дальше без всей переписки.

## Почему есть лимит токенов?

лимит существует потому, что модель работает с ограниченным контекстным окном и ограниченным размером отдельного ответа. Даже миллион токенов в бета-режиме не отменяет технические границы: Anthropic увеличила окно Claude с 9K до 100K токенов, а для Opus 4.6 описала 1M токенов. Для конкретного интерфейса отдельно проверяй доступный размер ответа и настройки текущего запуска.

Запрос «лимит токенов» может означать две разные границы.

Первая - сколько материала модель способна учитывать в одном контексте. Вторая - какой объём она способна выдать одним ответом. Они связаны, но это не одно и то же.

Anthropic сообщила о росте контекстного окна Claude с 9K до 100K токенов. В том же описании 100K токенов сопоставлены примерно с 75 000 слов.

Для Claude Opus 4.6 Anthropic также описала автоматическое сжатие старого контекста и окно 1M, то есть миллион токенов, в бета-режиме. Сжатие помогает продолжать длинную задачу, заменяя старую историю кратким представлением.

Но compaction не отменяет значение токенов. В [обсуждении compaction в Claude Code на Hacker News](https://news.ycombinator.com/item?id=47096210) пользователи описывают случаи, когда детали, оставшиеся на диске, не попадали в сжатое резюме. Технические лимиты при этом не исчезают.

Поэтому я не прошу агента одним заходом изучить проект, спроектировать приложение, написать весь код, протестировать его и отполировать интерфейс: у отдельных интерфейсов и моделей есть ограничения размера ответа, их нужно проверять для текущего запуска.

Разделяй работу там, где появляется самостоятельный результат. План, реализацию одной функции и отчёт о тестах можно проверять отдельно: у каждого результата должен быть собственный критерий готовности.

## Как разделить длинный запрос на этапы?

разделяй не текст на случайные куски, а работу на последовательность проверяемых результатов. На каждом этапе должна быть одна цель, понятный вход, сохранённый результат и сигнал «готово / не готово». Следующей сессии передавай решения, изменённые файлы, проверки и открытые вопросы, а не всю историю чата.

![Сиба-ину одобрительно смотрит на схему из трёх первых этапов работы.](https://s3.regru.cloud/crossmark/statejnik/images/guides/tokeny-razdelit-dlinnyj-zapros-na-etapy/kadr-2.webp)

Запиши результат текущего этапа так, чтобы его можно было проверить отдельно. Не проси одновременно изучить проект, изменить интерфейс и переписать сервер.

Когда я делаю форму заявки, план и реализацию развожу по разным этапам: иначе агент начинает менять и форму, и сохранение сразу. На большом проекте выдели естественную функциональную единицу: план, одну функцию, один экран или отдельную проверку. Слишком мелкие фазы заставят агента повторно загружать одни и те же файлы и могут увеличить расход токенов.

Проверь, что результат можно выразить одной фразой: «план готов», «форма сохраняет заявку», «тест проходит». Для каждого этапа нужен сигнал «готово / не готово».

Попроси агента перечислить файлы, границы этапа и способ проверки. До реализации сначала зафиксируй границы текущей фазы и задачи, которые останутся на потом.

   

Передай агенту план и попроси сделать только одну функциональную единицу. Не добавляй в тот же запрос полировку, новые функции и исправление всех найденных проблем.

Агенту нужен конкретный вход: файл плана, список решений и существующие файлы, которые относятся к текущей задаче. В Anthropic это называют prompt chaining: каждый вызов получает результат предыдущего.

Anthropic описывает prompt chaining как разбиение задачи на последовательность шагов, где каждый вызов языковой модели обрабатывает результат предыдущего. [Building Effective Agents](https://www.anthropic.com/engineering/building-effective-agents)

После изменения сразу проведи проверку. Подойдёт тест, сборка, diff или другой результат, который показывает состояние работы. Слово «готово» без проверки ничего не доказывает.

После завершения этапа запиши, что сделано, какие решения приняты, какие файлы изменены, что не сделано и как проходила проверка.

Удобная структура папки:

   ```text
   project/
     00-goal.md
     01-plan.md
     02-decisions.md
     03-phase-1-result.md
     04-phase-2-result.md
     05-checks.md
     handoff-next.md
   ```

Эти файлы заменяют попытку держать всё в голове или искать нужную фразу в длинном чате. В них не нужно складывать весь диалог. Оставляй только материалы, которые понадобятся дальше.

Попроси агента подготовить короткую передачу следующей сессии. В неё входят изменённые файлы, решения, проверки, незакрытые вопросы и следующее действие.

   

Открой следующий этап с handoff и нужными файлами. Передай только итог предыдущей работы, а не весь старый чат.

Не рассчитывай на автоматический перенос всей истории в новую сессию. Передай нужные решения и файлы вручную, чтобы новый контекст получил материалы текущего этапа, а не накопленные ошибки, лишние команды и нерелевантные файлы.

Для маленькой правки такой режим не нужен. Опечатку или переименование переменной я бы не превращал в цепочку из нескольких агентов. Многоэтапность оправдана там, где задача состоит из нескольких проверяемых частей.

## Что ломается в длинной сессии?

длинная сессия может расходовать токены на повторное чтение старого контекста и ухудшать качество ещё до формального переполнения окна. Слишком мелкие этапы снова загружают одни и те же файлы, новая сессия теряет часть памяти, а compaction способен пропустить детали. Состояние работы лучше хранить на диске.

![Мужчина закрывает лицо лапонью рядом с карточками о поломках длинной сессии.](https://s3.regru.cloud/crossmark/statejnik/images/guides/tokeny-razdelit-dlinnyj-zapros-na-etapy/kadr-3.webp)

Это наблюдение одного автора, а не универсальная характеристика Claude. Его вывод о большом расходе из-за повторной обработки контекста стоит воспринимать как частный опыт.

Вот основные поломки.

- **Повторное чтение файлов.** Слишком мелкое разбиение заставляет агента несколько раз загружать один и тот же проект. Этапы становятся дороже, а не дешевле.
- **Потеря памяти.** Новая сессия получает ограниченный набор материалов. Если не передать решения и ограничения, агент начнёт угадывать.
- **Цена handoff.** Передача контекста между отдельными агентами тоже расходует токены. Изоляция облегчает работу основной сессии, но не гарантирует меньший общий расход.
- **Потеря деталей при compaction.** Автоматическое сжатие может убрать информацию, которая всё ещё лежит в файлах. Поэтому решения, изменённые файлы и проверки лучше сохранять отдельно.

- **Скрытый стартовый расход.** Новая сессия не начинается с пустого места. В неё уже входят системные инструкции, инструменты, skills, MCP и файлы проекта.

Я бы держал простое правило: одна сессия - одна цель и один проверяемый результат. Когда цель закрыта, сохрани результат и реши, нужен ли продолженный контекст.

Если следующая часть опирается на ту же небольшую группу файлов, продолжение может быть разумнее. Если задача меняется, контекст разрастается или агент начал повторять старые ошибки, переходи в новую сессию с [handoff и передачей задачи между сессиями](/guides/claude-code-peredacha-zadachi-mezhdu-sessiyami-bez-poteri-konteksta).

## Вопросы и ответы

В запросе «гпт токены» речь идёт о тех же единицах обработки текста, что и в других языковых моделях. Они описывают, как модель представляет вход, ответ и рабочий контекст, а не отдельный продукт или ключ доступа.

AI-токены - фрагменты текста, из которых складываются запросы, ответы и контекст модели. Их количество зависит от самого текста и модели. Поэтому одинаковое число слов не гарантирует одинаковое число токенов.

Токены в нейросети - единицы обработки текста. Модель получает не человеческое представление о сообщении целиком, а последовательность токенов. В эту последовательность могут входить сообщения, файлы и результаты команд.

Токены в нейросети - не отдельный продукт и не функция. Это способ представить входной текст, ответ и внутренний контекст модели в виде последовательности небольших фрагментов.

Токены в нейросети - части текста, которые модель учитывает при подготовке ответа. Чем больше материалов попадает в текущий контекст, тем больше токенов приходится обработать.

Токен в нейросети - одна базовая единица обработки текста. Точный объём текста для одного токена нельзя назвать одинаковым для всех моделей и языков.

Токен в нейросети - фрагмент, из которого модель собирает входной текст, результат и рабочий контекст. Важно считать не только последнее сообщение, но и всё, что агент прочитал и получил в ходе работы.

Токены в нейросети влияют на объём контекста и длину работы. Большой контекст может приблизить лимит и ухудшить качество ещё до формального переполнения, поэтому длинную задачу полезно делить на проверяемые этапы.

- [Introducing 100K Context Windows - Anthropic](https://www.anthropic.com/news/100k-context-windows)
- [Introducing Claude Opus 4.6 - Anthropic](https://www.anthropic.com/news/claude-opus-4-6)
- [Building Effective Agents - Anthropic](https://www.anthropic.com/engineering/building-effective-agents)
- [Effective context engineering for AI agents - Anthropic](https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents)
- [Effective harnesses for long-running agents - Anthropic](https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents)
- [Best practices for Claude Code - Claude Code Docs](https://code.claude.com/docs/en/best-practices)
- [19 days, 245 sessions, 123M tokens in Claude Code - Reddit](https://www.reddit.com/r/ClaudeAI/comments/1ut866f/19_days_245_sessions_123m_tokens_in_claude_code/)
- [I need a serious advise on token consumption - Reddit](https://www.reddit.com/r/ClaudeCode/comments/1vhwo72/how_do_you_all_deal_with_claude_s_small_context_window/)
- [How do you all deal with Claude's small context window? - Reddit](https://www.reddit.com/r/ClaudeCode/comments/1qps9xj/how_do_you_all_deal_with_claude_s_small_context/)
- [Claude Code's compaction discards data that's still on disk - Hacker News](https://news.ycombinator.com/item?id=47096210)
- [I measured Claude Code's hidden token overhead - Reddit](https://www.reddit.com/r/ClaudeCode/comments/1s3xjn4/claude_codes_hidden_token_overhead/)
