# Qwen 3.8 27B вышла: xhigh по умолчанию съедает контекст до первой правки

> Qwen 3.8 27B вышла 14 августа 2026 года. Модель сильна в коде и работе с изображениями, но режим xhigh может превратить простую задачу в долгий марафон рассуждений.

Источник: https://vibeceh.ru/novosti/vyshla-qwen-38-27b-otlichnaya-model-no-izbytochno
Автор: Сергей Мазур · опубликовано 2026-08-17

Четырнадцатого августа две тысячи двадцать шестого года Alibaba Qwen выпустила плотную vision-модель на 27B параметров с лицензией Apache 2.0. Для [вайб-кодинга](/concepts/vajb-koding) она сильна в коде и агентных задачах, но `xhigh` по умолчанию съедает время на планирование.

## Что произошло с Qwen 3.8 27B?

релиз Qwen3.8-27B состоялся четырнадцатого августа две тысячи двадцать шестого года, но главная проблема не размер модели, а включённый по умолчанию `xhigh`, который съедает время на рассуждения.

Четырнадцатого августа две тысячи двадцать шестого года Alibaba Qwen выпустила Qwen3.8-27B - плотную vision-модель на 27B параметров с лицензией Apache 2.0. Она понимает изображения и видео, умеет работать с кодом и агентными задачами. Thinking по умолчанию включён на `xhigh`, поэтому простые запросы могут надолго застрять в рассуждениях. [Первоисточник Simon Willison](https://simonwillison.net/2026/Aug/16/qwen-38-27b/) подтверждает дату релиза и поведение модели.

Simon Willison называет модель отличной, но критикует обдумывание по умолчанию и выбор `xhigh` называет «забавным» (This is a hilarious default), не советуя запускать модель в этом режиме на пользовательском железе.

Что поменять завтра:

- не оставлять `xhigh` для коротких задач;
- начать с `low` или отключённого thinking;
- не считать размер файла универсальным требованием к RAM или VRAM.

## Что изменилось по сравнению с Qwen 3.6?

Qwen3.8 продолжает семейство Qwen3.5 и Qwen3.6. В версии 27B появилась плотная мультимодальная модель с пониманием изображений и видео, настраиваемым thinking (`xhigh`, `medium`, `low`, отключение) и контекстом до 262 тысяч токенов. Официальной таблицы сравнения с Qwen3.6 нет.

![Карточки сравнивают Qwen3.6 и Qwen3.8 по мультимодальности и размеру контекста.](https://s3.regru.cloud/crossmark/statejnik/images/guides/vyshla-qwen-38-27b-otlichnaya-model-no-izbytochno/kadr-1.webp)

| Было | Стало |
|---|---|
| Qwen3.6 как предыдущая серия семейства | Qwen3.8 как продолжение Qwen3.5 и Qwen3.6 |
| Обычная модель в описании предыдущей серии | Плотная мультимодальная модель с пониманием изображений и видео |
| Поведение рассуждений без описанного здесь управления | `enable_thinking`, `reasoning_effort` и режимы `xhigh`, `medium`, `low` |
| Короткий рабочий контекст в типичном локальном запуске | Официально заявленный контекст 262 тысячи токенов |
| Запрос без отдельного контроля глубины | Возможность отключить thinking или снизить глубину |

`enable_thinking` включает или отключает рассуждения, `reasoning_effort` выбирает глубину, а `preserve_thinking` сохраняет историю, но thinking не выключает.

Эти параметры описаны в [официальной карточке Qwen3.8-27B](https://huggingface.co/Qwen/Qwen3.8-27B).

[Контекст](/concepts/kontekst) в карточке указан как 262 тысячи токенов нативно с расширением до миллиона, но приложение может выставить меньший предел: Simon Willison столкнулся с лимитом LM Studio в восемь тысяч сто девяносто два токена.

Официального сравнения Qwen3.8-27B с Qwen3.6-27B нет, поэтому конкретный прирост в процентах или тестах я не приписываю. Пользователи называют Qwen3.8 сильнее, но более затратной по reasoning-токенам и времени.

Для вайб-кодера разница выглядит так:

1. В короткой правке важнее быстрый ответ и понятный объём изменений.
2. Для анализа нескольких файлов полезны длинный контекст и рассуждение.
3. Для изображения или видео у Qwen3.8 есть возможность, которой нет у текстовой модели.

## Подходит ли Qwen 3.8 27B для вайб-кодинга?

Qwen 3.8 27B стоит пробовать для анализа репозиториев, tool calling, генерации кода и агентных задач, но быструю модель она не заменяет. Она может быть сильнее Qwen3.6, но тратит больше reasoning-токенов и времени.

![Кот одобрительно смотрит на цепочку файлов, которую агент разобрал при анализе авторизации.](https://s3.regru.cloud/crossmark/statejnik/images/guides/vyshla-qwen-38-27b-otlichnaya-model-no-izbytochno/kadr-2.webp)

Qwen3.8 не является узкой кодовой моделью. В официальной карточке заявлены улучшения в coding, software engineering и долгих агентных задачах. Это повод для проверки, а не гарантия.

Coding agent разобрал авторизацию в проекте Datasette: прошёл по файлам `actor_auth_cookie.py`, `permissions.py` и `csrf.py` и использовал инструменты для анализа репозитория.

Simon Willison назвал такой ответ very solid («очень основательный») в [своём разборе модели](https://gist.github.com/simonw/6693d74a6bd45f641d43ceb9961dd95f).

Это сценарий, где длинное рассуждение окупается: агент читает несколько файлов, связывает проверки cookie и разрешения, затем объясняет цепочку. Здесь `low` не всегда лучший выбор.

Но на обычной задаче бюджет рассуждений может съесть время и контекст до первого изменения файла. В [обсуждении долгого thinking](https://www.reddit.com/r/LocalLLaMA/comments/1vq5to0/qwen_3827b_unusable_long_thinking/) пользователь Reddit сообщил, что модель потратила около пятидесяти тысяч токенов на планирование и не завершила задачу.

Ещё один симптом - разрастание результата: в [обсуждении ранних впечатлений](https://www.reddit.com/r/LocalLLaMA/comments/1vpfl3d/qwen_38_27b_early_thoughts/) пользователь Reddit сообщил, что простая навигационная панель превратилась примерно в двести строк CSS, а лишние визуальные эффекты замедляли браузер.

Я бы сначала оценивал задачу, затем выбирал модель, а не шёл за громким релизом:

| Задача | Решение |
|---|---|
| Исправить подпись кнопки | Сначала отключить thinking |
| Добавить небольшую форму | Начать с `low`, ограничить объём изменений |
| Разобрать незнакомый репозиторий | Попробовать Qwen3.8 с доступным контекстом |
| Сгенерировать код по изображению | Использовать vision-возможности |
| Запустить агент с инструментами | Сначала проверить обычный запрос, затем один tool call |
| Сделать сложную архитектурную задачу | Включить thinking, но следить за контекстом и временем |

Готовый промпт для первого coding-запроса:

Такой промпт не отключает thinking, а лишь ограничивает задачу. Настройку thinking меняй в раннере или API.

## Как запустить Qwen 3.8 27B у себя?

скачай сборку из официальной карточки, выбери локальный раннер и не оставляй `xhigh` при первом запуске. Начни с `low` или отключённого thinking, проверь обычный запрос и только потом подключай инструменты.

![Собака одобряет первый запуск модели с низким reasoning и простым запросом.](https://s3.regru.cloud/crossmark/statejnik/images/guides/vyshla-qwen-38-27b-otlichnaya-model-no-izbytochno/kadr-3.webp)

Открой [официальную карточку Qwen3.8-27B](https://huggingface.co/Qwen/Qwen3.8-27B) и выбери формат под свой раннер. Для конкретной Q4_K_M-сборки Simon Willison указывал размер около семнадцати гигабайт. Это размер одного файла, а не универсальное требование к RAM или VRAM.

Подойдут Transformers, vLLM, SGLang, Docker или локальные приложения. Сначала добейся обычного ответа модели, не подключая coding agent.

Не оставляй `xhigh`. На первом тесте выбери `low` или отключи thinking через `enable_thinking=false`. `preserve_thinking` сохраняет историю рассуждений, но сам thinking не выключает.

   ```json Настройки первого запроса
   {
      "enable_thinking": false,
      "temperature": 0.7,
      "top_p": 0.80
   }
   ```

Для thinking mode в карточке Qwen указаны другие параметры:

   ```json Параметры thinking mode
   {
      "enable_thinking": true,
      "reasoning_effort": "low",
      "temperature": 1.0,
      "top_p": 0.95,
      "top_k": 20
   }
   ```

Официальный контекст модели - 262 тысячи токенов с расширением до миллиона, но на конкретном компьютере доступно меньше. Начни с значения, которое выдерживает приложение и память.

Отправь короткую задачу без изображений и инструментов, например: «Напиши функцию, которая складывает два числа. Верни только код и один короткий пример». Проверь, появляется ли ответ, сколько времени занимает первый токен и не начинается ли длинное рассуждение.

Добавь один инструмент и одну маленькую операцию. Если обычный текст работает, а вызов инструмента ломается, проверяй совместимость template и parser.

Дай агенту одну ограниченную задачу и попроси показать список файлов до правки. Не подключай Qwen3.8 к [Claude Code](/guides/claude-code-bezopasnyy-dopusk-agenta-k-proektu) как официально поддерживаемую модель: Anthropic не подтверждает такую поддержку.

## Сколько стоит Qwen 3.8 27B и работает ли из России?

официальная карточка описывает локальный запуск и лицензию Apache-2.0, но цена API, тарифы, лимиты и доступность из России в открытых источниках не подтверждены. Известны семнадцать гигабайт для конкретной Q4_K_M-сборки и контекст 262 тысячи токенов.

Подтверждено: модель опубликована в формате Transformers; лицензия Apache-2.0; 27B параметров; нативный контекст 262 тысячи токенов; конкретная Q4_K_M-сборка занимает около семнадцати гигабайт.

Не подтверждено: цена API, тарифы, лимиты, бесплатный объём, доступность из России, универсальные требования к RAM и VRAM, наличие модели в Claude Code.

Семнадцать гигабайт относятся к конкретной квантованной сборке. Контекст, KV-cache (промежуточные данные) и настройки раннера добавляют свои расходы памяти.

Документация Anthropic описывает шлюзы для внешних моделей, но не подтверждает официальную поддержку Qwen3.8-27B: Anthropic пишет, что не поддерживает маршрутизацию Claude Code к моделям, не являющимся Claude, через сторонние шлюзы.

Доступные материалы не подтверждают ни доступ, ни блокировку. Нужна официальная страница Qwen Cloud или Qwen API.

## Вопросы и ответы

Qwen3.8-27B - плотная мультимодальная модель Alibaba Qwen на 27B параметров: понимает изображения и видео, поддерживает thinking и ориентирована на кодинг и агентные задачи.

Релиз Qwen3.8-27B состоялся четырнадцатого августа две тысячи двадцать шестого года. Simon Willison опубликовал разбор шестнадцатого августа. Вариантов qwen 3.8 plus и qwen 3.8 35b в официальной карточке нет.

Доступные материалы подтверждают генерацию кода, анализ репозитория и работу с инструментами, но модель может долго планировать и не дойти до реализации. Размер 27B сам по себе не гарантирует удобную разработку.

Подходит для проб в анализе репозиториев, генерации кода, tool calling и агентных задачах, но быструю модель не заменяет. Для коротких правок начни с отключённого thinking или `low`.

Да, официальная карточка заявляет улучшения в coding и software engineering, а практический пример показывает анализ авторизации в Datasette. Задавай узкую задачу и сначала проверяй обычный текстовый запрос.

На сложных задачах модель анализирует несколько файлов и использует инструменты. В другой задаче около пятидесяти тысяч токенов ушли на планирование без завершения. Результат зависит от уровня reasoning, контекста и раннера.

Подтверждённого сравнения Qwen3.8-27B с Qwen3 Coder нет. Подтверждено только, что Qwen3.8 заявлена для coding и агентных задач, а её главное ограничение - длительное reasoning.

Qwen3.8 продолжает семейство Qwen3.5 и Qwen3.6. Подтверждены плотная мультимодальная архитектура, vision, гибкое управление thinking и контекст 262 тысячи токенов. Официальной таблицы сравнения и проверяемых бенчмарков нет.

- [Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things - Simon Willison](https://simonwillison.net/2026/Aug/16/qwen-38-27b/)
- [Qwen/Qwen3.8-27B - официальная карточка модели на Hugging Face](https://huggingface.co/Qwen/Qwen3.8-27B)
- [Анализ авторизации в Datasette через coding agent](https://gist.github.com/simonw/6693d74a6bd45f641d43ceb9961dd95f)
- [Qwen 3.8 27B unusable long thinking - Reddit](https://www.reddit.com/r/LocalLLaMA/comments/1vq5to0/qwen_3827b_unusable_long_thinking/)
- [Qwen3.8-27B early thoughts - Reddit](https://www.reddit.com/r/LocalLLaMA/comments/1vpfl3d/qwen_38_27b_early_thoughts/)
- [Other LLM gateways - Claude Code Docs](https://docs.anthropic.com/en/docs/claude-code/llm-gateway)
- [CLI reference - Claude Code Docs](https://docs.anthropic.com/en/docs/claude-code/cli-usage)
