В технической базе Anthropic выделяют так называемые «пять грехов», которые влияют на работу Claude. Среди них — код с низкой энтропией, загрязнение контекста, ошибочное внедрение. Проблемы с Claude затрагивают разные аспекты: от генерации модели и объёма вычислений при выводе до сложности разделения разных моделей и неэффективного использования длинного контекста.
Пользователи сталкиваются с рядом сложностей при работе с Claude. Например, возникают трудности с добавлением машиносчитываемых маркеров в текст и код. Причина в том, что распределение токенов в естественном языке и коде существенно различается. В коде много мест с низкой энтропией: после объявления переменной почти всегда используется одно и то же имя; в JSON поля, кавычки и скобки ограничены строгой структурой; параметры функций должны соответствовать интерфейсу. Изменение токена в путях, регулярных выражениях, SQL, Shell-командах может изменить поведение системы.
Основная проблема водяного знака в коде — ограниченная ёмкость кодирования. Если в позиции возможен только один разумный вывод, там почти нет места для дополнительного сигнала. Если маркировать только позиции с высокой энтропией, возникает проблема короткой длины кода, высокого процента структурированных токенов и недостатка подходящих мест для маркировки. Возникает компромисс между силой обнаружения, качеством генерации и устойчивостью к изменениям: слабый сигнал трудно обнаружить, жёсткие ограничения могут нарушить корректную генерацию, а сохранение возможности обнаружения после форматирования и локальных изменений требует большего избытка сигнала. Подробнее об этом можно прочитать в статье по ссылке:
Кроме того, пользователи отмечают несоответствие реального опыта работы с Sonnet 5 заявленному уровню развития модели, высокую цену Fable 5 при неочевидных преимуществах перед Opus 5, а также то, что в Fable 5 используется только 20–30 % контекста, после чего производительность снижается.
Anthropic не раскрывает, как Claude изменяет выборку при текстовой маркировке, поэтому нельзя напрямую связать изменение качества Claude Code с конкретным алгоритмом водяных знаков. Код‑генерация сталкивается с растущим числом ограничений: помимо семантики и правильности выполнения, требуется соблюдение протоколов инструментов, структурированных форматов, правил безопасности и маркировки источников.
Адаптивное мышление Sonnet 5 меняет подход к работе модели: один и тот же модель может работать в разных интервалах test-time compute, и сама модель больше не полностью отражает объём задействованных ресурсов для запроса. Особенно это заметно в Coding Agent. При обнаружении бага Claude должен не только сгенерировать решение, но и решить, какие файлы читать, какую цепочку вызовов отслеживать, сколько гипотез сохранять, запускать ли тесты, проверять ли зависимости и когда считать доказательства достаточными.
Регулировка effort определяет не длину размышлений, а масштаб поиска в рамках задачи агента. Это меняет многоуровневую структуру моделей Anthropic: при повышении effort Opus может быстро выйти на новый уровень производительности; Fable будет наиболее полезен для работы с незнакомыми кодовыми базами, многоэтапного планирования, операций между инструментами, длительного автономного выполнения и восстановления после ошибок.
Высокоуровневые модели продают не просто более сильный ответ, а дополнительную надёжность в сложных сценариях. Но это преимущество раскрывается только в длинных задачах, где контекстное состояние становится ключевым фактором. Несмотря на 1M контекста, Claude может терять данные и допускать ошибки уже при использовании 200K или 300K токенов — context window отражает ёмкость, а не согласованность состояния. Длительные сессии агента представляют собой не статичный документ, а нарастающую историю выполнения.
Сложность длинного контекста не пропорциональна количеству токенов: 250K токенов в статическом документе проще обработать, чем 250K токенов в истории агента (из‑за изменённых объектов, промежуточных суждений, результатов инструментов, устаревших состояний). История мышления усиливает сложность: в сессии сохраняются не только события, но и обоснования решений; ранние рассуждения на основе опровергнутых гипотез могут влиять на дальнейшие выводы. Ограничение в 1M контекста связано не только с объёмом информации, но и с возможностью модели стабильно восстанавливать текущую версию объекта при множестве исторических версий.
При росте контекста сжатие (compaction) выглядит естественным решением — укоротить старую историю и продолжить работу. Но сжатие для агента отличается от простого суммирования: пропуск актуального ограничения в сжатом варианте может изменить последующие действия. Задача compaction — определить, какие части истории актуальны сейчас, а не просто важны. В истории могут быть завершённые задачи, опровергнутые суждения, действующие интерфейсные ограничения, устаревшие результаты тестов и временные обходные решения. Сжимающий механизм должен преобразовать это в представление, пригодное для следующей итерации. Ошибки сжатия (превращение временного предположения в факт, включение отброшенного решения, пропуск ключевого ограничения) могут исказить работу агента. Ключевой показатель compaction — не степень сжатия, а сохранность состояния.
Git, тесты, файлы задач, memory и структурированный handoff важны в долгосрочных агентах, так как переносят долгосрочные состояния из истории естественного языка во внешние системы: Git фиксирует версию кода, тесты дают проверяемые результаты, файлы задач фиксируют выполнение, структурированное состояние разделяет текущие выводы и прошлые попытки. Context сохраняет историю, но не может полностью управлять состоянием.
Агент может изменять среду: модифицировать код, выполнять команды, устанавливать зависимости, настраивать параметры и считывать новые результаты. Ошибка может привести к изменениям среды. Например, Claude может ошибочно определить баг как проблему с кэшем и изменить логику кэширования, механизм повторных попыток и несколько точек вызова, что приведёт к новым аномалиям в тестах.
Если агент не установит причинно‑следственные связи, он будет воспринимать новые ошибки как независимые проблемы и исправлять их последовательно — в итоге траектория выполнения задачи отклонится от исходной. Надёжность долгосрочных агентов зависит не от точности отдельных шагов, а от способности системы обнаруживать, анализировать и исправлять ошибки после их попадания в среду. Для этого используются: Git diff (показывает недавние изменения), тесты (проверяют, не нарушено ли поведение), checkpoint и rollback (ограничивают распространение ошибок), независимый evaluator (обеспечивает дополнительную проверку).
Benchmark обычно проверяют, может ли модель выполнить задачу в изначально заданной среде. Реальные агенты сталкиваются с проблемой: среда меняется под действием действий модели. Два агента с похожим итоговым показателем успешности могут вести себя по‑разному: один может точно оценивать ситуацию в начале, но затем двигаться по ошибочному пути, исправляя ошибки; другой может не превосходить в отдельных шагах, но быстрее обнаруживать, что изменение создало новую проблему, откатываться и выбирать другой путь.
При продлении задач агента важными становятся такие показатели:
* сколько ключевых состояний сохраняется после compaction;
* можно ли найти шаг, привнёсший ошибку, после её исправления;
* сохраняется ли соответствие внутреннего состояния задачи реальной среде при увеличении вызовов инструментов;
* насколько высока стоимость восстановления после отклонения от заданного пути.
Эти показатели оценивают не умность отдельного ответа, а контролируемость траектории. Проблемы, выявленные Anthropic, затрагивают разные уровни. После их массового появления технические ограничения Claude начали меняться. Раньше вопрос был в том, может ли модель решить задачу, теперь сложнее проверить, сможет ли система сохранить достоверную картину мира после нескольких часов работы, десятков вызовов инструментов, нескольких сжатий состояния и множественных изменений кода. Рост возможностей модели лишь повышает предел оценки каждого шага. Стабильность работы длинного агента всё больше зависит от ясности состояния, проверяемости действий и возможности отката ошибок.
Ссылки:
<<<CODE_BLOCK_N>>>
<<<IMG_N>>>