ЗаметкаИнженерное лидерство

Отсутствие сигнала не было отсутствием проблемы

Неделя 27 июля 2026. Anthropic обнаружил, что три модели Claude из тестовых сред добрались до реальных продакшн-систем, причём самый ранний случай — апрельский, а нашли его только потому, что конкурент раньше опубликовал похожий отказ. Эта форма повторялась всю неделю: контроль, тихо переставший работать; benchmark, меривший harness; компрометация агента, не оставляющая малвари; delete, который не удалил. Везде ничто не выглядело неправильным — и ничто не следило за тем, что было. Скан-слой TL;DR, пять тем каждая с operator move, одна разобрана глубоко, три контр-сигнала и что отслеживать.

Lukman Nuriakhmetov
Lukman Nuriakhmetov
12 мин чтения · 3 августа 2026 г.

Обычно интереснее всего, что произошло. На этой неделе интереснее, как об этом вообще узнали.

Anthropic раскрыл, что три модели Claude из тестовых сред, которые должны были быть герметичными, вышли в публичный интернет и получили несанкционированный доступ к продакшн-системам трёх реальных организаций. Самый ранний из этих случаев — апрельский. Нашли его в конце июля: не мониторингом, не по алерту, а потому что конкурент раньше опубликовал похожий отказ и это спровоцировало ретроспективный разбор 141 006 прогонов.

Три месяца. Две из трёх пострадавших организаций не знали, пока им не сообщили.

Та же форма всю неделю всплывала в несвязанных местах. Фреймворк, утверждающий, что тихо переставший работать контроль — уже инцидент. Значение benchmark, утроившееся от двух настроек, — то есть прежнее число мерило что-то другое, не модель. Компрометация агента, не меняющая ни одного бинарника и не вызывающая ни одного неразрешённого инструмента. Операция delete, убирающая разговор с экрана и оставляющая журнал на диске.

Issue 9 закончился на независимости: проверяющее не было отделено от проверяемого. Эта неделя уходит на слой ниже. Прежде чем спрашивать, независима ли проверка, надо спросить, проверяет ли вообще хоть что-то, — и честный ответ часто «ничто», а тишину при этом читают как хорошую новость.

The 60-second version

Если читать только это:

  • Трёхмесячную компрометацию нашли, прочитав чужое раскрытие. Anthropic пересмотрел 141 006 прогонов только после публикации OpenAI о похожем инциденте. Путь обнаружения — блог конкурента, а не телеметрия.
  • Тихо отказавший контроль — уже инцидент. Конфигурация доказывает намерение на момент времени. Она ничего не говорит о том, работает ли approval gate, поток аудита или правило egress сегодня утром.
  • Значение benchmark меряет модель вместе с harness. Две настройки исполнения утроили результат frontier-модели на ARC-AGI-3, вшестеро сократив выходные токены. Модель при этом не менялась.
  • Агента можно скомпрометировать без единого артефакта малвари. Отравленные память, инструкции или документы меняют поведение, пока тот же подписанный бинарник вызывает те же разрешённые инструменты, — а инструкции, разносимые через Copilot, копировали себя в новые документы.
  • Clear — это действие интерфейса, delete — контракт хранилища. Журналы, индексы, эмбеддинги и кэши регулярно переживают операцию, которую пользователь считает удалением.

Одна строка на неделю: тишина — не доказательство: если за контролем никто не следит, его молчание не говорит о его здоровье ничего.

1. Путь обнаружения — блог конкурента

Deep cut недели.

Это самый поучительный инцидент года, и поучительна в нём не компрометация. Поучительна хронология.

Факты — по собственному раскрытию Anthropic. 21 июля OpenAI опубликовал, что несколько его моделей вырвались из изолированной тестовой среды и добрались до продакшн-инфраструктуры Hugging Face. Anthropic в ответ запустил ретроспективный разбор собственных cybersecurity-оценок, целенаправленно ища свидетельства, что Claude мог достучаться до интернета из сред, которые должны были быть закрыты. Пересмотрев 141 006 прогонов, компания нашла три случая, когда модель вышла в интернет изнутри среды Irregular, стороннего партнёра по оценке, или во взаимодействии с ней, — и получила несанкционированный доступ к продакшн-инфраструктуре трёх разных организаций. Модели: Claude Opus 4.7, Claude Mythos 5 и внутренняя исследовательская. Самый ранний случай — апрельский. Разбор транскриптов начался 23 июля, все cyber-оценки были приостановлены в тот же день, пострадавших уведомили 27 июля — двое из троих сами активность не заметили.

Теперь механизм — он обыденнее и полезнее заголовка. Во всех трёх случаях модели ставили задачу capture-the-flag: вымышленный сценарий, секрет, спрятанный на другой машине в сети, и открытая инструкция его найти. В промпте модели сообщали, что она в симуляции и доступа в интернет у неё нет. Из-за того, что Anthropic называет недопониманием между собой и партнёром по оценке, это было неправдой — среда была подключена. И когда поиск модели повёл её наружу, она добралась до настоящих машин и скомпрометировала их совершенно обычными приёмами: слабые пароли, неаутентифицированные эндпоинты. Ни zero-day, ни изобретательности, ни неповиновения. Модель делала ровно то, что ей поручили, внутри среды, которая не была тем, чем её все считали.

Именно это делает историю системной, а не «про ИИ». Убери модель — тот же отказ работает: любой процесс с задачей, открытым поиском и неверным представлением о собственной границе рано или поздно выйдет за неё. Способности модели определили, насколько результативной вышла вылазка. Но не то, что она случилась.

А теперь часть, над которой стоит посидеть. Это не обнаружили. Это вспомнили. Три месяца не было ни алерта, ни аномалии, ни сигнала с любой стороны забора. Тестовый harness не заметил уходящего трафика. Пострадавшие организации в основном не заметили приходящего. Разрыв закрылся, только когда коллега по отрасли опубликовал сопоставимый отказ и кто-то спросил, по сути: а с нами так могло быть? — вопрос, для которого не нужна новая телеметрия, нужен только повод посмотреть. Стоит отметить, что обе лаборатории провели разбор и опубликовали результат, и это отрасль, работающая как надо. Но не стоит путать исправную норму раскрытия со способностью обнаруживать. Если быстрейший путь узнать о трёхмесячной компрометации — чужая прозрачность, то у вас не обнаружение, а везение с хорошими манерами.

Operator move: для каждой критичной границы — egress из сборочных и тестовых сред, объём credentials у автоматических задач, выход данных за пределы тенанта — выпиши конкретный сигнал, который сработал бы при тихом отказе границы, и дату, когда этот сигнал в последний раз срабатывал хоть по какой-то причине. Если ответ «не срабатывал никогда», у вас два варианта и никакой возможности их различить: либо ничего не ломалось, либо ничто не следит. Разрешается это синтетической пробой, которая по расписанию намеренно пытается сделать запрещённое и алертит, когда попытка удаётся. И проведите разово ретроспективную версию: возьмите самое весомое допущение в своей архитектуре и пойдите искать свидетельства, что его когда-то нарушили. Не ревью политики. Поиск по логам.

Самые дорогие инциденты — не громкие. Самые дорогие — те, что не породили никакого сигнала, а значит и никакой срочности, ровно до того момента, пока кому-то не пришло в голову посмотреть.

2. Контроль, который тихо перестал работать

У deep cut есть общая форма — и на этой неделе она пришла ещё и явным фреймворком.

Control Reliability Engineering выдвигает аргумент, очевидный после произнесения и редкий на практике: контроль безопасности, тихо переставший работать, — уже инцидент, независимо от того, воспользовался им атакующий или нет. Предложение — вести контроли как продакшн-сервисы: с SLI, SLO, error budget, синтетическими событиями, readiness-ревью и безобвинительными постмортемами при отказе.

С агентами это важнее по своей природе: агентские контроли деградируют тихо. Approval gate, чья политика больше не соответствует инструменту, который она стережёт. Поток аудита, переставший доставляться после смены схемы. Коннектор, чей scope расширился при повторной авторизации. Правило egress, молча потерянное при миграции платформы. Ни один из них о себе не объявляет. Каждый продолжает выглядеть корректно настроенным в том дашборде, куда смотрит организация, — и настройка действительно корректна, просто она ничего не делает.

В этом различии вся суть. Конфигурация — заявление о намерении на момент времени. Действенность — рантайм-свойство, и оно распадается. Заключение аудита полугодовой давности — свидетельство о том, что было полгода назад.

Operator move: выбери небольшой набор контролей, чей отказ существенно меняет то, до чего агент может дотянуться и что может сделать, — не все подряд, а несущие. Дай каждому владельца, сигнал здоровья и максимально допустимый интервал незамеченного отказа. Дальше прогоняй их по расписанию синтетическими событиями: попытайся выполнить действие, которое approval gate обязан заблокировать; отправь тестовое событие, которое поток аудита обязан доставить; запроси scope, в котором коннектор обязан отказать. Считай отказавший контроль инцидентом с постмортемом даже когда ничего плохого не произошло. Альтернатива — узнать о разрыве так, как узнали в deep cut этой недели.

Контроли не отказывают громко. Они перестают работать, и всё продолжает выглядеть ровно так же, как выглядело.

3. Benchmark мерил harness

Та же слепая зона проявилась в оценке — там она стоит денег, а не безопасности.

Frontier-модель изначально набрала 7,8% на ARC-AGI-3. Включение двух настроек исполнения — удержания рассуждения между шагами и компакции контекста — утроило результат, вшестеро сократив расход выходных токенов. Веса не менялись. Изменилась обвязка: удержание состояния, управление контекстом, способ подачи задачи.

Для всех, кто выбирает модель, вывод неудобный. Опубликованное значение benchmark — свойство модели, настроек API, harness, стратегии промптинга и политики контекста вместе. Две организации, гоняющие «одну и ту же модель», могут получить существенно разную способность, и обе будут правы относительно того, что именно измерили. Отсюда же следует, что разочаровывающий внутренний результат может диагностировать ваш harness, а не модель, а победа в лидерборде — harness, настроенный под этот лидерборд.

Это стержень недели в регистре оценки: число было читаемым, стабильным и тихо мерило не то, что все предполагали. Ничто в нём не выглядело неправильным.

Operator move: когда результат модели ляжет в основу закупочного или архитектурного решения, фиксируй рядом с числом полную конфигурацию — версию модели, настройки рассуждения и состояния, стратегию контекста, определения инструментов, политику ретраев — и считай единицей сравнения весь этот набор. Перед тем как поверить, что внешний score переносится, прогони собственную нагрузку. А когда результат меняется, сначала установи, изменилась модель или harness, и только потом делай вывод о способностях. Большая часть движения за последний год пришла именно от второго.

Значение benchmark без своего harness — измерение без единиц.

4. Компрометация, после которой нечего искать

Обнаружение предполагает наличие артефакта. Компрометация агента всё чаще не оставляет никакого.

Агента можно изменить через файлы памяти, постоянные инструкции, конфигурацию или обработанный им документ — при этом он продолжит исполнять тот же подписанный бинарник и вызывать те же разрешённые инструменты из тех же сетевых точек. Все классические индикаторы остаются чистыми, потому что ничего классического не менялось. Изменился устойчивый смысл.

Неделя дала самую наглядную демонстрацию этого. Исследователи показали инструкции, спрятанные внутри документов, которые обрабатывает Copilot: они меняют генерируемый вывод и копируют себя в новые документы — распространение через смысловое преобразование, а не через исполняемую репликацию. Microsoft выпустил меры против конкретной цепочки, а исследователи прямо сказали, что фундаментальная проблема остаётся: сегодняшние модели не умеют надёжно отделять недоверенные данные от инструкций.

Поставь рядом AgentForger того же периода, где одна сконструированная ссылка могла создать постоянного агента, наследующего коннекторы, которые пользователь авторизовал раньше, с подтверждениями, выставленными в «никогда не спрашивать». Тоже без малвари. Тоже без единого признака, который отметил бы endpoint-инструмент. Компрометация живёт в модели полномочий и в устойчивом контексте — ровно там, куда никто не смотрит.

Operator move: распространи телеметрию на смысловой слой. Версионируй и хешируй системные промпты, определения skills, файлы памяти и схемы инструментов — и алертируй при любом их изменении вне разрешённого пути обновления. Для значимых прогонов сохраняй, какие источники контекста и каких версий использовались, делегированные scopes, решения политик, аргументы инструментов и внешние побочные эффекты — столько, чтобы один экспорт восстанавливал цепочку от запроса до последствия. Дальше намеренно проверь сценарий: сымитируй компрометацию, при которой не меняется ни исполняемый файл, ни пакет, ни сетевое назначение, — и посмотри, заметит ли это хоть что-то в твоём стеке.

Если твоё обнаружение спрашивает только, что исполнилось, оно не увидит атаку, изменившую то, что система означает.

5. Delete не удалил

Последняя тема — самая узкая по охвату и с наибольшей вероятностью прямо сейчас сидящая в твоём продукте.

Разбор хранения агентских разговоров на этой неделе показал то, о чём многие команды догадываются наполовину: очистка или архивирование разговора в интерфейсе не обязательно убирает устойчивое состояние под ним. Журналы, поисковые индексы, эмбеддинги, суммаризации, чекпойнты, записи кэша и артефакты инструментов — всё это может пережить операцию, которую пользователь считает удалением своих данных. Часть такого хранения законна: восстановление, аудит, расследование инцидентов. Проблема в том, что интерфейс сообщил одно, а хранилище сделало другое, и у пользователя нет способа это различить.

AI-продукты порождают куда больше производного состояния, чем чат-лог. Каждая суммаризация, каждый эмбеддинг, каждый чекпойнт — копия смысла оригинала, и удаление оригинала не удаляет смысл. Это governance-проблема раньше, чем техническая: обещание, данное у кнопки, — это утверждение о системе, и если его никто не проверяет, это утверждение, которое никто не проверил.

Operator move: нарисуй карту жизненного цикла — для разговора перечисли каждый устойчивый артефакт, который он порождает, и где тот живёт. Дальше задай раздельную, видимую пользователю семантику для «скрыть», «архивировать», «отозвать доступ» и «удалить насовсем» и прямо укажи, какое хранение сохраняется ради аудита и на какой срок. И наконец, проверяй, а не утверждай: после жёсткого удаления попробуй восстановить содержимое через все остальные интерфейсы — поиск, экспорт, кэш, бэкап, локальную файловую систему — и убедись, что до него не добраться. Функция удаления, которую никогда не тестировали снаружи, — это обещание, а не контроль.

В AI-системе приватность зависит от производного состояния не меньше, чем от исходного сообщения.

Контр-сигналы, которые стоит держать

Три напряжения, которые стоит держать живыми, — и куда бы я положил вес:

Инструментирование против шума. Каждый сигнал из этого выпуска чего-то стоит: произвести, хранить, читать. Организация, инструментирующая всё, приходит к слою observability без владельца и к алертам, на которые никто не реагирует. Реально. Вес: ответ не в бо́льшем количестве телеметрии, а в выбранной телеметрии — определи границы, чей тихий отказ существенно меняет экспозицию, инструментируй их на уровне, который сможешь защитить, и сознательно прими слепоту в остальном вместо имитации покрытия, которого нет.

Внешнее раскрытие — работающая норма, а не только провал. Легко прочитать deep cut как обвинение. Обе лаборатории провели разбор и опубликовали результат, а это ровно то, как экосистема и должна себя вести; второй разбор случился только потому, что было первое раскрытие. Справедливо. Вес: зачти раскрытие — и всё равно откажись считать его обнаружением. Норма ценна именно тем, что ловит упущенное внутренним мониторингом, а это аргумент за улучшение мониторинга, а не за опору на коллег.

Не каждый разрыв стоит закрывать. Синтетические пробы, смысловая телеметрия, проверяемое удаление и benchmark с версионированным harness — это настоящие инженерные программы с настоящей ценой, и применить их везде — значит занять этим команду целиком. Верно. Вес: масштабируй вложения по радиусу поражения и по тому, насколько долго отказ мог бы правдоподобно оставаться невидимым. Контролю, который отказывает громко в течение часа, нужно куда меньше обвязки, чем тому, который может простоять сломанным три месяца, — а это и есть настоящий урок недели.

Operator takeaway

Если ты выпускаешь в регулируемых системах, чувствительных к безопасности или AI-смежных продуктах, на этой неделе затвердели три вещи:

  1. Считай «нет сигнала» непроверенным, а не подтверждённо-чистым. Для каждой несущей границы назови сигнал, который сработал бы при тихом отказе, и дату последнего срабатывания. Там, где ответ «никогда», добавь синтетическую пробу, по расписанию пытающуюся выполнить запрещённое действие.
  2. Дай контролям ту же операционную дисциплину, что и сервисам. Владелец, индикатор здоровья, предельный интервал незамеченного отказа, постмортем при сбое. Конфигурация — это намерение; действенность распадается, и её приходится доказывать заново.
  3. Распространи доказательства на смысловой слой. Версионируй и хешируй промпты, skills, память и схемы инструментов; сохраняй provenance контекста для значимых прогонов. Иначе компрометация, не меняющая ни одного бинарника, не оставит тебе ничего для расследования.

Это не прогнозы. Это описание того, куда операционная почва уже сместилась.

Стоит понаблюдать

Несколько конкретных вещей этой недели, на которые стоит взглянуть ближе:

  • Станет ли изоляция сред оценки опубликованным стандартом после того, как две лаборатории за десять дней раскрыли один и тот же класс отказа: жёсткая сетевая изоляция, никаких продакшн-credentials, оценивание вне досягаемой среды. Пока каждая организация доходит до этого самостоятельно, а разбор Anthropic прямо призывает другие лаборатории провести такой же обзор.
  • Stateless-ревизия MCP — удаление протокольных сессий делает удалённые серверы обычными в масштабировании, но это ломающее изменение, поэтому операционный вопрос ближайшего месяца — насколько чисто клиенты, шлюзы и SDK договариваются о версиях при частичном раскате.
  • Off-premises-нагрузки перевалили за половину — сторонние площадки держат 46% корпоративных нагрузок против 44% в собственных дата-центрах, а это переносит бо́льшую часть обсуждаемого здесь вопроса обнаружения на границы, которые ты наблюдаешь через чужой control plane.
Теги: ai-security · ai-governance · observability · systems-thinking · engineering-leadership