ЗаметкаИнженерное лидерство

Способность обогнала подтверждение

Неделя 3 августа 2026. Frontier-модели сгенерировали 6080 патчей безопасности, и примерно четверть из них сработала — а правдоподобная, но неверная подсказка в промпте роняла успех до одного из шести, причём агенты шли за подсказкой против собственных данных. Тот же зазор открылся всюду: пиковая способность расходится с продакшн-надёжностью, агенты не могут проверять сами себя, операционные данные ставят потолок любой модели, а переносимые артефакты не несут переносимого доверия. Производство подешевело. Подтверждение производимого — нет. Скан-слой TL;DR, пять тем каждая с operator move, одна разобрана глубоко, три контр-сигнала и что отслеживать.

Lukman Nuriakhmetov
Lukman Nuriakhmetov
12 мин чтения · 10 августа 2026 г.

Самое полезное число недели — 26%.

Столько из 6080 сгенерированных ИИ патчей безопасности действительно закрыли уязвимость, не изменив поведение приложения. Патчи писали две frontier-модели против шести недавно раскрытых CVE, и каждый оценивали вручную. Больше половины либо не починили дыру, либо открыли новую, либо сделали и то и другое.

Произвести правдоподобный фикс стало почти бесплатно. Установить, что фикс сработал, не подешевело вообще. Этот зазор — форма всей недели.

Он проявился в надёжности агентов, где пиковая способность всё дальше расходится с тем, на что можно опереться в повторяющихся прогонах. В дизайне мультиагентных систем, где работают ровно те, в которых ни один агент не проверяет собственный результат. В потолках автоматизации, где сломанной оказывалась не модель, а устаревшие записи об идентичностях. И в новых стандартах переносимости, где артефакт переезжает между клиентами чисто, а решение о доверии — категорически нет.

Issue 10 закончился на том, что отсутствие сигнала принимали за отсутствие проблемы. Эта неделя — версия сложнее: сигнал есть, и он положительный. Патч написан. Агент отработал. Benchmark пройден. Плагин установлен. Ни одно из этих событий не является подтверждением, и на этой неделе расстояние между ними стало измеримым.

The 60-second version

Если читать только это:

  • Три из четырёх сгенерированных патчей оставили что-то сломанным. 26% чистых, 53,9% провалились или внесли новую уязвимость, и больше трети «успешных» признаны хрупкими. Генерация отмасштабировалась, верификация нет.
  • Неверная подсказка стоит дороже, чем верная приносит. Правильное направление фикса в промпте закрывало баг примерно в двух третях случаев; правдоподобное, но неверное — роняло до одного из шести. И агенты шли за промптом против собственного противоречащего вывода инструментов.
  • Пиковая способность — не продакшн-надёжность. Успех в лучшей попытке мало говорит о workflow, который обязан отработать сотни раз; надёжность падает с числом шагов, а средние прячут разброс между прогонами.
  • Работающие мультиагентные системы запрещают самопроверку. Бэклог Astro разгребли, потому что воспроизведение, диагностика, верификация и реализация были разделены и передавали друг другу доказательства, а не потому что агентов было четыре.
  • Потолок автоматизации ставят операционные данные, а не модель. На ~150 000 действий IT-агентов слабейшими оказались identity, онбординг и оффбординг — они падали на отсутствующих аккаунтах и устаревших записях.

Одна строка на неделю: производство подешевело, а подтверждение нет — значит дефицитным стало доказательство, а не результат.

1. Генерация обогнала верификацию, и зазор измерим

Deep cut недели.

Это важнейший результат недели, потому что он заменяет спор числом. Пройдём внимательно.

Off-by-1 Labs (1Password) сгенерировали 6080 патчей для шести недавно раскрытых CVE — повышение привилегий в Linux, RCE в ActiveMQ, Exim, Spring AI и Gemini CLI, use-after-free в Chrome File System Access API на macOS — силами ChatGPT 5.5 и Claude Opus 4.8, и оценили каждый патч вручную, а не по тому, компилируется ли он и проходят ли тесты. Уязвимости подбирали достаточно свежими, чтобы они вряд ли попали в обучающие данные.

Заголовочная цифра: 26,0% полностью закрыли уязвимость, не изменив существенно поведение приложения. Ещё 20,1% закрыли уязвимость, но поведение изменили — характерный пример: логика тихо переворачивается из allow-list в deny-list, что чинит CVE и ломает продукт. 49,3% не закрыли хотя бы один путь эксплуатации. 2,3% починили дыру и открыли новую; 2,2% не сделали правильно ни того, ни другого. Совокупный провал — 53,9%. А среди прошедших патчей больше трети признали хрупкими: код перекрывал один конкретный вход, обычно экранированием отдельных символов, тогда как уязвимый код оставался нетронутым позади и ждал другого входа.

Класс таких результатов исследователи назвали FLAWED — Fix-Like Artifacts With Embedded Defects. Их вывод прямой: ожидаемая ценность полностью сгенерированного и не проверенного человеком патча отрицательна с большим запасом.

Теперь находка, которая важнее заголовка и о которой почти никто не написал. Направление фикса значило больше, чем выбор модели или устройство harness. Когда промпт нёс верное направление, модели закрывали баг примерно в двух третях случаев. Когда он нёс правдоподобное, но неверное — из тех, что подсовывает уверенный AI-ревьюер или спешный триаж, — успех обваливался примерно до одного из шести. Плохое направление стоит куда дороже, чем хорошее приносит. И в этих прогонах собственные вызовы инструментов агента иногда возвращали данные, противоречащие промпту. Модели всё равно шли за промптом.

Эта деталь переопределяет риск. Опасность не в том, что модель слаба. Опасность в том, что модель — усилитель без собственного мнения о переданной ей гипотезе: она исполнит твою неверную теорию быстрее, тщательнее и убедительнее, чем ты сам, и сделает это, переступив через собственные противоречащие данные. Каждый, кого уверенный коллега хоть раз отговорил от верной интуиции, знает этот отказ. Разница в том, что этот коллега не устаёт и производит артефакты, которые выглядят законченными.

Экономика делает хуже, а не лучше. Чистый патч обошёлся примерно в $6,74 с учётом неудачных попыток, против $2,11–2,81 за цикл генерации. Это достаточно дёшево, чтобы «сгенерировать ещё» всегда выглядело рациональным ходом, а экспертное ревью — дорогой частью. Ровно тот градиент стимулов, который производит очередь правдоподобных артефактов, не подтверждённых никем.

Operator move: сделай эксплойт приёмочным тестом, а не диффом. До того как агент возьмётся за фикс, воспроизведи уязвимость и сохрани воспроизведение как исполняемый артефакт; прогоняй его против пропатченной сборки; рядом гоняй поведенческий набор, чтобы фикс, меняющий поведение, падал громко, а не уезжал тихо. И добавь правило, за которое исследование и агитирует: если ты не можешь поручиться за направление фикса, которое передаёшь агенту, не передавай его. Отдай баг и промолчи. Уверенная неверная подсказка хуже, чем никакой, и теперь это измеренное утверждение, а не интуиция.

Генерация — это гипотеза. Верификация — это продукт.

2. Пиковая способность — не продакшн-надёжность

Тот же зазор проявился в менее драматичном регистре, и он должен поменять то, как читаются анонсы моделей.

Расстояние между тем, что агент выдаёт в лучшей попытке, и тем, на что команда может опереться в повторяющихся многошаговых прогонах, продолжает расти. Надёжность падает с числом шагов, потому что пошаговые вероятности перемножаются. А публикуемые средние прячут то, что операционно важнее всего: разброс между прогонами. Workflow, который в среднем успешен на 90%, но падает кластерами, — это другой продукт, чем тот, что падает равномерно.

Поэтому результат benchmark и решение о продакшене — разные артефакты. Модель, однажды выполнившая сложную задачу, продемонстрировала потолок способности. Workflow, обязанный отработать четыреста раз в день, нуждается в полу. Первое число ничего не говорит про второе — а индустрия публикует первое.

Operator move: оценивай агентов по распределению между прогонами, а не по best-of-N. Прогоняй один и тот же workflow много раз и фиксируй долю отказов, разброс и то, на каких шагах отказы скапливаются. Уровень автономии задавай от пола, а не от потолка, — и там, где пол не устраивает, укорачивай цепочку, а не апгрейди модель. Меньше шагов бьёт лучшую модель почти на любой планке надёжности, потому что перемножение вредит сильнее, чем помогает способность.

Лучшая попытка — материал для исследовательского отчёта. Худшая правдоподобная — для решения о проде.

3. Работающие мультиагентные системы запрещают самопроверку

Если верификация — дефицитный ресурс, то вопрос дизайна в том, кому позволено её выполнять. И неделя дала на редкость чистый ответ.

Astro issue factory от Cloudflare разгребла давний бэклог четырьмя агентами по раздельным стадиям: один воспроизводит проблему, второй диагностирует, третий верифицирует, четвёртый реализует. Ни один агент не ведёт issue от начала до конца. Состояние между стадиями несут метки и сгенерированные доказательства, а исходный репортёр проверяет превью-пакет до открытия pull request.

Соблазн прочитать это как «больше агентов — больше пропускной способности». Урок не в этом. Улучшение даёт ограничение: ни одна стадия не вправе удостоверить собственный результат, и каждая получает от предыдущей фальсифицируемый вход. Это разделение обязанностей — не новый контроль, а самый старый в операционном риске, — которое пришло в новую область, потому что старое допущение перестало держаться. Пока одному компетентному актору можно было доверить рассуждать и проверять одновременно, срезка была по карману. Агент, который производит правдоподобные артефакты в объёме, делает её дорогой.

Тот же принцип объясняет, почему вендорские AI-оценки регулярно приносят сюрпризы. Если организация, строящая систему, сама проектирует тест, сама его проводит и сама удостоверяет результат — на выходе самоаттестация с лишними шагами, независимо от чьих-либо добрых намерений.

Operator move: для любого агентского workflow с последствиями назови стадии и сделай так, чтобы каждая производила доказательство, которое следующая может отвергнуть. Воспроизведение, диагностика, реализация и верификация не должны делить актора, — а там, где нехватка людей вынуждает совмещать, у проверяющего шага должны быть хотя бы другие режимы отказа, чем у производящего: другое семейство моделей, детерминированная проверка, с которой нельзя договориться, или человек, владеющий исходом. Число агентов — деталь реализации. Разделение обязанностей — контроль.

4. Потолок ставят операционные данные, а не модель

Самая полезная поправка недели пришла из исследования того, на чём агенты реально спотыкаются в обычной IT-работе.

На примерно 150 000 действий агентов слабейшими workflow оказались identity, онбординг и оффбординг. Повторяющиеся причины — не провалы рассуждения: отсутствующие аккаунты, устаревшие записи, ненадёжные интеграции. В целом агенты закрывали около трети шагов, и там, где они падали, модель часто была наименее интересным сломанным компонентом.

Это тот потолок автоматизации, который почти никто не закладывает в бюджет. Автоматизация вскрывает противоречия, которые раньше молча поглощали люди — памятью, обходными каналами, сообщением тому, кто знает, и ручными исключениями, которые никто не записал. Эти костыли были невидимы именно потому, что за них платил человек. Передай тот же процесс агенту — и процесс обязан стать правдой, потому что у агента нет доступа к неформальному слою починки, на котором всё держалось.

Вторая половина ответа на этой неделе была архитектурной: Agent Access Model от Cloudflare оценивает каждое действие против текущего состояния задачи короткоживущими credentials — и, что стоит забрать себе, полномочия движутся только в одну сторону. Права могут истечь, быть отозванными или сузиться по ходу задачи. Тихо расшириться — нет. Маленький инвариант с большими последствиями, потому что типичный отказ не в том, что агент захватывает власть, а в том, что полномочия тихо переживают шаг, который их оправдывал.

Operator move: прежде чем апгрейдить модель, проверь процесс на наличие авторитетного источника, актуальных идентичностей, явного владения и детерминированной обработки отказов. Дальше примени монотонное правило к полномочиям: каждая задача стартует с максимального конверта возможностей, каждый вызов инструмента оценивается против текущего состояния задачи, а не статической роли, а расширение внутри задачи требует отдельного события одобрения и желательно новой границы исполнения. Ретраи и возобновлённые прогоны обязаны переоценивать полномочия, а не переиспользовать исходную выдачу.

Интеллект не может автоматизировать процесс, чья реальность размазана по сломанным записям.

5. Артефакт переносим, доверие — нет

Последняя тема укусит тише всех, потому что приходит в обличье хорошей новости.

Agent Plugins 1.0 стандартизирует упаковку для Agent Skills и MCP-серверов — и намеренно оставляет установку, права, дистрибуцию и поведение клиента вне слоя совместимости. Эта граница верна, и её стоит защищать. Соблазнительная ошибка следующая: принять переносимый пакет за переносимое решение о доверии. Skill, безопасный при одной модели прав клиента, может быть опасен при более широкой среде исполнения другого, — и формат пакета ничего не говорит о том, в какой из них ты находишься.

Та же форма прошла через неделю в других видах. Prime Agent выставляет контекст, сабагентов, инструменты и постоянное состояние harness через программируемый интерфейс — то есть слой, ограничивающий модель, становится тем, что модель может править, а изменение harness перестаёт быть деталью рантайма и становится привилегированным продакшн-изменением. Cloudflare OS отдаёт в open source целое внутреннее агентское рабочее пространство — это по-настоящему полезно и одновременно передаёт проблемы identity, прав, песочницы и управления затратами тому, кто это поставит. А Taalas, которую покупает AMD, зашивает веса модели в кремний — переносимость в обратную сторону: меняет возможность версионировать, маршрутизировать и откатывать модель на эффективность инференса и превращает апгрейд модели в решение о жизненном цикле железа.

Четыре разных слоя, один вопрос: когда нечто переезжает между средами, что именно переехало? Обычно код, пакет, веса. Почти никогда — авторизация, путь ревью и причина, по которой этому вообще доверяли.

Operator move: для каждого переносимого артефакта, который принимают твои системы — плагины, skills, MCP-серверы, версии моделей, open-source-платформы, — выпиши отдельно, что артефакт декларирует и что выдаёт твоя среда. Требуй, чтобы требования к возможностям приезжали вместе с пакетом, а авторизация выдавалась локально, под каждую среду, и никогда не наследовалась. И считай любой компонент, который агент может менять — harness, промпты, определения инструментов, память, — привилегированным продакшн-состоянием с версией, диффом, путём ревью и откатом.

Совместимость должна сокращать интеграционную работу. Она не должна попутно сплющивать границу безопасности.

Контр-сигналы, которые стоит держать

Три напряжения, которые стоит держать живыми, — и куда бы я положил вес:

Цена верификации против паралича. Воспроизведение эксплойтов, поведенческие наборы, стадийные агентские конвейеры, тесты распределения между прогонами и монотонные полномочия — всё это настоящие инженерные программы, и требовать их везде значит не выпускать ничего. Реально. Вес: масштабируй бремя доказательства по последствиям и обратимости — исследование мерило security-фиксы, где неверный ответ создаёт новый путь атаки, а это не профиль правки текста или внутреннего дашборда. Трать верификацию там, где правдоподобный неверный ответ дорого обнаруживать поздно.

Результат по патчам — измерение потолка, а не приговор. Уязвимости специально брали свежие и сложные, чтобы отсечь припоминание из обучающих данных, а модели работали без того богатого контекста, который есть у мейнтейнера. Лучшие промпты и итеративный harness заметно улучшали результат. Справедливо. Вес: 26% — это число для трудной новой работы на тонком контексте, а не для рутинного ремонта с хорошим репродьюсером и мейнтейнером в петле, а таково большинство патчей. Переносимая находка — чувствительность к направлению, а не заголовочная доля.

Разделение обязанностей против цены координации. Стадийные конвейеры добавляют задержку, теряют контекст на передачах и могут раздробить задачу на куски, ни один из которых не видит целого. Верно, и дизайн Astro работает только потому, что у каждой стадии есть внятный контракт. Вес: применяй разделение там, где независимая проверка меняет исход, а не везде — тест простой: может ли стадия правдоподобно отвергнуть работу предыдущей. Если не может, это шаг, а не проверка, и покупаешь ты только задержку.

Operator takeaway

Если ты выпускаешь в регулируемых системах, чувствительных к безопасности или AI-смежных продуктах, на этой неделе затвердели три вещи:

  1. Сделай доказательство исполняемым, а не инспекционным. Воспроизведи отказ, сохрани воспроизведение как приёмочный тест, прогоняй его против изменения. Артефакт, который выглядит верным, — не доказательство, а чтение диффа — не верификация; теперь это измеренное утверждение, а не предпочтение.
  2. Не передавай агенту гипотезу, за которую не можешь поручиться. Уверенное неверное направление роняло успех с двух третей до одного из шести, и модели переступали через собственные противоречащие данные, чтобы ему последовать. Если твоя заметка в триаже — догадка, отдай проблему без догадки.
  3. Раздели производство и удостоверение, и пусть полномочия только сужаются. Ни одна стадия не должна проверять собственный результат, ни одно право не должно тихо расширяться внутри задачи, ни один переносимый артефакт не должен нести переносимое доверие. Это один и тот же контроль в трёх костюмах.

Это не прогнозы. Это описание того, куда операционная почва уже сместилась.

Стоит понаблюдать

Несколько конкретных вещей этой недели, на которые стоит взглянуть ближе:

  • Harness оценки FLAWED, выпущенный вместе с исследованием патчей, — станет ли «воспроизведи эксплойт, прогони его после патча» штатным гейтом в AI-конвейерах ремонта или останется исследовательским артефактом, пока очередь правдоподобных патчей растёт.
  • Agent Plugins 1.0 против его намеренных пробелов — формат пакета решён; подписи, обнаружение, политика обновлений, совместимость и декларация прав — нет, а именно там экосистема либо становится безопасной для установки, либо не становится.
  • Покупка Taalas со стороны AMD — модель-специфичный кремний в дорожной карте крупного вендора ускорителей станет самой ясной проверкой того, насколько стабильной должна быть продакшн-нагрузка, чтобы заморозка модели в железе окупилась.
Теги: ai-engineering · ai-governance · engineering-leadership · systems-thinking · operator-notes