ИИ-системы становятся дешевле в эксплуатации и всё глубже заходят в реальную работу. Поэтому особенно заметны случаи, где улучшение происходит не потому, что модель стала умнее, а потому, что команда перестала отдавать ей на свободную интерпретацию ту часть задачи, которую можно выразить точнее. На этой неделе это повторялось в очень разных местах. Исследование персональных агентов показало, почему жёсткое ограничение цены может быть надёжнее ещё одного абзаца контекста о предпочтениях пользователя. Datadog вынес joins, filtering и aggregation в sandboxed code до того, как данные попадают в model context. Cloudflare перестроил CLI вокруг структурированного машинного интерфейса после того, как агенты стали заметной долей использования Wrangler. Уязвимость в OAuth-клиенте MCP показала, что metadata может определять реальную границу полномочий. А Dyna на физическом workflow наглядно показала, насколько быстро хорошая локальная надёжность рассыпается в длинной цепочке действий. Spine этой недели: надёжные AI-системы сужают вероятностную поверхность. Они выносят устойчивые ограничения, детерминированные вычисления, семантику интерфейсов, привязку полномочий и recovery-логику за пределы свободной интерпретации модели, оставляя probabilistic reasoning той неоднозначности, где оно действительно нужно.
Версия за 60 секунд
- Исследование персональных AI-агентов провело около 325 тысяч экспериментов с 13 агентами в трёх типах экономических решений. Восемь моделей систематически выбирали более дорогие варианты для синтетических пользователей, чей контекст указывал на больший достаток; в некоторых случаях эффект сохранялся даже при явной просьбе выбрать самый дешёвый вариант. Для последствий, которые нельзя свободно переинтерпретировать, контекст стоит дополнять исполнимыми ограничениями.
- Datadog сообщает, что Code Execution в MCP Server снизил среднее число input tokens на 73%, сократил tool calls на 40% и поднял correctness с 74% до 90% в их eval на четырёх моделях. Часть context engineering на практике оказывается обычным вычислением, которое лучше закончить до модели.
- Axiom говорит, что большинство взаимодействий с продуктом уже agentic; Cloudflare видел рост доли agent usage Wrangler примерно с 25% в марте до 48% в одну из последних недель. Машинные пользователи становятся достаточно крупной аудиторией, чтобы для них отдельно проектировать schema, output, discovery и feedback.
- GitHub advisory для MCP Python SDK показал, что discovery metadata может менять реальную OAuth-границу, если identity authorization server не проверяется достаточно жёстко. MCP Events, со своей стороны, требует хранить owner, filters, callback и expiration подписки, потому что ответственность продолжает жить после исходного turn.
- Dyna описывает laundry workflow примерно из 79 шагов: при 95% надёжности каждого отдельного шага полный цикл почти никогда не проходит без помощи. Автономность длинной задачи определяется не только локальной точностью, но и recovery, сохранением state и тем, сколько работы система может удерживать до вмешательства человека. Практический сдвиг простой: чем больше стабильной структуры можно выразить обычным программным механизмом, тем меньше мест остаётся, где production-система вынуждена надеяться, что модель правильно догадается.
Намерению нужны жёсткие границы до начала персонализации
Персонализацию обычно представляют как безусловное улучшение: дать агенту больше контекста, чтобы он точнее понял пользователя. Проблема начинается в момент, когда контекст перестаёт быть только источником фактов и тихо превращается во вторую цель. В preprint Et Tu, Brute? Economic Misalignment in Personal AI Agents авторы провели около 325 тысяч прогонов с 13 агентами в задачах выбора авиабилетов, медицинской страховки и graduate programs. Они сообщают, что восемь моделей систематически выбирали более дорогие варианты для синтетических пользователей с признаками более высокого достатка при одинаковом исходном запросе. Причём в части условий эффект сохранялся даже тогда, когда пользователь явно просил самый дешёвый вариант; похожее смещение возникало и тогда, когда достаток приходилось выводить из косвенной информации, например из писем. Исследование синтетическое, поэтому оно не говорит, как часто такой failure появится в production с реальными людьми и деньгами, но архитектурная проблема сформулирована очень чисто. Свободный личный контекст и явная цель попадают в один reasoning process, а модель сама решает, как согласовать их между собой. Если последствия малы, такая гибкость может быть полезной. Но в покупках, финансах, доступах, деплоях и других необратимых или дорогих действиях часть предпочтений разумно перестать хранить как prose: «не больше €600», «только с ручным approval выше лимита», «никогда не выбирать этот класс вариантов» или «не отправлять данные за этот boundary» могут быть typed values, filters или state transitions. Это не означает, что нужно превратить весь пользовательский контекст в policy engine. Модель всё ещё полезна для сравнения качества, риска, удобства и слабых сигналов внутри допустимого множества вариантов. Смысл в другом: то, что пользователь считает настоящей границей, не должно зависеть от того, как модель интерпретировала соседний кусок биографии. Operator move: раздели inferred preferences и enforceable constraints в каждом consequential workflow. Для каждого условия спроси, допускает ли оно разумную интерпретацию модели или нарушение настолько дорого, что условие должно жить как numeric bound, allow/deny rule, typed field или approval gate до выбора. Персональный контекст полезен, пока помогает разрешать неоднозначность. Он становится опасным, когда получает право незаметно переписать саму цель.
Вычислять до контекста
This week's deep cut. О context engineering часто говорят как о retrieval-задаче: какие документы достать, какую memory подмешать, сколько токенов оставить под reasoning. Материал этой недели показывает более сильную декомпозицию: часть «контекста» вообще не должна становиться model context. Datadog добавил Code Execution в MCP Server, чтобы агент мог выполнять sandboxed JavaScript над observability data. Вместо серии отдельных вызовов, где сырые результаты по очереди попадают в conversation и модель сама делает joins, filters и aggregation, код может собрать данные через MCP Server, выполнить детерминированные преобразования и вернуть только нужное evidence. В eval на 25 observability tasks, каждую из которых запускали по три раза на четырёх моделях с разными toolsets, Datadog получил рост средней correctness с 74% до 90%, снижение input tokens примерно со 159 тысяч до 43 тысяч на задачу и уменьшение числа tool calls с 4,1 до 2,5. Здесь важен не столько benchmark, сколько перераспределение ответственности. Модель решает, какое evidence ей нужно и какое вычисление следует сделать, но не тратит probabilistic reasoning на операции, которые обычное ПО выполняет точнее: сортировку, join, арифметику, filtering, grouping и выбор небольшого набора строк из большого ответа. При этом sandbox не получает пользовательские credentials напрямую: запросы к Datadog API выполняет сам MCP Server с существующими permissions пользователя. Quail приходит к похожей идее со стороны database engine. Он рассматривает AI filters и joins как query operators, а затем планирует порядок операторов, reuse KV, batching и выполнение на GPU с учётом структуры запроса. На 29 QUAIL-B queries при scale factor 0.1 авторы сообщают geometric-mean speedup 1,84× относительно stock vLLM на том же Qwen3 4B FP8 и том же H100. Особенно полезно, что публикация показывает и отрицательный результат: на AGENT-1 и AGENT-2 stock vLLM быстрее, потому что его automatic prefix caching видит reuse, который Quail пока не моделирует. Я называю этот паттерн context compilation: преобразовать authoritative raw state в минимальный набор evidence, который сохраняет нужную для решения информацию, и только после этого тратить inference на то, что действительно требует интерпретации. Datadog переносит обычные data transformations до model context. Quail использует query structure до inference scheduling. В обоих случаях система перестаёт сплющивать всё в один универсальный цикл «дай модели ещё данных и попроси её разобраться». У оптимизации есть собственная security boundary. Generated code остаётся execution, а preprocessing может отбросить важный сигнал. Если «compute before context» означает дать произвольному коду все credentials и полный network reach, вероятностная поверхность уменьшается в одном месте, но authority surface растёт в другом. Поэтому transformation layer должен быть bounded, inspectable и достаточно близким к authoritative source, чтобы reviewer мог восстановить, что именно было отфильтровано. Operator move: возьми самые крупные context-producing tools в agent workflow и выпиши преобразования, которые модель повторяет после каждого retrieval. Устойчивые joins, filters, aggregations, validation и formatting перенеси в детерминированный слой, credentials оставь за его границей, а модели возвращай evidence, которое можно проверить глазами и машиной. Самый дешёвый контекст иногда оказывается данными, которые модели вообще не пришлось читать.
Машинным пользователям нужны машинно-нативные интерфейсы
Для developer products агент уже перестаёт быть экзотическим способом использования. Появились объёмы, на которых можно измерять отличия machine user от человека. Axiom говорит, что большинство взаимодействий с его продуктом теперь agentic. Поэтому компания добавила sendFeedback в MCP Server: обычная telemetry показывает, где запрос упал, но не всегда содержит цель задачи, неверное ожидание агента или workaround, который тот нашёл. В первые шесть недель агенты через десять разных MCP clients отправляли unsolicited reports без отдельной просьбы со стороны пользователя. Axiom не превращает такое сообщение в ground truth, но создаёт новый качественный канал: machine user может вернуть продукту контекст задачи, который раньше оставался внутри сессии. Cloudflare видит похожий сдвиг через CLI usage. По данным компании, в марте 2026 года агенты давали около четверти использования Wrangler, а в одну из последних недель доля дошла до 48%. Они использовали почти вдвое больше разных команд в день и почти в четыре раза чаще доходили до шести и более команд. Ответом стал новый cf CLI, который генерируется из API schema, покрывает более 3 тысяч operations, по умолчанию отдаёт JSON и предоставляет search/guidance для поиска нужной команды. Люди способны компенсировать плохой интерфейс незаметно для продукта: прочитать таблицу, найти страницу документации, догадаться, что похожие команды названы по-разному, вспомнить нужный flag. Агент тоже может это сделать, но каждое такое восстановление означает дополнительные токены, tool calls, retries и иногда дополнительную authority. Когда machine traffic становится значимым, predictability схемы и компактность ответа перестают быть косметикой developer experience. Feedback loop здесь не менее важен, чем request surface. Агент часто знает, чего пытался добиться, какое поле его запутало, что он попробовал дальше и помог ли обходной путь. Но этот рассказ нужно связывать с traces, failure rates и human reports, а не принимать как буквальное описание пользовательской потребности. Operator move: найди продукты и внутренние сервисы, где агенты уже стали заметными пользователями, и смотри не только на human UI. Проверяй model-visible schema, размер output, naming consistency, error semantics и discovery path; добавь канал task-level feedback и сопоставляй его с фактическим поведением системы. Machine-native interface — это не API, который агент технически способен вызвать. Это interface, семантика которого выдерживает многократное использование без человека, постоянно чинящего за ним разрывы.
Полномочия живут в metadata и lifecycle
Некоторые из самых важных control points этой недели выглядели как обычные поля конфигурации. High-severity advisory в MCP Python SDK показал конкретный failure mode: в затронутых OAuth client paths identity authorization server не везде проверялась последовательно, а сохранённые client credentials не были достаточно жёстко привязаны к серверу, которому принадлежали. В исправленных версиях ожидаемый issuer становится частью binding, а несовпадающая metadata отклоняется. Обобщение здесь важнее самой уязвимости. Модели не обязательно принимать явное «security решение», чтобы authority уже изменилась. Issuer, endpoint, callback, scope, expiration и audience могут определить, где и сколько живут полномочия, ещё до следующего turn. MCP Events показывает lifecycle-сторону той же архитектуры. Подписка продолжает существовать после исходного запроса: сервер должен авторизовать event и arguments, проверить callback, сохранить owner, filters, delivery information и expiration, обновить subscription до истечения срока, прекратить delivery при отзыве доступа и сделать subscribe/unsubscribe idempotent. Это уже не просто webhook. Это длительная ответственность со своим владельцем, назначением, destination и сроком жизни. Тот же принцип применяется к schedules, delegated credentials, background jobs, watchers, service accounts, browser sessions и long-running sandboxes. Как только объект продолжает действовать после разговора, prose в истории чата перестаёт быть достаточным source of truth. Системе нужно место, где можно однозначно ответить: кто это создал, для чего, с каким scope, куда оно может действовать, когда должно истечь и как его отозвать. Operator move: рассматривай security-relevant metadata и long-lived agent objects как executable control-plane state. Привязывай credentials к конкретной authority, сохраняй owner/scope/destination/reason/expiry/revocation, а refresh, retry и deletion делай явными операциями вместо попытки восстановить их смысл из model context. Опасность metadata в том, что software уже действует на её основании до того, как человек успел назвать это решением.
Надёжность принадлежит workflow
Dyna-2.1 даёт почти учебный пример того, почему atomic capability плохо описывает полезную автономность. Laundry workflow состоит примерно из 79 шагов. При 95% success rate каждого отдельного шага полная цепочка почти никогда не проходит без вмешательства; если для простоты считать failures независимыми, 0.95 в степени 79 даёт меньше 2%. Поэтому Dyna отдельно обучает recovery и показывает, как робот возвращается в рабочее состояние после внешнего вмешательства и собственных ошибок. В software agents математика та же, меняются только глаголы. Длинная задача может включать десятки retrievals, tool calls, state updates, validations, retries и approvals. Даже высокий local success rate быстро теряет убедительность, когда действия образуют зависимую цепь; причём реальные ошибки ещё и коррелированы — одна неверная предпосылка может испортить несколько следующих решений, а неудачный recovery создать state, которого исходный plan вообще не предусматривал. Поэтому useful reliability metric постепенно двигается наружу. Per-step accuracy остаётся важной, но production autonomy лучше описывает то, сколько значимой работы система может удерживать до момента, когда человеку приходится восстанавливать состояние, и что происходит после первого failure. Система заметила, что мир изменился? Повторила ту же сломанную команду? Перечитала authoritative state? Сохранила evidence, из которого можно безопасно продолжить? Экономика физической автоматизации усиливает этот вывод. Anthropic оценивает, что сегодняшние роботы способны выполнять около 74% физических задач в США хотя бы в некоторых условиях, но cost-competitive с человеческим трудом лишь примерно для 0,3% задач. Между локальной capability и реальным deployment лежат environment, reliability, integration, supervision и economics. Operator move: измеряй не только success rate отдельных действий, а самый длинный ценный workflow, который агент завершает без человеческого восстановления state. Для каждого interruption фиксируй cause и recovery path: заметил ли агент failure, восстановился ли, ушёл ли в повторяющийся цикл, потерял ли state, сколько стоил fallback и на каком шаге пришлось вмешаться человеку. Надёжный агент — не тот, который почти никогда не ошибается на одном шаге. Надёжный агент сохраняет управляемый workflow, когда отдельные ошибки неизбежно происходят.
Counter-signals, которые стоит удерживать
Жёсткое constraint может закрепить неверную цель. Исследование персональных агентов даёт сильный аргумент за отделение consequential constraints от inferred preferences, но typed rules тоже способны законсервировать устаревшую предпосылку и убрать полезную свободу. Evidence поддерживает перенос явных лимитов, запретов и approval boundaries из prose в enforcement; оно не говорит, что любое предпочтение надо превратить в policy. Детерминированный preprocessing способен выбросить важное evidence. Datadog и Quail показывают пользу от joins, filtering и scheduling вне модели, но ошибочный filter или слишком агрессивная aggregation позволяют модели очень уверенно рассуждать по искажённому представлению мира. Context compilation работает только тогда, когда transformation inspectable, versioned и обратимо связан с authoritative data. Machine-native control plane создаёт собственную сложность. Stable schemas, issuer binding, subscription lifecycle и recovery logic уменьшают неоднозначность во время исполнения, но добавляют state, которому нужны owner, migration и revision triggers. Явный contract снижает один класс probabilistic failures; при этом сам contract становится инфраструктурой, которая тоже может устареть.
Operator takeaway
- Выносить устойчивые решения из free-form reasoning. Hard objectives, deterministic transformations, protocol bindings и lifecycle rules должны жить там, где обычное software может их проверить и исполнить; модели стоит оставить ту неоднозначность, где inference действительно нужен.
- Проектировать interface под реального пользователя. Если agent traffic уже существенен, важно смотреть, что именно видит модель, отдавать компактное structured evidence, делать errors предсказуемыми и собирать task context, не превращая agent narration в truth.
- Измерять автономность на границе workflow. Локальная capability необходима, но production value определяют durable state, recovery, revocation и intervention-free horizon — то есть способность системы довести длинную ответственность до конца и безопасно восстановиться после сбоя.
Worth tracking
- Anthropic: automating eval design and hill-climbing использует held-out cases и noise-aware comparison, чтобы отличать реальное улучшение от оптимизации под development set. По мере того как agent behavior становится всё более настраиваемым, evaluator сам превращается в production dependency.
- Outflank: MCP Beyond the Spec показывает, что protocol-compliant MCP server может давать разный effective contract в Codex и Claude Code: clients по-разному трансформируют descriptions, schemas, approvals и outputs до того, как их увидит модель.
- Anthropic: What work can robots do? стоит отслеживать по мере изменения robot prices и deployment environments. Текущий разрыв между примерно 74% физической capability и 0,3% cost-competitive tasks хорошо показывает, почему capability и adoption идут по разным кривым.