ИИ-системы становятся мощнее, но главный сюжет этой недели — не дополнительная мощность, а отбор. Одни команды добавляли параллельных агентов. Canva учил воркеры самостоятельно снижать давление на зависимость. Databricks искал клиентские сбои, которые не видны по обычному service health. Datadog переносил повторяющуюся расследовательскую работу с frontier-модели-учителя на специализированную 9B-модель. Эксперимент DFDX Labs произвёл много софта и почти не создал спроса. Это разные задачи, но у них одна граница. Следующая проблема масштабирования — решить, где исполнение вообще оправдано: какую работу пускать в систему, какое давление ей разрешать, какие доказательства могут отклонить результат, где заканчиваются полномочия и когда повторяющийся workflow пора переносить на специализированный execution path.
Версия за 60 секунд
- Анализ Toby Ord показывает, что параллельные агенты могут покупать меньшее wall-clock time ценой дополнительного compute: при сопоставимом качестве четыре агента использовали примерно вдвое больше reasoning tokens суммарно, но каждый агент мог работать примерно вдвое меньше времени. Параллелизм — экономический выбор, а не обязательная следующая стадия зрелости.
- Queue workers Canva использовали локальную обратную связь по успехам и ошибкам, чтобы снижать concurrency во время 32,5-часовой перегрузки. Защищённый fleet продолжал обрабатывать около двух миллионов сообщений в час; было зафиксировано 1 795 025 failed attempts, а dead-letter queue выросла только на 22 сообщения.
- RADAR у Databricks ловит gray failures по пользовательским ошибкам даже тогда, когда обычный health компонентов остаётся зелёным. Рекомендации NVIDIA по оценке агентов и аудит benchmark-датасетов Horizon поднимают тот же вопрос уровнем выше: какие доказательства вообще имеют право принять результат?
- Datadog обучил Qwen3.5-9B на успешных investigation traces от GLM-5.3. На held-out внутренних инцидентах student-модель получила 0,55 Recall@5 против 0,63 у teacher при примерно $0,003 против $0,06 за расследование. Повторяющийся AI-workflow может превратиться из постоянной frontier-inference задачи в задачу обучения и serving.
- DFDX Labs дал агенту три недели на управление бизнесом. Агент построил 17 платных продуктов, создал 46 API endpoints, использовал более пяти миллиардов токенов и получил $1,54 выручки. Дешёвое предложение само по себе не создаёт разрешённый спрос. Практический сдвиг: доступную AI-мощность больше нельзя автоматически считать работой, которую стоит потребить. Масштабированию нужны admission rules, backpressure, независимые доказательства результата, границы полномочий по реальным эффектам и execution paths, подобранные под доступную в задаче обратную связь.
Параллелизму нужен тормоз
Multi-agent systems часто выглядят как очевидный следующий шаг: если один способный агент полезен, несколько параллельных агентов должны быть ещё полезнее. Пропущенная переменная — цена времени до результата. Toby Ord восстановил поведение swarm scaling по опубликованным результатам и получил task-dependent scaling exponents примерно от 0,48 до 0,68 на трёх benchmarks. Практический вывод проще математики. При сопоставимом качестве четыре агента в опубликованных кривых требовали примерно вдвое больше total reasoning tokens, чем один агент, при этом reasoning budget каждого агента мог быть примерно вдвое короче. Дополнительный compute действительно может покупать меньшее elapsed time. Toby Ord Это хороший обмен во время инцидента, широкого поиска, работы к жёсткому дедлайну или задачи, которая хорошо раскладывается на независимые части. Но он плох как default, если latency не является дефицитным ресурсом. Больше агентов означает больше вызовов, state, координации, retries и способов сильнее нагрузить downstream dependency. Worker Backpressure у Canva показывает вторую половину контура. Queue workers активно используют доступную capacity, пока зависимость здорова, и снижают concurrency, когда локальная доля ошибок растёт. Во время 32,5-часовой перегрузки Canva сообщает, что fleet продолжал обрабатывать около двух миллионов сообщений в час; было зафиксировано около 1,8 миллиона failed attempts, а dead-letter queue выросла только на 22 сообщения. Canva Engineering Ключевое свойство — negative feedback рядом с исполнителем. Static rate limit предполагает, что мир не меняется. Retry backoff регулирует отдельные повторы, но может не снизить суммарное давление. Контроллер Canva позволяет воркерам увидеть последствия собственной активности и делать меньше, когда больше работы усиливает отказ. Agent runtime нужен тот же primitive. Если swarm умеет добавлять workers, повторять tools, делегировать задачи и использовать свободную quota, он должен уметь снижать давление по наблюдаемому сигналу деградации. Иначе resilience mechanism превращается в retry storm. Operator move: для каждого workflow, который умеет fan-out или autonomous retry, назови scarce downstream resource, degradation signal, видимый исполнителю, и автоматическую реакцию. Используй swarms там, где более быстрый результат стоит efficiency premium; снижай concurrency раньше, чем человек заметит, что fleet агентов ухудшает инцидент. Зрелый вопрос масштабирования — не сколько агентов мы можем запустить, а какое параллельное давление оправдывает ценность более раннего результата.
Acceptance — это механизм отбора
Чем адаптивнее исполнитель, тем меньше информации несёт его собственный terminal success. Масштабируемой системе нужен способ отклонить работу, даже если исполнитель сообщил, что закончил. Databricks называет gray failures частичные отказы, при которых стандартные service dashboards могут оставаться зелёными, хотя часть клиентов уже получает ошибки. RADAR отслеживает аномалии в user-error behavior. В опубликованном deployment Databricks сообщает о сокращении времени обнаружения инцидента на 95% при precision выше 90%. Databricks Механизм здесь — независимость evidence. Component health отвечает, считает ли компонент себя здоровым. Customer-outcome evidence отвечает, продолжает ли работа реально выполняться. Эти сигналы могут расходиться, и именно поэтому второй полезен. NVIDIA проводит похожую границу для агентов. Step-level evaluation помогает разбирать tool choice, arguments, retries, latency и cost, а end-to-end evaluation проверяет итоговое состояние среды. Если задача допускает executable check, проверка environment state становится сильной acceptance surface: изменилась ли запись, прошли ли tests, закрылся ли ticket на самом деле. NVIDIA Но executable evaluation не решает проблему автоматически, потому что ошибаться может сам evaluator. Horizon просканировал 5 241 задачу из 20 публичных benchmark datasets, глубже проверил подмножества и подтвердил 29 сломанных задач. Среди примеров — неполные tests, leaked answers, gameable graders и reference solutions, которые не выполняют собственное задание. Horizon Поэтому в эксплуатации нужны три разные поверхности. Наблюдай за executor, чтобы понимать его поведение. Независимо проверяй целевое состояние среды, чтобы рассказ executor о собственном успехе не был единственным доказательством. И отдельно проверяй acceptance surface: tests, benchmarks, outcome metrics и judges тоже являются спецификациями. Чем лучше агенты компенсируют дефекты, тем важнее это разделение. Способный executor может обойти плохой tool, пережить transient failure, переинтерпретировать ошибку или выдать правдоподобный artifact несмотря на сломанный промежуточный путь. Адаптивность улучшает completion rate и одновременно может скрывать слабые интерфейсы и слабые tests. Operator move: определи хотя бы один acceptance signal, который executor не контролирует. Для operational work предпочитай observable final state или customer outcome. Для benchmarks версионируй и аудируй grader. Для неоднозначной knowledge work оставляй независимую или sampled review surface вместо схемы, где одна система и производит, и сертифицирует ответ. Масштабирование становится безопаснее, когда система умеет сказать «нет» собственному результату по причинам, которые executor не может переписать.
Полномочия следуют за эффектом, а не за ярлыком
Security review часто опирается на категории вроде read-only, sandboxed, internal или approved connector. Для навигации они полезны, но реальную authority лучше описывать через эффекты. Google разворачивает custom starters, Apps Script steps, third-party integrations и webhooks в Workspace Studio. Эти возможности выключены по умолчанию и включаются раздельно; Google также даёт configurable approvals и allowlists для webhook destinations в поддерживаемых editions. Google Workspace Выполнение custom logic, раскрытие данных другому сервису, изменение внешнего state и обращение к внешнему destination — разные полномочия, даже если UI объединяет их в одном automation product. Governance должен следовать за эффектом, а не только за названием connector. То же правило относится к runtime isolation, network reachability, filesystem, identity, credentials, human fallback и tool scopes. Успех одной boundary check не сертифицирует соседние границы автоматически. «Sandboxed» — не одно свойство. Operator move: моделируй authority как набор наблюдаемых эффектов. Для каждого workflow step зафиксируй, что может исполниться, какие данные могут уйти наружу, какое состояние может измениться, какие destinations доступны, какой principal действует и кто может разрешить или отозвать этот эффект. Полезная граница — та, чей failure mode можно назвать без ссылки на продуктовый ярлык.
Специализация начинается с feedback contract
This week's deep cut. Есть привычная схема model routing: дешёвая модель для простых задач, frontier-модель для сложных. Материал этой недели подсказывает более полезный вопрос. До выбора модели стоит спросить, какую обратную связь вообще предоставляет задача и насколько надёжно система видит failure. Datadog использовал GLM-5.3 для генерации успешных investigation traces по change attribution в production alerts, отфильтровал traces и fine-tuned Qwen3.5-9B на этом поведении. На 187 held-out внутренних инцидентах student получил 0,55 Recall@5 против 0,63 у teacher. Datadog оценивает стоимость примерно в $0,003 за student investigation против $0,06 у teacher: 87% teacher Recall@5 примерно за 5% inference cost в их setup. На 139 held-out customer incidents fine-tuned model получила 0,62 против 0,52 у base Qwen и 0,51 у heuristic ranker Datadog. Datadog Есть важная оговорка. Label Datadog берётся из incident conclusion и служит proxy для causal change; он не является независимым доказательством причинности. Но это ограничение само является частью архитектуры. У системы есть повторяющаяся задача, production-derived traces, proxy label, held-out evaluation set и достаточный объём, чтобы serving cost имел значение. Frontier-модель может оставаться teacher и escalation path, не оставаясь постоянным worker для каждого кейса. QoRL показывает другой feedback regime. Rohan Bansal обучил 4B Qwen генерировать PostgreSQL query-plan hints; candidate plans реально исполнялись, а reward строился на measured latency. На 113 join-heavy queries финальная оценка запускала три rollouts на query и выбирала лучший feedback среди максимум 15 candidates; результат составил 1,81× geometric-mean speedup и снижение summed latency на 44,7% относительно default plans PostgreSQL в рамках их measurement setup. QoRL Здесь environment даёт то, что Datadog может только приблизить: дешёвую прямую награду. В QoRL model предлагает plan и измеряет последствия. Когда reward настолько конкретен, небольшой specialist может экономично исследовать узкое action space. Jev сужает contract со стороны output. TypeSafe описывает interface модели, который возвращает заранее определённые typed values с calibrated probabilities вместо unrestricted generated text. TypeSafe AI Vercel сообщил, что почти 13% paid AI Gateway teams использовали Jev в первые 24 часа. Это сигнал initial adoption, а не retained production value, но он показывает спрос на intentionally bounded output domain. Vercel Execution topology добавляет ещё одну ось. Antigravity SDK у Google поддерживает local models через LiteRT и workflows, где local execution может работать offline, а hybrid architecture оставляет часть работы на устройстве и эскалирует в cloud то, чему нужна более высокая capability. Google Developers Эти системы не являются вариантами одной универсальной «small model strategy». Они становятся возможными при разных feedback contracts. Можно ли измерить результат напрямую? Может ли frontier trace стать training data? Ограничен ли output space? Должен ли sensitive context остаться local? Повторяется ли задача достаточно часто, чтобы окупить specialization? Ломается ли слабая модель так, чтобы система могла это обнаружить и эскалировать? Ответы определяют, где должен жить recurring workflow: на frontier model, distilled specialist, bounded decision model или local execution path. Capability остаётся важной, но перестаёт быть единственной осью, когда задача достаточно структурирована, чтобы failure был наблюдаемым. Operator move: классифицируй recurring AI work по feedback contract до выбора serving architecture. Оставляй frontier inference там, где доминируют ambiguity, novelty и evidence gaps. Distill повторяющееся поведение, когда trace quality и held-out evaluation достаточно надёжны. Используй небольших specialists при дешёвом прямом reward, bounded models при известном output domain, а local execution — когда data boundary важнее максимальной capability. Специализация становится возможной, когда задача структурирована настолько, что может явно сказать меньшей системе, чему разрешено учиться, что возвращать, что оптимизировать и как выглядят её ошибки.
Дешёвое предложение не создаёт ценную работу
Когда execution становится дешёвым, самая простая ошибка — заполнить всю доступную capacity. DFDX Labs дал агенту три недели на управление небольшим бизнесом. Агент построил 17 платных продуктов, создал 46 API endpoints, использовал более пяти миллиардов токенов и получил $1,54 выручки. Авторы прямо называют lack of demand одним из главных ограничений эксперимента. DFDX Labs Эта выручка не является прогнозом для autonomous companies. Эксперимент специально работал на незрелом agent-to-agent market. Полезный failure mode — разрыв между production capacity и authorized demand. Агент мог продолжать строить, пока очень немногие покупатели одновременно имели причину купить и полномочие потратить деньги. Внутри компаний легко получить менее заметную версию. Если research summaries, prototypes, dashboards, migrations, analyses и patches почти ничего не стоят в производстве, очереди могут заполняться artifacts, которые никто не выбрал достаточно осознанно. Bottleneck перемещается upstream: какой вопрос важен, какому решению он служит и какие evidence действительно способны изменить действие. The Voice of User предлагает компактный routing rule для исследований. До ответа каждый вопрос получает одну из трёх цен: минуты, если trustworthy evidence уже существует; дни, если решение достаточно важно, чтобы создать новые evidence; или явно owned risk, если никакой правдоподобный ответ не изменит решение. The Voice of User Для autonomous work это полезная модель admission control. Сгенерированный ответ не доказывает, что вопрос заслуживал исследования. Сгенерированная реализация не доказывает, что проблема заслуживала продукта. Высокая utilization агентов не доказывает, что организация создала больше ценности. Operator move: поставь admission question перед дорогой автономной работой: какое решение, customer outcome или operational state изменится, если работа будет успешна? Если ответа нет, используй существующие evidence, создай новые evidence осознанно или зафиксируй uncertainty и двигайся дальше. Не трать machine capacity только потому, что она доступна. Дешёвое исполнение делает приоритизацию важнее, потому что waste теперь тоже производится с машинной скоростью.
Counter-signals, которые стоит удерживать
Параллелизм остаётся полезным, когда latency действительно дорогая. Анализ Toby Ord не является аргументом против swarms. Он делает цену видимой: некоторые задачи оправдывают больший total compute, потому что ценность более раннего результата высока. Incident response, широкий независимый поиск и research под дедлайн могут оправдать premium. Specialization зависит от качества evidence. Student Datadog всё ещё уступал GLM-5.3 в прямом внутреннем сравнении, а labels остаются proxies. QoRL узок и benchmark-specific. Small или local model становится привлекательной, когда её failure наблюдаем и задача повторяется; это не делает её общей заменой frontier capability. Selection mechanisms устаревают. Backpressure может недоиспользовать здоровую capacity, approval policy — централизовать low-risk work, benchmark — кодировать неверную цель, а specialized model — законсервировать вчерашнее поведение. Admission rules, evaluators и routing policies нужны owners, telemetry и revision triggers.
Operator takeaway
- Перейти от capacity planning к admission и pressure control. Решать, какая работа входит в autonomous system, какой latency premium оправдывает parallelism и какой локальный signal автоматически снижает нагрузку при деградации environment.
- Перейти от completion claims к independent acceptance и authority по эффектам. Разделять executor telemetry, observable outcome state, integrity evaluator и реальные эффекты каждого workflow step.
- Перейти от one-model routing к feedback-contract design. Использовать recurrence, reward quality, output shape, data boundary и escalation evidence, чтобы выбирать между frontier model, specialized student, bounded decision model и local execution.
Worth tracking
- RRSI — конкретная попытка ограничить benchmark overfitting при recursive harness improvement; авторы сообщают о положительном OOD-эффекте на пяти benchmarks и о 30% меньшем количестве policy tokens относительно unregularized evolution.
- Local-model support в Antigravity — конкретный пример routing execution не только по capability и cost, но и по data boundary.
- Performance sprint Anthropic — production-пример того, как размытая цель оптимизации превращается в детерминированные измерения и CI ratchets, по которым агенты могут вести поиск.