На этой неделе Mistral утроила точность на финансовой отчётности — с 26,7% до 86% — не меняя модель.
Изменили то, как она ищет.
Число, над которым стоит посидеть, — не 86%. А то, что две разные модели из двух разных лабораторий получили примерно одинаковый трёхкратный прирост от одной и той же смены обвязки. Mistral Medium 3.5 прибавила 47,3 пункта. GLM-5.2, построенная совсем другой командой, — 52,6. То, что дало этот прирост, не было свойством ни одной из моделей.
Тот же узор прошёл через всю неделю в местах, которые выглядят несвязанными.
Авторизация перестала быть одним credential и распалась на четыре отдельных вопроса. Оптимизация токенов сократила токены и подняла суммарную стоимость workflow в полтора раза. Инженерная пропускная способность выросла на 37%, пока ёмкость ревью и тестирования вокруг неё осталась прежней. А исполнение начало переезжать из приватных терминалов в общие командные каналы, где работа агента становится видимым социальным состоянием — вместе с заметно выросшей поверхностью полномочий.
Issue 12 закончился на том, что следствие оторвалось от санкционировавшей его причины. Эта неделя — конструктивная версия того же наблюдения: рычаг раз за разом оказывался вне модели — в обвязке, в дизайне авторизации, в ёмкости ревью, в workflow вокруг оптимизированного шага. Два года мы настраивали ту часть, которую проще всего назвать.
The 60-second version
Если читать только это:
- Обвязка сдвинула способность сильнее, чем сдвинул бы апгрейд модели. С 26,7% до 86% на FinanceBench одной процедурой поиска — и тот же прирост перенёсся на две модели из разных лабораторий, что и делает это свойством системы, а не заявлением вендора.
- «Дай агенту API-ключ» как модель авторизации закончилась. Identity, scope, intent и revocation — теперь четыре отдельных проектных вопроса, и на каждый отвечает свой продукт.
- Оптимизация части может ухудшить целое. Сжатие контекста сократило токены и подняло суммарную стоимость примерно в полтора раза на 2908 сессиях. Составная система прибавила 86% к своему score, тихо перестав исполнять назначенную роль.
- Пропускная способность обогнала систему вокруг. Объём PR вырос на 37% при почти удвоившемся размере — против неизменной ёмкости ревью, тестирования и принятия решений.
- Исполнение переезжает в общие каналы. Кодовых агентов затягивают в командные поверхности, где работа становится видимым социальным состоянием, — и где они наследуют права вызвавшего их человека.
Одна строка на неделю: мы апгрейдим модель, а рычаг раз за разом оказывается в другом месте.
1. Обвязка и есть способность
Deep cut недели.
Это важнейший результат недели, и заголовочное число в нём — наименее интересная часть.
Agentic Search от Mistral заменяет одноразовый retrieval циклом операций: search, open, navigate, read, grep. Модель может искать повторно, пройти по ссылке, углубиться в конкретную страницу и проверить найденное, а не потреблять тот кусок, который индекс вернул первым. На FinanceBench — 150 вопросов по 368 отчётам SEC в среднем по 147 страниц, около 53 900 страниц суммарно — точность выросла с 26,7% до 86%.
Теперь разложение, и урок именно в нём. Переход от одноразового RAG к search-only циклу дал бо́льшую часть: +47,3 пункта для Mistral Medium 3.5 и +52,6 для GLM-5.2, модели другой компании. Добавление навигационных инструментов принесло ещё +8,7 и +6,7 соответственно. Задержка при этом упала, а не выросла — p90 с 255 секунд до 154 — и расход токенов сократился до трети. Конфигурация — штатный тулкит Mistral без подгонки под бенчмарк.
Отсюда следуют две вещи, и вторая важнее.
Первая: процедурное изменение обошло то, что даёт большинство апгрейдов модели. Трёхкратный рост точности — не то число, которое приходит с минорным релизом.
Вторая: оно перенеслось. Если бы прирост появился только в собственной модели Mistral, честным прочтением была бы подгонка — вендор демонстрирует свою обвязку на своих весах. Две модели двух лабораторий с сопоставимым приростом — утверждение другого рода. Улучшение оказывается свойством процедуры, а процедура переносима.
Это переопределяет, что означает число в бенчмарке. Когда лидерборд сообщает, что модель A выше модели B, часть измеряемого — это обвязка, в которой каждую запускали: контракты инструментов, процедура поиска, цикл верификации, разделение ролей. Они способны сдвинуть эффективную способность сильнее, чем отчитанная разница между моделями. И это переопределяет решение об апгрейде: если у тебя одноразовый retrieval, следующая модель этого не починит, а разочарование ты спишешь на модель.
Та же неделя сделала это утверждение и со стороны обучения. GLM-5.3 вышла с существенным приростом в коде и агентности без новой базовой архитектуры — работа была в post-training, отмасштабированном на больше сред и задач. А исследование обучения across harnesses предлагает намеренно варьировать skills, схемы, промпты и поведение хуков во время обучения, чтобы модель училась работать в разных интерфейсах, а не переобучалась на один.
Operator move: перед следующим апгрейдом модели проведи эксперимент с обвязкой. Возьми одну недотягивающую нагрузку и поменяй только процедуру — одноразовый retrieval на итеративный цикл, добавь навигацию и шаги верификации, ужесточи контракты инструментов, — оставив модель прежней. Измерь дельту. Дальше фиксируй полную конфигурацию обвязки рядом с каждым числом бенчмарка, на которое опираешься, внутренним или внешним, и считай единицей сравнения весь этот набор. Score модели без её обвязки — не сравнение. Если не можешь воспроизвести опубликованное число в своей обвязке, ты узнал что-то про свою обвязку, а не про модель.
Мы сравнивали модели. Значительная часть измеренного была машинерией вокруг них.
2. Авторизация распалась на четыре вопроса
Самое ясное архитектурное схождение недели: четыре независимых продукта пришли к одному разложению.
WorkOS ввела регистрацию агентов с машиночитаемыми метаданными и ограниченными короткоживущими credentials — машинному клиенту больше не нужно проталкиваться через человеческий браузерный логин. Agent Access Model от Cloudflare сосредоточена на временных credentials и возможности отозвать полномочия прямо по ходу исполнения; отдельно Cloudflare добавила опциональные OAuth-скоупы, чтобы пользователь мог согласиться на часть запрошенного приложением, а не на всё. А Voight-Kampff от Tempo криптографически привязывает биометрическое подтверждение человека к конкретному высокорисковому действию.
Вместе они отвечают на четыре разных вопроса, у которых раньше был один ответ:
Identity — кто действует? Scope — что ему позволено? Intent — было ли санкционировано именно это действие? Revocation — можно ли отозвать полномочия, пока задача ещё идёт?
API-ключ отвечает на первые два плохо, а на последние два не отвечает вовсе. Это было терпимо, пока credential принадлежал скрипту с фиксированной работой. Это нетерпимо, когда держатель рассуждает, планирует и попадает в ситуации, которых никто не перечислял.
Честная трудность — третий вопрос. Привязка человеческого намерения к конкретному действию здесь самый сильный контроль и самый дорогой: требуй его везде — и автоматизация перестанет окупаться. Проектная задача в том, каким действиям нужно жёсткое человеческое намерение, а какие могут исполняться под ограниченной политикой.
Operator move: для каждого агента в твоих системах выпиши четыре ответа раздельно и посмотри, какие пустые. У большинства найдутся identity и scope в каком-то виде и ничего по intent и revocation. Начинай с revocation — он дешевле всего добавляется и полезнее всего в инциденте: можешь ли ты отозвать полномочия у работающей задачи, не убивая систему целиком? Дальше выставляй intent по уровням последствий: необратимые, видимые снаружи или финансово значимые действия получают привязанное подтверждение, остальное идёт под политикой.
3. Оптимизация части ухудшила целое
Два результата этой недели измерили один и тот же отказ с противоположных сторон, и оба стоит держать.
Первый: оптимизация сжатия контекста, применённая на 2908 сессиях, действительно сократила токены — и подняла суммарную стоимость workflow примерно в полтора раза. Сжатие сделало каждый вызов дешевле, а работу целиком дороже: сжатый контекст порождал больше ходов, больше ретраев, больше перечитывания. Метрика, в которую целились, улучшилась. Метрика, которая имела значение, ухудшилась.
Второй: составная мультиагентная система показала 86% прироста своего RL-score, и бо́льшая часть прироста исчезла, стоило заставить один модуль остаться в назначенной роли. Он передавал ответ вниз вместо того, чтобы выполнять декомпозицию. Score вырос, потому что архитектура перестала быть архитектурой.
И то и другое — закон Гудхарта, но механизм конкретнее, чем «мера становится целью». В обоих случаях оптимизируемая величина была локально читаемой и дешёвой в измерении, а то, что действительно имело значение, размазано по workflow и дорого в измерении. Именно эта асимметрия и выбирает неверную цель. Третий раз она проявилась в опросе, где 84% сказали, что AI оправдал или превзошёл ожидания по ROI, а 52% сообщили о выросшей общей нагрузке: автоматизация убрала работу по триажу и создала работу по интеграции, валидации и поддержке, под которую ни у кого не было метрики.
Operator move: для каждой оптимизации в AI-workflow назови объемлющую величину до старта — полная стоимость завершённой задачи, время до принятого результата, человеко-часы на закрытый тикет — и меряй её в том же эксперименте. Если объемлющую величину измерить нельзя, это и есть находка: ты собираешься оптимизировать единственное, что видно. А когда составная система улучшилась, проверь, что каждый компонент по-прежнему делал свою работу, а не только что число сдвинулось.
Улучшение, которое ты не можешь локализовать в целом, — гипотеза, а не результат.
4. Пропускная способность обогнала систему вокруг
Если способность живёт в обвязке, то тратится она в окружающей системе — и на этой неделе эта система заметно отставала.
Инженерные данные показали рост пропускной способности по pull request на 37% за четыре квартала при почти удвоившемся среднем размере PR. Проблема именно в том, что оба числа выросли вместе: изменений больше, каждое крупнее, и приходят они в ёмкость ревью, которая масштабируется людьми, а не токенами. Продуктовая часть той же недели сделала коммерческую версию аргумента: более быстрое производство софта не ускоряет выручку автоматически, потому что ограничение сидит в коммерческой готовности, а не во времени сборки.
История Shopify — конструктивная. Их мобильная система E2E-тестов стала настолько ненадёжной, что команда убрала её из PR-проверок — рациональный шаг, который заодно убрал страховочную сетку, — а затем перестроила интерфейс тестирования вокруг более строгих инвариантов, вернув стабильность к 98%. Окружающая система не фиксирована. Её просто надо намеренно перестраивать, и эта работа ничьим заголовком не становится.
Организационная версия проявилась как архитектура решений. Когда реализация занимала три недели, два дня на выяснение, кто выбирает подход, почти не считались. Когда агент выдаёт несколько жизнеспособных реализаций раньше, чем закончится совещание, задержка решений становится видимым критическим путём — и размытые права решать, которые раньше прятались внутри медленного цикла поставки, становятся дорогими.
Operator move: измерь, куда реально уходит время между «работа запрошена» и «изменение принято», и проверь, близко ли генерация к вершине списка. Если ответ — очередь ревью, нестабильные тесты, согласование или бесхозное решение, то следующий бюджет автоматизации принадлежит туда, а не ускорению и без того быстрого шага. Дальше сопоставь механизмы решений со ставками: обратимые выборы остаются рядом с работой, значимые получают названного владельца и путь эскалации, а консенсус берегут для случаев, где действительно нужна разделяемая приверженность.
5. Исполнение переезжает в общие поверхности
Последняя тема несёт самые крупные последствия второго порядка и приходит тихо, под видом удобства.
Slack Code помещает кодовых агентов в каналы под конкретную задачу, где люди промптят, смотрят диффы, проверяют превью и совместно рулят работой. Linear теперь даёт агентам среды, в которых они настраивают, запускают приложение, тестируют его в браузере, чинят падения и перезапускают до возврата работы. Постоянные агенты обзаводятся идентичностями, памятью, правами и присутствием внутри каналов. Запись встреч становится исполняемой работой.
Очевидное прочтение — удобство. Организационное интереснее: как только исполнение происходит там, где команда общается, работа агента становится видимым социальным состоянием. Кто его вызвал, что изменилось, кто проверил, какой контекст окружал решение — всё это попадает в общую запись, а не остаётся в чьём-то приватном терминале. Это настоящий выигрыш в читаемости, и аргумент здесь тот же, что и у разделения обязанностей: работу, которую видно, можно оспорить.
Цена приезжает в той же коробке. Агенты Slack Code работают с правами вызвавшего пользователя, а канал совместной работы несёт куда больше контекста — и куда больше полномочий, — чем изолированная сессия. Агент в общем канале видит переписку, вложения, связанные документы и credentials того, кто его позвал. Поверхность прав выросла ровно в тот момент, когда поверхность исполнения стала удобной.
Operator move: считай агента в общем канале новым принципалом в своей модели доступа, а не функцией мессенджера. Спроси, что он может прочитать в этом канале из того, что не мог бы в приватной сессии; на что он может подействовать правами вызвавшего; стала ли история канала частью его контекста. Дальше примени к нему вопросы из раздела 2: есть ли у него собственная identity, уже ли его scope, чем у вызвавшего, требует ли значимое действие привязанного намерения и можешь ли ты отозвать его посреди задачи. Удобство приезжает быстрее, чем модель авторизации под ним.
Контр-сигналы, которые стоит держать
Три напряжения, которые стоит держать живыми, — и куда бы я положил вес:
Числа по обвязке — от вендора. Mistral оценила собственную обвязку и опубликовала результат, а конфигурации бенчмарков — ровно то место, где живёт выборочная отчётность. Справедливо. Вес: держит всё это перенос между моделями — прирост, проявившийся в модели конкурента так же сильно, как в своей, трудно поставить, и именно он делает утверждение свойством системы, а не демонстрацией. Считай 86% невыверенным, а перенос — находкой.
«Модель не важна» — неверный вывод. У работы с обвязкой есть предел, и никакая процедура не сделает слабую модель сильной; прирост GLM-5.3 от post-training был настоящим улучшением модели, а базовая способность по-прежнему задаёт потолок, внутри которого обвязка работает. Верно. Вес: утверждение не в том, что модели перестали улучшаться, — а в том, что на текущих уровнях способности у большинства команд неиспользованного запаса в обвязке больше, чем в следующем апгрейде, и обвязка дешевле в изменении.
Общие поверхности исполнения — чистый выигрыш. Раздел 5 легко прочитать как аргумент против агентов в командных каналах, тогда как выигрыш в читаемости существенный, а альтернатива — агенты, работающие невидимо в приватных терминалах — хуже для ревью, атрибуции и обучения. Верно. Вес: ответ в том, чтобы двигать модель авторизации с той же скоростью, что и модель исполнения, а не держать исполнение приватным. Риск в отставании между ними, а не в направлении.
Operator takeaway
Если ты выпускаешь в регулируемых системах, чувствительных к безопасности или AI-смежных продуктах, на этой неделе затвердели три вещи:
- Проверь обвязку до того, как покупать апгрейд. Оставь модель прежней и поменяй процедуру — итеративный retrieval, навигация, верификация, более жёсткие контракты инструментов. Фиксируй конфигурацию обвязки рядом с каждым числом бенчмарка: score без обвязки — не сравнение.
- Отвечай на identity, scope, intent и revocation раздельно. API-ключ отвечает на два из них плохо. Начинай с revocation — дешевле всего добавить, ценнее всего в инциденте, — дальше выставляй привязанное намерение по уровням последствий.
- Назови объемлющую величину до оптимизации части. Полная стоимость завершённой задачи, а не токены на вызов. Если объемлющую величину измерить нельзя, это и есть находка — ты собираешься улучшить единственное, что видно.
Это не прогнозы. Это описание того, куда операционная почва уже сместилась.
Стоит понаблюдать
Несколько конкретных вещей этой недели, на которые стоит взглянуть ближе:
- Станет ли конфигурация обвязки частью отчётности по бенчмаркам — разложение Mistral показывает, сколько способно спрятать число в лидерборде; полезным следующим шагом были бы лидерборды, публикующие контракты инструментов и процедуру поиска рядом со score.
- AI-Infra-Guard и появление сканеров AI-инфраструктуры — red-team-инструментарий, нацеленный именно на MCP-серверы, agent skills и уязвимость к jailbreak, означает, что агентская инфраструктура стала отдельной поверхностью атаки со своим инструментарием по обе стороны.
- Bun 1.4 как ставка на консолидацию рантайма — более 1500 дополнительно проходящих Node-тестов плюс встроенные браузерная автоматизация, HTTP/3 и cron — это ставка на то, что агентские нагрузки предпочитают меньше подвижных частей, а это противоположно направлению на специализированные context-подсистемы, за которое агитировала та же неделя.